강화 미세 조정(RFT)
강화 미세 조정(RFT)은 정확히 올바른 답변으로 직접 감독하는 대신 응답 품질을 나타내는 피드백 신호(측정 가능한 점수 또는 보상)를 통해 모델 성능을 개선하는 기법입니다. 입력과 출력 페어로부터 학습하는 SFT와 달리, RFT는 보상 함수를 사용하여 모델 응답을 평가하고 반복적으로 모델을 최적화하여 이러한 보상을 극대화합니다. RFT는 싱글 턴 훈련과 멀티 턴 훈련을 모두 지원합니다.
-
싱글 턴 RFT: 모델이 프롬프트에 대한 단일 응답을 생성하고 보상 함수가 해당 응답에 점수를 매깁니다. 수학, 코드 생성, 구조화된 추론처럼 명확한 응답별 품질 지표가 있는 작업에 가장 적합합니다.
-
멀티 턴 RFT: 모델이 다단계 상호 작용(예: 도구 사용이 포함된 에이전트 워크플로)에 참여하고 보상 함수가 전체 궤적을 평가합니다. 다단계 문제 해결, 도구 오케스트레이션, 대화형 에이전트 등 순차적 의사 결정이 요구되는 복잡한 작업에 가장 적합합니다.
RFT는 사용하는 경우
명확하고 측정 가능한 성공 기준을 정의할 수 있지만 훈련에 정확히 올바른 출력을 제공하는 데 어려움을 겪는 경우 RFT를 사용합니다. RFT는 다음의 경우에 적합합니다.
-
프로그래밍 방식으로 모델 출력을 평가할 수 있는 신뢰할 수 있는 보상 함수가 있는 경우
-
모델 동작을 특정 기본 설정 또는 제약 조건에 맞게 조정해야 하는 경우
-
레이블링된 고품질 예시를 수집하는 작업에 비용이 많이 들거나 해당 작업이 실용적이지 않은 사례의 경우
-
유효한 솔루션이 여러 개 있지만 그중 일부가 다른 솔루션보다 명확하게 더 나은 경우(창의적 글쓰기, 코드 최적화, 복잡한 추론)
RFT는 수학 문제 해결, 코드 생성, 과학적 추론, 구조화된 데이터 분석, 다단계 추론, 도구 사용, 특정한 제약 조건이 있는 복잡한 워크플로 등, 출력 품질을 객관적으로 측정할 수 있는 영역에서 뛰어난 성능을 발휘합니다.
지원되는 모델
싱글 턴 및 멀티 턴 RFT는 다음 Amazon Nova 모델에 사용할 수 있습니다.
-
Nova 2.0(Lite)
싱글 턴 RFT와 멀티 턴 RFT를 사용해야 하는 각각의 경우
작업이 원샷 교환인 경우 싱글 턴 RFT를 선택합니다. 모델이 프롬프트를 수신하고 중간 도구 직접 호출이나 추적할 환경 상태 없이 자체적으로 점수를 매길 수 있는 단일 응답을 생성합니다. 분류, 추출, 분야별 Q&A, 요약, 콘텐츠 조정 또는 검증 가능한 답변이 필요한 모든 작업(정확한 매칭, F1, 스키마 검증, 최종 출력에 대한 규칙 기반 또는 LLM 평가 등)과 같은 사용 사례에 적합합니다. 각 롤아웃이 한 번의 생성으로 이루어지고 마지막에 보상이 한 번만 계산되므로, 실행이 더 간단하고 비용이 적게 들며 빠릅니다.
결과를 판단하기 전에 모델이 도구 직접 호출, 상태 읽기와 변경, 반환되는 내용에 따른 적응 등 여러 단계에 걸쳐 에이전트 역할을 해야 하는 작업의 경우, 멀티 턴 RFT를 선택합니다. 도구 사용 시퀀스, 다단계 문제 해결, 대화형 어시스턴트 또는 최종 답변뿐만 아니라, 성공 여부가 궤적(여러 턴에 걸친 작업의 순서와 정확성)에 따라 결정되는 작업과 같은 에이전틱 워크플로에 적합합니다.
경험 법칙: 도구 직접 호출이나 변화하는 상태 없이 단일 모델 출력만으로 작업을 평가할 수 있다면, 싱글 턴 RFT를 사용하고, 도구를 사용하거나 상태를 유지하는 환경에서 일련의 작업을 수행하는 것이 성공 조건이라면 멀티 턴 RFT를 사용합니다.
Nova 1.0 및 Nova 2.0을 사용해야 하는 각각의 경우
RFT는 Nova 2.0 Lite에서만 사용할 수 있습니다. Nova 1.0 모델의 경우 대안 정렬 기법으로 직접 선호 최적화(DPO) 또는 근접 정책 최적화(PPO)를 사용합니다.
추론 모드
Amazon Nova 2.0은 RFT 훈련 중에 추론 모드를 지원합니다. 다음 모드를 사용할 수 있습니다.
-
none: 추론 없음(reasoning_effort 필드 생략)
-
low: 최소한의 추론 오버헤드
-
high: 최대 추론 기능(reasoning_effort를 지정할 때 기본값)
참고
RFT에는 중간 옵션이 없습니다. 구성에 reasoning_effort 필드가 없으면 추론이 비활성화됩니다.