기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.
사용자 지정 기법
사용자 지정 기법은 모델이 데이터에서 학습하는 방법을 정의합니다. 각 기법에는 서로 다른 데이터 세트 형식이 필요하며 자체 하이퍼파라미터가 있습니다. 보유한 데이터와 달성하고자 하는 동작에 따라를 선택합니다.
SFT (지도 미세 조정) - 레이블이 지정된 프롬프트-응답 페어에 대해 훈련합니다. 모델별 스타일, 형식 또는 도메인 지식을 가르치는 데 가장 적합합니다.
DPO (직접 기본 설정 최적화) - 기본 응답 페어와 거부된 응답 페어를 훈련합니다. 인적 기본 설정에 맞게 조정하고 원치 않는 출력을 방지하는 데 가장 적합합니다.
RFT (강화 미세 조정) - 코드 기반 확인(RLVR) 또는 LLM 판사(RLAIF)와 같은 보상 신호를 통해 최적화합니다. 사실적 정확도 또는 주관적 품질을 개선하는 데 가장 적합합니다.
멀티턴 강화 학습 (다중 회전 강화 학습) - 컨텍스트가 증가하는 다단계 에이전트 작업을 위해 에이전트를 교육합니다.
지속적인 사용자 지정 (연속 사용자 지정) - 여러 기술을 순차적으로 연결합니다(예: SFT → DPO → RLVR). LoRA 훈련 유형이 필요합니다.
각 기법은 LoRA 또는 FFT 훈련 유형과 결합할 수 있습니다. 둘 중 하나를 선택하는 방법에 대한 훈련 유형 자세한 내용은 섹션을 참조하세요.