View a markdown version of this page

멀티턴 강화 학습 - Amazon SageMaker AI

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

멀티턴 강화 학습

멀티턴 강화 학습(RL)은 에이전트가 한 순간뿐만 아니라 일련의 단계에서 올바른 결정을 내리도록 훈련합니다. 에이전트는 환경을 관찰하고, 조치를 취하고, 보상을 받고, 새 상태로 전환하여 여러 단계에 걸쳐이 프로세스를 반복합니다. 목표는 한 단계를 개별적으로 최적화하는 대신 전체 시퀀스에서 누적 보상을 극대화하는 정책(모델 동작)을 학습하는 것입니다. 이 접근 방식은 다단계 추론 및 에이전트 작업에 대한 언어 모델을 훈련하는 데 점점 더 많이 사용되며,이 모델은 여러 차례 도구 호출, 코드 실행 또는 웹 검색과 같은 작업을 수행하고 전체 시퀀스를 기반으로 보상을 받습니다. 이는 보상이 한 번에 하나의 출력에 할당되는 단일 회전 RLHF/RLAIF와 다릅니다.

간단한 비유

지원 티켓을 처리하는 고객 서비스 에이전트라고 가정해 보겠습니다. 이 문제를 하나의 메시지로 해결하지 않습니다. 명확한 질문을 하고, 고객의 계정을 조회하고, 수정을 시도하고, 작동했는지 확인하고, 그렇지 않은 경우 후속 조치를 취합니다. 결국 고객은 만족하거나 만족하지 않습니다. 시간이 지남에 따라 어떤 단계 시퀀스가 좋은 해결로 이어지는지 더 잘 인식할 수 있습니다.

멀티턴 RL은 모델을 동일한 방식으로 훈련합니다. 단일 응답으로 모델을 그레이딩하는 대신 모델이 여러 단계에서 작업을 진행하고 전체 시퀀스를 기반으로 보상할 수 있습니다. 모델은 대화의 앞부분에서 실제로 중요한 결정을 학습합니다.

핵심 용어

  • 에이전트: 시스템의 의사 결정 엔터티입니다. 현재 상황을 관찰하고, 취해야 할 조치를 결정하며, 전략을 개선하기 위해 시간이 지남에 따라 학습합니다. 실제로 에이전트는 AI 모델로 구동되지만 둘은 동일하지 않습니다. 모델은 기본 신경망이며, 에이전트는 이를 사용하여 인지하고 결정하고 행동하는 더 광범위한 시스템입니다. 간단히 말해 티켓을 처리하는 고객 서비스 담당자입니다.

  • 환경/에이전틱 애플리케이션: 대화 기록, 고객의 계정 세부 정보 및 에이전트가 사용할 수 있는 도구를 포함하여 에이전트가 상호 작용하는 모든 항목입니다. 간단히 말해 지원 플랫폼, 고객 및 담당자가 사용할 수 있는 모든 정보입니다.

  • 상태: 에이전트가 다음에 수행할 작업을 결정하기 전에 관찰하는 현재 상황의 스냅샷입니다. 간단히 말하면 고객의 문제, 이미 시도한 내용, 최신 회신 등 영업 담당자가 현재 알고 있는 내용입니다.

  • 작업: 에이전트가 각 단계에서 수행하는 작업으로, 여기에는 명확한 질문, 도구 호출 또는 응답 전송이 포함됩니다. 간단히 말해서 질문을 하든, 무언가를 조회하든, 수정 사항을 보내든 상관없습니다.

  • 보상: 각 단계 또는 작업 종료 시 에이전트가 수신하는 피드백 신호로, 사물이 얼마나 잘 진행되었는지를 나타냅니다. 간단히 말해 고객이 만족했나요? 그 결과는 보상입니다.

  • 정책: 에이전트가 학습한 전략입니다. 주어진 상태를 좋은 결과로 이어질 가능성이 가장 높은 작업에 매핑합니다. 간단히 말해서, 영업 담당자의 지식은 경험을 바탕으로 구축되어 주어진 상황에서 어떤 것이 효과적인지 알고 있습니다.

  • 에피소드: 처음부터 끝까지 작업을 한 번 완전히 실행합니다. 간단히 말하면 고객의 첫 번째 메시지부터 해결에 이르기까지 하나의 전체 지원 대화입니다.

  • 턴: 에피소드 내의 단일 교환으로, 일반적으로 에이전트가 수행한 작업 하나와 환경에서 수신한 응답 하나. 대화에서 이는 하나의 메시지와 해당 응답입니다. 간단히 말해 에이전트가 질문하고 고객이 응답하는 등 지원 대화의 한 단계입니다.

  • 궤적: 전체 에피소드에 기록된 상태, 작업 및 보상의 전체 시퀀스입니다. 이는 에이전트가 수행한 작업과 그 결과로 발생한 작업에 대한 전체 레코드로, 보상을 계산하고 정책을 업데이트하는 데 사용됩니다. 간단히 말해서 에이전트가 내린 모든 결정과 진행 방식을 포함하여 지원 대화의 전체 기록을 처음부터 끝까지 작성합니다.

  • 누적 보상: 에피소드의 모든 단계에서 누적된 총 보상으로, 에이전트가 궁극적으로 최대화하려고 합니다. 간단히 말해 한 단계가 잘 진행되었는지 여부뿐만 아니라 전체 대화가 전반적으로 잘 진행되었는지 여부입니다.

멀티턴 강화 학습 사용 사례

다중 회전 RL은 단일 응답만으로는 작업을 제대로 완료하기에 충분하지 않을 때 올바른 접근 방식입니다. 사용 사례에 이전 단계에 따라 결정되는 일련의 단계가 포함된 경우 멀티턴 RL을 고려할 가치가 있습니다.

다음은 이를 가리키는 몇 가지 신호입니다.

  • 작업back-and-forth 작용이 필요합니다. 모델은 질문을 하고, 정보를 수집하고, 학습한 내용에 따라 조정해야 합니다. 단일 프롬프트-응답 주기로는 충분하지 않습니다. 예: 수정 사항을 제안하기 전에 후속 질문을 하여 문제를 진단하는 지원 에이전트입니다.

  • 결과의 품질은 일련의 작업에 따라 달라집니다. 마지막에 올바른 답변을 얻으려면 전체적으로 올바른 조치를 취해야 합니다. 경로가 중요한 경우 최종 출력만 보상하는 것만으로는 충분하지 않습니다. 예: 여러 단계에 걸쳐 코드를 계획, 작성, 실행 및 디버깅하는 코딩 어시스턴트입니다.

  • 모델은 여러 단계에 걸쳐 도구를 사용해야 합니다. 모델은 검색, APIs 또는 코드 실행과 같은 외부 도구를 호출하고 한 도구 호출의 결과는 다음에 수행하는 작업에 영향을 미칩니다. 예: 요약을 생성하기 전에 정보를 검색하고 결과를 평가하며 쿼리를 구체화하는 연구 도우미입니다.

  • 작업 중 실수는 복구 가능해야 합니다. 처음부터 잘못된 경로를 커밋하는 대신 모델이 작동하지 않고 올바른 과정을 인식하도록 해야 합니다. 예: 솔루션을 시도하고, 작동 여부를 확인하고, 그렇지 않은 경우 다른 접근 방식을 시도하는 에이전트입니다.

  • 단일 턴 성능은 좋지만 end-to-end 작업 완료는 좋지 않은 경우: 모델이 개별 단계를 잘 처리하지만 이를 일관성 있고 성공적인 결과로 함께 묶는 데 어려움을 겪는 경우, 다중 턴 RL은 이러한 격차를 해소하는 데 도움이 될 수 있습니다.

지원되는 모델, 요금 및 리전

지원되는 모델

모델 리전
Nova Lite 2.0 IAD(us-east-1), PDX(us-west-2)
GPT-OSS-20B IAD(us-east-1), PDX(us-west-2)
Gemma-4-31B-it PDX(us-west-2)
Qwen 3.6 27B PDX(us-west-2)

가격 책정

전체 요금 세부 정보는 공개 요금 페이지를 참조하세요. 요금은 세 가지 차원을 기준으로 합니다.

  • 사전 채우기: 각 훈련 단계가 시작될 때 모델에 공급되는 입력 토큰을 처리하는 비용입니다. 여기에는 응답을 생성하기 전에 모델이 수신하는 프롬프트, 대화 기록 및 컨텍스트가 포함됩니다.

  • 샘플: 모델이 훈련 롤아웃 중에 생성하는 토큰의 비용입니다. 여기에서 모델은 응답을 생성하고 이를 평가하여 보상 신호를 계산하는 데 사용합니다.

  • 훈련: 보상 신호를 기반으로 모델의 가중치가 업데이트되는 역방향 패스 비용입니다. RL 프로세스의 핵심 학습 단계입니다.

주제