As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Multi-turn aprendizagem por reforço
Multi-turn o aprendizado por reforço (RL) treina um agente para tomar boas decisões em uma sequência de etapas, não apenas em um único momento. O agente observa seu ambiente, realiza uma ação, recebe uma recompensa e passa para um novo estado, repetindo esse processo por várias etapas de tempo. O objetivo é aprender uma política (comportamento do modelo) que maximize a recompensa cumulativa em toda a sequência, em vez de otimizar para qualquer etapa isolada. Essa abordagem é cada vez mais usada para treinar modelos de linguagem em tarefas agênticas e de raciocínio em várias etapas, nas quais o modelo realiza ações como chamadas de ferramentas, execução de código ou pesquisa na web em várias etapas e é recompensado com base em toda a sequência. Isso é diferente do turno único RLHF/RLAIF, em que uma recompensa é atribuída a uma saída por vez.
Uma analogia simples
Imagine que você é um agente de atendimento ao cliente gerenciando um ticket de suporte. Você não resolve isso em uma mensagem. Você faz perguntas esclarecedoras, consulta a conta do cliente, tenta uma solução, verifica se funcionou e acompanha se não funcionou. No final, o cliente ou sai satisfeito ou não. Com o tempo, você fica melhor em reconhecer qual sequência de etapas tende a levar a uma boa resolução.
Multi-turn O RL treina o modelo da mesma maneira. Em vez de classificar o modelo em uma única resposta, ele permite que o modelo execute uma tarefa em várias etapas e a recompensa com base em toda a sequência. O modelo aprende quais decisões no início da conversa realmente importaram.
Terminologia básica
-
Agente: a entidade de tomada de decisão no sistema. Ele observa a situação atual, decide qual ação tomar e aprende com o tempo a melhorar sua estratégia. Na prática, o agente é alimentado por um modelo de IA, mas os dois não são a mesma coisa. O modelo é a rede neural subjacente; o agente é o sistema mais amplo que o usa para perceber, decidir e agir. Em termos simples: o representante de atendimento ao cliente responsável pelo ticket.
-
Environment/Agentic Aplicação: tudo com o qual o agente interage, incluindo o histórico de conversas, os detalhes da conta do cliente e quaisquer ferramentas que o agente possa usar. Em termos simples: a plataforma de suporte, o cliente e todas as informações disponíveis para o representante.
-
Estado: um retrato da situação atual que o agente observa antes de decidir o que fazer a seguir. Em termos simples: o que o representante sabe no momento, como o problema do cliente, o que já foi testado e a resposta mais recente.
-
Ação: o que o agente faz em cada etapa, como fazer uma pergunta esclarecedora, ligar para uma ferramenta ou enviar uma resposta. Em termos simples: o próximo passo do representante, seja fazer uma pergunta, pesquisar algo ou enviar uma correção.
-
Recompensa: o sinal de feedback que o agente recebe, seja em cada etapa ou no final da tarefa, indicando o quão bem as coisas correram. Em termos simples: o cliente saiu satisfeito? Esse resultado é a recompensa.
-
Política: a estratégia que o agente aprendeu. Ele mapeia um determinado estado para a ação com maior probabilidade de levar a um bom resultado. Em termos simples: o conhecimento do representante é construído a partir da experiência, sabendo o que tende a funcionar em uma determinada situação.
-
Episódio: uma execução completa de uma tarefa do início ao fim. Em termos simples: uma conversa de suporte completa, desde a primeira mensagem do cliente até a resolução.
-
Turno: uma única troca dentro de um episódio, normalmente uma ação realizada pelo agente e a resposta que ele recebe do ambiente. Em uma conversa, essa é uma mensagem e sua resposta. Em termos simples: uma etapa na conversa de suporte, como o agente fazendo uma pergunta e o cliente respondendo.
-
Trajetória: a sequência completa de estados, ações e recompensas registradas em um episódio inteiro. É o registro completo do que o agente fez e do que aconteceu como resultado, usado para calcular a recompensa e atualizar a política. Em termos simples: a transcrição completa da conversa de suporte do início ao fim, incluindo todas as decisões tomadas pelo agente e como as coisas se desenrolaram.
-
Recompensa cumulativa: a recompensa total acumulada em todas as etapas de um episódio, que é o que o agente está tentando maximizar. Em termos simples: não apenas se uma etapa correu bem, mas se toda a conversa correu bem no geral.
Casos de uso para aprendizado por reforço em vários turnos
Multi-turn A RL é a abordagem correta quando uma única resposta não é suficiente para concluir bem uma tarefa. Se seu caso de uso envolver uma sequência de etapas, decisões que dependem das anteriores, vale a pena considerar a RL de várias voltas.
Aqui estão alguns sinais que apontam para isso:
-
Sua tarefa exige interação de ida e volta: o modelo precisa fazer perguntas, coletar informações e se adaptar com base no que aprende ao longo do caminho. Um único ciclo de resposta rápida não é suficiente. Exemplo: um agente de suporte que diagnostica um problema fazendo perguntas complementares antes de sugerir uma solução.
-
A qualidade do resultado depende de uma sequência de ações: obter a resposta certa no final exige fazer os movimentos certos durante todo o processo. Recompensar apenas o resultado final não é suficiente se o caminho para chegar lá for importante. Exemplo: um assistente de codificação que planeja, grava, executa e depura código em várias etapas.
-
O modelo precisa usar ferramentas em várias etapas: o modelo chama ferramentas externas, como pesquisa, APIs ou execução de código, e os resultados de uma chamada de ferramenta influenciam o que ele faz a seguir. Exemplo: um assistente de pesquisa que busca informações, avalia os resultados e refina sua consulta antes de produzir um resumo.
-
Os erros no meio da tarefa devem ser recuperáveis: você quer que o modelo reconheça quando algo não está funcionando e está correto, em vez de se comprometer com um caminho ruim desde o início. Exemplo: um agente que tenta uma solução, verifica se ela funcionou e tenta uma abordagem diferente se não funcionou.
-
Você está vendo um bom desempenho em um único turno, mas uma conclusão ruim de tarefas de ponta a ponta: se seu modelo lida bem com etapas individuais, mas tem dificuldade em agrupá-las em um resultado coerente e bem-sucedido, o RL de várias voltas pode ajudar a preencher essa lacuna.
Modelos, preços e regiões compatíveis
Modelos compatíveis
| Modelo | Região |
|---|---|
| Nova Lite 2.0 | IAD (us-east-1), PDX (us-west-2) |
| GPT-OSS-20B | IAD (us-east-1), PDX (us-west-2) |
| Gemma-4-31B-it | PDX (us-west-2) |
| Qwen 3.6 27V | PDX (us-west-2) |
Preços
Para obter detalhes completos sobre preços, consulte a página pública de preços
-
Pré-preenchimento: o custo de processamento dos tokens de entrada inseridos no modelo no início de cada etapa de treinamento. Isso inclui o prompt, o histórico de conversas e qualquer contexto que o modelo receba antes de gerar uma resposta.
-
Amostra: o custo dos tokens que o modelo gera durante a implementação do treinamento. É aqui que o modelo produz suas respostas, que são então avaliadas e usadas para calcular o sinal de recompensa.
-
Trem: o custo do retrocesso, em que os pesos do modelo são atualizados com base no sinal de recompensa. Essa é a principal etapa de aprendizado no processo de RL.