As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Configurando funções de recompensa para modelos Amazon Nova
As funções de recompensa avaliam a qualidade da resposta e fornecem sinais de feedback para o treinamento do modelo. Você pode configurar funções de recompensa usando funções personalizadas do Lambda ou modelos da Amazon Bedrock-hosted Foundation como juízes. Modelos guiados estão disponíveis para simplificar a criação de funções de recompensa para tarefas comuns, como acompanhamento de instruções e validação de formato. Escolha a abordagem que atenda aos requisitos da sua tarefa.
Aprendizado por reforço por meio de recompensas verificáveis (RLVR)
O RLVR otimiza modelos para tarefas objetivas, como geração de código ou raciocínio matemático, usando avaliadores verificáveis baseados em regras ou modelos prontos para uso.
Você tem duas opções para RLVR (código personalizado):
O console Amazon Bedrock fornece modelos de amostra para funções do Grader Lambda:
-
Raciocínio matemático com verificação da verdade básica
-
Validação de formato e verificação de restrições
-
Modelo genérico de niveladora Lambda com código clichê
Siga as instruções no modelo fornecido na página Create RFT job no console Amazon Bedrock.
Crie funções de recompensa personalizadas usando seu próprio Lambda ARN para lógica complexa, APIs externas, cálculos de várias etapas ou combinação de vários critérios de avaliação.
nota
Se você usa sua própria função do Lambda, tenha em mente o seguinte:
-
Aumente o tempo limite do Lambda do padrão de 3 segundos para no máximo 15 minutos para avaliações complexas.
-
A função de execução do Lambda precisa de permissões para invocar modelos conforme descrito em. Acesso e segurança para modelos Amazon Nova
Aprendizado por reforço por meio de feedback de IA (RLAIF)
O RLAIF otimiza modelos para tarefas subjetivas, como acompanhamento de instruções ou interações com chatbots, usando juízes com modelos prontos para uso. AI-based
Para RLAIF (Modelo como Juiz):
-
Selecione um modelo básico hospedado pela Amazon Bedrock como juiz
-
Configurar instruções para avaliação
-
Defina critérios de avaliação e diretrizes de pontuação
Modelos de LLM-as-Judge prompt disponíveis no console Amazon Bedrock:
-
Seguimento das instruções (treinamento do modelo de juiz)
-
Resumo (Multi-turn diálogos)
-
Avaliação do raciocínio (CoT para domínios especializados)
-
Fidelidade ao RAG (perguntas e respostas) Context-grounded
nota
A opção Model as Judge do console converte automaticamente sua configuração em uma função Lambda durante o treinamento.
Detalhes da implementação da função Lambda
Ao implementar funções de recompensa personalizadas do Lambda, sua função deve aceitar e retornar dados no formato a seguir.
Diretrizes de design
Classifique as respostas — Dê à melhor resposta uma pontuação claramente mais alta
Use verificações consistentes — Avalie a conclusão da tarefa, a adesão ao formato, a segurança e a duração razoável
Mantenha a escala estável — Mantenha as pontuações normalizadas e não exploráveis