As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
RFT
O reforço Fine-Tuning (RFT) usa o aprendizado por reforço para otimizar o comportamento do modelo com base em sinais de recompensa, em vez de exemplos explícitos de entrada-saída. O Amazon SageMaker AI oferece suporte a duas variantes de RFT: RLVR (Reinforcement Learning with Verifiable Rewards) e RLAIF (Reinforcement Learning from AI Feedback).
RLVR
O RLVR usa uma função de recompensa baseada em código que verifica programaticamente se as saídas do modelo estão corretas. Mais adequado para tarefas com respostas objetivamente certas ou erradas.
Quando usar
Sua tarefa tem respostas corretas verificáveis (matemática, código, questões factuais)
Você pode escrever uma função de pontuação que avalia a correção da resposta
Você quer melhorar a precisão factual e reduzir as alucinações
Formato do conjunto de dados
Cada registro contém metadados do modelo de solicitação e recompensa. A função de recompensa avalia as respostas geradas pelo modelo durante o treinamento.
{ "data_source": "openai/gsm8k", "prompt": [ { "content": "Natalia sold clips to 48 of her friends in April, and then she sold half as many clips in May. How many clips did Natalia sell altogether in April and May? Let's think step by step and output the final answer after \"####\".", "role": "user" } ], "ability": "math", "reward_model": { "ground_truth": "72", "style": "rule" } }
Campos obrigatórios:
prompt— matriz de objetos de mensagem comroleecontentreward_model.style— definido como"rule"para verificação programáticareward_model.ground_truth— a resposta correta para verificação
Funções de recompensa predefinidas
gsm8k— Verificação de matemática na escola primáriaprime_code— Verificação da exatidão do códigoprime_math— Verificação do raciocínio matemático
Hiperparâmetros RLVR LoRa
nota
As tabelas abaixo mostram os hiperparâmetros disponíveis quando você usa a personalização do modelo sem servidor. Outros hiperparâmetros são predefinidos pela Amazon SageMaker AI usando padrões otimizados. Ao usar o SageMaker AI Training Jobs ou HyperPod, você pode acessar a lista completa de hiperparâmetros disponíveis nas receitas. Consulte o repositório SageMaker AI Recipes
| Parâmetro | Tipo | Obrigatório? | Intervalo/Valores | Description |
|---|---|---|---|---|
preset_reward_function | string | Obrigatório | gsm8k, prime_code, prime_math | Função de recompensa predefinida para verificação. |
learning_rate | flutuação | Obrigatório | 1e-07—1e-03 | Tamanho da etapa para atualizações de peso. Defina como menor para RL (por exemplo, 1e-5). |
lr_warmup_steps_ratio | flutuação | Obrigatório | 0—1 | Fração de etapas para aquecimento do LR. |
max_epochs | integer | Obrigatório | 1–100 | Número de passagens pelo conjunto de dados. |
global_batch_size | integer | Obrigatório | 128, 256, 512, 1024 | Total de amostras por etapa do otimizador. |
max_prompt_length | integer | Obrigatório | 512—16384 | Máximo de tokens por porção imediata. |
weight_decay | flutuação | Obrigatório | 0, 0 a 1,0 | Coeficiente de regularização L2. |
clip_ratio | flutuação | Obrigatório | 0,1—1,5 | Parâmetro de recorte GRPO. Limita a alteração da política por atualização. |
kl_loss_coef | flutuação | Obrigatório | 0—0,1 | Peso da penalidade por divergência KL. Evita desvios nas políticas. |
rollout_n | integer | Obrigatório | 1, 2, 4, 8, 16, 32 | Respostas dos candidatos por solicitação durante os lançamentos. |
rollout_temperature | flutuação | Obrigatório | 0,01—2,0 | Temperatura para geração de lançamento. |
lora_rank | integer | Obrigatório | 8, 16, 32, 64, 128 | LoRAclassificação. Dimensionalidade de matrizes de baixa classificação. |
lora_alpha | integer | Obrigatório | 16, 32, 64, 128, 256 | LoRAfator de escala. O LR eficaz é escalado como alpha/rank. |
warmup_steps | integer | Obrigatório | -1—100 | Etapas de aquecimento absoluto (-1 para automático). |
min_lr | flutuação | Obrigatório | 0, 0 a 1,0 | Piso mínimo da taxa de aprendizagem. |
clip_ratio_high | flutuação | Obrigatório | 0,0—0,5 | Limite superior de recorte. |
clip_ratio_low | flutuação | Obrigatório | 0,0—0,5 | Limite de recorte inferior. |
temperature | flutuação | Obrigatório | 0,0—2,0 | Temperatura de amostragem para avaliação. |
use_kl_loss | booleano | Obrigatório | true, false | Adicione a penalidade de divergência KL à derrota. |
train_val_split_ratio | flutuação | Opcional | 0, 0 a 1,0 | Train/validation dividir. |
Hiperparâmetros RLVR FFT
Mesmos parâmetros do RLVR LoRa sem e. lora_rank lora_alpha
RALIF
O RLAIF usa outro LLM como juiz para avaliar as respostas do modelo com base em uma solicitação de recompensa em linguagem natural. Mais adequado para tarefas com critérios de qualidade subjetivos que são difíceis de avaliar programaticamente.
Quando usar
Seus critérios de qualidade são subjetivos (utilidade, segurança, tom)
Você pode descrever a aparência de “bom” em linguagem natural
Você quer escalar o feedback além do que a anotação humana pode fornecer
Formato do conjunto de dados
Cada registro contém metadados do modelo de solicitação e recompensa. O juiz do LLM avalia as respostas geradas pelo modelo durante o treinamento.
{ "data_source": "WeOpenML/PandaLM", "prompt": [ { "role": "user", "content": "Below are two responses for a given task...Evaluate the responses and generate a reference answer.\n\n### Instruction:\nCompare the given products..." } ], "ability": "pairwise-judging", "reward_model": { "style": "llmj", "ground_truth": "2\n\n### Reason: Response 2 provides a more detailed comparison..." } }
Campos obrigatórios:
prompt— matriz de objetos de mensagem comroleecontentreward_model.style— definido como"llmj"para LLM-as-judgereward_model.ground_truth— julgamento de referência para calibração
Modelos de juízes
Os seguintes modelos de juízes predefinidos são fornecidos no contêiner de treinamento. Selecione um usando o judge_prompt_template hiperparâmetro.
cot.jinja— Chain-of-thought avaliaçãoevaluate.jinja— Avaliação geral da qualidadefaithfulness.jinja— Fidelidade ao material de origemsummarize.jinja— Qualidade da sumarizaçãograder.jinja— Rubric-based classificação
Hiperparâmetros RLAIF LoRa
Mesmos parâmetros do RLVR LoRa com a seguinte diferença:
| Parâmetro | Tipo | Obrigatório? | Intervalo/Valores | Description |
|---|---|---|---|---|
judge_prompt_template | string | Opcional | cot.jinja, avalie.jinja, faithfulness.jinja, summarize.jinja, grader.jinja | Modelo para avaliação de juízes do LLM. Substituipreset_reward_function. |
Hiperparâmetros RLAIF FFT
Mesmos parâmetros do RLAIF LoRa sem e. lora_rank lora_alpha