View a markdown version of this page

RFT - Amazon SageMaker AI

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

RFT

Reinforcement Fine-Tuning (RFT) utilizza l'apprendimento per rinforzo per ottimizzare il comportamento del modello sulla base di segnali di ricompensa piuttosto che di esempi espliciti di input-output. Amazon SageMaker AI supporta due varianti RFT: RLVR (Reinforcement Learning with Verifiable Rewards) e RLAIF (Reinforcement Learning from AI Feedback).

RLVR

RLVR utilizza una funzione di ricompensa basata su codice che verifica in modo programmatico se gli output del modello sono corretti. Ideale per attività con risposte oggettivamente giuste o sbagliate.

Quando utilizzarlo

  • La tua attività ha risposte corrette verificabili (matematica, codice, domande concrete)

  • Puoi scrivere una funzione di punteggio che valuti la correttezza delle risposte

  • Vuoi migliorare l'accuratezza dei fatti e ridurre le allucinazioni

Formato del set di dati

Ogni record contiene i metadati del modello di richiesta e ricompensa. La funzione di ricompensa valuta le risposte generate dal modello durante l'allenamento.

{ "data_source": "openai/gsm8k", "prompt": [ { "content": "Natalia sold clips to 48 of her friends in April, and then she sold half as many clips in May. How many clips did Natalia sell altogether in April and May? Let's think step by step and output the final answer after \"####\".", "role": "user" } ], "ability": "math", "reward_model": { "ground_truth": "72", "style": "rule" } }

Campi obbligatori:

  • prompt— matrice di oggetti messaggio con role e content

  • reward_model.style— impostato su "rule" per la verifica programmatica

  • reward_model.ground_truth— la risposta corretta per la verifica

Funzioni di ricompensa preimpostate

  • gsm8k— Verifica matematica scolastica

  • prime_code— Verifica della correttezza del codice

  • prime_math— Verifica del ragionamento matematico

Iperparametri RLVR LoRa

Nota

Le tabelle seguenti mostrano gli iperparametri disponibili quando si utilizza la personalizzazione del modello serverless. Personalizzazione del modello serverless Altri iperparametri sono preimpostati da Amazon SageMaker AI utilizzando valori predefiniti ottimizzati. Quando utilizzi SageMaker AI Training Jobs or HyperPod, puoi accedere all'elenco completo degli iperparametri disponibili nelle ricette. Consulta il repository SageMaker AI Recipes per ottenere una ricetta e accedere a tutti gli iperparametri.

Parametro Tipo Obbligatorio? Intervallo/valori Description
preset_reward_functionstringaCampo obbligatoriogsm8k, prime_code, prime_mathFunzione di ricompensa preimpostata per la verifica.
learning_ratevirgola mobileCampo obbligatorio1e-07—1e-03Dimensione del gradino per l'aggiornamento del peso. Impostare un valore più basso per RL (ad esempio, 1e-5).
lr_warmup_steps_ratiovirgola mobileCampo obbligatorio0—1Frazione di passaggi per il riscaldamento LR.
max_epochsinteroCampo obbligatorio1-100Numero di passaggi nel set di dati.
global_batch_sizeinteroCampo obbligatorio128, 256, 512, 1024Campioni totali per fase di ottimizzazione.
max_prompt_lengthinteroCampo obbligatorio512—16384Numero massimo di token per la porzione richiesta.
weight_decayvirgola mobileCampo obbligatorio0.0 - 1.0Coefficiente di regolarizzazione L2.
clip_ratiovirgola mobileCampo obbligatorio0,1—1,5Parametro di ritaglio GRPO. Limita la modifica della politica per aggiornamento.
kl_loss_coefvirgola mobileCampo obbligatorio0—0,1Peso della penalità di divergenza KL. Impedisce la deriva delle politiche.
rollout_ninteroCampo obbligatorio1, 2, 4, 8, 16, 32Risposte dei candidati per richiesta durante le implementazioni.
rollout_temperaturevirgola mobileCampo obbligatorio0,01—2,0Temperatura per la generazione del rollout.
lora_rankinteroCampo obbligatorio8, 16, 32, 64, 128LoRArango. Dimensionalità delle matrici di basso rango.
lora_alphainteroCampo obbligatorio16, 32, 64, 128, 256LoRAfattore di scala. L'LR effettivo si ridimensiona come. alpha/rank
warmup_stepsinteroCampo obbligatorio-1—100Fasi di riscaldamento assolute (-1 per auto).
min_lrvirgola mobileCampo obbligatorio0.0 - 1.0Frequenza minima di apprendimento.
clip_ratio_highvirgola mobileCampo obbligatorio0,0—0,5Soglia di ritaglio superiore.
clip_ratio_lowvirgola mobileCampo obbligatorio0,0—0,5Soglia di ritaglio inferiore.
temperaturevirgola mobileCampo obbligatorio0,0-2,0Temperatura di campionamento per la valutazione.
use_kl_lossbooleanoCampo obbligatoriotrue, falseAggiungi la penalità di divergenza KL alla perdita.
train_val_split_ratiovirgola mobileFacoltativo0.0 - 1.0Train/validation dividere.

Iperparametri FFT RLVR

Stessi parametri di RLVR LoRa senza e. lora_rank lora_alpha

RAIF

RLAIF utilizza un altro LLM come giudice per valutare le risposte del modello sulla base di una richiesta di ricompensa in linguaggio naturale. Ideale per attività con criteri di qualità soggettivi difficili da valutare programmaticamente.

Quando utilizzarlo

  • I tuoi criteri di qualità sono soggettivi (disponibilità, sicurezza, tono)

  • Puoi descrivere l'aspetto di «buono» in linguaggio naturale

  • Vuoi scalare il feedback oltre a quello che può fornire l'annotazione umana

Formato del set di dati

Ogni record contiene i metadati del modello di richiesta e ricompensa. Il giudice LLM valuta le risposte generate dal modello durante la formazione.

{ "data_source": "WeOpenML/PandaLM", "prompt": [ { "role": "user", "content": "Below are two responses for a given task...Evaluate the responses and generate a reference answer.\n\n### Instruction:\nCompare the given products..." } ], "ability": "pairwise-judging", "reward_model": { "style": "llmj", "ground_truth": "2\n\n### Reason: Response 2 provides a more detailed comparison..." } }

Campi obbligatori:

  • prompt— matrice di oggetti messaggio con role e content

  • reward_model.style— impostato su "llmj" for LLM-as-judge

  • reward_model.ground_truth— giudizio di riferimento per la calibrazione

Modelli Judge

I seguenti modelli di giudice preimpostati sono forniti nel contenitore di formazione. Selezionane uno utilizzando l'judge_prompt_templateiperparametro.

  • cot.jinja— valutazione Chain-of-thought

  • evaluate.jinja— Valutazione generale della qualità

  • faithfulness.jinja— Fedeltà al materiale originale

  • summarize.jinja— Qualità del riepilogo

  • grader.jinja— valutazione Rubric-based

Iperparametri RLAIF LoRa

Stessi parametri di RLVR LoRa con la seguente differenza:

ParametroTipoObbligatorio?Intervallo/valoriDescription
judge_prompt_templatestringaFacoltativocot.jinja, evaluate.jinja, faithfulness.jinja, summarize.jinja, grader.jinjaModello per la valutazione dei giudici del LLM. Sostituiscepreset_reward_function.

Iperparametri FFT RLAIF

Stessi parametri di RLAIF LoRa senza e. lora_rank lora_alpha