Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
RFT
Reinforcement Fine-Tuning (RFT) utilizza l'apprendimento per rinforzo per ottimizzare il comportamento del modello sulla base di segnali di ricompensa piuttosto che di esempi espliciti di input-output. Amazon SageMaker AI supporta due varianti RFT: RLVR (Reinforcement Learning with Verifiable Rewards) e RLAIF (Reinforcement Learning from AI Feedback).
RLVR
RLVR utilizza una funzione di ricompensa basata su codice che verifica in modo programmatico se gli output del modello sono corretti. Ideale per attività con risposte oggettivamente giuste o sbagliate.
Quando utilizzarlo
La tua attività ha risposte corrette verificabili (matematica, codice, domande concrete)
Puoi scrivere una funzione di punteggio che valuti la correttezza delle risposte
Vuoi migliorare l'accuratezza dei fatti e ridurre le allucinazioni
Formato del set di dati
Ogni record contiene i metadati del modello di richiesta e ricompensa. La funzione di ricompensa valuta le risposte generate dal modello durante l'allenamento.
{ "data_source": "openai/gsm8k", "prompt": [ { "content": "Natalia sold clips to 48 of her friends in April, and then she sold half as many clips in May. How many clips did Natalia sell altogether in April and May? Let's think step by step and output the final answer after \"####\".", "role": "user" } ], "ability": "math", "reward_model": { "ground_truth": "72", "style": "rule" } }
Campi obbligatori:
prompt— matrice di oggetti messaggio conroleecontentreward_model.style— impostato su"rule"per la verifica programmaticareward_model.ground_truth— la risposta corretta per la verifica
Funzioni di ricompensa preimpostate
gsm8k— Verifica matematica scolasticaprime_code— Verifica della correttezza del codiceprime_math— Verifica del ragionamento matematico
Iperparametri RLVR LoRa
Nota
Le tabelle seguenti mostrano gli iperparametri disponibili quando si utilizza la personalizzazione del modello serverless. Personalizzazione del modello serverless Altri iperparametri sono preimpostati da Amazon SageMaker AI utilizzando valori predefiniti ottimizzati. Quando utilizzi SageMaker AI Training Jobs or HyperPod, puoi accedere all'elenco completo degli iperparametri disponibili nelle ricette. Consulta il repository SageMaker AI Recipes
| Parametro | Tipo | Obbligatorio? | Intervallo/valori | Description |
|---|---|---|---|---|
preset_reward_function | stringa | Campo obbligatorio | gsm8k, prime_code, prime_math | Funzione di ricompensa preimpostata per la verifica. |
learning_rate | virgola mobile | Campo obbligatorio | 1e-07—1e-03 | Dimensione del gradino per l'aggiornamento del peso. Impostare un valore più basso per RL (ad esempio, 1e-5). |
lr_warmup_steps_ratio | virgola mobile | Campo obbligatorio | 0—1 | Frazione di passaggi per il riscaldamento LR. |
max_epochs | intero | Campo obbligatorio | 1-100 | Numero di passaggi nel set di dati. |
global_batch_size | intero | Campo obbligatorio | 128, 256, 512, 1024 | Campioni totali per fase di ottimizzazione. |
max_prompt_length | intero | Campo obbligatorio | 512—16384 | Numero massimo di token per la porzione richiesta. |
weight_decay | virgola mobile | Campo obbligatorio | 0.0 - 1.0 | Coefficiente di regolarizzazione L2. |
clip_ratio | virgola mobile | Campo obbligatorio | 0,1—1,5 | Parametro di ritaglio GRPO. Limita la modifica della politica per aggiornamento. |
kl_loss_coef | virgola mobile | Campo obbligatorio | 0—0,1 | Peso della penalità di divergenza KL. Impedisce la deriva delle politiche. |
rollout_n | intero | Campo obbligatorio | 1, 2, 4, 8, 16, 32 | Risposte dei candidati per richiesta durante le implementazioni. |
rollout_temperature | virgola mobile | Campo obbligatorio | 0,01—2,0 | Temperatura per la generazione del rollout. |
lora_rank | intero | Campo obbligatorio | 8, 16, 32, 64, 128 | LoRArango. Dimensionalità delle matrici di basso rango. |
lora_alpha | intero | Campo obbligatorio | 16, 32, 64, 128, 256 | LoRAfattore di scala. L'LR effettivo si ridimensiona come. alpha/rank |
warmup_steps | intero | Campo obbligatorio | -1—100 | Fasi di riscaldamento assolute (-1 per auto). |
min_lr | virgola mobile | Campo obbligatorio | 0.0 - 1.0 | Frequenza minima di apprendimento. |
clip_ratio_high | virgola mobile | Campo obbligatorio | 0,0—0,5 | Soglia di ritaglio superiore. |
clip_ratio_low | virgola mobile | Campo obbligatorio | 0,0—0,5 | Soglia di ritaglio inferiore. |
temperature | virgola mobile | Campo obbligatorio | 0,0-2,0 | Temperatura di campionamento per la valutazione. |
use_kl_loss | booleano | Campo obbligatorio | true, false | Aggiungi la penalità di divergenza KL alla perdita. |
train_val_split_ratio | virgola mobile | Facoltativo | 0.0 - 1.0 | Train/validation dividere. |
Iperparametri FFT RLVR
Stessi parametri di RLVR LoRa senza e. lora_rank lora_alpha
RAIF
RLAIF utilizza un altro LLM come giudice per valutare le risposte del modello sulla base di una richiesta di ricompensa in linguaggio naturale. Ideale per attività con criteri di qualità soggettivi difficili da valutare programmaticamente.
Quando utilizzarlo
I tuoi criteri di qualità sono soggettivi (disponibilità, sicurezza, tono)
Puoi descrivere l'aspetto di «buono» in linguaggio naturale
Vuoi scalare il feedback oltre a quello che può fornire l'annotazione umana
Formato del set di dati
Ogni record contiene i metadati del modello di richiesta e ricompensa. Il giudice LLM valuta le risposte generate dal modello durante la formazione.
{ "data_source": "WeOpenML/PandaLM", "prompt": [ { "role": "user", "content": "Below are two responses for a given task...Evaluate the responses and generate a reference answer.\n\n### Instruction:\nCompare the given products..." } ], "ability": "pairwise-judging", "reward_model": { "style": "llmj", "ground_truth": "2\n\n### Reason: Response 2 provides a more detailed comparison..." } }
Campi obbligatori:
prompt— matrice di oggetti messaggio conroleecontentreward_model.style— impostato su"llmj"for LLM-as-judgereward_model.ground_truth— giudizio di riferimento per la calibrazione
Modelli Judge
I seguenti modelli di giudice preimpostati sono forniti nel contenitore di formazione. Selezionane uno utilizzando l'judge_prompt_templateiperparametro.
cot.jinja— valutazione Chain-of-thoughtevaluate.jinja— Valutazione generale della qualitàfaithfulness.jinja— Fedeltà al materiale originalesummarize.jinja— Qualità del riepilogograder.jinja— valutazione Rubric-based
Iperparametri RLAIF LoRa
Stessi parametri di RLVR LoRa con la seguente differenza:
| Parametro | Tipo | Obbligatorio? | Intervallo/valori | Description |
|---|---|---|---|---|
judge_prompt_template | stringa | Facoltativo | cot.jinja, evaluate.jinja, faithfulness.jinja, summarize.jinja, grader.jinja | Modello per la valutazione dei giudici del LLM. Sostituiscepreset_reward_function. |
Iperparametri FFT RLAIF
Stessi parametri di RLAIF LoRa senza e. lora_rank lora_alpha