Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
RFT
Reinforcement Fine-Tuning (RFT) nutzt Reinforcement Learning zur Optimierung des Modellverhaltens auf der Grundlage von Belohnungssignalen und nicht anhand von expliziten Input-Output-Beispielen. Amazon SageMaker AI unterstützt zwei RFT-Varianten: RLVR (Reinforcement Learning with Verifiable Rewards) und RLAIF (Reinforcement Learning from AI Feedback).
RLVR
RLVR verwendet eine codebasierte Belohnungsfunktion, die programmgesteuert überprüft, ob die Modellausgaben korrekt sind. Am besten geeignet für Aufgaben mit objektiv richtigen oder falschen Antworten.
Wann sollte dies verwendet werden?
Ihre Aufgabe enthält nachweislich richtige Antworten (Mathematik, Code, Sachfragen)
Sie können eine Bewertungsfunktion schreiben, die die Richtigkeit der Antworten bewertet
Sie möchten die sachliche Genauigkeit verbessern und Halluzinationen reduzieren
Format des Datensatzes
Jeder Datensatz enthält Modell-Metadaten für Aufforderungen und Belohnungen. Die Belohnungsfunktion wertet modellgenerierte Reaktionen während des Trainings aus.
{ "data_source": "openai/gsm8k", "prompt": [ { "content": "Natalia sold clips to 48 of her friends in April, and then she sold half as many clips in May. How many clips did Natalia sell altogether in April and May? Let's think step by step and output the final answer after \"####\".", "role": "user" } ], "ability": "math", "reward_model": { "ground_truth": "72", "style": "rule" } }
Erforderliche Felder:
prompt— Array von Nachrichtenobjekten mitroleundcontentreward_model.style—"rule"für die programmatische Überprüfung auf gesetztreward_model.ground_truth— die richtige Antwort für die Überprüfung
Voreingestellte Belohnungsfunktionen
gsm8k— Überprüfung der Mathematik in der Grundschuleprime_code— Überprüfung der Richtigkeit des Codesprime_math— Überprüfung der mathematischen Argumentation
RLVR — LoRa-Hyperparameter
Anmerkung
Die folgenden Tabellen zeigen die Hyperparameter, die verfügbar sind, wenn Sie die serverlose Modellanpassung verwenden. Andere Hyperparameter werden von Amazon SageMaker AI unter Verwendung optimierter Standardwerte voreingestellt. Wenn Sie SageMaker AI Training Jobs oder verwenden HyperPod, können Sie auf die vollständige Liste der Hyperparameter zugreifen, die in den Rezepten verfügbar sind. Im SageMaker AI Recipes-Repository finden
| Parameter | Typ | Erforderlich? | Bereich/Werte | Description |
|---|---|---|---|---|
preset_reward_function | Zeichenfolge | Erforderlich | gsm8k, prime_code, prime_math | Voreingestellte Belohnungsfunktion zur Überprüfung. |
learning_rate | float | Erforderlich | 1e-07—1e-03 | Schrittgröße für Gewichtsaktualisierungen. Stellen Sie für RL einen niedrigeren Wert ein (z. B. 1e-5). |
lr_warmup_steps_ratio | float | Erforderlich | 0—1 | Bruchteil der Schritte für das LR-Aufwärmen. |
max_epochs | Ganzzahl | Erforderlich | 1-100 | Anzahl der Durchläufe durch den Datensatz. |
global_batch_size | Ganzzahl | Erforderlich | 128, 256, 512, 1024 | Gesamtzahl der Stichproben pro Optimierer-Schritt. |
max_prompt_length | Ganzzahl | Erforderlich | 512—16384 | Maximale Anzahl an Tokens für den Prompt-Teil. |
weight_decay | float | Erforderlich | 0,0 bis 1,0 | L2-Regularisierungskoeffizient. |
clip_ratio | float | Erforderlich | 0,1—1,5 | GRPO-Schnittparameter. Schränkt die Änderung der Richtlinien pro Update ein. |
kl_loss_coef | float | Erforderlich | 0—0,1 | Strafgewicht für KL-Divergenzen. Beugt politischen Abweichungen vor. |
rollout_n | Ganzzahl | Erforderlich | 1, 2, 4, 8, 16, 32 | Antworten der Kandidaten pro Aufforderung während der Rollouts. |
rollout_temperature | float | Erforderlich | 0,01—2,0 | Temperatur für die Rollout-Generierung. |
lora_rank | Ganzzahl | Erforderlich | 8, 16, 32, 64, 128 | LoRARang. Dimensionalität von Matrizen mit niedrigem Rang. |
lora_alpha | Ganzzahl | Erforderlich | 16, 32, 64, 128, 256 | LoRASkalierungsfaktor. Effektiver LR skaliert als alpha/rank. |
warmup_steps | Ganzzahl | Erforderlich | -1—100 | Absolute Aufwärmschritte (-1 für Auto). |
min_lr | float | Erforderlich | 0,0 bis 1,0 | Mindestuntergrenze für die Lernrate. |
clip_ratio_high | float | Erforderlich | 0,0—0,5 | Oberer Schwellenwert für das Ausschneiden. |
clip_ratio_low | float | Erforderlich | 0,0—0,5 | Niedrigerer Schwellenwert für das Ausschneiden. |
temperature | float | Erforderlich | 0,0—2,0 | Probenahmetemperatur zur Auswertung. |
use_kl_loss | boolesch | Erforderlich | true, false | Fügen Sie dem Verlust den KL-Divergenzabzug hinzu. |
train_val_split_ratio | float | Optional | 0,0 bis 1,0 | Train/validation aufgeteilt. |
RLVR-FFT-Hyperparameter
Dieselben Parameter wie RLVR LoRa ohne und. lora_rank lora_alpha
RLAIF
RLAIF verwendet einen anderen LLM als Richter, um die Modellantworten auf der Grundlage einer Aufforderung zur Belohnung in natürlicher Sprache zu bewerten. Am besten geeignet für Aufgaben mit subjektiven Qualitätskriterien, die sich programmatisch nur schwer bewerten lassen.
Wann sollte dies verwendet werden?
Ihre Qualitätskriterien sind subjektiv (Hilfsbereitschaft, Sicherheit, Tonalität)
Du kannst in natürlicher Sprache beschreiben, wie „gut“ aussieht
Sie möchten Feedback über das hinaus skalieren, was menschliche Annotationen bieten können
Format des Datensatzes
Jeder Datensatz enthält Modell-Metadaten für Aufforderungen und Belohnungen. Der LLM-Richter bewertet die modellgenerierten Antworten während des Trainings.
{ "data_source": "WeOpenML/PandaLM", "prompt": [ { "role": "user", "content": "Below are two responses for a given task...Evaluate the responses and generate a reference answer.\n\n### Instruction:\nCompare the given products..." } ], "ability": "pairwise-judging", "reward_model": { "style": "llmj", "ground_truth": "2\n\n### Reason: Response 2 provides a more detailed comparison..." } }
Erforderliche Felder:
prompt— Array von Nachrichtenobjekten mitroleundcontentreward_model.style— gesetzt auf"llmj"für LLM-as-judgereward_model.ground_truth— Referenzurteil für die Kalibrierung
Vorlagen für Richter
Die folgenden voreingestellten Vorlagen für Richter sind im Schulungscontainer enthalten. Wählen Sie mithilfe des judge_prompt_template Hyperparameters eine aus.
cot.jinja— Bewertung Chain-of-thoughtevaluate.jinja— Allgemeine Qualitätsbewertungfaithfulness.jinja— Treue zum Quellenmaterialsummarize.jinja— Qualität der Zusammenfassunggrader.jinja— Benotung Rubric-based
RLAIF LoRa-Hyperparameter
Dieselben Parameter wie RLVR LoRa mit dem folgenden Unterschied:
| Parameter | Typ | Erforderlich? | Bereich/Werte | Description |
|---|---|---|---|---|
judge_prompt_template | Zeichenfolge | Optional | cot.jinja, evaluate.jinja, faithfulness.jinja, summarize.jinja, grader.jinja | Vorlage für die Bewertung durch LLM-Juroren. Ersetztpreset_reward_function. |
RLAIF FFT-Hyperparameter
Dieselben Parameter wie RLAIF LoRa ohne und. lora_rank lora_alpha