View a markdown version of this page

RFT - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

RFT

Reinforcement Fine-Tuning (RFT) nutzt Reinforcement Learning zur Optimierung des Modellverhaltens auf der Grundlage von Belohnungssignalen und nicht anhand von expliziten Input-Output-Beispielen. Amazon SageMaker AI unterstützt zwei RFT-Varianten: RLVR (Reinforcement Learning with Verifiable Rewards) und RLAIF (Reinforcement Learning from AI Feedback).

RLVR

RLVR verwendet eine codebasierte Belohnungsfunktion, die programmgesteuert überprüft, ob die Modellausgaben korrekt sind. Am besten geeignet für Aufgaben mit objektiv richtigen oder falschen Antworten.

Wann sollte dies verwendet werden?

  • Ihre Aufgabe enthält nachweislich richtige Antworten (Mathematik, Code, Sachfragen)

  • Sie können eine Bewertungsfunktion schreiben, die die Richtigkeit der Antworten bewertet

  • Sie möchten die sachliche Genauigkeit verbessern und Halluzinationen reduzieren

Format des Datensatzes

Jeder Datensatz enthält Modell-Metadaten für Aufforderungen und Belohnungen. Die Belohnungsfunktion wertet modellgenerierte Reaktionen während des Trainings aus.

{ "data_source": "openai/gsm8k", "prompt": [ { "content": "Natalia sold clips to 48 of her friends in April, and then she sold half as many clips in May. How many clips did Natalia sell altogether in April and May? Let's think step by step and output the final answer after \"####\".", "role": "user" } ], "ability": "math", "reward_model": { "ground_truth": "72", "style": "rule" } }

Erforderliche Felder:

  • prompt— Array von Nachrichtenobjekten mit role und content

  • reward_model.style"rule" für die programmatische Überprüfung auf gesetzt

  • reward_model.ground_truth— die richtige Antwort für die Überprüfung

Voreingestellte Belohnungsfunktionen

  • gsm8k— Überprüfung der Mathematik in der Grundschule

  • prime_code— Überprüfung der Richtigkeit des Codes

  • prime_math— Überprüfung der mathematischen Argumentation

RLVR — LoRa-Hyperparameter

Anmerkung

Die folgenden Tabellen zeigen die Hyperparameter, die verfügbar sind, wenn Sie die serverlose Modellanpassung verwenden. Andere Hyperparameter werden von Amazon SageMaker AI unter Verwendung optimierter Standardwerte voreingestellt. Wenn Sie SageMaker AI Training Jobs oder verwenden HyperPod, können Sie auf die vollständige Liste der Hyperparameter zugreifen, die in den Rezepten verfügbar sind. Im SageMaker AI Recipes-Repository finden Sie ein Rezept und können auf alle Hyperparameter zugreifen.

Parameter Typ Erforderlich? Bereich/Werte Description
preset_reward_functionZeichenfolgeErforderlichgsm8k, prime_code, prime_mathVoreingestellte Belohnungsfunktion zur Überprüfung.
learning_ratefloatErforderlich1e-07—1e-03Schrittgröße für Gewichtsaktualisierungen. Stellen Sie für RL einen niedrigeren Wert ein (z. B. 1e-5).
lr_warmup_steps_ratiofloatErforderlich0—1Bruchteil der Schritte für das LR-Aufwärmen.
max_epochsGanzzahlErforderlich1-100Anzahl der Durchläufe durch den Datensatz.
global_batch_sizeGanzzahlErforderlich128, 256, 512, 1024Gesamtzahl der Stichproben pro Optimierer-Schritt.
max_prompt_lengthGanzzahlErforderlich512—16384Maximale Anzahl an Tokens für den Prompt-Teil.
weight_decayfloatErforderlich0,0 bis 1,0L2-Regularisierungskoeffizient.
clip_ratiofloatErforderlich0,1—1,5GRPO-Schnittparameter. Schränkt die Änderung der Richtlinien pro Update ein.
kl_loss_coeffloatErforderlich0—0,1Strafgewicht für KL-Divergenzen. Beugt politischen Abweichungen vor.
rollout_nGanzzahlErforderlich1, 2, 4, 8, 16, 32Antworten der Kandidaten pro Aufforderung während der Rollouts.
rollout_temperaturefloatErforderlich0,01—2,0Temperatur für die Rollout-Generierung.
lora_rankGanzzahlErforderlich8, 16, 32, 64, 128LoRARang. Dimensionalität von Matrizen mit niedrigem Rang.
lora_alphaGanzzahlErforderlich16, 32, 64, 128, 256LoRASkalierungsfaktor. Effektiver LR skaliert als alpha/rank.
warmup_stepsGanzzahlErforderlich-1—100Absolute Aufwärmschritte (-1 für Auto).
min_lrfloatErforderlich0,0 bis 1,0Mindestuntergrenze für die Lernrate.
clip_ratio_highfloatErforderlich0,0—0,5Oberer Schwellenwert für das Ausschneiden.
clip_ratio_lowfloatErforderlich0,0—0,5Niedrigerer Schwellenwert für das Ausschneiden.
temperaturefloatErforderlich0,0—2,0Probenahmetemperatur zur Auswertung.
use_kl_lossbooleschErforderlichtrue, falseFügen Sie dem Verlust den KL-Divergenzabzug hinzu.
train_val_split_ratiofloatOptional0,0 bis 1,0Train/validation aufgeteilt.

RLVR-FFT-Hyperparameter

Dieselben Parameter wie RLVR LoRa ohne und. lora_rank lora_alpha

RLAIF

RLAIF verwendet einen anderen LLM als Richter, um die Modellantworten auf der Grundlage einer Aufforderung zur Belohnung in natürlicher Sprache zu bewerten. Am besten geeignet für Aufgaben mit subjektiven Qualitätskriterien, die sich programmatisch nur schwer bewerten lassen.

Wann sollte dies verwendet werden?

  • Ihre Qualitätskriterien sind subjektiv (Hilfsbereitschaft, Sicherheit, Tonalität)

  • Du kannst in natürlicher Sprache beschreiben, wie „gut“ aussieht

  • Sie möchten Feedback über das hinaus skalieren, was menschliche Annotationen bieten können

Format des Datensatzes

Jeder Datensatz enthält Modell-Metadaten für Aufforderungen und Belohnungen. Der LLM-Richter bewertet die modellgenerierten Antworten während des Trainings.

{ "data_source": "WeOpenML/PandaLM", "prompt": [ { "role": "user", "content": "Below are two responses for a given task...Evaluate the responses and generate a reference answer.\n\n### Instruction:\nCompare the given products..." } ], "ability": "pairwise-judging", "reward_model": { "style": "llmj", "ground_truth": "2\n\n### Reason: Response 2 provides a more detailed comparison..." } }

Erforderliche Felder:

  • prompt— Array von Nachrichtenobjekten mit role und content

  • reward_model.style— gesetzt auf "llmj" für LLM-as-judge

  • reward_model.ground_truth— Referenzurteil für die Kalibrierung

Vorlagen für Richter

Die folgenden voreingestellten Vorlagen für Richter sind im Schulungscontainer enthalten. Wählen Sie mithilfe des judge_prompt_template Hyperparameters eine aus.

  • cot.jinja— Bewertung Chain-of-thought

  • evaluate.jinja— Allgemeine Qualitätsbewertung

  • faithfulness.jinja— Treue zum Quellenmaterial

  • summarize.jinja— Qualität der Zusammenfassung

  • grader.jinja— Benotung Rubric-based

RLAIF LoRa-Hyperparameter

Dieselben Parameter wie RLVR LoRa mit dem folgenden Unterschied:

ParameterTypErforderlich?Bereich/WerteDescription
judge_prompt_templateZeichenfolgeOptionalcot.jinja, evaluate.jinja, faithfulness.jinja, summarize.jinja, grader.jinjaVorlage für die Bewertung durch LLM-Juroren. Ersetztpreset_reward_function.

RLAIF FFT-Hyperparameter

Dieselben Parameter wie RLAIF LoRa ohne und. lora_rank lora_alpha