Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Feinabstimmung der Verstärkung (RFT)
Verstärkung Fine-Tuning (RFT) ist eine Technik, bei der die Modellleistung durch Feedback-Signale — messbare Punktzahlen oder Belohnungen, die auf die Qualität der Antworten hinweisen — verbessert wird, und nicht durch direkte Überwachung mit exakt richtigen Antworten. Im Gegensatz zu SFT, das aus Input-Output-Paaren lernt, verwendet RFT Belohnungsfunktionen, um die Modellreaktionen zu bewerten, und optimiert das Modell iterativ, um diese Belohnungen zu maximieren. RFT unterstützt sowohl Singleturn- als auch Multi-Turn-Training:
-
Single-turn RFT: Das Modell generiert eine einzelne Antwort auf eine Aufforderung, und eine Belohnungsfunktion bewertet diese Reaktion. Am besten geeignet für Aufgaben mit klaren Qualitätsmetriken pro Antwort wie Mathematik, Codegenerierung und strukturiertes Denken.
-
Multi-turn RFT: Das Modell nutzt Interaktionen in mehreren Schritten (z. B. agentische Arbeitsabläufe unter Verwendung von Tools), und eine Belohnungsfunktion bewertet den Gesamtverlauf. Ideal für komplexe Aufgaben, die eine sequentielle Entscheidungsfindung erfordern, wie z. B. mehrstufige Problemlösung, Werkzeugorchestrierung und Gesprächsagenten.
Wann sollte RFT verwendet werden
Verwenden Sie RFT, wenn Sie klare, messbare Erfolgskriterien definieren können, aber Schwierigkeiten haben, genau die richtigen Ergebnisse für das Training bereitzustellen. RFT ist ideal, wenn:
-
Sie haben eine zuverlässige Belohnungsfunktion, die Modellausgaben programmgesteuert auswerten kann
-
Sie müssen das Modellverhalten an bestimmten Präferenzen oder Einschränkungen ausrichten
-
Das Sammeln qualitativ hochwertiger, beschrifteter Beispiele ist teuer oder unpraktisch
-
Es gibt mehrere gültige Lösungen, aber einige sind eindeutig besser als andere (kreatives Schreiben, Codeoptimierung, komplexes Denken)
RFT zeichnet sich in Bereichen aus, in denen die Ausgabequalität objektiv gemessen werden kann: mathematische Problemlösung, Codegenerierung, wissenschaftliches Denken, strukturierte Datenanalyse, mehrstufiges Denken, Einsatz von Tools und komplexe Arbeitsabläufe mit spezifischen Einschränkungen.
Unterstützte Modelle
Single-turn und Multiturn-RFT sind für die folgenden Amazon Nova-Modelle verfügbar:
-
Nova 2.0 (Lite)
Wann sollte RFT im Vergleich Multi-turn zu Single-turn RFT verwendet werden
Wählen Sie Single-turn RFT, wenn es sich bei der Aufgabe um einen einmaligen Austausch handelt: Das Modell erhält eine Aufforderung und gibt eine einzelne Antwort aus, die eigenständig bewertet werden kann, ohne dass zwischengeschaltete Tool-Aufrufe oder der Umgebungsstatus nachverfolgt werden müssen. Dies eignet sich für Anwendungsfälle wie Klassifizierung, Extraktion, domänenspezifische Fragen und Antworten, Zusammenfassung, Inhaltsmoderation oder jede Aufgabe mit einer überprüfbaren Antwort (exakte Übereinstimmung, F1, Schemavalidierung, regelbasierte oder Überprüfung der endgültigen Ausgabe). LLM-judge Es ist einfacher, billiger und schneller durchzuführen, da jeder Rollout eine einzelne Generation ist und die Belohnung am Ende einmal berechnet wird.
Entscheiden Sie sich für Multi-turn RFT, wenn die Aufgabe erfordert, dass das Modell in mehreren Schritten als Agent fungiert — das Aufrufen von Tools, das Lesen und Ändern des Zustands und die Anpassung an das, was zurückkommt —, bevor das Ergebnis beurteilt werden kann. Dies eignet sich für agentische Arbeitsabläufe wie Abläufe bei der Verwendung von Werkzeugen, mehrstufige Problembehebung, Konversationsassistenten oder jede andere Aufgabe, bei der der Erfolg nicht nur von der endgültigen Antwort, sondern vom Verlauf (der Reihenfolge und Richtigkeit der Aktionen in mehreren Zügen) abhängt.
Faustregel: Wenn Ihre Aufgabe anhand einer einzigen Modellausgabe bewertet werden kann, ohne dass Werkzeuge aufgerufen werden oder sich der Status weiterentwickelt, verwenden Sie Single-turn RFT. Wenn der Erfolg von einer Abfolge von Aktionen gegen Tools oder einer zustandsbehafteten Umgebung abhängt, verwenden Sie Multi-turn RFT.
Wann sollte Nova 1.0 im Vergleich zu Nova 2.0 verwendet werden
RFT ist nur auf Nova 2.0 Lite verfügbar. Verwenden Sie für Nova 1.0-Modelle Direct Preference Optimization (DPO) oder Proximal Policy Optimization (PPO) als alternative Ausrichtungstechniken.
Modus „Argumentation“
Amazon Nova 2.0 unterstützt den Argumentationsmodus während des RFT-Trainings. Die folgenden Modi sind verfügbar:
-
none: Keine Begründung (lassen Sie das Feld reasoning_effort aus)
-
niedrig: Minimaler Argumentationsaufwand
-
hoch: Maximales Denkvermögen (Standardeinstellung, wenn reasoning_effort angegeben ist)
Anmerkung
Für RFT gibt es keine mittlere Option. Wenn das Feld reasoning_effort in Ihrer Konfiguration fehlt, ist die Argumentation deaktiviert.