Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Kontinuierliche Anpassung
Bei der kontinuierlichen Anpassung können Sie auf einem zuvor angepassten Modell aufbauen, indem Sie zusätzliche Schulungen durchführen — entweder mit einer anderen Technik oder mit derselben Technik mit neuen Daten. Beginnen Sie beispielsweise mit SFT, um Fachwissen zu vermitteln, wenden Sie dann DPO an, um es an den Benutzerpräferenzen auszurichten, und wenden Sie dann RLVR an, um die sachliche Genauigkeit zu verbessern.
Wichtig
Kontinuierliche Anpassung unterscheidet sich von Multi-turn verstärkendes Lernen MTRL (Reinforcement Learning). Multi-Turn Kontinuierliche Anpassung verbindet Trainingsjobs mit verschiedenen Techniken. MTRL schult Agenten im Rahmen eines einzigen Schulungsauftrags für Aufgaben, bei denen Werkzeuge in mehreren Schritten eingesetzt werden müssen.
Funktionsweise
Lädt LoRa-Adaptergewichte aus einem früheren Trainingsjob
Setzt den Optimierer, den Scheduler und den Schrittzähler zurück (neues Training mit neuer Technik oder Daten)
Die Ausgabe des vorherigen Jobs wird zum Ausgangspunkt für den neuen Trainingslauf
Anmerkung
Kontinuierliche Anpassungen sind derzeit über die MTRL und Workflows zur kontinuierlichen Anpassung nur über das Python SDK möglich. Es wird mit dem LoRa-Trainingstyp unterstützt. Eine kontinuierliche Anpassung verschiedener Techniken mit FFT wird nicht unterstützt.
Unterstützte Technikübergänge
Die folgende Tabelle zeigt alle unterstützten Kombinationen für die kontinuierliche Anpassung:
| Aus der Technik | Zur Technik | Unterstützt |
|---|---|---|
| SFT | DPO | ✓ |
| SFT | RLVR | ✓ |
| SFT | RALIF | ✓ |
| SFT | SFT (neue Daten) | ✓ |
| SFT | MTRL | ✓ |
| DPO | DPO (neue Daten) | ✓ |
| DPO | RLVR | ✓ |
| DPO | RALIF | ✓ |
| DPO | SFT | ✓ |
| RLVR | DPO | ✓ |
| RLVR | RLVR (neue Daten) | ✓ |
| RLAIF | DPO | ✓ |
| RLAIF | RLAIF (neue Daten) | ✓ |
Kontinuierliche Anpassung im Vergleich zur Wiederaufnahme des Trainings
| Kontinuierliche Anpassung | Schulung wieder aufnehmen | |
|---|---|---|
| Technik | Andere oder gleiche Technik | Nur dieselbe Technik |
| Status des Optimierers | Zurücksetzen (Neustart) | Vom Checkpoint wiederhergestellt |
| Anwendungsfall | Kettentechniken (SFT → DPO → RLVR) | Unterbrochenes Training fortsetzen |
| Art des Trainings | Nur LoRa | Nur LoRa |
Erste Schritte
Kontinuierliche Anpassungen sind über das Python SDK möglich. Geben Sie den Ausgabepfad eines vorherigen Trainingsjobs als den resume_from_path für die nächste Technik an.
from sagemaker.modules.train import DPOTrainer # Continue from a previous SFT job with DPO trainer = DPOTrainer( model_id="meta-textgeneration-llama-3-1-8b-instruct", train_data="s3://my-bucket/dpo-preferences.jsonl", resume_from_path="s3://my-bucket/previous-sft-output/", hyperparameters={ "max_epochs": 2, "learning_rate": 1e-5, "lora_rank": 16, } ) trainer.train()
Beispiel-Workflows
- STF → DPO
Vermitteln Sie zuerst Fachkenntnisse und orientieren Sie sich dann an den Benutzerpräferenzen
- SFT → RLVR
Bringen Sie zuerst das Aufgabenformat bei und optimieren Sie es dann auf sachliche Richtigkeit
- SFT → DPO → RLVR
Vollständige Pipeline — Wissen → Einstellungen → Genauigkeit
- SFT → MTRL
Vermitteln Sie grundlegende Fähigkeiten und trainieren Sie anschließend für Agentenaufgaben mit mehreren Runden
- DPO → DPO (neue Daten)
Verfeinern Sie Ihre Präferenzen iterativ mit neuen Feedback-Daten