View a markdown version of this page

Kontinuierliche Anpassung - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Kontinuierliche Anpassung

Bei der kontinuierlichen Anpassung können Sie auf einem zuvor angepassten Modell aufbauen, indem Sie zusätzliche Schulungen durchführen — entweder mit einer anderen Technik oder mit derselben Technik mit neuen Daten. Beginnen Sie beispielsweise mit SFT, um Fachwissen zu vermitteln, wenden Sie dann DPO an, um es an den Benutzerpräferenzen auszurichten, und wenden Sie dann RLVR an, um die sachliche Genauigkeit zu verbessern.

Wichtig

Kontinuierliche Anpassung unterscheidet sich von Multi-turn verstärkendes Lernen MTRL (Reinforcement Learning). Multi-Turn Kontinuierliche Anpassung verbindet Trainingsjobs mit verschiedenen Techniken. MTRL schult Agenten im Rahmen eines einzigen Schulungsauftrags für Aufgaben, bei denen Werkzeuge in mehreren Schritten eingesetzt werden müssen.

Funktionsweise

  • Lädt LoRa-Adaptergewichte aus einem früheren Trainingsjob

  • Setzt den Optimierer, den Scheduler und den Schrittzähler zurück (neues Training mit neuer Technik oder Daten)

  • Die Ausgabe des vorherigen Jobs wird zum Ausgangspunkt für den neuen Trainingslauf

Anmerkung

Kontinuierliche Anpassungen sind derzeit über die MTRL und Workflows zur kontinuierlichen Anpassung nur über das Python SDK möglich. Es wird mit dem LoRa-Trainingstyp unterstützt. Eine kontinuierliche Anpassung verschiedener Techniken mit FFT wird nicht unterstützt.

Unterstützte Technikübergänge

Die folgende Tabelle zeigt alle unterstützten Kombinationen für die kontinuierliche Anpassung:

Aus der Technik Zur Technik Unterstützt
SFTDPO
SFTRLVR
SFTRALIF
SFTSFT (neue Daten)
SFTMTRL
DPODPO (neue Daten)
DPORLVR
DPORALIF
DPOSFT
RLVRDPO
RLVRRLVR (neue Daten)
RLAIFDPO
RLAIFRLAIF (neue Daten)

Kontinuierliche Anpassung im Vergleich zur Wiederaufnahme des Trainings

Kontinuierliche Anpassung Schulung wieder aufnehmen
Technik Andere oder gleiche Technik Nur dieselbe Technik
Status des Optimierers Zurücksetzen (Neustart) Vom Checkpoint wiederhergestellt
Anwendungsfall Kettentechniken (SFT → DPO → RLVR) Unterbrochenes Training fortsetzen
Art des Trainings Nur LoRa Nur LoRa

Erste Schritte

Kontinuierliche Anpassungen sind über das Python SDK möglich. Geben Sie den Ausgabepfad eines vorherigen Trainingsjobs als den resume_from_path für die nächste Technik an.

from sagemaker.modules.train import DPOTrainer # Continue from a previous SFT job with DPO trainer = DPOTrainer( model_id="meta-textgeneration-llama-3-1-8b-instruct", train_data="s3://my-bucket/dpo-preferences.jsonl", resume_from_path="s3://my-bucket/previous-sft-output/", hyperparameters={ "max_epochs": 2, "learning_rate": 1e-5, "lora_rank": 16, } ) trainer.train()

Beispiel-Workflows

STF → DPO

Vermitteln Sie zuerst Fachkenntnisse und orientieren Sie sich dann an den Benutzerpräferenzen

SFT → RLVR

Bringen Sie zuerst das Aufgabenformat bei und optimieren Sie es dann auf sachliche Richtigkeit

SFT → DPO → RLVR

Vollständige Pipeline — Wissen → Einstellungen → Genauigkeit

SFT → MTRL

Vermitteln Sie grundlegende Fähigkeiten und trainieren Sie anschließend für Agentenaufgaben mit mehreren Runden

DPO → DPO (neue Daten)

Verfeinern Sie Ihre Präferenzen iterativ mit neuen Feedback-Daten