View a markdown version of this page

Personalizzazione continua - Amazon SageMaker AI

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Personalizzazione continua

Con la personalizzazione continua, puoi basarti su un modello precedentemente personalizzato applicando una formazione aggiuntiva, con una tecnica diversa o con la stessa tecnica con nuovi dati. Ad esempio, iniziate con SFT per insegnare la conoscenza del dominio, quindi applicate il DPO per allinearvi alle preferenze dell'utente, quindi applicate RLVR per migliorare l'accuratezza dei fatti.

Importante

La personalizzazione continua è diversa da MTRL (Reinforcement Learning). Multi-turn apprendimento per rinforzo Multi-Turn La personalizzazione continua concatena i lavori di formazione tra le tecniche. MTRL forma gli agenti per attività di utilizzo degli strumenti in più fasi nell'ambito di un unico lavoro di formazione.

Come funziona

  • Carica i pesi degli adattatori LoRa ottenuti da un precedente lavoro di formazione

  • Reimposta l'ottimizzatore, lo scheduler e il contapassi (nuovo allenamento con nuove tecniche o dati)

  • Il risultato del lavoro precedente diventa il punto di partenza per il nuovo ciclo di formazione

Nota

La personalizzazione continua è attualmente disponibile tramite MTRL e i flussi di lavoro di personalizzazione continua utilizzando solo l'SDK. Python È supportato dal tipo di formazione LoRa. LoRA La personalizzazione continua tra diverse tecniche con FFT non è supportata.

Transizioni tecniche supportate

La tabella seguente mostra tutte le combinazioni supportate per la personalizzazione continua:

Dalla tecnica Alla tecnica Supportata
SFTDPO
SFTRLVR
SFTRAIF
SFTSFT (nuovi dati)
SFTMTRL
DPODPO (nuovi dati)
DPORLVR
DPORAIF
DPOSFT
RLVRDPO
RLVRRLVR (nuovi dati)
RAIFDPO
RAIFRLAIF (nuovi dati)

Personalizzazione continua e formazione del curriculum

Personalizzazione continua Riprendi la formazione
Tecnica Tecnica diversa o stessa Solo stessa tecnica
Stato dell'ottimizzatore Reset (nuovo inizio) Ripristinato dal checkpoint
Caso d'uso Tecniche a catena (SFT → DPO → RLVR) Continua l'allenamento interrotto
Tipo di allenamento Solo LoRa Solo LoRa

Nozioni di base

La personalizzazione continua è disponibile tramite l'PythonSDK. Fornisci il percorso di output di un precedente lavoro di formazione come metodo resume_from_path per la tecnica successiva.

from sagemaker.modules.train import DPOTrainer # Continue from a previous SFT job with DPO trainer = DPOTrainer( model_id="meta-textgeneration-llama-3-1-8b-instruct", train_data="s3://my-bucket/dpo-preferences.jsonl", resume_from_path="s3://my-bucket/previous-sft-output/", hyperparameters={ "max_epochs": 2, "learning_rate": 1e-5, "lora_rank": 16, } ) trainer.train()

Flussi di lavoro di esempio

SFT → DPO

Insegna prima la conoscenza del dominio, poi allinea le tue conoscenze alle preferenze dell'utente

SFT → RLVR

Insegna prima il formato delle attività, quindi ottimizza per la correttezza dei fatti

SFT → DPO → RLVR

Pipeline completa: conoscenza → preferenze → precisione

SFT → MTRL

Insegna le capacità di base, quindi allenati per attività agentiche a più turni

DPO → DPO (nuovi dati)

Perfeziona le preferenze in modo iterativo con nuovi dati di feedback