Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Personalizzazione continua
Con la personalizzazione continua, puoi basarti su un modello precedentemente personalizzato applicando una formazione aggiuntiva, con una tecnica diversa o con la stessa tecnica con nuovi dati. Ad esempio, iniziate con SFT per insegnare la conoscenza del dominio, quindi applicate il DPO per allinearvi alle preferenze dell'utente, quindi applicate RLVR per migliorare l'accuratezza dei fatti.
Importante
La personalizzazione continua è diversa da MTRL (Reinforcement Learning). Multi-turn apprendimento per rinforzo Multi-Turn La personalizzazione continua concatena i lavori di formazione tra le tecniche. MTRL forma gli agenti per attività di utilizzo degli strumenti in più fasi nell'ambito di un unico lavoro di formazione.
Come funziona
Carica i pesi degli adattatori LoRa ottenuti da un precedente lavoro di formazione
Reimposta l'ottimizzatore, lo scheduler e il contapassi (nuovo allenamento con nuove tecniche o dati)
Il risultato del lavoro precedente diventa il punto di partenza per il nuovo ciclo di formazione
Nota
Transizioni tecniche supportate
La tabella seguente mostra tutte le combinazioni supportate per la personalizzazione continua:
| Dalla tecnica | Alla tecnica | Supportata |
|---|---|---|
| SFT | DPO | ✓ |
| SFT | RLVR | ✓ |
| SFT | RAIF | ✓ |
| SFT | SFT (nuovi dati) | ✓ |
| SFT | MTRL | ✓ |
| DPO | DPO (nuovi dati) | ✓ |
| DPO | RLVR | ✓ |
| DPO | RAIF | ✓ |
| DPO | SFT | ✓ |
| RLVR | DPO | ✓ |
| RLVR | RLVR (nuovi dati) | ✓ |
| RAIF | DPO | ✓ |
| RAIF | RLAIF (nuovi dati) | ✓ |
Personalizzazione continua e formazione del curriculum
Nozioni di base
La personalizzazione continua è disponibile tramite l'PythonSDK. Fornisci il percorso di output di un precedente lavoro di formazione come metodo resume_from_path per la tecnica successiva.
from sagemaker.modules.train import DPOTrainer # Continue from a previous SFT job with DPO trainer = DPOTrainer( model_id="meta-textgeneration-llama-3-1-8b-instruct", train_data="s3://my-bucket/dpo-preferences.jsonl", resume_from_path="s3://my-bucket/previous-sft-output/", hyperparameters={ "max_epochs": 2, "learning_rate": 1e-5, "lora_rank": 16, } ) trainer.train()
Flussi di lavoro di esempio
- SFT → DPO
Insegna prima la conoscenza del dominio, poi allinea le tue conoscenze alle preferenze dell'utente
- SFT → RLVR
Insegna prima il formato delle attività, quindi ottimizza per la correttezza dei fatti
- SFT → DPO → RLVR
Pipeline completa: conoscenza → preferenze → precisione
- SFT → MTRL
Insegna le capacità di base, quindi allenati per attività agentiche a più turni
- DPO → DPO (nuovi dati)
Perfeziona le preferenze in modo iterativo con nuovi dati di feedback