View a markdown version of this page

Tecniche di personalizzazione - Amazon SageMaker AI

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Tecniche di personalizzazione

Le tecniche di personalizzazione definiscono il modo in cui il modello apprende dai dati. Ogni tecnica richiede un formato di set di dati diverso e ha i propri iperparametri. Scegli in base ai dati di cui disponi e al comportamento che desideri ottenere.

  • SFT(Supervisionato Fine-Tuning): allenati su coppie di risposta rapida etichettate. Ideale per insegnare una conoscenza di stile, formato o dominio specifici di un modello.

  • DPO(Ottimizzazione delle preferenze dirette): formazione sulle coppie di risposte preferite e rifiutate. Ideale per allinearsi alle preferenze umane ed evitare risultati indesiderati.

  • RFT(Rinforzo Fine-Tuning) — Ottimizzazione tramite segnali di ricompensa: verifica basata su codice (RLVR) o giudice LLM (RLAIF). Ideale per migliorare l'accuratezza dei fatti o la qualità soggettiva.

  • Multi-turn apprendimento per rinforzo(Multi-Turn Reinforcement Learning): forma gli agenti per attività agentistiche in più fasi con un contesto in crescita.

  • Personalizzazione continua(Personalizzazione continua): concatena più tecniche in sequenza (ad esempio, SFT → DPO → RLVR). LoRARichiede un tipo di formazione LoRa.

Ogni tecnica può essere combinata con il tipo di allenamento LoRa o FFT. Vedi Tipi di allenamento per i dettagli sulla scelta tra di essi.