Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Personalizzazione di Amazon Nova su SageMaker HyperPod
Puoi personalizzare i modelli Amazon Nova, inclusi i modelli avanzati di Amazon Nova 2.0, utilizzando le ricette Amazon Nova e addestrarli su Hyperpod. Una ricetta è un file di configurazione YAML che fornisce dettagli all' SageMaker IA su come eseguire il processo di personalizzazione del modello. SageMaker HyperPod supporta due tipi di servizi: Forge e. Non-forge
Hyperpod offre elaborazione ad alte prestazioni con istanze GPU ottimizzate e storage Amazon FSx for Lustre, un monitoraggio affidabile tramite l'integrazione con strumenti come TensorBoard la gestione flessibile dei checkpoint per il miglioramento iterativo, la distribuzione senza interruzioni su Amazon Bedrock per l'inferenza e una formazione distribuita multinodo efficiente e scalabile, che collaborano per fornire alle organizzazioni un ambiente sicuro, performante e flessibile per adattare i modelli Amazon Nova ai loro requisiti aziendali specifici.
Personalizzazione di Amazon Nova SageMaker HyperPod sugli artefatti del modello, inclusi i checkpoint del modello, in un bucket Amazon S3 gestito dal servizio. Gli artefatti nel bucket gestito dal servizio sono crittografati con chiavi. SageMaker AI-managed AWS KMS Service-managed I bucket Amazon S3 attualmente non supportano la crittografia dei dati tramite chiavi KMS gestite dal cliente. È possibile utilizzare questa posizione di checkpoint per processi di valutazione o per l’inferenza Amazon Bedrock.
È possibile applicare prezzi standard per le istanze di calcolo, l’archiviazione Amazon S3 e FSx per Lustre. Per informazioni dettagliate sui prezzi, consulta i prezzi di Hyperpod
Requisiti di calcolo per i modelli Amazon Nova 2
Le tabelle seguenti riassumono i requisiti computazionali SageMaker HyperPod e la formazione dei lavori di formazione con SageMaker intelligenza artificiale per i modelli Amazon Nova 2.
Tecnica di allenamento |
Istanze minime |
Tipo di istanza |
Numero di GPU |
Note |
Modelli supportati |
|---|---|---|---|---|---|
SFT (LoRa) |
4 |
P5.48xlarge |
16 |
Parameter-efficient messa a punto |
Nova 2 Lite |
SFT (grado completo) |
4 |
P5.48xlarge |
32 |
Messa a punto completa del modello |
Nova 2 Lite |
RFT sui lavori di SageMaker formazione (LoRa) |
2 |
P5.48xlarge |
16 |
Funzioni di ricompensa personalizzate nel tuo ambiente AWS |
Nova 2 Lite |
RFT sui lavori SageMaker di formazione (grado completo) |
4 |
P5.48xlarge |
32 |
Lunghezza del contesto 32K |
Nova 2 Lite |
RFT attivo SageMaker HyperPod |
8 |
P5.48xlarge |
64 |
Lunghezza predefinita del contesto 8192 |
Nova 2 Lite |
CPT |
4 |
P5.48xlarge |
16 |
Elabora circa 400 milioni di token per istanza al giorno |
Nova 2 Lite |
Per ottimizzare i flussi di lavoro di personalizzazione dei modelli Amazon Nova su Hyperpod, segui queste best practice consigliate per una formazione efficiente, una gestione delle risorse e una corretta implementazione del modello.
Le migliori pratiche per la personalizzazione di Amazon Nova
Panoramica di
Questa sezione fornisce una panoramica delle tecniche di personalizzazione e ti aiuta a scegliere l'approccio migliore per le tue esigenze e i dati disponibili.
Due fasi della formazione LLM
La formazione su modelli linguistici di grandi dimensioni è costituita da due fasi principali: pre-formazione e post-formazione. Durante il pre-training, il modello elabora i token di testo non elaborato e li ottimizza per la previsione del token successivo. Questo processo crea un completatore di modelli che assorbe sintassi, semantica, fatti e schemi di ragionamento dal web e dal testo curato. Tuttavia, il modello preaddestrato non comprende le istruzioni, gli obiettivi dell'utente o il comportamento appropriato al contesto. Continua il testo in qualsiasi stile si adatti alla sua distribuzione di formazione. Un modello preaddestrato si completa automaticamente anziché seguire le istruzioni, produce una formattazione incoerente e può rispecchiare distorsioni indesiderate o contenuti non sicuri dei dati di addestramento. Pre-training sviluppa la competenza generale, non l'utilità delle attività.
Post-training trasforma il compilatore di schemi in un utile assistente. Si eseguono più cicli di Supervised Fine-Tuning (SFT) per insegnare al modello a seguire le istruzioni, aderire a schemi e politiche, chiamare strumenti e produrre risultati affidabili imitando dimostrazioni di alta qualità. Questo allineamento insegna al modello a rispondere ai prompt come attività anziché al testo per continuare. Quindi applichi Reinforcement Fine-Tuning (RFT) per ottimizzare il comportamento utilizzando un feedback misurabile (ad esempio verificatori o altro LLM-as-a-judge), bilanciando compromessi come precisione e brevità, sicurezza e copertura o ragionamento in più fasi in base a vincoli. In pratica, si alternano SFT e RFT in cicli per trasformare il modello preformato in un sistema affidabile e allineato alle politiche che esegue attività complesse in modo coerente.
Scegliete il giusto approccio di personalizzazione
In questa sezione tratteremo le strategie di personalizzazione post-formazione: RFT e SFT.
Ottimizzazione del rinforzo (RFT)
La messa a punto del rinforzo migliora le prestazioni del modello attraverso segnali di feedback, punteggi o ricompense misurabili che indicano la qualità della risposta, piuttosto che una supervisione diretta con risposte esatte e corrette. A differenza della tradizionale ottimizzazione supervisionata che apprende dalle coppie input-output, RFT utilizza le funzioni di ricompensa per valutare le risposte del modello e ottimizza in modo iterativo il modello per massimizzare tali ricompense. Questo approccio funziona bene per le attività in cui è difficile definire esattamente l'output corretto, ma è possibile misurare in modo affidabile la qualità della risposta. L'RFT consente ai modelli di apprendere comportamenti e preferenze complessi attraverso prove e feedback, rendendolo ideale per applicazioni che richiedono un processo decisionale dettagliato, una risoluzione creativa dei problemi o il rispetto di criteri di qualità specifici che è possibile valutare programmaticamente. Ad esempio, rispondere a domande legali complesse è un caso d'uso ideale per RFT perché si desidera insegnare al modello come ragionare meglio per rispondere alle domande in modo più accurato.
Come funziona
Nella messa a punto dei rinforzi, si parte da una linea di base calibrata sulle istruzioni e si considera ogni richiesta come un piccolo torneo. Per un dato input, campionate una manciata di risposte dei candidati tratte dal modello, assegnate un punteggio a ciascuna di esse con la funzione di ricompensa, quindi le classificate all'interno di quel gruppo. La fase di aggiornamento spinge il modello a rendere più probabili i candidati con un punteggio più alto la prossima volta e meno probabili quelli con un punteggio più basso, mentre un vincolo di rimanere vicino alla linea di base impedisce che il comportamento si modifichi o diventi prolisso o sfruttatore. Ripeti questo ciclo su molti prompt, aggiornando i casi difficili, rafforzando i verificatori o le rubriche di giudizio quando noti degli exploit e monitorando continuamente le metriche delle attività.
Quando usare RFT
Le attività che traggono maggior beneficio dalla RFT hanno diverse caratteristiche. Offrono segnali di successo misurabili anche quando è difficile specificare un singolo risultato corretto. Ammettono un punteggio parziale o una qualità graduale, in modo da poter classificare le risposte migliori rispetto a quelle peggiori all'interno di un prompt o utilizzando una funzione di ricompensa. Si tratta di obiettivi multipli che devono essere bilanciati (ad esempio precisione e brevità, chiarezza, sicurezza o costo). Richiedono il rispetto di vincoli espliciti che è possibile verificare a livello di codice. Operano in contesti mediati dagli strumenti o basati sull'ambiente in cui i risultati sono osservabili (successo o fallimento, latenza, uso delle risorse). Si verificano in regimi di bassa classificazione in cui la raccolta di obiettivi in oro è costosa ma il feedback automatico o basato su rubriche è abbondante. L'RFT funziona meglio quando è possibile trasformare la qualità in uno scalare o un ranking affidabile e si desidera che il modello amplifichi preferibilmente i comportamenti con punteggi più alti senza bisogno di obiettivi etichettati esaustivi.
Prendi in considerazione altri metodi quando:
-
Le coppie di ingresso/uscita etichettate sono numerose e affidabili: usate SFT
-
La lacuna principale è la conoscenza o il gergo: utilizzate la generazione aumentata di recupero (RAG)
-
Il tuo segnale di ricompensa è rumoroso o inaffidabile e non puoi correggerlo con rubriche o strumenti migliori: stabilizzalo prima di RFT
Quando non usare RFT
Evita la RFT in queste situazioni:
-
È possibile produrre coppie input-output etichettate e affidabili a basso costo (SFT è più semplice, economico e stabile)
-
Il divario è la conoscenza o il gergo piuttosto che il comportamento (usa RAG)
-
Il segnale di ricompensa è rumoroso, scarso, facile da giocare, costoso o lento da calcolare (correggi prima il valutatore)
-
Le prestazioni di base sono prossime allo zero (bootstrap con SFT prima di ottimizzare le preferenze)
-
L'attività presenta schemi deterministici, una formattazione rigorosa o un'unica risposta corretta (la convalida SFT o basata su regole funziona meglio)
-
La latenza o i budget di costo ridotti non possono assorbire il campionamento o l'esplorazione aggiuntivi richiesti da RFT
-
I vincoli di sicurezza o politici non sono chiaramente specificati e applicabili nella ricompensa
Se riesci a indicare «la risposta giusta», usa SFT. Se hai bisogno di nuove conoscenze, usa RAG. Usa RFT solo dopo aver stabilito una base solida e una funzione di ricompensa robusta, veloce e difficile da sfruttare.
Fine-tuning supervisionato (SFT)
La messa a punto supervisionata addestra l'LLM su un set di dati di coppie input-output etichettate dall'uomo per il tuo compito. Fornisci esempi di prompt (domande, istruzioni e così via) con le risposte corrette o desiderate e continui ad addestrare il modello su questi esempi. Il modello regola i suoi pesi per ridurre al minimo una perdita supervisionata (in genere l'entropia incrociata tra le sue previsioni e i token di output target). Si tratta della stessa formazione utilizzata nella maggior parte delle attività di machine learning supervisionate, applicata per specializzare un LLM.
La SFT modifica il comportamento, non la conoscenza. Non insegna al modello fatti o gergo nuovi che non abbia visto nella fase preliminare. Insegna al modello come rispondere, non cosa sapere. Se hai bisogno di nuove conoscenze di dominio (come la terminologia interna), utilizza la generazione aumentata di recupero (RAG) per fornire quel contesto al momento dell'inferenza. SFT aggiunge quindi il comportamento desiderato che segue le istruzioni.
Come funziona
SFT ottimizza l'LLM riducendo al minimo la perdita media di entropia incrociata sui token di risposta, trattando i token prompt come contesto e mascherandoli dalla perdita. Il modello interiorizza lo stile, la struttura e le regole decisionali del target, imparando a generare il completamento corretto per ogni richiesta. Ad esempio, per classificare i documenti in categorie personalizzate, è possibile ottimizzare il modello con prompt (il testo del documento) e completamenti etichettati (le etichette delle categorie). Ci si allena su queste coppie fino a quando il modello non emette l'etichetta corretta per ogni richiesta con alta probabilità.
È possibile eseguire SFT con poche centinaia di esempi e scalare fino a qualche centinaio di migliaia. I campioni SFT devono essere di alta qualità e direttamente allineati al comportamento del modello desiderato.
Quando usare SFT
Usa SFT quando hai un'attività ben definita con risultati desiderati chiari. Se potete dichiarare esplicitamente «Dato l'input X, l'output corretto è Y» e raccogliere esempi di tali mappature, la messa a punto supervisionata è una buona scelta. SFT eccelle in questi scenari:
-
Attività di classificazione strutturate o complesse: classifica i documenti o i contratti interni in molte categorie personalizzate. Con SFT, il modello apprende queste categorie specifiche meglio di quanto lo faccia da solo.
-
Question-answering o attività di trasformazione con risposte note: Fine-tune un modello per rispondere alle domande della knowledge base di un'azienda o convertire i dati tra formati in cui ogni input ha una risposta corretta.
-
Formattazione e coerenza stilistica: addestrate il modello a rispondere sempre in un determinato formato o tono ottimizzando gli esempi del formato o del tono corretti. Ad esempio, la formazione sulle coppie pronta-risposta che dimostrano una particolare voce del marchio insegna al modello a generare risultati con quello stile. Instruction-following il comportamento viene spesso insegnato inizialmente tramite SFT su esempi curati di buon comportamento da assistente.
La SFT è il modo più diretto per insegnare a un LLM una nuova abilità o comportamento quando è possibile specificare quale sia il comportamento giusto. Utilizza la comprensione del linguaggio esistente nel modello e la concentra sul tuo compito. Usa SFT quando vuoi che il modello faccia una cosa specifica e hai o puoi creare un set di dati di esempi.
Usa SFT quando puoi assemblare coppie di prompt e risposta di alta qualità che rispecchino fedelmente il comportamento che desideri. È adatto ad attività con obiettivi chiari o formati deterministici come schemi, chiamate a funzioni o strumenti e risposte strutturate in cui l'imitazione è un segnale di addestramento appropriato. L'obiettivo è modellare il comportamento: insegnare al modello a trattare i prompt come attività, seguire le istruzioni, adottare politiche di tono e rifiuto e produrre una formattazione coerente. Pianifica almeno centinaia di dimostrazioni, in cui la qualità, la coerenza e la deduplicazione dei dati sono più importanti del volume grezzo. Per un aggiornamento semplice ed economico, utilizza metodi efficienti dal punto di vista dei parametri come Low-Rank Adaptation per addestrare adattatori di piccole dimensioni lasciando intatta la maggior parte della struttura portante.
Quando non usare SFT
Non usare SFT quando il divario è costituito dalla conoscenza piuttosto che dal comportamento. Non insegna al modello fatti nuovi, gergo o eventi recenti. In questi casi, utilizza la generazione aumentata con recupero per trarre deduzioni da conoscenze esterne. Evita l'SFT quando puoi misurare la qualità ma non riesci a etichettare una sola risposta corretta. Usa la messa a punto dei rinforzi con ricompense verificabili o una per ottimizzarle direttamente. LLM-as-a-judge Se le tue esigenze o i tuoi contenuti cambiano frequentemente, affidati al recupero e all'uso degli strumenti anziché alla riqualificazione del modello.