Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Configurazione delle funzioni di ricompensa per i modelli Amazon Nova
Le funzioni di ricompensa valutano la qualità della risposta e forniscono segnali di feedback per l'addestramento dei modelli. Puoi configurare le funzioni di ricompensa utilizzando funzioni Lambda personalizzate o modelli Amazon Bedrock-hosted Foundation come giudici. Sono disponibili modelli guidati per semplificare la creazione di funzioni di ricompensa per attività comuni come seguire le istruzioni e convalidare il formato. Scegli l'approccio più adatto ai requisiti delle tue attività.
Apprendimento per rinforzo tramite premi verificabili (RLVR)
RLVR ottimizza i modelli per attività oggettive come la generazione di codice o il ragionamento matematico utilizzando classificatori verificabili basati su regole o modelli pronti all'uso.
Sono disponibili due opzioni per RLVR (codice personalizzato):
La console Amazon Bedrock fornisce modelli di esempio per le funzioni Grader Lambda:
-
Ragionamento matematico con verifica della verità fondamentale
-
Convalida del formato e controllo dei vincoli
-
Modello Lambda di livellatore generico con codice standard
Segui le istruzioni nel modello fornito nella pagina del lavoro Create RFT nella console Amazon Bedrock. https://console.aws.amazon.com/bedrock
Crea funzioni di ricompensa personalizzate utilizzando il tuo Lambda ARN per logiche complesse, API esterne, calcoli in più fasi o combinando più criteri di valutazione.
Nota
Se utilizzi la tua funzione Lambda, tieni presente quanto segue:
-
Aumenta il timeout Lambda dai 3 secondi predefiniti a un massimo di 15 minuti per valutazioni complesse.
-
Il ruolo di esecuzione Lambda necessita delle autorizzazioni per richiamare i modelli come descritto in. Accesso e sicurezza per i modelli Amazon Nova
Apprendimento per rinforzo tramite AI Feedback (RLAIF)
RLAIF ottimizza i modelli per attività soggettive come seguire le istruzioni o interagire con i chatbot utilizzando giudici con modelli pronti all'uso. AI-based
Per RLAIF (Model as Judge):
-
Seleziona un modello base ospitato da Amazon Bedrock come giudice
-
Configura le istruzioni per la valutazione
-
Definisci i criteri di valutazione e le linee guida per il punteggio
Modelli di LLM-as-Judge prompt disponibili nella console Amazon Bedrock:
-
Seguono le istruzioni (Judge model training)
-
Riepilogo (Multi-turn finestre di dialogo)
-
Valutazione del ragionamento (CoT per domini specializzati)
-
Fedeltà RAG (Q&A) Context-grounded
Nota
L'opzione Model as Judge della console converte automaticamente la configurazione in una funzione Lambda durante l'addestramento.
Dettagli sull'implementazione della funzione Lambda
Quando si implementano funzioni di ricompensa Lambda personalizzate, la funzione deve accettare e restituire i dati nel seguente formato.
Linee guida di progettazione
Classifica le risposte: assegna alla risposta migliore un punteggio nettamente più alto
Utilizza controlli coerenti: valuta il completamento delle attività, l'aderenza al formato, la sicurezza e la durata ragionevole
Mantieni una scalabilità stabile: mantieni i punteggi normalizzati e non sfruttabili