Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Multi-turn apprendimento per rinforzo
Multi-turn l'apprendimento per rinforzo (RL) forma un agente a prendere buone decisioni attraverso una sequenza di fasi, non solo in un singolo momento. L'agente osserva il suo ambiente, intraprende un'azione, riceve una ricompensa e passa a un nuovo stato, ripetendo questo processo in più fasi temporali. L'obiettivo è apprendere una politica (comportamento modello) che massimizzi la ricompensa cumulativa nell'intera sequenza anziché ottimizzarla per una singola fase isolata. Questo approccio viene sempre più utilizzato per addestrare i modelli linguistici su attività di ragionamento in più fasi e agentiche, in cui il modello esegue azioni come chiamate di strumenti, esecuzione di codice o ricerca sul Web in più fasi e viene ricompensato in base all'intera sequenza. Questo è diverso dal turno singolo RLHF/RLAIF, in cui una ricompensa viene assegnata a un risultato alla volta.
Una semplice analogia
Immagina di essere un agente del servizio clienti che gestisce un ticket di assistenza. Non lo risolvi in un solo messaggio. Fai domande chiarificatrici, cerchi l'account del cliente, provi a risolvere il problema, verifichi se ha funzionato e, in caso contrario, prosegui con un follow-up. Alla fine, il cliente o se ne va soddisfatto o no. Col tempo, si impara a riconoscere meglio quale sequenza di passaggi tende a portare a una buona risoluzione.
Multi-turn RL addestra il modello allo stesso modo. Invece di classificare il modello in base a una singola risposta, consente al modello di eseguire un'attività in più fasi e la premia in base all'intera sequenza. Il modello impara quali decisioni prese all'inizio della conversazione sono state effettivamente importanti.
Terminologia chiave
-
Agente: l'entità decisionale del sistema. Osserva la situazione attuale, decide quali azioni intraprendere e impara nel tempo a migliorare la propria strategia. In pratica, l'agente è alimentato da un modello di intelligenza artificiale, ma le due cose non sono la stessa cosa. Il modello è la rete neurale sottostante; l'agente è il sistema più ampio che lo utilizza per percepire, decidere e agire. In parole semplici: il rappresentante del servizio clienti che gestisce il ticket.
-
Environment/Agentic Applicazione: tutto ciò con cui interagisce l'agente, inclusa la cronologia delle conversazioni, i dettagli dell'account del cliente e tutti gli strumenti che l'agente può utilizzare. In parole semplici: la piattaforma di supporto, il cliente e tutte le informazioni a disposizione del rappresentante.
-
Stato: un'istantanea della situazione attuale che l'agente osserva prima di decidere cosa fare dopo. In parole povere: ciò che il rappresentante sa in questo momento, ad esempio il problema del cliente, ciò che è già stato provato e l'ultima risposta.
-
Azione: cosa fa l'agente in ogni fase, ad esempio porre una domanda di chiarimento, chiamare uno strumento o inviare una risposta. In parole povere: la prossima mossa del rappresentante, che si tratti di porre una domanda, cercare qualcosa o inviare una correzione.
-
Ricompensa: il segnale di feedback che l'agente riceve, a ogni fase o alla fine dell'attività, che indica l'andamento delle cose. In parole semplici: il cliente se n'è andato soddisfatto? Questo risultato è la ricompensa.
-
Politica: la strategia che l'agente ha appreso. Associa un determinato stato all'azione che ha maggiori probabilità di portare a un buon risultato. In parole povere: la conoscenza del rappresentante costruita sull'esperienza, la conoscenza di cosa tende a funzionare in una determinata situazione.
-
Episodio: un'esecuzione completa di un'attività dall'inizio alla fine. In parole povere: una conversazione di assistenza completa, dal primo messaggio del cliente alla risoluzione.
-
Turno: un singolo scambio all'interno di un episodio, in genere un'azione intrapresa dall'agente e la risposta che riceve dall'ambiente. In una conversazione, si tratta di un messaggio e della relativa risposta. In parole povere: una fase della conversazione di assistenza, ad esempio quando l'operatore fa una domanda e il cliente risponde.
-
Traiettoria: la sequenza completa di stati, azioni e ricompense registrate in un intero episodio. È la registrazione completa di ciò che l'agente ha fatto e di ciò che è accaduto di conseguenza, utilizzata per calcolare la ricompensa e aggiornare la politica. In parole povere: l'intera trascrizione della conversazione di assistenza dall'inizio alla fine, inclusa ogni decisione presa dall'agente e l'andamento delle cose.
-
Ricompensa cumulativa: la ricompensa totale accumulata in tutte le fasi di un episodio, che è ciò che l'agente sta alla fine cercando di massimizzare. In parole povere: non solo se un passaggio è andato bene, ma se l'intera conversazione è andata bene nel complesso.
Casi d'uso per l'apprendimento per rinforzo in più turni
Multi-turn RL è l'approccio giusto quando una singola risposta non è sufficiente per completare bene un'attività. Se il caso d'uso prevede una sequenza di passaggi, decisioni che dipendono da quelle precedenti, vale la pena prendere in considerazione l'RL a più turni.
Ecco alcuni segnali che lo indicano:
-
La tua attività richiede un'interazione continua: il modello deve porre domande, raccogliere informazioni e adattarsi in base a ciò che apprende lungo il percorso. Un singolo ciclo di risposta rapida non è sufficiente. Esempio: un addetto all'assistenza che diagnostica un problema ponendo domande di follow-up prima di suggerire una soluzione.
-
La qualità del risultato dipende da una sequenza di azioni: per ottenere la risposta giusta alla fine è necessario fare le mosse giuste in ogni momento. Premiare solo il risultato finale non è sufficiente se il percorso per arrivarci è importante. Esempio: un assistente di programmazione che pianifica, scrive, esegue ed esegue il debug del codice in più fasi.
-
Il modello deve utilizzare strumenti in più fasi: il modello richiama strumenti esterni come la ricerca, le API o l'esecuzione del codice e i risultati di una chiamata allo strumento influiscono sulle operazioni successive. Esempio: un assistente di ricerca che cerca informazioni, valuta i risultati e perfeziona la ricerca prima di produrre un riepilogo.
-
Gli errori commessi a metà attività dovrebbero essere recuperabili: si desidera che il modello riconosca quando qualcosa non funziona e corregga la rotta, piuttosto che imboccare una strada sbagliata fin dall'inizio. Esempio: un agente che prova una soluzione, verifica se ha funzionato e prova un approccio diverso in caso contrario.
-
Si riscontrano buone prestazioni in un solo turno ma uno scarso completamento delle attività dall'inizio alla fine: se il modello gestisce bene i singoli passaggi ma ha difficoltà a metterli insieme in un risultato coerente e di successo, l'RL a più turni può contribuire a colmare questa lacuna.
Modelli, prezzi e aree geografiche supportati
Modelli supportati
| Modello | Region |
|---|---|
| Nova Lite 2.0 | IAD (us-east-1), PDX (us-west-2) |
| GPT-OSS-20B | IAD (us-east-1), PDX (us-west-2) |
| Gemma-4-31B-it | PDX (us-west-2) |
| Qwen 3.6 27V | PDX (us-west-2) |
Prezzi
Per i dettagli completi sui prezzi, consulta la pagina dei prezzi pubblica
-
Precompilazione: il costo di elaborazione dei token di input inseriti nel modello all'inizio di ogni fase di formazione. Ciò include il prompt, la cronologia delle conversazioni e qualsiasi contesto ricevuto dal modello prima di generare una risposta.
-
Esempio: il costo dei token generati dal modello durante l'implementazione della formazione. È qui che il modello produce le sue risposte, che vengono poi valutate e utilizzate per calcolare il segnale di ricompensa.
-
Treno: il costo del backward pass, in cui i pesi del modello vengono aggiornati in base al segnale di ricompensa. Questa è la fase di apprendimento principale del processo RL.