

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

# Multi-turn apprendimento per rinforzo
<a name="model-customize-mtrl"></a>

Multi-turn l'apprendimento per rinforzo (RL) forma un agente a prendere buone decisioni attraverso una sequenza di fasi, non solo in un singolo momento. L'agente osserva il suo ambiente, intraprende un'azione, riceve una ricompensa e passa a un nuovo stato, ripetendo questo processo in più fasi temporali. L'obiettivo è apprendere una politica (comportamento modello) che massimizzi la ricompensa cumulativa nell'intera sequenza anziché ottimizzarla per una singola fase isolata. Questo approccio viene sempre più utilizzato per addestrare i modelli linguistici su attività di ragionamento in più fasi e agentiche, in cui il modello esegue azioni come chiamate di strumenti, esecuzione di codice o ricerca sul Web in più fasi e viene ricompensato in base all'intera sequenza. Questo è diverso dal turno singolo RLHF/RLAIF, in cui una ricompensa viene assegnata a un risultato alla volta.

## Una semplice analogia
<a name="model-customize-mtrl-analogy"></a>

Immagina di essere un agente del servizio clienti che gestisce un ticket di assistenza. Non lo risolvi in un solo messaggio. Fai domande chiarificatrici, cerchi l'account del cliente, provi a risolvere il problema, verifichi se ha funzionato e, in caso contrario, prosegui con un follow-up. Alla fine, il cliente o se ne va soddisfatto o no. Col tempo, si impara a riconoscere meglio quale sequenza di passaggi tende a portare a una buona risoluzione.

Multi-turn RL addestra il modello allo stesso modo. Invece di classificare il modello in base a una singola risposta, consente al modello di eseguire un'attività in più fasi e la premia in base all'intera sequenza. Il modello impara quali decisioni prese all'inizio della conversazione sono state effettivamente importanti.

## Terminologia chiave
<a name="model-customize-mtrl-terminology"></a>
+ **Agente:** l'entità decisionale del sistema. Osserva la situazione attuale, decide quali azioni intraprendere e impara nel tempo a migliorare la propria strategia. In pratica, l'agente è alimentato da un modello di intelligenza artificiale, ma le due cose non sono la stessa cosa. Il modello è la rete neurale sottostante; l'agente è il sistema più ampio che lo utilizza per percepire, decidere e agire. *In parole semplici: il rappresentante del servizio clienti che gestisce il ticket.*
+ **Environment/Agentic Applicazione:** tutto ciò con cui interagisce l'agente, inclusa la cronologia delle conversazioni, i dettagli dell'account del cliente e tutti gli strumenti che l'agente può utilizzare. *In parole semplici: la piattaforma di supporto, il cliente e tutte le informazioni a disposizione del rappresentante.*
+ **Stato:** un'istantanea della situazione attuale che l'agente osserva prima di decidere cosa fare dopo. *In parole povere: ciò che il rappresentante sa in questo momento, ad esempio il problema del cliente, ciò che è già stato provato e l'ultima risposta.*
+ **Azione:** cosa fa l'agente in ogni fase, ad esempio porre una domanda di chiarimento, chiamare uno strumento o inviare una risposta. *In parole povere: la prossima mossa del rappresentante, che si tratti di porre una domanda, cercare qualcosa o inviare una correzione.*
+ **Ricompensa:** il segnale di feedback che l'agente riceve, a ogni fase o alla fine dell'attività, che indica l'andamento delle cose. *In parole semplici: il cliente se n'è andato soddisfatto? Questo risultato è la ricompensa.*
+ **Politica:** la strategia che l'agente ha appreso. Associa un determinato stato all'azione che ha maggiori probabilità di portare a un buon risultato. *In parole povere: la conoscenza del rappresentante costruita sull'esperienza, la conoscenza di cosa tende a funzionare in una determinata situazione.*
+ **Episodio:** un'esecuzione completa di un'attività dall'inizio alla fine. *In parole povere: una conversazione di assistenza completa, dal primo messaggio del cliente alla risoluzione.*
+ **Turno:** un singolo scambio all'interno di un episodio, in genere un'azione intrapresa dall'agente e la risposta che riceve dall'ambiente. In una conversazione, si tratta di un messaggio e della relativa risposta. *In parole povere: una fase della conversazione di assistenza, ad esempio quando l'operatore fa una domanda e il cliente risponde.*
+ **Traiettoria:** la sequenza completa di stati, azioni e ricompense registrate in un intero episodio. È la registrazione completa di ciò che l'agente ha fatto e di ciò che è accaduto di conseguenza, utilizzata per calcolare la ricompensa e aggiornare la politica. *In parole povere: l'intera trascrizione della conversazione di assistenza dall'inizio alla fine, inclusa ogni decisione presa dall'agente e l'andamento delle cose.*
+ Ricompensa **cumulativa: la ricompensa** totale accumulata in tutte le fasi di un episodio, che è ciò che l'agente sta alla fine cercando di massimizzare. *In parole povere: non solo se un passaggio è andato bene, ma se l'intera conversazione è andata bene nel complesso.*

## Casi d'uso per l'apprendimento per rinforzo in più turni
<a name="model-customize-mtrl-use-cases"></a>

Multi-turn RL è l'approccio giusto quando una singola risposta non è sufficiente per completare bene un'attività. Se il caso d'uso prevede una sequenza di passaggi, decisioni che dipendono da quelle precedenti, vale la pena prendere in considerazione l'RL a più turni.

Ecco alcuni segnali che lo indicano:
+ **La tua attività richiede un'interazione continua:** il modello deve porre domande, raccogliere informazioni e adattarsi in base a ciò che apprende lungo il percorso. Un singolo ciclo di risposta rapida non è sufficiente. Esempio: un addetto all'assistenza che diagnostica un problema ponendo domande di follow-up prima di suggerire una soluzione.
+ **La qualità del risultato dipende da una sequenza di azioni:** per ottenere la risposta giusta alla fine è necessario fare le mosse giuste in ogni momento. Premiare solo il risultato finale non è sufficiente se il percorso per arrivarci è importante. Esempio: un assistente di programmazione che pianifica, scrive, esegue ed esegue il debug del codice in più fasi.
+ **Il modello deve utilizzare strumenti in più fasi:** il modello richiama strumenti esterni come la ricerca, le API o l'esecuzione del codice e i risultati di una chiamata allo strumento influiscono sulle operazioni successive. Esempio: un assistente di ricerca che cerca informazioni, valuta i risultati e perfeziona la ricerca prima di produrre un riepilogo.
+ **Gli errori commessi a metà attività dovrebbero essere recuperabili:** si desidera che il modello riconosca quando qualcosa non funziona e corregga la rotta, piuttosto che imboccare una strada sbagliata fin dall'inizio. Esempio: un agente che prova una soluzione, verifica se ha funzionato e prova un approccio diverso in caso contrario.
+ **Si riscontrano buone prestazioni in un solo turno ma uno scarso completamento delle attività dall'inizio alla fine:** se il modello gestisce bene i singoli passaggi ma ha difficoltà a metterli insieme in un risultato coerente e di successo, l'RL a più turni può contribuire a colmare questa lacuna.

## Modelli, prezzi e aree geografiche supportati
<a name="model-customize-mtrl-supported"></a>

### Modelli supportati
<a name="model-customize-mtrl-supported-models"></a>


| Modello | Region | 
| --- | --- | 
| Nova Lite 2.0 | IAD (us-east-1), PDX (us-west-2) | 
| GPT-OSS-20B | IAD (us-east-1), PDX (us-west-2) | 
| Gemma-4-31B-it | PDX (us-west-2) | 
| Qwen 3.6 27V | PDX (us-west-2) | 

### Prezzi
<a name="model-customize-mtrl-pricing"></a>

Per i dettagli completi sui prezzi, consulta la pagina dei prezzi [pubblica](https://aws.amazon.com/sagemaker/ai/pricing/). Le tariffe si basano su tre aspetti:
+ **Precompilazione:** il costo di elaborazione dei token di input inseriti nel modello all'inizio di ogni fase di formazione. Ciò include il prompt, la cronologia delle conversazioni e qualsiasi contesto ricevuto dal modello prima di generare una risposta.
+ **Esempio:** il costo dei token generati dal modello durante l'implementazione della formazione. È qui che il modello produce le sue risposte, che vengono poi valutate e utilizzate per calcolare il segnale di ricompensa.
+ **Treno:** il costo del backward pass, in cui i pesi del modello vengono aggiornati in base al segnale di ricompensa. Questa è la fase di apprendimento principale del processo RL.

## Argomenti
<a name="w2aac29c15c13"></a>
+  [Prerequisiti](model-customize-mtrl-prereqs.md) 
+  [Preparazione del tuo agente](model-customize-mtrl-agent.md) 
+  [Creazione di risorse per l'apprendimento per rinforzo in più turni](model-customize-mtrl-assets.md) 
+  [Invio di un lavoro di formazione](model-customize-mtrl-job.md) 
+  [Valutazione del modello](model-customize-mtrl-evaluation.md) 
+  [Implementazione di modelli](model-customize-mtrl-deployment.md) 
+  [Riferimento agli iperparametri](model-customize-mtrl-hyperparams.md) 
+  [Configurazione di un VPC per lavori RL a turni multipli](model-customize-mtrl-vpc.md) 
+  [Crittografia a riposo per il reinforcement learning a più turni](model-customize-mtrl-encryption-at-rest.md) 
+  [Risoluzione dei problemi](model-customize-mtrl-troubleshooting.md) 
+  [Quote](model-customize-mtrl-quotas.md) 
+  [Set di dati e tutorial di esempio](model-customize-mtrl-samples.md) 