View a markdown version of this page

Multi-turn apprentissage par renforcement - Amazon SageMaker AI

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Multi-turn apprentissage par renforcement

Multi-turn l'apprentissage par renforcement (RL) apprend à un agent à prendre de bonnes décisions en une séquence d'étapes, et pas seulement en un seul instant. L'agent observe son environnement, prend une action, reçoit une récompense et passe à un nouvel état, en répétant ce processus sur de nombreuses étapes. L'objectif est d'apprendre une politique (comportement modèle) qui maximise la récompense cumulée sur l'ensemble de la séquence plutôt que d'optimiser une étape isolée. Cette approche est de plus en plus utilisée pour entraîner les modèles de langage au raisonnement en plusieurs étapes et à des tâches agentiques, où le modèle effectue des actions telles que des appels d'outils, l'exécution de code ou une recherche sur le Web en plusieurs tours et est récompensé en fonction de la séquence complète. Cela est différent du tour unique RLHF/RLAIF, où une récompense est attribuée à une sortie à la fois.

Une simple analogie

Imaginez que vous êtes un agent du service client qui gère un ticket d'assistance. Vous ne pouvez pas le résoudre en un seul message. Vous posez des questions de clarification, recherchez le compte du client, essayez un correctif, vérifiez s'il fonctionne et effectuez un suivi si ce n'est pas le cas. Au final, le client repart satisfait ou non. Au fil du temps, vous apprenez à mieux reconnaître quelle séquence d'étapes a tendance à mener à une bonne résolution.

Multi-turn RL entraîne le modèle de la même manière. Au lieu de noter le modèle en fonction d'une seule réponse, il permet au modèle d'exécuter une tâche en plusieurs étapes et de la récompenser en fonction de la séquence complète. Le modèle apprend quelles décisions prises plus tôt dans la conversation étaient réellement importantes.

Terminologie clé

  • Agent : entité décisionnelle du système. Il observe la situation actuelle, décide des mesures à prendre et apprend au fil du temps pour améliorer sa stratégie. En pratique, l'agent est alimenté par un modèle d'IA, mais les deux ne sont pas identiques. Le modèle est le réseau neuronal sous-jacent ; l'agent est le système plus large qui l'utilise pour percevoir, décider et agir. En termes simples : le représentant du service client qui gère le ticket.

  • Environment/Agentic Application : tout ce avec quoi l'agent interagit, y compris l'historique des conversations, les détails du compte du client et tous les outils que l'agent peut utiliser. En termes simples : la plateforme d'assistance, le client et toutes les informations mises à la disposition du représentant.

  • État : un aperçu de la situation actuelle que l'agent observe avant de décider de la marche à suivre. En termes simples : ce que le représentant sait à l'heure actuelle, comme le problème du client, ce qui a déjà été essayé et la dernière réponse.

  • Action : ce que fait l'agent à chaque étape, par exemple en posant une question de clarification, en appelant un outil ou en envoyant une réponse. En termes simples : la prochaine étape du représentant, qu'il s'agisse de poser une question, de rechercher quelque chose ou d'envoyer un correctif.

  • Récompense : le signal de feedback que l'agent reçoit, soit à chaque étape, soit à la fin de la tâche, indiquant si les choses se sont bien passées. En termes simples : le client est-il reparti satisfait ? Ce résultat est la récompense.

  • Politique : stratégie apprise par l'agent. Il associe un état donné à l'action la plus susceptible de mener à un bon résultat. En termes simples : le représentant a acquis ses connaissances grâce à son expérience, en sachant ce qui a tendance à fonctionner dans une situation donnée.

  • Épisode : exécution complète d'une tâche du début à la fin. En termes simples : une conversation d'assistance complète, du premier message du client à la résolution.

  • Tour : un échange unique au cours d'un épisode, généralement une action entreprise par l'agent et la réponse qu'il reçoit de l'environnement. Dans une conversation, il s'agit d'un message et de sa réponse. En termes simples : une étape dans la conversation d'assistance, comme le fait que l'agent pose une question et que le client y réponde.

  • Trajectoire : séquence complète des états, des actions et des récompenses enregistrés tout au long d'un épisode. Il s'agit de l'enregistrement complet de ce que l'agent a fait et de ce qui s'est passé en conséquence, utilisé pour calculer la récompense et mettre à jour la politique. En termes simples : la transcription complète de la conversation d'assistance, du début à la fin, y compris toutes les décisions prises par l'agent et le déroulement des choses.

  • Récompense cumulée : récompense totale accumulée à chaque étape d'un épisode, et c'est ce que l'agent essaie en fin de compte de maximiser. En termes simples : il ne s'agit pas seulement de savoir si une étape s'est bien passée, mais aussi si l'ensemble de la conversation s'est bien déroulé dans l'ensemble.

Cas d'utilisation pour l'apprentissage par renforcement à plusieurs tours

Multi-turn RL est la bonne approche lorsqu'une seule réponse ne suffit pas pour bien accomplir une tâche. Si votre cas d'utilisation implique une séquence d'étapes, des décisions qui dépendent de décisions antérieures, une RL à plusieurs tours vaut la peine d'être prise en compte.

Voici quelques signaux qui pointent dans ce sens :

  • Votre tâche nécessite des interactions réciproques : le modèle doit poser des questions, recueillir des informations et s'adapter en fonction de ce qu'il apprend en cours de route. Un seul cycle de réponse rapide ne suffit pas. Exemple : un agent de support qui diagnostique un problème en posant des questions de suivi avant de suggérer une solution.

  • La qualité du résultat dépend d'une séquence d'actions : pour obtenir la bonne réponse à la fin, il faut prendre les bonnes décisions tout au long du processus. Il ne suffit pas de récompenser uniquement le résultat final si le chemin à suivre pour y parvenir compte. Exemple : un assistant de codage qui planifie, écrit, exécute et débogue le code en plusieurs étapes.

  • Le modèle doit utiliser des outils en plusieurs étapes : le modèle fait appel à des outils externes tels que la recherche, les API ou l'exécution de code, et les résultats d'un appel d'outil influencent ce qu'il fait ensuite. Exemple : un assistant de recherche qui recherche des informations, évalue les résultats et affine sa requête avant de produire un résumé.

  • Les erreurs commises en cours de tâche doivent être réparables : vous voulez que le modèle reconnaisse les dysfonctionnements et qu'il prenne la bonne voie, plutôt que de s'engager sur une mauvaise voie dès le départ. Exemple : un agent qui essaie une solution, vérifie si elle fonctionne et essaie une approche différente dans le cas contraire.

  • Vous constatez de bonnes performances en un tour mais une exécution médiocre des tâches de bout en bout : si votre modèle gère bien les étapes individuelles mais a du mal à les enchaîner pour obtenir un résultat cohérent et réussi, le RL multitour peut vous aider à combler cet écart.

Modèles, tarifs et régions pris en charge

Modèles pris en charge

Modèle Région
Nova Lite 2.0 IAD (us-east-1), PDX (us-west-2)
GPT-OSS-20B IAD (us-east-1), PDX (us-west-2)
Gemma-4-31B-it PDX (us-west-2)
Qwen 3.6 27B PDX (us-west-2)

Tarification

Pour plus de détails sur les prix, consultez la page des tarifs publics. Les frais sont basés sur trois dimensions :

  • Préremplissage : coût de traitement des jetons d'entrée introduits dans le modèle au début de chaque étape de formation. Cela inclut l'invite, l'historique des conversations et tout contexte que le modèle reçoit avant de générer une réponse.

  • Exemple : le coût des jetons générés par le modèle lors du déploiement de la formation. C'est là que le modèle produit ses réponses, qui sont ensuite évaluées et utilisées pour calculer le signal de récompense.

  • Train : coût du trajet retour, où les poids du modèle sont mis à jour en fonction du signal de récompense. Il s'agit de l'étape d'apprentissage principale du processus RL.

Rubriques