View a markdown version of this page

Multi-turn verstärkendes Lernen - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Multi-turn verstärkendes Lernen

Multi-turn Reinforcement-Learning (RL) trainiert einen Agenten darin, gute Entscheidungen in einer Abfolge von Schritten zu treffen, nicht nur in einem einzigen Moment. Der Agent beobachtet seine Umgebung, ergreift Maßnahmen, erhält eine Belohnung und wechselt in einen neuen Zustand, wobei er diesen Vorgang über viele Zeitschritte wiederholt. Das Ziel besteht darin, eine Richtlinie (Verhaltensmuster) zu erlernen, die die kumulative Belohnung über die gesamte Sequenz hinweg maximiert, anstatt für einen einzelnen Schritt isoliert zu optimieren. Dieser Ansatz wird zunehmend verwendet, um Sprachmodelle für mehrstufiges Denken und agentische Aufgaben zu trainieren, bei denen das Modell Aktionen wie Tool-Aufrufe, Codeausführung oder Websuche über mehrere Runden durchführt und auf der Grundlage der gesamten Sequenz belohnt wird. Dies unterscheidet sich von Single-Turn RLHF/RLAIF, bei dem jeweils nur einer Ausgabe eine Belohnung zugewiesen wird.

Eine einfache Analogie

Stellen Sie sich vor, Sie sind ein Kundendienstmitarbeiter, der ein Support-Ticket bearbeitet. Sie lösen es nicht in einer Nachricht. Sie stellen klärende Fragen, suchen im Kundenkonto nach, probieren eine Lösung aus, überprüfen, ob sie funktioniert hat, und setzen sich mit ihnen in Verbindung, falls sie nicht funktioniert hat. Am Ende geht der Kunde entweder zufrieden oder nicht. Mit der Zeit können Sie immer besser erkennen, welche Abfolge von Schritten tendenziell zu einer guten Lösung führt.

Multi-turn RL trainiert das Modell auf die gleiche Weise. Anstatt das Modell anhand einer einzigen Antwort zu bewerten, ermöglicht es dem Modell, eine Aufgabe in mehreren Schritten zu bearbeiten, und belohnt es auf der Grundlage der gesamten Sequenz. Das Modell lernt, welche Entscheidungen zu Beginn des Gesprächs tatsächlich wichtig waren.

Wichtige Begriffe

  • Agent: Die Entscheidungsinstanz im System. Es beobachtet die aktuelle Situation, entscheidet, welche Maßnahmen zu ergreifen sind, und lernt im Laufe der Zeit, um seine Strategie zu verbessern. In der Praxis wird der Agent von einem KI-Modell unterstützt, aber die beiden sind nicht dasselbe. Das Modell ist das zugrundeliegende neuronale Netzwerk; der Agent ist das umfassendere System, das es verwendet, um wahrzunehmen, zu entscheiden und zu handeln. Einfach ausgedrückt: Der Kundendienstmitarbeiter, der das Ticket bearbeitet.

  • Environment/Agentic Anwendung: alles, mit dem der Agent interagiert, einschließlich des Konversationsverlaufs, der Kontodaten des Kunden und aller Tools, die der Agent verwenden kann. Einfach ausgedrückt: die Support-Plattform, der Kunde und alle Informationen, die dem Mitarbeiter zur Verfügung stehen.

  • Status: Eine Momentaufnahme der aktuellen Situation, die der Mitarbeiter beobachtet, bevor er entscheidet, was als Nächstes zu tun ist. Einfach ausgedrückt: Was der Mitarbeiter gerade weiß, z. B. das Problem des Kunden, was bereits versucht wurde und die letzte Antwort.

  • Aktion: was der Mitarbeiter bei jedem Schritt tut, z. B. eine klärende Frage stellen, ein Tool aufrufen oder eine Antwort senden. Einfach ausgedrückt: Der nächste Schritt des Mitarbeiters, ob das nun darin besteht, eine Frage zu stellen, etwas nachzuschlagen oder eine Lösung zu senden.

  • Belohnung: Das Feedback-Signal, das der Agent entweder bei jedem Schritt oder am Ende der Aufgabe erhält, und gibt an, wie gut die Arbeit gelaufen ist. Einfach ausgedrückt: Hat der Kunde das Unternehmen zufrieden verlassen? Dieses Ergebnis ist die Belohnung.

  • Richtlinie: Die Strategie, die der Agent gelernt hat. Sie ordnet einen bestimmten Status der Maßnahme zu, die am wahrscheinlichsten zu einem guten Ergebnis führen wird. Einfach ausgedrückt: Das Wissen des Mitarbeiters wurde aus Erfahrung gewonnen und weiß, was in einer bestimmten Situation tendenziell funktioniert.

  • Episode: Ein vollständiger Durchlauf einer Aufgabe von Anfang bis Ende. Einfach ausgedrückt: ein vollständiges Support-Gespräch, von der ersten Nachricht des Kunden bis zur Lösung.

  • Wende: ein einziger Austausch innerhalb einer Episode, in der Regel eine Aktion des Agenten und die Antwort, die er von der Umgebung erhält. In einer Konversation besteht dies aus einer Nachricht und ihrer Antwort. Einfach ausgedrückt: ein Schritt in der Support-Konversation, z. B. wenn der Mitarbeiter eine Frage stellt und der Kunde antwortet.

  • Verlauf: Die gesamte Abfolge von Zuständen, Aktionen und Belohnungen, die während einer gesamten Episode aufgezeichnet wurden. Es handelt sich um die vollständige Aufzeichnung dessen, was der Agent getan hat und was daraufhin passiert ist. Sie wird zur Berechnung der Prämie und zur Aktualisierung der Richtlinie verwendet. Einfach ausgedrückt: Die gesamte Abschrift der Support-Konversation von Anfang bis Ende, einschließlich aller Entscheidungen, die der Mitarbeiter getroffen hat, und der Art und Weise, wie sich die Dinge entwickelt haben.

  • Kumulative Belohnung: Die Gesamtprämie, die sich über alle Schritte in einer Episode angesammelt hat. Das ist es, was der Mitarbeiter letztendlich zu maximieren versucht. Einfach ausgedrückt: nicht nur, ob ein Schritt gut gelaufen ist, sondern ob die gesamte Konversation insgesamt gut gelaufen ist.

Anwendungsfälle für Reinforcement-Learning in mehreren Runden

Multi-turn RL ist der richtige Ansatz, wenn eine einzige Antwort nicht ausreicht, um eine Aufgabe gut zu erledigen. Wenn Ihr Anwendungsfall eine Abfolge von Schritten und Entscheidungen umfasst, die von früheren Schritten abhängen, ist Multi-Turn RL eine Überlegung wert.

Hier sind einige Signale, die darauf hindeuten:

  • Ihre Aufgabe erfordert eine wechselseitige Interaktion: Das Modell muss Fragen stellen, Informationen sammeln und sich auf der Grundlage dessen, was es dabei lernt, anpassen. Ein einziger Antwortzyklus reicht nicht aus. Beispiel: Ein Support-Mitarbeiter, der ein Problem diagnostiziert, indem er Folgefragen stellt, bevor er eine Lösung vorschlägt.

  • Die Qualität des Ergebnisses hängt von einer Abfolge von Aktionen ab: Um am Ende die richtige Antwort zu erhalten, müssen Sie durchgehend die richtigen Schritte unternehmen. Es reicht nicht aus, nur das Endergebnis zu belohnen, wenn der Weg dorthin wichtig ist. Beispiel: Ein Programmierassistent, der Code in mehreren Schritten plant, schreibt, ausführt und debuggt.

  • Das Modell muss Tools für mehrere Schritte verwenden: Das Modell ruft externe Tools wie Suche, APIs oder Codeausführung auf, und die Ergebnisse eines Werkzeugaufrufs beeinflussen, was als Nächstes ausgeführt wird. Beispiel: Ein wissenschaftlicher Mitarbeiter, der nach Informationen sucht, die Ergebnisse auswertet und seine Abfrage verfeinert, bevor er eine Zusammenfassung erstellt.

  • Fehler während der Aufgabe sollten behebbar sein: Sie möchten, dass das Modell erkennt, wenn etwas nicht funktioniert, und den Kurs korrigiert, anstatt sich von Anfang an auf einen schlechten Weg festzulegen. Beispiel: Ein Agent versucht, eine Lösung auszuprobieren, prüft, ob sie funktioniert hat, und versucht, wenn nicht, einen anderen Ansatz.

  • Sie sehen eine gute Single-Turn-Leistung, aber eine schlechte Ende-zu-Ende-Aufgabenerfüllung: Wenn Ihr Modell einzelne Schritte gut handhabt, aber Schwierigkeiten hat, sie zu einem kohärenten, erfolgreichen Ergebnis zusammenzufügen, kann Multi-Turn-RL helfen, diese Lücke zu schließen.

Unterstützte Modelle, Preise und Regionen

Unterstützte Modelle

Modell Region
Nova Lite 2.0 IAD (us-east-1), PDX (US-West-2)
GPT-OSS-20B IAD (us-east-1), PDX (US-West-2)
Gemma-4-31B-it PDX (US-West-2)
Qwen 3.6 27B PDX (US-West-2)

Preisgestaltung

Vollständige Preisinformationen finden Sie auf der öffentlichen Preisseite. Die Gebühren basieren auf drei Dimensionen:

  • Vorabfüllung: Die Kosten für die Verarbeitung der Eingabe-Token, die zu Beginn jedes Trainingsschritts in das Modell eingegeben wurden. Dazu gehören die Aufforderung, der Konversationsverlauf und der gesamte Kontext, den das Modell empfängt, bevor eine Antwort generiert wird.

  • Beispiel: Die Kosten der Token, die das Modell während der Einführung des Trainings generiert. Hier erzeugt das Modell seine Antworten, die dann ausgewertet und zur Berechnung des Belohnungssignals verwendet werden.

  • Zug: Die Kosten für den Rückwärtspass, bei dem die Gewichte des Modells auf der Grundlage des Belohnungssignals aktualisiert werden. Dies ist der zentrale Lernschritt im RL-Prozess.

Topics