View a markdown version of this page

Belohnungsfunktionen für Amazon Nova-Modelle einrichten - Amazon Bedrock

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Belohnungsfunktionen für Amazon Nova-Modelle einrichten

Belohnungsfunktionen bewerten die Antwortqualität und liefern Feedbacksignale für das Modelltraining. Sie können Belohnungsfunktionen einrichten, indem Sie benutzerdefinierte Lambda-Funktionen oder Amazon Bedrock-hosted Foundation-Modelle als Juroren verwenden. Es stehen Vorlagen mit Anleitungen zur Verfügung, um die Erstellung von Belohnungsfunktionen für allgemeine Aufgaben wie das Befolgen von Anweisungen und die Validierung von Formaten zu vereinfachen. Wählen Sie den Ansatz, der Ihren Aufgabenanforderungen entspricht.

Verstärktes Lernen durch verifizierbare Belohnungen (RLVR)

RLVR optimiert Modelle für objektive Aufgaben wie Codegenerierung oder mathematisches Denken mithilfe überprüfbarer, regelbasierter Korrektoren oder gebrauchsfertiger Vorlagen.

Sie haben zwei Optionen für RLVR (Benutzerdefinierter Code):

Die Amazon Bedrock-Konsole bietet Beispielvorlagen für Grader-Lambda-Funktionen:

  • Mathematische Argumentation mit Ground-Truth-Verifizierung

  • Formatvalidierung und Überprüfung von Einschränkungen

  • Generische Lambda-Vorlage für Grader mit Boilerplate-Code

Folgen Sie den Anweisungen in der bereitgestellten Vorlage auf der Seite „RFT-Job erstellen“ in der Amazon Bedrock-Konsole. https://console.aws.amazon.com/bedrock

Erstellen Sie benutzerdefinierte Belohnungsfunktionen mit Ihrem eigenen Lambda-ARN für komplexe Logik, externe APIs, mehrstufige Berechnungen oder die Kombination mehrerer Bewertungskriterien.

Anmerkung

Wenn Sie Ihre eigene Lambda-Funktion mitbringen, beachten Sie Folgendes:

  • Erhöhen Sie das Lambda-Timeout von standardmäßig 3 Sekunden auf maximal 15 Minuten für komplexe Auswertungen.

  • Die Lambda-Ausführungsrolle benötigt Berechtigungen zum Aufrufen von Modellen, wie unter beschrieben. Zugriff und Sicherheit für Amazon Nova-Modelle

Verstärktes Lernen durch KI-Feedback (RLAIF)

RLAIF optimiert Modelle für subjektive Aufgaben wie das Befolgen von Anweisungen oder Chatbot-Interaktionen mithilfe von Richtern mit gebrauchsfertigen Vorlagen. AI-based

Für RLAIF (Model as Judge):

  • Wählen Sie ein von Amazon Bedrock gehostetes Basismodell als Judge aus

  • Konfigurieren Sie die Anweisungen für die Bewertung

  • Definieren Sie Bewertungskriterien und Bewertungsrichtlinien

Verfügbare Vorlagen für LLM-as-Judge Eingabeaufforderungen in der Amazon Bedrock-Konsole:

  • Es folgt eine Anleitung (Schulung zum Richter-Modell)

  • Zusammenfassung (Multi-turn Dialoge)

  • Bewertung der Argumentation (CoT für Fachgebiete)

  • Treue der RAG (Fragen und Antworten) Context-grounded

Anmerkung

Die Option Model as Judge der Konsole wandelt Ihre Konfiguration während des Trainings automatisch in eine Lambda-Funktion um.

Einzelheiten zur Implementierung der Lambda-Funktion

Bei der Implementierung benutzerdefinierter Lambda-Belohnungsfunktionen muss Ihre Funktion Daten im folgenden Format akzeptieren und zurückgeben.

Input structure
[{ "id": "123", "messages": [ { "role": "user", "content": "Do you have a dedicated security team?" }, { "role": "assistant", "content": "As an AI developed by Amazon, I don not have a dedicated security team..." } ], "metadata": { "reference_answer": { "compliant": "No", "explanation": "As an AI developed by Company, I do not have a traditional security team..." }, "my_key": "sample-001" } }]
Output structure
[{ "id": "123", "aggregate_reward_score": 0.85, "metrics_list": [ { "name": "accuracy", "value": 0.9, "type": "Reward" }, { "name": "policy_compliance", "value": 0.8, "type": "Metric" } ] }]

Richtlinien für das Design

  • Antworten bewerten — Geben Sie der besten Antwort eine deutlich höhere Punktzahl

  • Verwenden Sie konsistente Prüfungen — Bewerten Sie die Erledigung der Aufgaben, die Einhaltung des Formats, die Sicherheit und den angemessenen Umfang

  • Sorgen Sie für eine stabile Skalierung — Sorgen Sie dafür, dass die Ergebnisse normalisiert sind und nicht ausgenutzt werden können