View a markdown version of this page

Chargenauswertung - Amazon Grundgestein AgentCore

Chargenauswertung

Bei der Batch-Auswertung werden Evaluatoren für mehrere Agentensitzungen in einem einzigen Job mit serverseitiger Orchestrierung ausgeführt. Im Gegensatz zur On-Demand-Evaluierung, bei der Sie die Spannweiten erfassen und die Evaluate-API selbst aufrufen, erfolgt bei der Batch-Auswertung die Sitzungserkennung, die Erfassung der Zeitspannen und die Bewertung ausschließlich auf der Serviceseite. Sie reichen einen Job ein, und der Service verarbeitet alle passenden Sitzungen und gibt aggregierte Ergebnisse zurück.

Verwenden Sie die Batch-Auswertung, wenn Sie:

  • Messen Sie einen Ausgangswert, bevor Sie Änderungen an der Aufforderung, den Tools oder dem Modell Ihres Agenten vornehmen.

  • Überprüfen Sie die Verbesserungen, indem Sie die Ergebnisse vor und nach einer Konfigurationsänderung vergleichen.

  • Führen Sie Regressionstests für eine kuratierte Reihe von Sitzungen oder Szenarien durch.

  • Überwachen Sie die Qualität in regelmäßigen Abständen in allen Produktionssitzungen innerhalb eines bestimmten Zeitfensters.

Funktionsweise

Ein Auftrag zur Batch-Auswertung folgt diesem Ablauf:

  1. Sie starten einen Job, indem Sie eine Sitzungsquelle (wo die Agentensitzungen zu finden sind) und eine Testkonfiguration (welche Evaluatoren ausgeführt werden sollen) angeben. Optional stellen Sie Ground-Truth-Metadaten für eine referenzbasierte Bewertung bereit.

  2. Der Dienst erkennt Sitzungen anhand von CloudWatch Protokollen auf der Grundlage der von Ihnen angegebenen Protokollgruppen und Filter.

  3. Der Dienst führt Evaluatoren für jede erkannte Sitzung durch. Jeder Evaluator bewertet jede Sitzung unabhängig. Wenn Grundwahrheiten vorliegen, verwenden Gutachter, die eine referenzgestützte Bewertung unterstützen, diese.

  4. Sie fragen nach Ergebnissen ab. Der Job wechselt durch PENDINGIN_PROGRESSCOMPLETED (oderFAILED). Wenn die Antwort abgeschlossen ist, enthält sie zusammengefasste Zusammenfassungen mit Durchschnittswerten pro Evaluator, Anzahl der Sitzungen und Token-Nutzung.

  5. Per-session Einzelheiten sind in den CloudWatch Protokollen an der in outputDataConfig der Antwort angegebenen Position verfügbar.

Vergleich mit anderen Bewertungsarten

Aspekt On-demand Status "Online" Batch

Auslöser

Caller-initiated, synchron

Kontinuierlich, ereignisgesteuert

Caller-initiated, asynchron

Quelle der Sitzung

Der Anrufer stellt Spans inline bereit

Überwacht eine Protokollgruppe

Der Dienst erkennt anhand von CloudWatch Protokollen

Scope

Eine einzige Sitzung

Alle Sitzungen entsprechen den Stichprobenregeln

Mehrere Sitzungen (Zeitraum, Sitzungs-IDs oder vollständige Protokollgruppe)

Grundlegende Wahrheit

Über evaluationReferenceInputs

Nicht unterstützt

Via sessionMetadata mit Inline Ground Truth

Ergebnisse

Synchrone Antwort

CloudWatch Metriken und Dashboards

Aggregierte Zusammenfassungen mit Durchschnittswerten pro Evaluator sowie Einzelheiten pro Sitzung in CloudWatch

Anwendungsfall

Dev-time stichprobenartige Kontrollen, CI/CD

Produktionsüberwachung

Basismessung, pre/post Vergleich, Regressionstests