Chargenauswertung
Bei der Batch-Auswertung werden Evaluatoren für mehrere Agentensitzungen in einem einzigen Job mit serverseitiger Orchestrierung ausgeführt. Im Gegensatz zur On-Demand-Evaluierung, bei der Sie die Spannweiten erfassen und die Evaluate-API selbst aufrufen, erfolgt bei der Batch-Auswertung die Sitzungserkennung, die Erfassung der Zeitspannen und die Bewertung ausschließlich auf der Serviceseite. Sie reichen einen Job ein, und der Service verarbeitet alle passenden Sitzungen und gibt aggregierte Ergebnisse zurück.
Verwenden Sie die Batch-Auswertung, wenn Sie:
-
Messen Sie einen Ausgangswert, bevor Sie Änderungen an der Aufforderung, den Tools oder dem Modell Ihres Agenten vornehmen.
-
Überprüfen Sie die Verbesserungen, indem Sie die Ergebnisse vor und nach einer Konfigurationsänderung vergleichen.
-
Führen Sie Regressionstests für eine kuratierte Reihe von Sitzungen oder Szenarien durch.
-
Überwachen Sie die Qualität in regelmäßigen Abständen in allen Produktionssitzungen innerhalb eines bestimmten Zeitfensters.
Funktionsweise
Ein Auftrag zur Batch-Auswertung folgt diesem Ablauf:
-
Sie starten einen Job, indem Sie eine Sitzungsquelle (wo die Agentensitzungen zu finden sind) und eine Testkonfiguration (welche Evaluatoren ausgeführt werden sollen) angeben. Optional stellen Sie Ground-Truth-Metadaten für eine referenzbasierte Bewertung bereit.
-
Der Dienst erkennt Sitzungen anhand von CloudWatch Protokollen auf der Grundlage der von Ihnen angegebenen Protokollgruppen und Filter.
-
Der Dienst führt Evaluatoren für jede erkannte Sitzung durch. Jeder Evaluator bewertet jede Sitzung unabhängig. Wenn Grundwahrheiten vorliegen, verwenden Gutachter, die eine referenzgestützte Bewertung unterstützen, diese.
-
Sie fragen nach Ergebnissen ab. Der Job wechselt durch
PENDING→IN_PROGRESS→COMPLETED(oderFAILED). Wenn die Antwort abgeschlossen ist, enthält sie zusammengefasste Zusammenfassungen mit Durchschnittswerten pro Evaluator, Anzahl der Sitzungen und Token-Nutzung. -
Per-session Einzelheiten sind in den CloudWatch Protokollen an der in
outputDataConfigder Antwort angegebenen Position verfügbar.
Vergleich mit anderen Bewertungsarten
| Aspekt | On-demand | Status "Online" | Batch |
|---|---|---|---|
|
Auslöser |
Caller-initiated, synchron |
Kontinuierlich, ereignisgesteuert |
Caller-initiated, asynchron |
|
Quelle der Sitzung |
Der Anrufer stellt Spans inline bereit |
Überwacht eine Protokollgruppe |
Der Dienst erkennt anhand von CloudWatch Protokollen |
|
Scope |
Eine einzige Sitzung |
Alle Sitzungen entsprechen den Stichprobenregeln |
Mehrere Sitzungen (Zeitraum, Sitzungs-IDs oder vollständige Protokollgruppe) |
|
Grundlegende Wahrheit |
Über |
Nicht unterstützt |
Via |
|
Ergebnisse |
Synchrone Antwort |
CloudWatch Metriken und Dashboards |
Aggregierte Zusammenfassungen mit Durchschnittswerten pro Evaluator sowie Einzelheiten pro Sitzung in CloudWatch |
|
Anwendungsfall |
Dev-time stichprobenartige Kontrollen, CI/CD |
Produktionsüberwachung |
Basismessung, pre/post Vergleich, Regressionstests |