Evaluierung von Datensätzen
Anmerkung
Die Auswertung der Datensätze befindet sich in der öffentlichen Vorschauphase. Funktionen und APIs können sich vor der allgemeinen Verfügbarkeit ändern.
Mithilfe von Datensatzauswertungen können Sie Ihren Agenten anhand einer Reihe von Szenarien ausführen und die Ergebnisse automatisch auswerten. Anstatt Ihren Agenten manuell aufzurufen, Spans zu sammeln und die Evaluate-API aufzurufen, orchestriert ein Dataset-Runner den gesamten Lebenszyklus in einem einzigen Aufruf: Rufen Sie den Agenten auf, warten Sie auf die Telemetrieaufnahme und werten Sie aus.
Dies ist nützlich für Regressionstests, Benchmark-Datensätze, CI/CD Pipelines, Basismessungen und Vergleiche nach Konfigurationsänderungen. pre/post
Das AgentCore SDK bietet zwei Dataset-Runner, die dasselbe Datensatzschema und dasselbe Ground-Truth-Format verwenden, sich jedoch darin unterscheiden, wo die Auswertung stattfindet:
-
On-demand dataset runner (
OnDemandEvaluationDatasetRunner) — Sammelt Spans und ruft die Evaluate-API clientseitig auf. Am besten für Iterationen während der Entwicklung und für kleine Datensätze. -
Batch Dataset Runner (
BatchEvaluationRunner) — Delegierte reichen die Erfassung und Auswertung über die Batch-Evaluierungs-API an den Service weiter. Am besten für große Datensätze und Produktionsbasislinien.
Einen Läufer auswählen
| Aspekt | On-demand Läufer | Batch-Runner |
|---|---|---|
|
Sammlung Spany |
SDK-side über |
Server-side; Service liest CloudWatch direkt von |
|
Evaluieren Sie API-Aufrufe |
SDK-Aufrufe |
Das SDK ruft einmal auf |
|
Ausführungsmodell |
Synchrone dreiphasige Pipeline (aufrufen, warten, auswerten) |
Asynchrone vierphasige Pipeline (aufrufen, warten, senden, abfragen) |
|
Ergebnisse |
Strukturiert |
Aggregiert |
|
Am besten geeignet für |
Dev-time Iteration, kleine Datensätze CI/CD, wenn Sie sofort Details pro Szenario benötigen |
Basismessung, große Datensätze, pre/post Vergleich, wenn die aggregierten Ergebnisse ausreichend sind |
Voraussetzungen
Beide Läufer benötigen:
-
Python 3.10 und höher
-
Ein auf AgentCore Runtime bereitgestellter Agent mit aktivierter Observability oder ein Agent, der mit einem unterstützten Framework erstellt wurde, das mit Observability konfiguriert ist. AgentCore Unterstützte Frameworks:
-
Strands, Agenten
-
LangGraph mit
opentelemetry-instrumentation-langchainoderopeninference-instrumentation-langchain
-
-
Die Transaktionssuche ist aktiviert in CloudWatch; siehe Transaktionssuche aktivieren
-
Das AgentCore SDK ist installiert:
pip install bedrock-agentcore -
AWS Anmeldeinformationen, die mit Berechtigungen für
bedrock-agentcorebedrock-agentcore-control, undlogs(CloudWatch) konfiguriert sind