View a markdown version of this page

Evaluierung von Datensätzen - Amazon Grundgestein AgentCore

Evaluierung von Datensätzen

Anmerkung

Die Auswertung der Datensätze befindet sich in der öffentlichen Vorschauphase. Funktionen und APIs können sich vor der allgemeinen Verfügbarkeit ändern.

Mithilfe von Datensatzauswertungen können Sie Ihren Agenten anhand einer Reihe von Szenarien ausführen und die Ergebnisse automatisch auswerten. Anstatt Ihren Agenten manuell aufzurufen, Spans zu sammeln und die Evaluate-API aufzurufen, orchestriert ein Dataset-Runner den gesamten Lebenszyklus in einem einzigen Aufruf: Rufen Sie den Agenten auf, warten Sie auf die Telemetrieaufnahme und werten Sie aus.

Dies ist nützlich für Regressionstests, Benchmark-Datensätze, CI/CD Pipelines, Basismessungen und Vergleiche nach Konfigurationsänderungen. pre/post

Das AgentCore SDK bietet zwei Dataset-Runner, die dasselbe Datensatzschema und dasselbe Ground-Truth-Format verwenden, sich jedoch darin unterscheiden, wo die Auswertung stattfindet:

  • On-demand dataset runner (OnDemandEvaluationDatasetRunner) — Sammelt Spans und ruft die Evaluate-API clientseitig auf. Am besten für Iterationen während der Entwicklung und für kleine Datensätze.

  • Batch Dataset Runner (BatchEvaluationRunner) — Delegierte reichen die Erfassung und Auswertung über die Batch-Evaluierungs-API an den Service weiter. Am besten für große Datensätze und Produktionsbasislinien.

Einen Läufer auswählen

Aspekt On-demand Läufer Batch-Runner

Sammlung Spany

SDK-side über AgentSpanCollector

Server-side; Service liest CloudWatch direkt von

Evaluieren Sie API-Aufrufe

SDK-Aufrufe evaluate() pro Evaluator pro Szenario

Das SDK ruft einmal auf startBatchEvaluation()

Ausführungsmodell

Synchrone dreiphasige Pipeline (aufrufen, warten, auswerten)

Asynchrone vierphasige Pipeline (aufrufen, warten, senden, abfragen)

Ergebnisse

Strukturiert EvaluationResult mit Details für jedes Szenario und jeden Evaluator

Aggregiert BatchEvaluationSummary mit Durchschnittswerten pro Evaluator plus Einzelheiten pro Sitzung in CloudWatch

Am besten geeignet für

Dev-time Iteration, kleine Datensätze CI/CD, wenn Sie sofort Details pro Szenario benötigen

Basismessung, große Datensätze, pre/post Vergleich, wenn die aggregierten Ergebnisse ausreichend sind

Voraussetzungen

Beide Läufer benötigen: