Bewerten Sie die Leistung Ihrer Agenten mit Amazon Bedrock AgentCore Evaluations
Amazon Bedrock AgentCore Evaluations bietet automatisierte Bewertungstools, mit denen Sie messen können, wie gut Ihr Agent oder Ihre Tools bestimmte Aufgaben ausführen, Randfälle bearbeiten und die Konsistenz zwischen verschiedenen Eingaben und Kontexten gewährleisten können. Der Service ermöglicht eine datengestützte Optimierung und stellt sicher, dass Ihre Mitarbeiter vor und nach der Bereitstellung die Qualitätsstandards erfüllen.
AgentCore Evaluations lässt sich in gängige Agenten-Frameworks wie Strands und Bibliotheken LangGraphmit OpenTelemetryOpenInferenceInstrumentierung integrieren. Unter der Haube werden die Traces dieser Agenten in ein einheitliches Format umgewandelt und mithilfe von LLM-as-a-Judge Techniken bewertet, die sowohl für integrierte als auch für benutzerdefinierte Evaluatoren verwendet werden.
Jedem Evaluator sind ein eindeutiger Amazon-Ressourcenname (ARN) und eine Ressourcenrichtlinie zugeordnet. Die ARNs der Evaluatoren haben folgende Formate:
arn:aws:bedrock-agentcore:::evaluator/Builtin.Helpfulness (for built-in evaluators)
arn:aws:bedrock-agentcore:region:account:evaluator/my-evaluator-id (for custom evaluators)
Built-in Evaluatoren sind öffentlich und für alle Nutzer zugänglich. Benutzerdefinierte Bewertungsressourcen sind privat und können nur von Benutzern abgerufen werden, denen der Zugriff ausdrücklich gewährt wurde. Um Zugriff zu gewähren, können Sie ressourcenbasierte IAM-Richtlinien für Evaluatoren und Evaluierungskonfigurationen sowie identitätsbasierte IAM-Richtlinien für Benutzer und Rollen verwenden.
Standardmäßig können Sie in einem AWS Konto bis zu 1.000 Testkonfigurationen pro AWS Region erstellen, wobei bis zu 100 zu einem beliebigen Zeitpunkt aktiv sind. Der Service unterstützt bis zu 1 Million Eingabe- und Ausgabetokens pro Minute und Konto für große Regionen.