View a markdown version of this page

Valuta le prestazioni degli agenti con Amazon Bedrock AgentCore Evaluations - Amazon Bedrock AgentCore

Valuta le prestazioni degli agenti con Amazon Bedrock AgentCore Evaluations

Amazon Bedrock AgentCore Evaluations fornisce strumenti di valutazione automatizzati per misurare la capacità del tuo agente o dei tuoi strumenti di svolgere attività specifiche, gestire casi limite e mantenere la coerenza tra diversi input e contesti. Il servizio consente l'ottimizzazione basata sui dati e garantisce che gli agenti soddisfino gli standard di qualità prima e dopo l'implementazione.

AgentCore Evaluations si integra con i framework di agenti più diffusi, tra cui Strands e con e le librerie di strumentazione. LangGraphOpenTelemetryOpenInference Sotto il cofano, le tracce di questi agenti vengono convertite in un formato unificato e valutate utilizzando LLM-as-a-Judge tecniche di valutazione integrate e personalizzate.

A ogni valutatore sono associati un Amazon Resource Name (ARN) e una policy sulle risorse univoci. Gli ARN di valutazione seguono questi formati:

arn:aws:bedrock-agentcore:::evaluator/Builtin.Helpfulness (for built-in evaluators)
arn:aws:bedrock-agentcore:region:account:evaluator/my-evaluator-id (for custom evaluators)

Built-in gli valutatori sono pubblici e accessibili a tutti gli utenti. Le risorse di valutazione personalizzate sono private e possono accedervi solo gli utenti a cui è esplicitamente concesso l'accesso. Per concedere l'accesso, puoi utilizzare policy basate su risorse IAM per valutatori e configurazioni di valutazione e policy basate sull'identità IAM per utenti e ruoli.

Per impostazione predefinita, puoi creare fino a 1.000 configurazioni di valutazione per AWS regione in un AWS account, con un massimo di 100 attive in qualsiasi momento. Il servizio supporta fino a 1 milione di token di input e output al minuto per account per aree di grandi dimensioni.