Marcos de agentes compatibles
Amazon Bedrock AgentCore Evaluations evalúa a los agentes creados con marcos de agentes populares. Lo que un agente emite como telemetría y la forma en que se estructura esa telemetría dependen del marco de agentes con el que se cree y de la biblioteca de instrumentación que se utilice para grabarlo.
Para cada marco compatible, en esta sección se describe:
-
Las bibliotecas de instrumentación que puede utilizar.
-
Cómo instrumentar a su agente.
-
Cómo se ven los intervalos y los registros de eventos resultantes.
-
Cómo localiza el servicio de evaluación los valores que necesita, como el mensaje del usuario, la respuesta del agente y las llamadas a las herramientas.
AgentCore Evaluations es compatible con los siguientes marcos y bibliotecas de instrumentación. Solo es compatible con las versiones de Python de estas bibliotecas.
| Marco de agentes | Biblioteca de instrumentación | Nombre del ámbito | Versión recomendada |
|---|---|---|---|
|
Strands Agents |
Built-in (SDK de Strands Agents) |
|
La más reciente |
|
LangGraph |
OpenTelemetry ( |
|
|
|
LangGraph |
OpenInference ( |
|
|
|
Agentes de OpenAI |
OpenTelemetry ( |
|
|
|
Agentes de OpenAI |
OpenInference ( |
|
|
|
LlamaIndex |
OpenTelemetry ( |
|
|
|
LlamaIndex |
OpenInference ( |
|
|
|
ADK de Google |
OpenInference ( |
|
|
|
SDK de Claude Agent |
OpenInference ( |
|
|
El nombre del ámbito es el valor del scope.name campo en cada registro de intervalo y evento. El servicio de evaluación lo usa para determinar si puede procesar un intervalo.
Cómo lee el servicio una sesión
Independientemente del marco, el servicio de evaluación reconstruye una sesión a partir de dos señales de telemetría: intervalos y registros de eventos. Clasifica cada intervalo por su tipo y, a continuación, extrae su contenido:
-
Identifique el tipo de tramo a partir de los atributos específicos del marco. Un intervalo puede ser un intervalo de invocación de un agente (la ejecución del agente de nivel superior), un intervalo de herramientas de ejecución (una sola llamada a una herramienta) o un intervalo de inferencia (una llamada de un solo modelo).
-
Extraiga los valores relevantes de los atributos de cada intervalo o de su registro de eventos correlacionados. Por ejemplo, el mensaje del usuario proviene del mensaje humano (rol de usuario) que aparece en la entrada del agente, y la respuesta del agente proviene del mensaje de IA (rol de asistente) que aparece en la salida del agente.
Los nombres exactos de los atributos y las ubicaciones del contenido difieren según el marco y la biblioteca de instrumentación. La página de intervalos, registros de eventos y señales de telemetría explica la estructura de los intervalos y los registros de eventos y dónde se encuentra el contenido. Las páginas por marco describen los atributos y los datos de ejemplo de cada marco compatible.
Configure la observabilidad
Instrumentar a su agente es una parte de la producción de telemetría que el servicio de evaluación pueda leer. Antes de que la evaluación funcione de principio a fin, tu agente también debe tener habilitada la observabilidad y exportar sus intervalos y registros de eventos a Amazon. CloudWatch Realice los siguientes pasos:
-
Activa CloudWatch la búsqueda de transacciones, que es un requisito previo para la evaluación. Consulte Habilitar la AgentCore observabilidad.
-
Habilite la observabilidad para su agente en función del lugar donde esté alojado:
-
Para los agentes alojados en Amazon Bedrock AgentCore Runtime, consulte Habilitar la observabilidad en el código de agente para AgentCore-hosted agentes.
-
Para ver los agentes alojados en Amazon Elastic Container Service (Amazon ECS), Amazon Elastic Kubernetes Service (Amazon AWS EKS), Lambda u otros entornos, consulte Habilitar la observabilidad para agentes alojados fuera de. AgentCore
-
Ejemplos de agentes
Los siguientes ejemplos muestran a los agentes de Strands alojados fuera de Amazon Bedrock AgentCore Runtime que exportan telemetría a Amazon CloudWatch con ADOT. Se centran en la configuración de la observabilidad más que en la API de evaluación. Las muestras utilizan Strands, pero el mismo patrón de alojamiento y exportación de telemetría se aplica a otros marcos compatibles, como. LangGraph
-
Amazon EKS: observabilidad de un EKS-hosted agente y un agente
de Strands en Amazon EKS . -
Amazon ECS: agente de Strands en Amazon ECS
. -
AWS Lambda: agente de hebras en AWS Lambda
.