View a markdown version of this page

Evaluadores de habilidades - Base amazónica AgentCore

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Evaluadores de habilidades

Una habilidad es un archivo de SKILL.md instrucciones reutilizable que un agente carga en tiempo de ejecución para ayudar con una tarea. Las habilidades siguen el estándar abierto Agent Skills para la estructura de archivos de habilidades. Para obtener información sobre la terminología, consulte Habilidad.

AgentCore Evaluations proporciona dos evaluadores integrados para los agentes que utilizan sus habilidades. Ambos son evaluadores a nivel de herramienta. AgentCore Las evaluaciones emiten un resultado por cada invocación de habilidad y ancla cada resultado al intervalo de llamadas a la herramienta en el que se cargó la habilidad. Una sesión con tres invocaciones de habilidades produce tres resultados por evaluador.

Puede utilizar estos evaluadores con evaluaciones bajo demanda, por lotes y en línea. Para ver los cuerpos exactos de las solicitudes, consulte Precisión en la selección de habilidades e Instrucción de habilidades que aparecen más adelante en la página de plantillas de solicitudes.

Builtin.SkillSelectionAccuracy

El evaluador de precisión en la selección de habilidades (Builtin.SkillSelectionAccuracy) determina si la habilidad cargada por el agente es adecuada para la tarea, teniendo en cuenta el catálogo de habilidades disponibles. Devuelve Yes (1.0) o No (0.0).

Marcadores de posición que usa el evaluador:

  • invoked_skill— El nombre de la habilidad a la que llamó el agente cargado en esta herramienta.

  • available_skills— El catálogo de habilidades entre las que el agente podía elegir en tiempo de ejecución. No todos los marcos exponen un catálogo. Cuando el catálogo no está en el rastreo, este marcador de posición está vacío y el evaluador juzga la habilidad invocada basándose únicamente en la solicitud del usuario y en el contexto de la conversación.

  • user_message— La solicitud del usuario en el turno que activó la invocación de la habilidad.

  • context— En la versión anterior aparece la llamada a la herramienta que se está evaluando.

El evaluador se ejecuta cada vez que AgentCore Evaluations detecta la invocación de una habilidad. Se centra en la decisión de selección, no en la eficacia con la que el agente ejecutó entonces la habilidad.

Builtin.SkillInstructionFollowing

La instrucción de habilidad que sigue al evaluador (Builtin.SkillInstructionFollowing) determina en qué medida el agente ha seguido los pasos prescritos por la habilidad cargada. Devuelve Fully Followed (1.0), Mostly Followed (0.75), Partially Followed (0.5), Minimally Followed (0.25) o Not Followed (0.0).

Marcadores de posición que usa el evaluador:

  • invoked_skill— El nombre de la habilidad a la que llamó el agente cargado en esta herramienta.

  • skill_content— El conjunto completo de SKILL.md instrucciones de la habilidad cargada.

  • context— El contexto completo de la sesión: cada turno, desde el inicio hasta el final de la sesión. Como el agente puede llevar a cabo los pasos prescritos en cualquier momento después de cargar la habilidad, el juez necesita toda la sesión, no solo las presentaciones hasta la toma de herramientas.

El evaluador solo se ejecuta cuando tanto la habilidad invocada como su SKILL.md cuerpo están presentes en la traza. El juez identifica los pasos prescritos en el conjunto de habilidades y, a continuación, para cada paso, determina, a partir del registro de la conversación, si el paso se llevó a cabo en su totalidad, se llevó a cabo parcialmente o se omitió, y obtiene una calificación general coherente con ese desglose por pasos.

Soporte marco

AgentCore Las evaluaciones detectan las invocaciones de habilidades a partir de dos tipos de señales de rastreo: la lectura de un SKILL.md archivo desde el sistema de archivos y la herramienta de carga de habilidades nativa de un marco. La señal de lectura del sistema de archivos funciona en cualquier marco. La señal de herramienta nativa se aplica a los marcos específicos de la segunda fila de la tabla siguiente.

Método de detección

Marcos

SKILL.mdarchivo leído (universal)

LlamaIndex, OpenAI Agents y cualquier agente que SKILL.md lea una herramienta genérica de lectura de archivos.

Herramienta nativa de carga de habilidades (además de la lectura de archivos)

Strands Agents, LangGraph Deep Agents, Google ADK, Claude Agent SDK.

En el caso de la ruta de lectura de archivos, AgentCore Evaluations compara una llamada a una herramienta con una carga de habilidad cuando sus parámetros contienen una ruta que termina en /SKILL.md y el cuerpo del resultado de la herramienta es un SKILL.md archivo bien formado (el texto frontal con description campos name y, seguido de un cuerpo de instrucciones).

Strands Agents, Deep Agents y Google ADK emiten de forma nativa un catálogo de habilidades disponibles. LangGraph El SDK de Claude Agent y los agentes de lectura de archivos no emiten un catálogo. Builtin.SkillSelectionAccuracytodavía se ejecuta en esos agentes, con un marcador de posición vacío. available_skills

Para ver la configuración general de la instrumentación y los nombres de los ámbitos por marco, consulte los marcos de agentes compatibles.

Comportamiento de omisión

AgentCore Las evaluaciones clasifican una llamada a una herramienta como una invocación de habilidad cuando el rastreo revela invoked_skill o skill_content para esa llamada. Si ninguna de las señales está presente, AgentCore Evaluations omite a los dos evaluadores de habilidades para esa llamada y no emite ningún resultado. Si su agente no carga ninguna habilidad, ninguno de los evaluadores arroja ningún resultado para la sesión; esto es normal, no se trata de un error.

Si su agente carga las habilidades pero los evaluadores siguen sin obtener ningún resultado, ejecute la habilidad de diagnóstico en Diagnostic Skill Source para confirmar que los rastreos contienen las señales esperadas.

Marcadores de posición de habilidades para evaluadores personalizados

Puede escribir un evaluador TOOL_CALL personalizado que evalúe las habilidades que ha adquirido un agente. Los marcadores de posición de habilidades descritos anteriormente (invoked_skill,, skill_contentavailable_skills,user_message) están disponibles para cualquier evaluador de TOOL_CALL personalizado, junto con los marcadores de posición estándar a nivel de herramienta (,,). context available_tools tool_turn Session-level y los evaluadores personalizados a nivel de carrera no pueden usar estos marcadores de posición.

El comportamiento de AgentCore las evaluaciones depende de los marcadores de posición de habilidades a los que haga referencia el evaluador personalizado:

  • Un evaluador al que invoked_skill se hace referencia se comporta de la siguiente maneraBuiltin.SkillSelectionAccuracy: solo se ejecuta en las llamadas a las herramientas de invocación de habilidades y muestra la instantánea estándar previa a la llamada. {context}

  • Un evaluador al que skill_content se hace referencia se comporta de la siguiente maneraBuiltin.SkillInstructionFollowing: solo se ejecuta en las llamadas a las herramientas de invocación de habilidades cuyo SKILL.md cuerpo está disponible, y muestra el contexto completo de la sesión, desde el inicio hasta el {context} final de la sesión. Esto difiere del nivel de herramienta estándar. context

En cualquier caso, AgentCore Evaluations emite un resultado por cada invocación de habilidad. Para crear un evaluador personalizado, consulte Crear un evaluador. Crear evaluador