View a markdown version of this page

Évaluateurs de compétences - Base rocheuse de l'Amazonie AgentCore

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Évaluateurs de compétences

Une compétence est un fichier d'SKILL.mdinstructions réutilisable qu'un agent charge au moment de l'exécution pour faciliter une tâche. Les compétences suivent la norme ouverte Agent Skills pour la structure des fichiers de compétences. Pour la terminologie, voir Compétence.

AgentCore Evaluations fournit deux évaluateurs intégrés pour les agents qui utilisent des compétences. Les deux sont des évaluateurs au niveau des outils. AgentCore Les évaluations émettent un résultat par appel de compétence et ancrent chaque résultat dans la durée d'appel de l'outil qui a chargé la compétence. Une session comportant trois invocations de compétences produit trois résultats par évaluateur.

Vous pouvez utiliser ces évaluateurs pour des évaluations à la demande, par lots et en ligne. Pour connaître le corps exact des instructions, consultez la section Précision de la sélection des compétences et Instructions relatives aux compétences suivantes sur la page des modèles d'invite.

Builtin.SkillSelectionAccuracy

L'évaluateur de précision de sélection des compétences (Builtin.SkillSelectionAccuracy) détermine si la compétence chargée par l'agent correspond à la tâche, en fonction du catalogue des compétences disponibles. Elle renvoie Yes (1.0) ou No (0.0).

Espaces réservés utilisés par l'évaluateur :

  • invoked_skill— Nom de la compétence que l'agent a chargée dans cet outil.

  • available_skills— Le catalogue de compétences parmi lesquelles l'agent pouvait choisir au moment de l'exécution. Tous les frameworks n'exposent pas un catalogue. Lorsque le catalogue ne figure pas dans la trace, cet espace réservé est vide et l'évaluateur évalue la compétence invoquée en fonction de la demande de l'utilisateur et du contexte de la conversation uniquement.

  • user_message— La demande de l'utilisateur au cours du tour qui a déclenché l'invocation de la compétence.

  • context— La page précédente indique l'appel d'outil en cours d'évaluation.

L'évaluateur s'exécute chaque fois que AgentCore Evaluations détecte une invocation de compétence. Il se concentre sur la décision de sélection, et non sur la façon dont l'agent a ensuite exécuté la compétence.

Builtin.SkillInstructionFollowing

L'instruction de compétence qui suit l'évaluateur (Builtin.SkillInstructionFollowing) évalue dans quelle mesure l'agent a suivi les étapes prescrites pour la compétence chargée. Elle renvoie Fully Followed (1,0), Mostly Followed (0,75), Partially Followed (0,5), Minimally Followed (0,25) ou Not Followed (0,0).

Espaces réservés utilisés par l'évaluateur :

  • invoked_skill— Nom de la compétence que l'agent a chargée dans cet outil.

  • skill_content— Le corps complet des SKILL.md instructions de la compétence chargée.

  • context— Le contexte complet de la session  : chaque tour, du début à la fin de la session. Étant donné que l'agent peut effectuer les étapes prescrites à tout moment après le chargement de la compétence, le juge a besoin de toute la session, et pas seulement des tours précédant l'appel à l'outil.

L'évaluateur ne s'exécute que lorsque la compétence invoquée et son SKILL.md corps sont présents dans la trace. Le juge identifie les étapes prescrites dans le corpus de compétences, puis, pour chaque étape, détermine à partir de l'enregistrement de la conversation si l'étape a été entièrement réalisée, partiellement exécutée ou ignorée, et produit une note globale conforme à cette répartition par étape.

Support du cadre

AgentCore Evaluations détecte les appels de compétences à partir de deux types de signaux de trace : la lecture d'un SKILL.md fichier par le système de fichiers et l'outil de chargement de compétences natif d'un framework. Le signal de lecture du système de fichiers fonctionne pour n'importe quel framework. Le signal de l'outil natif s'applique aux frameworks spécifiques de la deuxième ligne du tableau suivant.

Méthode de détection

Cadres

SKILL.mdlecture de fichiers (universelle)

LlamaIndex, les agents OpenAI et tout agent qui lit SKILL.md via un outil de lecture de fichiers générique.

Outil de chargement de compétences natif (en plus de la lecture de fichiers)

Strands Agents, LangGraph Deep Agents, Google ADK, Claude Agent SDK.

Pour le chemin de lecture des fichiers, AgentCore Evaluations fait correspondre un appel d'outil à une charge de compétences lorsque ses paramètres contiennent un chemin se terminant par /SKILL.md et que le corps du résultat de l'outil est un SKILL.md fichier bien formé (élément de base avec description champs name et, suivi d'un corps d'instructions).

Un catalogue des compétences disponibles est émis nativement par Strands Agents, LangGraph Deep Agents et Google ADK. Le SDK Claude Agent et les agents de lecture de fichiers n'émettent pas de catalogue. Builtin.SkillSelectionAccuracyfonctionne toujours sur ces agents, avec un available_skills espace réservé vide.

Pour la configuration générale de l'instrumentation et les noms des étendues par framework, consultez Frameworks d'agents pris en charge.

Comportement de saut

AgentCore Evaluations classe un appel d'outil comme une invocation de compétence lorsque la trace est exposée invoked_skill ou skill_content pour cet appel. Si aucun signal n'est présent, AgentCore Evaluations ignore les deux évaluateurs de compétences pour cet appel et n'émet aucun résultat. Si votre agent ne charge aucune compétence, les deux évaluateurs n'obtiennent aucun résultat pour la session. C'est normal, ce n'est pas une erreur.

Si votre agent charge des compétences mais que les évaluateurs ne renvoient toujours aucun résultat, exécutez la compétence de diagnostic dans la source de compétences de diagnostic pour confirmer que les traces transmettent les signaux attendus.

espaces réservés aux compétences pour les évaluateurs personnalisés

Vous pouvez écrire un évaluateur TOOL_CALL personnalisé qui raisonne sur les compétences qu'un agent a chargées. Les espaces réservés aux compétences décrits ci-dessus (invoked_skill,, skill_contentavailable_skills,user_message) sont disponibles pour tout évaluateur TOOL_CALL personnalisé, en plus des espaces réservés standard au niveau de l'outil (,,). context available_tools tool_turn Session-level et les évaluateurs personnalisés au niveau des traces ne peuvent pas utiliser ces espaces réservés.

Le comportement AgentCore des évaluations dépend des espaces réservés aux compétences auxquels l'évaluateur personnalisé fait référence :

  • Un évaluateur qui fait référence invoked_skill se comporte de la manière suivante Builtin.SkillSelectionAccuracy : il s'exécute uniquement lors des appels à l'outil d'invocation de compétences et {context} affiche l'instantané standard d'avant-appel.

  • Un évaluateur qui fait référence skill_content se comporte comme suit Builtin.SkillInstructionFollowing : il s'exécute uniquement sur les appels d'outils d'invocation de compétences dont le SKILL.md corps est disponible, et {context} affiche le contexte complet de la session, à chaque tour, du début à la fin de la session. Cela diffère du niveau d'outil context standard.

Dans les deux cas, AgentCore Evaluations émet un résultat par appel de compétence. Pour la création d'un évaluateur personnalisé, voir Créer un évaluateur.