View a markdown version of this page

Avaliadores de habilidades - Base da Amazônia AgentCore

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Avaliadores de habilidades

Uma habilidade é um arquivo de SKILL.md instrução reutilizável que um agente carrega em tempo de execução para ajudar em uma tarefa. As habilidades seguem o padrão aberto Agent Skills para estrutura de arquivos de habilidades. Para obter a terminologia, consulte Habilidade.

AgentCore As avaliações fornecem dois avaliadores integrados para agentes que usam habilidades. Ambos são avaliadores em nível de ferramenta. AgentCore As avaliações emitem um resultado por invocação de habilidade e ancoram cada resultado ao período de chamadas da ferramenta que carregou a habilidade. Uma sessão com três invocações de habilidades produz três resultados por avaliador.

Você pode usar esses avaliadores com avaliações sob demanda, em lote e on-line. Para obter os corpos exatos das solicitações, consulte Precisão da seleção de habilidades e instruções de habilidades a seguir na página de modelos de solicitações.

Builtin.SkillSelectionAccuracy

O avaliador de precisão da seleção de habilidades (Builtin.SkillSelectionAccuracy) avalia se a habilidade carregada pelo agente se encaixa na tarefa, de acordo com o catálogo de habilidades disponíveis. Ele retorna Yes (1,0) ou No (0,0).

Espaços reservados que o avaliador usa:

  • invoked_skill— O nome da habilidade que o agente carregou nessa chamada de ferramenta.

  • available_skills— O catálogo de habilidades que o agente pode escolher em tempo de execução. Nem toda estrutura expõe um catálogo. Quando o catálogo não está no rastreamento, esse espaço reservado fica vazio e o avaliador julga a habilidade invocada apenas com base na solicitação do usuário e no contexto da conversa.

  • user_message— A solicitação do usuário no turno que acionou a invocação da habilidade.

  • context— Voltas anteriores até a chamada da ferramenta que está sendo avaliada.

O avaliador é executado sempre que o AgentCore Evaluations detecta uma invocação de habilidade. Ele se concentra na decisão de seleção, não em quão bem o agente executou a habilidade.

Builtin.SkillInstructionFollowing

A instrução de habilidade após o avaliador (Builtin.SkillInstructionFollowing) avalia até que ponto o agente seguiu as etapas prescritas pela habilidade carregada. Ele retorna Fully Followed (1,0), Mostly Followed (0,75), Partially Followed (0,5), Minimally Followed (0,25) ou Not Followed (0,0).

Espaços reservados que o avaliador usa:

  • invoked_skill— O nome da habilidade que o agente carregou nessa chamada de ferramenta.

  • skill_content— O corpo inteiro das SKILL.md instruções da habilidade carregada.

  • context— O contexto completo da sessão — cada turno, do início da sessão ao fim da sessão. Como o agente pode executar as etapas prescritas a qualquer momento após o carregamento da habilidade, o juiz precisa de toda a sessão, não apenas da participação na chamada da ferramenta.

O avaliador é executado somente quando a habilidade invocada e seu SKILL.md corpo estão presentes no rastreamento. O juiz identifica as etapas prescritas no corpo de habilidades e, em seguida, para cada etapa, determina, a partir do registro da conversa, se a etapa foi totalmente realizada, parcialmente executada ou ignorada, e produz uma classificação geral consistente com a divisão por etapa.

Suporte de estrutura

AgentCore As avaliações detectam invocações de habilidades a partir de dois tipos de sinais de rastreamento: uma leitura de um SKILL.md arquivo no sistema de arquivos e uma ferramenta nativa de carregamento de habilidades da estrutura. O sinal de leitura do sistema de arquivos funciona em qualquer estrutura. O sinal da ferramenta nativa se aplica às estruturas específicas na segunda linha da tabela a seguir.

Método de detecção

Estruturas

SKILL.mdleitura de arquivo (universal)

LlamaIndex, OpenAI Agents e qualquer agente que leia SKILL.md por meio de uma ferramenta genérica de leitura de arquivos.

Ferramenta nativa de carregamento de habilidades (além da leitura de arquivos)

Agentes Strands, LangGraph Deep Agents, Google ADK, Claude Agent SDK.

Para o caminho de leitura do arquivo, AgentCore as avaliações combinam uma chamada de ferramenta como uma carga de habilidade quando seus parâmetros contêm um caminho que termina em /SKILL.md e o corpo do resultado da ferramenta é um SKILL.md arquivo bem formado (frontmatter com description campos name e, seguido por um corpo de instruções).

Um catálogo de habilidades disponíveis é emitido nativamente por Strands Agents, LangGraph Deep Agents e Google ADK. O Claude Agent SDK e os agentes de leitura de arquivos não emitem um catálogo. Builtin.SkillSelectionAccuracyainda funciona nesses agentes, com um available_skills espaço reservado vazio.

Para ver a configuração geral da instrumentação e os nomes do escopo por estrutura, consulte Estruturas de agentes compatíveis.

Ignorar o comportamento

AgentCore As avaliações classificam uma chamada de ferramenta como uma invocação de habilidade quando o rastreamento expõe invoked_skill ou para essa chamada. skill_content Se nenhum sinal estiver presente, o AgentCore Evaluations ignora os dois avaliadores de habilidades dessa chamada e não emite nenhum resultado. Se seu agente não carregar nenhuma habilidade, os dois avaliadores não produzirão nenhum resultado para a sessão — isso é esperado, não um erro.

Se seu agente carregar habilidades, mas os avaliadores ainda não retornarem resultados, execute a habilidade de diagnóstico na Fonte de habilidades de diagnóstico para confirmar se os rastreamentos transmitem os sinais esperados.

Espaços reservados para habilidades para avaliadores personalizados

Você pode escrever um avaliador TOOL_CALL personalizado que explique as habilidades que um agente carregou. Os espaços reservados para habilidades descritos acima (invoked_skill,, skill_contentavailable_skills,user_message) estão disponíveis para qualquer avaliador TOOL_CALL personalizado junto com os espaços reservados padrão no nível da ferramenta (,,). context available_tools tool_turn Session-level e avaliadores personalizados em nível de rastreamento não podem usar esses espaços reservados.

O comportamento AgentCore das avaliações depende de quais espaços reservados para habilidades o avaliador personalizado faz referência:

  • Um avaliador que faz referência invoked_skill se comporta da Builtin.SkillSelectionAccuracy seguinte forma: ele é executado somente em chamadas de ferramentas de invocação de habilidades e renderiza o instantâneo padrão de pré-chamada. {context}

  • Um avaliador que faz referência skill_content se comporta da Builtin.SkillInstructionFollowing seguinte forma: ele é executado somente em chamadas de ferramentas de invocação de habilidades cujo SKILL.md corpo está disponível e {context} renderiza o contexto completo da sessão, desde o início até o final da sessão. Isso difere do nível de ferramenta context padrão.

Em ambos os casos, o AgentCore Evaluations emite um resultado por invocação de habilidade. Para criar um avaliador personalizado, consulte Criar avaliador. Criar avaliador