View a markdown version of this page

Valutatori delle competenze - Fondamento Amazon AgentCore

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Valutatori delle competenze

Una skill è un file di SKILL.md istruzioni riutilizzabile che un agente carica in fase di esecuzione per facilitare l'esecuzione di un'operazione. Le competenze seguono lo standard aperto Agent Skills per la struttura dei file di abilità. Per la terminologia, vedi Skill.

AgentCore Evaluations fornisce due valutatori integrati per gli agenti che utilizzano le competenze. Entrambi sono valutatori a livello di strumento. AgentCore Le valutazioni emettono un risultato per chiamata di abilità e ancorano ogni risultato all'intervallo di chiamate dello strumento che ha caricato la skill. Una sessione con tre invocazioni di competenze produce tre risultati per valutatore.

Puoi utilizzare questi valutatori con valutazioni su richiesta, in batch e online. Per informazioni dettagliate, consultate Precisione nella selezione delle abilità e Istruzioni relative alle abilità nella pagina dei modelli di prompt.

Builtin.SkillSelectionAccuracy

Il valutatore dell'accuratezza della selezione delle abilità (Builtin.SkillSelectionAccuracy) valuta se l'abilità caricata dall'agente è adatta all'attività, in base al catalogo delle competenze disponibili. Restituisce Yes (1,0) o No (0,0).

Segnaposto utilizzati dal valutatore:

  • invoked_skill— Il nome della skill che l'agente ha caricato in questo strumento richiamata.

  • available_skills— Il catalogo di competenze tra cui l'agente può scegliere in fase di esecuzione. Non tutti i framework espongono un catalogo. Quando il catalogo non è presente nella traccia, questo segnaposto è vuoto e il valutatore giudica l'abilità richiamata solo in base alla richiesta dell'utente e al contesto della conversazione.

  • user_message— La richiesta dell'utente nel turno che ha attivato l'invocazione dell'abilità.

  • context— In precedenza viene visualizzata la chiamata allo strumento in fase di valutazione.

Il valutatore viene eseguito ogni volta che AgentCore Evaluations rileva una richiesta di abilità. Si concentra sulla decisione di selezione, non sul modo in cui l'agente ha poi eseguito l'abilità.

Builtin.SkillInstructionFollowing

L'istruzione Skill following evaluator (Builtin.SkillInstructionFollowing) valuta la completezza con cui l'agente ha seguito i passaggi prescritti dall'abilità caricata. Restituisce Fully Followed (1,0), Mostly Followed (0,75), Partially Followed (0,5), (0,25) o Minimally Followed Not Followed (0,0).

Segnaposto utilizzati dal valutatore:

  • invoked_skill— Il nome della skill che l'agente ha caricato in questo strumento richiamata.

  • skill_content— Il corpo completo delle SKILL.md istruzioni dell'abilità caricata.

  • context— Il contesto completo della sessione: ogni turno dall'inizio alla fine della sessione. Poiché l'agente può eseguire i passaggi prescritti in qualsiasi momento dopo aver caricato l'abilità, il giudice ha bisogno dell'intera sessione, non solo dei turni che precedono la chiamata allo strumento.

Il valutatore viene eseguito solo quando sia l'abilità richiamata che il relativo SKILL.md corpo sono presenti nella traccia. Il giudice identifica le fasi prescritte nell'ambito della competenza, quindi, per ciascuna fase, determina in base al verbale della conversazione se la fase è stata completata completamente, parzialmente o saltata e produce una valutazione complessiva coerente con la suddivisione per fase.

Supporto del framework

AgentCore Evaluations rileva i richiami alle competenze da due tipi di segnali di tracciamento: una lettura di un file da parte del filesystem e lo strumento nativo di caricamento delle competenze di un SKILL.md framework. Il segnale di lettura del file system funziona per qualsiasi framework. Il segnale native-tool si applica ai framework specifici nella seconda riga della tabella seguente.

Metodo di rilevamento

Framework

SKILL.mdfile letto (universale)

LlamaIndex, OpenAI Agents e qualsiasi agente che legge SKILL.md tramite uno strumento generico di lettura dei file.

Strumento nativo per il caricamento delle competenze (oltre alla lettura dei file)

Strands Agents, LangGraph Deep Agents, Google ADK, Claude Agent SDK.

Per quanto riguarda il percorso di lettura del file, AgentCore Evaluations fa corrispondere una chiamata allo strumento come skill load quando i suoi parametri contengono un percorso che termina con /SKILL.md e il corpo del risultato dello strumento è un SKILL.md file ben formato (frontespizio con description campi name e, seguito da un corpo di istruzioni).

Un catalogo di competenze disponibili viene emesso in modo nativo da Strands Agents, Deep Agents e Google ADK. LangGraph Claude Agent SDK e gli agenti di lettura dei file non emettono un catalogo. Builtin.SkillSelectionAccuracyfunziona ancora su quegli agenti, con un segnaposto vuoto. available_skills

Per la configurazione generale della strumentazione e i nomi degli ambiti per framework, vedere Supported agent framework. Framework per agenti supportati

Comportamento da ignorare

AgentCore Le valutazioni classificano una chiamata a uno strumento come un'invocazione di abilità quando la traccia espone invoked_skill o per quella chiamata. skill_content Se nessuno dei due segnali è presente, AgentCore Evaluations ignora entrambi i valutatori di abilità per quella chiamata e non produce alcun risultato. Se il tuo agente non carica alcuna competenza, entrambi i valutatori non producono alcun risultato per la sessione: è previsto, non si tratta di un errore.

Se il vostro agente carica le competenze ma i valutatori non restituiscono comunque alcun risultato, eseguite l'abilità diagnostica in Diagnostic skill source per confermare che le tracce trasmettono i segnali previsti.

Segnaposto delle abilità per valutatori personalizzati

Puoi scrivere un valutatore TOOL_CALL personalizzato che spieghi le competenze caricate da un agente. I segnaposto delle competenze descritti sopra (invoked_skill, skill_contentavailable_skills,user_message) sono disponibili per qualsiasi valutatore TOOL_CALL personalizzato insieme ai segnaposto standard a livello di strumento (,,). context available_tools tool_turn Session-level e i valutatori personalizzati a livello di traccia non possono utilizzare questi segnaposto.

Il comportamento di AgentCore Evaluations dipende dai segnaposto delle abilità a cui fa riferimento il valutatore personalizzato:

  • Un valutatore a cui invoked_skill si fa riferimento si comporta nel modo Builtin.SkillSelectionAccuracy seguente: viene eseguito solo sulle chiamate allo strumento di richiamo delle competenze ed esegue il rendering dell'istantanea standard precedente alla chiamata. {context}

  • Un valutatore a cui skill_content si fa riferimento si comporta nel modo Builtin.SkillInstructionFollowing seguente: funziona solo sulle chiamate allo strumento di invocazione delle competenze il cui SKILL.md corpo è disponibile e {context} rende il contesto completo della sessione, ogni turno dall'inizio alla fine della sessione. Questo è diverso dal livello di strumento standard. context

In entrambi i casi, AgentCore Evaluations emette un risultato per ogni richiesta di abilità. Per la creazione di un valutatore personalizzato, consulta Create evaluator. Crea un valutatore