Terminologia di valutazione
La comprensione dei concetti e della terminologia chiave è essenziale per utilizzare AgentCore efficacemente le valutazioni. I seguenti termini definiscono i componenti e i processi principali coinvolti nella valutazione degli agenti.
Argomenti
Agent Framework
Un framework di agenti fornisce i componenti fondamentali per la creazione, l'orchestrazione e l'esecuzione di applicazioni basate su agenti. I framework definiscono strutture come passaggi, strumenti, flusso di controllo e gestione della memoria. I framework di settore comuni includono Strands
AgentCore Attualmente Evaluations supporta Strands Agents e Agent Frameworks. LangGraph
Libreria di strumentazione
Una libreria di strumentazione registra la telemetria generata dall'agente durante l'esecuzione. Questa telemetria può includere tracce, intervalli, chiamate agli strumenti, invocazioni di modelli e passaggi intermedi. Librerie come OpenTelemetrye OpenInferenceoffrono API standardizzate e convenzioni semantiche che consentono di acquisire il comportamento degli agenti con modifiche minime al codice. La strumentazione è necessaria per la raccolta e la valutazione delle tracce.
AgentCore Le valutazioni attualmente supportano OpenTelemetrye OpenInferencefungono da librerie di strumentazione.
Agente di strumentazione
Un agente di strumentazione acquisisce automaticamente la telemetria dal codice dell'applicazione, la elabora e la esporta in un servizio di backend per l'archiviazione o la valutazione. Strumenti come ADOT (AWS Distro for OpenTelemetry) forniscono un agente di strumentazione automatica indipendente dal fornitore e pronto per la produzione che inietta dinamicamente il bytecode per acquisire tracce senza modifiche al codice. L'agente è un componente chiave per consentire la valutazione automatizzata.
AgentCore Attualmente Evaluations supporta ADOT (AWS Distro for OpenTelemetry) come agente di strumentazione.
Sessione
Una sessione rappresenta un raggruppamento logico di interazioni correlate da un singolo utente o flusso di lavoro. Una sessione può contenere una o più tracce. Le sessioni consentono di visualizzare e valutare il comportamento degli agenti nell'ambito di interazioni in più fasi, anziché concentrarsi su richieste individuali.
Traccia
Una traccia è un record completo dell'esecuzione o della richiesta di un singolo agente. Una traccia contiene uno o più intervalli, che rappresentano le singole operazioni eseguite durante l'esecuzione. Le tracce forniscono una visibilità completa sulle decisioni degli agenti e sull'utilizzo degli strumenti.
Tool Call
Una chiamata allo strumento è un intervallo che rappresenta l'invocazione da parte di un agente di una funzione, API o funzionalità esterna. Gli intervalli di chiamata allo strumento in genere acquisiscono informazioni come il nome dello strumento, i parametri di input, il tempo di esecuzione e l'output. I dettagli relativi alla chiamata allo strumento vengono utilizzati per valutare se l'agente ha selezionato e utilizzato gli strumenti in modo corretto ed efficiente.
Fai riferimento ai Free Large Language Models (LLM) come giudici
I Large Language Models (LLM), utilizzati come giudici, si riferiscono a un metodo di valutazione che utilizza un modello di linguaggio di grandi dimensioni (LLM) per valutare automaticamente la qualità, la correttezza o l'efficacia dell'output di un agente o di un altro modello. Invece di affidarsi alla revisione manuale o ai controlli basati su regole, l'LLM riceve criteri di valutazione e produce un punteggio, un'etichetta o una spiegazione in base all'input e all'output oggetto della valutazione. A differenza delle valutazioni tradizionali che si basano su dati fondati, i LLM-as-a-judge metodi si basano sulla conoscenza interna del modello per formulare giudizi. Questo approccio consente valutazioni qualitative scalabili, coerenti e personalizzabili, come la correttezza, la qualità del ragionamento o l'aderenza alle istruzioni, su un gran numero di interazioni tra agenti o risposte del modello.