View a markdown version of this page

Third-party valutatori - Fondamento Amazon AgentCore

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Third-party valutatori

AgentCore Evaluations offre valutatori provenienti da librerie AutoEval open source DeepEval e open source. Se utilizzi già queste librerie, puoi eseguire le stesse metriche all'interno di Evaluations. AgentCore Il servizio gestisce l'hosting e il codice di valutazione per te. Con l'opzione managed, il servizio seleziona anche il modello ed esegue l'inferenza, allo stesso modo dei valutatori integrati.

Esistono due modi per utilizzare valutatori di terze parti:

  • Gestito: seleziona un valutatore di terze parti per ID e implementalo. Il servizio lo esegue, seleziona il modello e gestisce la versione della libreria.

  • Personalizzato: crea un valutatore che esegua la logica di un valutatore esistente, un valutatore di terze parti integrato o gestito, sul tuo modello e sulla tua inferenza. Per ulteriori informazioni, vedere Valutatori personalizzati derivati da un valutatore di base. Valutatori personalizzati derivati da un valutatore di base

Qualità del valutatore

AgentCore i valutatori integrati vengono testati e confrontati per verificarne le prestazioni. DeepEval e AutoEval sono valutatori open source e non rilasciamo dichiarazioni sulla loro qualità.

Identità del valutatore

Due campi insieme identificano ogni valutatore, compresi i valutatori di terze parti:

  • evaluatorType— Il tipo di risorsa: chi la fornisce e come. Builtine ThirdParty sono valutatori globali AWS gestiti a cui fai riferimento ma non crei. Custome CustomDerived sono valutatori creati dall'utente. CustomCode

  • provider— Da dove proviene la logica di valutazione: AWS per i AWS valutatori con autore, DeepEval o per le corrispondenti librerie di terze parti, o AutoEval Custom per un valutatore creato da te stesso.

I due campi sono indipendenti, quindi ogni valutatore è una coppia: (evaluatorType, provider)

Valutatore Tipo di valutatore provider

Gestito e integrato

Builtin

AWS

Terza parte gestita

ThirdParty

DeepEval o AutoEval

Valutatore personalizzato derivato da un sistema integrato

CustomDerived

AWS

Valutatore personalizzato derivato da un valutatore di terze parti

CustomDerived

DeepEval o AutoEval

Valutatore personalizzato basato su codice

CustomCode

Custom

LLM-as-a-judge Valutatore personalizzato

Custom

Custom

L'ID di un valutatore di terze parti gestito segue il ThirdParty.<Provider>.<Metric> formato, ad esempio o. ThirdParty.DeepEval.TaskCompletion ThirdParty.AutoEval.Security Questo rispecchia il Builtin.<Metric> formato utilizzato per i valutatori integrati di prima parte.

Scopri i valutatori disponibili

Third-party i valutatori vengono restituiti dall'ListEvaluatorsAPI insieme ai valutatori integrati di prima parte e a tutti i valutatori personalizzati presenti nel tuo account.

{ "evaluators": [ { "evaluatorId": "Builtin.Helpfulness", "evaluatorType": "Builtin", "provider": "AWS", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.DeepEval.TaskCompletion", "evaluatorType": "ThirdParty", "provider": "DeepEval", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.AutoEval.Security", "evaluatorType": "ThirdParty", "provider": "AutoEval", "level": "TRACE", "status": "ACTIVE" } ] }

Valutatori gestiti da terze parti

Utilizza un valutatore gestito di terze parti esattamente come un valutatore integrato: selezionalo per ID e il servizio lo esegue su un modello su cui opera. Non fornisci un modello, un prompt o una configurazione.

  • Modello: i valutatori gestiti di terze parti vengono eseguiti sullo stesso modello dei valutatori integrati in Amazon Bedrock. AgentCore Non ci sono campi del modello e nessuna configurazione del modello da impostare.

  • Controllo delle versioni: non è possibile selezionare la versione per i valutatori gestiti da terze parti. Il servizio esegue la versione della libreria che ha convalidato e gestisce autonomamente gli aggiornamenti.

Puoi passare l'ID di un valutatore di terze parti gestito ovunque desideri passare un ID di valutazione integrato:

  • On-demand valutazione: passa l'ID nella richiesta Evaluate API.

  • Valutazione online: aggiunge l'ID all'evaluatorselenco di una configurazione di valutazione online. Si combina liberamente con i valutatori integrati e personalizzati ed è regolato dalle stesse regole di campionamento e filtro.

  • Valutazione in batch: inserisci l'ID nell'evaluatorselenco di un processo di valutazione in batch. Avvia la valutazione in batch

L'esempio seguente esegue un valutatore gestito di terze parti con l'EvaluateAPI:

import boto3 client = boto3.client('bedrock-agentcore') response = client.evaluate( evaluatorId="ThirdParty.DeepEval.TaskCompletion", evaluationInput={"sessionSpans": session_span_logs} ) for result in response["evaluationResults"]: print(f"Value: {result.get('value')}") print(f"Explanation: {result.get('explanation', '')}")

Valutatori personalizzati derivati da un valutatore di base

Usa un valutatore derivato personalizzato per eseguire un valutatore esistente, un valutatore di terze parti integrato o gestito, sul tuo modello. Invece di utilizzare il modello selezionato dal servizio, fornite il modello e i parametri di inferenza. Il valutatore di base fornisce il prompt e il punteggio. Questo vale solo per i valutatori. LLM-based

Per creare un valutatore derivato personalizzato, specificate il derived membro evaluatorConfig con l'ID del valutatore di base e la configurazione del modello. Salvate quanto segue con nome: derived_evaluator_config.json

{ "derived": { "baseEvaluatorId": "ThirdParty.DeepEval.TaskCompletion", "modelConfig": { "bedrockEvaluatorModelConfig": { "modelId": "global.anthropic.claude-sonnet-4-5-20250929-v1:0", "inferenceConfig": { "temperature": 0.0, "topP": 1.0, "maxTokens": 2048 } } } } }

Puoi anche derivare un valutatore personalizzato da un valutatore integrato baseEvaluatorId impostando un Builtin. ID anziché un ID. ThirdParty.

Crea il valutatore con la CLI: AWS

aws bedrock-agentcore-control create-evaluator \ --evaluator-name 'my_task_completion' \ --evaluator-config file://derived_evaluator_config.json

Il valutatore risultante è evaluatorType impostato su. CustomDerived Il servizio deriva provider automaticamente dal valutatore di base: AWS per una Builtin. base o dal nome del provider per una base. ThirdParty. Non lo impostilevel: il servizio lo deriva dal valutatore di base ed è di sola lettura attivo. GetEvaluator Inoltre, non lo imposti instructions o ratingScale perché il valutatore di base possiede entrambi.

Dopo aver creato il valutatore, utilizzalo esattamente come qualsiasi altro valutatore personalizzato: passane l'ID del valutatore o aggiungilo all'Evaluateevaluatorselenco di una valutazione online o in batch.

  • Modello: qualsiasi modello Bedrock, impostato. bedrockEvaluatorModelConfig

  • Proprietà dell'inferenza: il modello viene eseguito utilizzando l' AWS account e le credenziali dell'utente: il ruolo di esecuzione per la valutazione online o le credenziali del chiamante per la valutazione su richiesta. Questa è la differenza fondamentale rispetto a un valutatore gestito da terze parti, in cui il servizio esegue il modello secondo le proprie capacità.

  • Proprietà della qualità: poiché sei tu a scegliere il modello, la qualità della valutazione riflette tale scelta. Il servizio non convalida il modello rispetto a ciascuna metrica.

Risultati

Third-party i valutatori restituiscono la stessa forma del risultato dei valutatori integrati e personalizzati, nelle stesse posizioni. Per ulteriori informazioni, consulta Risultati e risultati.

Set iniziale di valutatori

I seguenti valutatori sono disponibili al momento del lancio.

DeepEval

Metrica Che cosa controlla

Bias

Se l'output mostra pregiudizi di genere, politici, razziali o geografici.

Tossicità

Se l'output contiene attacchi, scherno, odio o minacce.

Perdita di dati PII

Se la risposta espone informazioni personali.

Riassunto

Se il riassunto è fedele e completo.

TaskCompletion

Se l'agente ha raggiunto l'obiettivo dell'utente.

ConversationCompleteness

Se tutte le richieste degli utenti durante la conversazione sono state soddisfatte.

KnowledgeRetention

Se l'agente ha ricordato le informazioni condivise in precedenza.

TurnRelevancy

Se ogni risposta rimane pertinente ai turni precedenti.

GoalAccuracy

Se l'agente ha raggiunto i suoi obiettivi nel corso di una conversazione a più turni.

ToolUse

Se l'agente ha scelto lo strumento giusto e fornito le argomentazioni corrette.

AutoEval

Metrica Che cosa controlla

Sicurezza

Se la risposta è dannosa.

Umorismo

Se la risposta è divertente.

Possibile

Se l'agente ha tentato una soluzione o ha dichiarato l'operazione impossibile.

Console

Nel selettore di valutazione, i valutatori di terze parti vengono visualizzati nella propria sezione Third-party valutatori, raggruppati per provider, separata dai gruppi di valutatori integrati. Questa sezione è compressa per impostazione predefinita.

Per creare un valutatore personalizzato derivato da un valutatore di base, utilizzate il flusso Crea valutatore personalizzato esistente e scegliete la Third-party libreria come tipo di definizione del valutatore. Questa opzione rimuove le sezioni relative alle istruzioni e alla scala visualizzate LLM-as-a-judge, poiché il valutatore di base è proprietario del prompt e del punteggio. Scegliete una libreria e una metrica, quindi fornite il modello e i parametri di inferenza. Il livello di valutazione viene visualizzato in sola lettura, impostato dalla metrica.