Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Third-party valutatori
AgentCore Evaluations offre valutatori provenienti da librerie AutoEval open source DeepEval e open source. Se utilizzi già queste librerie, puoi eseguire le stesse metriche all'interno di Evaluations. AgentCore Il servizio gestisce l'hosting e il codice di valutazione per te. Con l'opzione managed, il servizio seleziona anche il modello ed esegue l'inferenza, allo stesso modo dei valutatori integrati.
Esistono due modi per utilizzare valutatori di terze parti:
-
Gestito: seleziona un valutatore di terze parti per ID e implementalo. Il servizio lo esegue, seleziona il modello e gestisce la versione della libreria.
-
Personalizzato: crea un valutatore che esegua la logica di un valutatore esistente, un valutatore di terze parti integrato o gestito, sul tuo modello e sulla tua inferenza. Per ulteriori informazioni, vedere Valutatori personalizzati derivati da un valutatore di base. Valutatori personalizzati derivati da un valutatore di base
Qualità del valutatore
AgentCore i valutatori integrati vengono testati e confrontati per verificarne le prestazioni. DeepEval e AutoEval sono valutatori open source e non rilasciamo dichiarazioni sulla loro qualità.
Argomenti
Identità del valutatore
Due campi insieme identificano ogni valutatore, compresi i valutatori di terze parti:
-
evaluatorType— Il tipo di risorsa: chi la fornisce e come.BuiltineThirdPartysono valutatori globali AWS gestiti a cui fai riferimento ma non crei.CustomeCustomDerivedsono valutatori creati dall'utente.CustomCode -
provider— Da dove proviene la logica di valutazione:AWSper i AWS valutatori con autore,DeepEvalo per le corrispondenti librerie di terze parti, oAutoEvalCustomper un valutatore creato da te stesso.
I due campi sono indipendenti, quindi ogni valutatore è una coppia: (evaluatorType, provider)
| Valutatore | Tipo di valutatore | provider |
|---|---|---|
|
Gestito e integrato |
|
|
|
Terza parte gestita |
|
|
|
Valutatore personalizzato derivato da un sistema integrato |
|
|
|
Valutatore personalizzato derivato da un valutatore di terze parti |
|
|
|
Valutatore personalizzato basato su codice |
|
|
|
LLM-as-a-judge Valutatore personalizzato |
|
|
L'ID di un valutatore di terze parti gestito segue il ThirdParty.<Provider>.<Metric> formato, ad esempio o. ThirdParty.DeepEval.TaskCompletion ThirdParty.AutoEval.Security Questo rispecchia il Builtin.<Metric> formato utilizzato per i valutatori integrati di prima parte.
Scopri i valutatori disponibili
Third-party i valutatori vengono restituiti dall'ListEvaluatorsAPI insieme ai valutatori integrati di prima parte e a tutti i valutatori personalizzati presenti nel tuo account.
{ "evaluators": [ { "evaluatorId": "Builtin.Helpfulness", "evaluatorType": "Builtin", "provider": "AWS", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.DeepEval.TaskCompletion", "evaluatorType": "ThirdParty", "provider": "DeepEval", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.AutoEval.Security", "evaluatorType": "ThirdParty", "provider": "AutoEval", "level": "TRACE", "status": "ACTIVE" } ] }
Valutatori gestiti da terze parti
Utilizza un valutatore gestito di terze parti esattamente come un valutatore integrato: selezionalo per ID e il servizio lo esegue su un modello su cui opera. Non fornisci un modello, un prompt o una configurazione.
-
Modello: i valutatori gestiti di terze parti vengono eseguiti sullo stesso modello dei valutatori integrati in Amazon Bedrock. AgentCore Non ci sono campi del modello e nessuna configurazione del modello da impostare.
-
Controllo delle versioni: non è possibile selezionare la versione per i valutatori gestiti da terze parti. Il servizio esegue la versione della libreria che ha convalidato e gestisce autonomamente gli aggiornamenti.
Puoi passare l'ID di un valutatore di terze parti gestito ovunque desideri passare un ID di valutazione integrato:
-
On-demand valutazione: passa l'ID nella richiesta
EvaluateAPI. -
Valutazione online: aggiunge l'ID all'
evaluatorselenco di una configurazione di valutazione online. Si combina liberamente con i valutatori integrati e personalizzati ed è regolato dalle stesse regole di campionamento e filtro. -
Valutazione in batch: inserisci l'ID nell'
evaluatorselenco di un processo di valutazione in batch. Avvia la valutazione in batch
L'esempio seguente esegue un valutatore gestito di terze parti con l'EvaluateAPI:
import boto3 client = boto3.client('bedrock-agentcore') response = client.evaluate( evaluatorId="ThirdParty.DeepEval.TaskCompletion", evaluationInput={"sessionSpans": session_span_logs} ) for result in response["evaluationResults"]: print(f"Value: {result.get('value')}") print(f"Explanation: {result.get('explanation', '')}")
Valutatori personalizzati derivati da un valutatore di base
Usa un valutatore derivato personalizzato per eseguire un valutatore esistente, un valutatore di terze parti integrato o gestito, sul tuo modello. Invece di utilizzare il modello selezionato dal servizio, fornite il modello e i parametri di inferenza. Il valutatore di base fornisce il prompt e il punteggio. Questo vale solo per i valutatori. LLM-based
Per creare un valutatore derivato personalizzato, specificate il derived membro evaluatorConfig con l'ID del valutatore di base e la configurazione del modello. Salvate quanto segue con nome: derived_evaluator_config.json
{ "derived": { "baseEvaluatorId": "ThirdParty.DeepEval.TaskCompletion", "modelConfig": { "bedrockEvaluatorModelConfig": { "modelId": "global.anthropic.claude-sonnet-4-5-20250929-v1:0", "inferenceConfig": { "temperature": 0.0, "topP": 1.0, "maxTokens": 2048 } } } } }
Puoi anche derivare un valutatore personalizzato da un valutatore integrato baseEvaluatorId impostando un Builtin.
ID anziché un ID. ThirdParty.
Crea il valutatore con la CLI: AWS
aws bedrock-agentcore-control create-evaluator \ --evaluator-name 'my_task_completion' \ --evaluator-config file://derived_evaluator_config.json
Il valutatore risultante è evaluatorType impostato su. CustomDerived Il servizio deriva provider automaticamente dal valutatore di base: AWS per una Builtin.
base o dal nome del provider per una base. ThirdParty. Non lo impostilevel: il servizio lo deriva dal valutatore di base ed è di sola lettura attivo. GetEvaluator Inoltre, non lo imposti instructions o ratingScale perché il valutatore di base possiede entrambi.
Dopo aver creato il valutatore, utilizzalo esattamente come qualsiasi altro valutatore personalizzato: passane l'ID del valutatore o aggiungilo all'Evaluateevaluatorselenco di una valutazione online o in batch.
-
Modello: qualsiasi modello Bedrock, impostato.
bedrockEvaluatorModelConfig -
Proprietà dell'inferenza: il modello viene eseguito utilizzando l' AWS account e le credenziali dell'utente: il ruolo di esecuzione per la valutazione online o le credenziali del chiamante per la valutazione su richiesta. Questa è la differenza fondamentale rispetto a un valutatore gestito da terze parti, in cui il servizio esegue il modello secondo le proprie capacità.
-
Proprietà della qualità: poiché sei tu a scegliere il modello, la qualità della valutazione riflette tale scelta. Il servizio non convalida il modello rispetto a ciascuna metrica.
Risultati
Third-party i valutatori restituiscono la stessa forma del risultato dei valutatori integrati e personalizzati, nelle stesse posizioni. Per ulteriori informazioni, consulta Risultati e risultati.
Set iniziale di valutatori
I seguenti valutatori sono disponibili al momento del lancio.
DeepEval
| Metrica | Che cosa controlla |
|---|---|
|
Bias |
Se l'output mostra pregiudizi di genere, politici, razziali o geografici. |
|
Tossicità |
Se l'output contiene attacchi, scherno, odio o minacce. |
|
Perdita di dati PII |
Se la risposta espone informazioni personali. |
|
Riassunto |
Se il riassunto è fedele e completo. |
|
TaskCompletion |
Se l'agente ha raggiunto l'obiettivo dell'utente. |
|
ConversationCompleteness |
Se tutte le richieste degli utenti durante la conversazione sono state soddisfatte. |
|
KnowledgeRetention |
Se l'agente ha ricordato le informazioni condivise in precedenza. |
|
TurnRelevancy |
Se ogni risposta rimane pertinente ai turni precedenti. |
|
GoalAccuracy |
Se l'agente ha raggiunto i suoi obiettivi nel corso di una conversazione a più turni. |
|
ToolUse |
Se l'agente ha scelto lo strumento giusto e fornito le argomentazioni corrette. |
AutoEval
| Metrica | Che cosa controlla |
|---|---|
|
Sicurezza |
Se la risposta è dannosa. |
|
Umorismo |
Se la risposta è divertente. |
|
Possibile |
Se l'agente ha tentato una soluzione o ha dichiarato l'operazione impossibile. |
Console
Nel selettore di valutazione, i valutatori di terze parti vengono visualizzati nella propria sezione Third-party valutatori, raggruppati per provider, separata dai gruppi di valutatori integrati. Questa sezione è compressa per impostazione predefinita.
Per creare un valutatore personalizzato derivato da un valutatore di base, utilizzate il flusso Crea valutatore personalizzato esistente e scegliete la Third-party libreria come tipo di definizione del valutatore. Questa opzione rimuove le sezioni relative alle istruzioni e alla scala visualizzate LLM-as-a-judge, poiché il valutatore di base è proprietario del prompt e del punteggio. Scegliete una libreria e una metrica, quindi fornite il modello e i parametri di inferenza. Il livello di valutazione viene visualizzato in sola lettura, impostato dalla metrica.