View a markdown version of this page

Valutatori - Amazon Bedrock AgentCore

Valutatori

I valutatori sono i componenti principali che valutano le prestazioni dell'agente in diverse dimensioni. Analizzano le tracce degli agenti e forniscono punteggi quantitativi basati su criteri specifici come utilità, precisione o metriche aziendali personalizzate. AgentCore Evaluations offre sia strumenti di valutazione integrati per casi d'uso comuni sia la flessibilità necessaria per creare valutatori personalizzati su misura per le vostre esigenze specifiche.

Built-in valutatori

Built-in gli valutatori sono soluzioni preconfigurate che utilizzano Large Language Models (LLM) come giudici per valutare le prestazioni degli agenti. Questi valutatori sono dotati di configurazioni predefinite, tra cui modelli di prompt creati con cura, modelli di valutazione selezionati e criteri di punteggio standardizzati.

Built-in i valutatori sono progettati per soddisfare le esigenze di valutazione comuni, garantendo al contempo la coerenza e l'affidabilità tra le valutazioni. Poiché fanno parte della nostra offerta completamente gestita, è possibile utilizzarli immediatamente senza alcuna configurazione aggiuntiva e continueremo a migliorarne la qualità e ad aggiungere nuovi valutatori nel tempo. Per preservare la coerenza e l'affidabilità, le configurazioni dei valutatori integrati non possono essere modificate.

Valutatori personalizzati

I valutatori personalizzati offrono una maggiore flessibilità poiché consentono di definire tutti gli aspetti del processo di valutazione. AgentCore Evaluations supporta due tipi di valutatori personalizzati:

  • LLM-as-a-judge valutatori: definisci il tuo modello di valutazione, le istruzioni di valutazione e gli schemi di punteggio. È possibile personalizzare la valutazione in base alle proprie esigenze specifiche selezionando il modello di valutazione, creando istruzioni di valutazione personalizzate, definendo criteri di valutazione specifici e progettando uno schema di punteggio personalizzato. Per ulteriori informazioni, consulta Valutatori personalizzati.

  • Code-based evaluators: utilizza la tua funzione AWS Lambda per valutare a livello di codice le prestazioni degli agenti. Questo approccio offre il pieno controllo sulla logica di valutazione, abilitando controlli deterministici, chiamate API esterne, corrispondenze regex, metriche personalizzate o qualsiasi regola aziendale senza affidarsi a un giudice LLM. Per ulteriori informazioni, consulta Custom Code-based evaluator.

Questo livello di personalizzazione è particolarmente utile quando è necessario valutare agenti specifici del dominio, applicare standard di qualità esclusivi o implementare sistemi di punteggio specializzati. Ad esempio, è possibile creare criteri di valutazione personalizzati per settori specifici come l'assistenza sanitaria o la finanza o progettare schemi di punteggio in linea con le metriche di qualità dell'organizzazione.