View a markdown version of this page

Terminologie de l'évaluation - Amazon Bedrock AgentCore

Terminologie de l'évaluation

La compréhension des concepts et de la terminologie clés est essentielle pour utiliser efficacement AgentCore les évaluations. Les termes suivants définissent les principaux composants et processus impliqués dans l'évaluation des agents.

Framework d'agents

Un framework d'agents fournit les composants de base pour créer, orchestrer et exécuter des applications basées sur des agents. Les frameworks définissent des structures telles que les étapes, les outils, le flux de contrôle et la gestion de la mémoire. Les cadres industriels courants incluent Strands Agents, LangGraphetc. Ces cadres aident à normaliser la manière dont les agents sont construits et à les rendre plus faciles à instrumenter et à évaluer.

AgentCore Les évaluations prennent actuellement en charge les Strands Agents et les frameworks d'LangGraphagents.

Bibliothèque d'instrumentation

Une bibliothèque d'instrumentation enregistre la télémétrie générée par votre agent lors de l'exécution. Cette télémétrie peut inclure des traces, des intervalles, des appels d'outils, des appels de modèles et des étapes intermédiaires. Les bibliothèques telles que OpenTelemetryet OpenInferenceproposent des API standardisées et des conventions sémantiques qui vous permettent de capturer le comportement des agents avec un minimum de modifications de code. Des instruments sont nécessaires pour la collecte et l'évaluation des traces.

AgentCore Les évaluations sont actuellement prises en charge OpenTelemetryet OpenInferenceen tant que bibliothèques d'instrumentation.

Agent d'instrumentation

Un agent d'instrumentation capture automatiquement les données télémétriques du code de l'application, les traite et les exporte vers un service principal à des fins de stockage ou d'évaluation. Des outils tels qu'ADOT (AWS Distro for OpenTelemetry) fournissent un agent d'auto-instrumentation indépendant du fournisseur et prêt à être produit qui injecte dynamiquement du bytecode pour capturer des traces sans modifier le code. L'agent joue un rôle clé dans l'automatisation de l'évaluation.

AgentCore Evaluations prend actuellement en charge ADOT (AWS Distro for OpenTelemetry) en tant qu'agent d'instrumentation.

Session

Une session représente un regroupement logique d'interactions connexes provenant d'un seul utilisateur ou d'un seul flux de travail. Une session peut contenir une ou plusieurs traces. Les sessions vous aident à visualiser et à évaluer le comportement des agents au cours des interactions en plusieurs étapes, plutôt que de vous concentrer sur des demandes individuelles.

Suivi

Une trace est un enregistrement complet de l'exécution ou de la demande d'un seul agent. Une trace contient une ou plusieurs plages, qui représentent les différentes opérations effectuées au cours de cette exécution. Les traces fournissent une visibilité de bout en bout sur les décisions des agents et l'utilisation des outils.

Appel à outils

Un appel d'outil est un intervalle qui représente l'invocation par un agent d'une fonction, d'une API ou d'une capacité externe. Les intervalles d'appel d'outils capturent généralement des informations telles que le nom de l'outil, les paramètres d'entrée, le temps d'exécution et la sortie. Les détails de l'appel d'outils sont utilisés pour évaluer si l'agent a sélectionné et utilisé les outils correctement et efficacement.

Référencez les grands modèles linguistiques gratuits (LLM) en tant que juges

En tant que juges, les grands modèles linguistiques (LLM) font référence à une méthode d'évaluation qui utilise un grand modèle linguistique (LLM) pour évaluer automatiquement la qualité, l'exactitude ou l'efficacité des résultats d'un agent ou d'un autre modèle. Au lieu de s'appuyer sur une révision manuelle ou des vérifications basées sur des règles, le LLM est invité à définir des critères d'évaluation et produit un score, une étiquette ou une explication en fonction des entrées et des sorties évaluées. Contrairement aux évaluations traditionnelles qui s'appuient sur des données factuelles, LLM-as-a-judge les méthodes s'appuient sur les connaissances internes du modèle pour porter des jugements. Cette approche permet des évaluations qualitatives évolutives, cohérentes et personnalisables, telles que l'exactitude, la qualité du raisonnement ou le respect des instructions, sur un grand nombre d'interactions entre agents ou de réponses de modèles.