View a markdown version of this page

Third-party evaluator - Batu Dasar Amazon AgentCore

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Third-party evaluator

AgentCore Evaluasi menawarkan evaluator dari pust DeepEval aka AutoEval open source. Jika Anda sudah menggunakan pustaka ini, Anda dapat menjalankan metrik yang sama di dalam AgentCore Evaluasi. Layanan ini menangani hosting dan kode evaluasi untuk Anda. Dengan opsi terkelola, layanan juga memilih model dan menjalankan inferensi, seperti halnya untuk evaluator bawaan.

Ada dua cara untuk menggunakan evaluator pihak ketiga:

  • Dik elola — Pilih evaluator pihak ketiga berdasarkan ID dan terapkan. Layanan menjalankannya, memilih model, dan mengelola versi pustaka.

  • Kustom — Buat evaluator yang menjalankan logika evaluator yang ada — evaluator pihak ketiga bawaan atau terkelola — pada model dan inferensi Anda sendiri. Untuk informasi selengkapnya, lihat Evaluator khusus yang berasal dari evalu ator dasar.

Kualitas evaluator

AgentCore evaluator bawaan diuji dan diukur untuk kinerja. DeepEval dan AutoEval merupakan evaluator sumber terbuka, dan kami tidak membuat klaim tentang kualitasnya.

Identitas evaluator

Dua bidang bersama-sama mengidentifikasi setiap evaluator, termasuk evaluator pihak ketiga:

  • evaluatorTypeJenis sumber daya: siapa yang menyediakannya dan bagaimana. Builtindan ThirdParty merupakan evaluator global yang AWS dikelola yang Anda referensikan tetapi tidak dibuat. Custom,CustomCode, dan CustomDerived merupakan evaluator yang Anda buat.

  • provider— Dari mana logika evaluasi berasal: AWS untuk evaluator AWS yang ditulis, atau untuk perpustakaan pihak ketiga yang sesuai, DeepEval atau AutoEval untuk evaluator yang Anda Custom tulis sendiri.

Kedua bidang tersebut independen, sehingga setiap evaluator adalah satu (evaluatorType, provider) pasangan:

Evaluator Jenis Evaluator penyedia

Terkelola bawaan

Builtin

AWS

Pihak ketiga yang dikelola

ThirdParty

DeepEval atau AutoEval

Evaluator kustom berasal dari bawaan

CustomDerived

AWS

Evaluator kustom berasal dari evaluator pihak ketiga

CustomDerived

DeepEval atau AutoEval

Evaluator berbasis kode khusus

CustomCode

Custom

LLM-as-a-judge Evaluator kustom

Custom

Custom

ID evaluator pihak ketiga yang dikelola mengikuti ThirdParty.<Provider>.<Metric> format—misalnya, atau. ThirdParty.DeepEval.TaskCompletion ThirdParty.AutoEval.Security Ini mencerminkan Builtin.<Metric> format yang digunakan untuk evaluator bawaan pihak pertama.

Temukan evaluator yang tersedia

Third-party evaluator dikembalikan oleh ListEvaluators API bersama evaluator bawaan pihak pertama dan evaluator khusus apa pun di akun Anda.

{ "evaluators": [ { "evaluatorId": "Builtin.Helpfulness", "evaluatorType": "Builtin", "provider": "AWS", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.DeepEval.TaskCompletion", "evaluatorType": "ThirdParty", "provider": "DeepEval", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.AutoEval.Security", "evaluatorType": "ThirdParty", "provider": "AutoEval", "level": "TRACE", "status": "ACTIVE" } ] }

Evaluator pihak ketiga yang dikelola

Gunakan evaluator pihak ketiga yang dikelola persis seperti evaluator bawaan: pilih berdasarkan ID, dan layanan menjalankannya pada model yang dioperasikannya. Anda tidak menyediakan model, prompt, atau konfigurasi.

  • Model: Evaluator pihak ketiga yang dikelola berjalan pada model yang sama dengan evaluator bawaan di Amazon Bedrock. AgentCore Tidak ada bidang model dan tidak ada konfigurasi model untuk disetel.

  • Pembuatan versi: Tidak ada pilihan versi untuk evaluator pihak ketiga yang dikelola. Layanan menjalankan versi pustaka yang telah divalidasi dan mengelola peningkatan itu sendiri.

Anda dapat meneruskan ID evaluator pihak ketiga yang dikelola di mana pun Anda akan meneruskan ID evaluator bawaan:

  • On-demand evaluasi — Meneruskan ID dalam permintaan Evaluate API.

  • Evaluasi online — Tambahkan ID ke evaluators daftar konfigurasi evaluasi online. Ini bercampur secara bebas dengan evaluator bawaan dan khusus, dan diatur oleh aturan pengambilan sampel dan pemfilteran yang sama.

  • Evaluasi batch — Meneruskan ID dalam evaluators daftar pekerjaan evaluasi batch.

Contoh berikut menjalankan evaluator pihak ketiga yang dikelola dengan Evaluate API:

import boto3 client = boto3.client('bedrock-agentcore') response = client.evaluate( evaluatorId="ThirdParty.DeepEval.TaskCompletion", evaluationInput={"sessionSpans": session_span_logs} ) for result in response["evaluationResults"]: print(f"Value: {result.get('value')}") print(f"Explanation: {result.get('explanation', '')}")

Evaluator kustom berasal dari evaluator dasar

Gunakan evaluator turunan khusus untuk menjalankan evaluator yang ada — evaluator pihak ketiga bawaan atau dikelola — pada model Anda sendiri. Alih-alih menggunakan model yang dipilih layanan, Anda menyediakan parameter model dan inferensi. Evaluator dasar memberikan prompt dan penilaian. Ini hanya berlaku untuk LLM-based evaluator.

Untuk membuat evaluator turunan khusus, tent derived ukan anggota evaluatorConfig dengan ID evaluator dasar dan konfigurasi model Anda. Simpan yang berikut ini sebagaiderived_evaluator_config.json:

{ "derived": { "baseEvaluatorId": "ThirdParty.DeepEval.TaskCompletion", "modelConfig": { "bedrockEvaluatorModelConfig": { "modelId": "global.anthropic.claude-sonnet-4-5-20250929-v1:0", "inferenceConfig": { "temperature": 0.0, "topP": 1.0, "maxTokens": 2048 } } } } }

Anda juga dapat memperoleh evaluator kustom dari evaluator bawaan dengan menyetel baseEvaluatorId ke Builtin. ID alih-alih ID. ThirdParty.

Buat evaluator dengan AWS CLI:

aws bedrock-agentcore-control create-evaluator \ --evaluator-name 'my_task_completion' \ --evaluator-config file://derived_evaluator_config.json

Evaluator yang dihasilkan telah evaluatorType menetapkan keCustomDerived. Layanan berasal provider secara otomatis dari evaluator dasar: AWS untuk Builtin. basis, atau nama penyedia untuk ThirdParty. basis. Anda tidak menyet level el — layanan mendapatkannya dari evaluator dasar, dan diaktifkan hanya baca. GetEvaluator Anda juga tidak mengatur instructions atau ratingScale karena evaluator dasar memiliki keduanya.

Setelah Anda membuat evaluator, gunakan persis seperti evaluator kustom lainnya: berikan ID evaluatornya keEvaluate, atau tambahkan ke evaluators daftar evaluasi online atau batch.

  • Model: Model Bedrock apa pun, diatur. bedrockEvaluatorModelConfig

  • Kepemilikan inferensi: Model berjalan menggunakan AWS akun dan kredensial Anda sendiri—peran eksekusi untuk evaluasi online, atau kredenSIAL penelepon untuk evaluasi sesuai permintaan. Ini adalah perbedaan utama dari evaluator pihak ketiga yang dikelola, di mana layanan menjalankan model pada kapasitasnya sendiri.

  • Kepemilikan kualitas: Karena Anda memilih model, kualitas evaluasi mencerminkan pilihan itu. Layanan tidak memvalidasi model terhadap setiap metrik.

Hasil

Third-party evaluator mengembalikan bentuk hasil yang sama dengan evaluator bawaan dan kustom, di lokasi yang sama. Untuk informasi selengkapnya, lihat Hasil dan keluaran.

Kumpulan evaluator awal

Evaluator berikut tersedia saat peluncuran.

DeepEval

Metrik Apa yang diperiksa

Bias

Apakah output menunjukkan bias gender, politik, ras, atau geografis.

Toksisitas

Apakah output berisi serangan, ejekan, kebencian, atau ancaman.

Piileakage

Apakah tanggapan tersebut mengekspos informasi pribadi.

Ringkasan

Apakah ringkasannya setia dan komprehensif.

TaskCompletion

Apakah agen mencapai tujuan pengguna.

ConversationCompleteness

Apakah semua permintaan pengguna di seluruh percakapan ditangani.

KnowledgeRetention

Apakah agen mengingat informasi yang dibagikan sebelumnya.

TurnRelevancy

Apakah setiap balasan tetap relevan dengan giliran sebelumnya.

GoalAccuracy

Apakah agen mencapai tujuannya melalui percakapan multi-putaran.

ToolUse

Apakah agen memilih alat yang tepat dan memberikan argumen yang benar.

AutoEval

Metrik Apa yang diperiksa

Keamanan

Apakah responsnya berbahaya.

Humor

Apakah jawabannya lucu.

Kemungkinan

Apakah agen mencoba solusi atau menyatakan tugas itu tidak mungkin.

Konsol

Di pemilih evaluator, evaluator pihak ketiga muncul di bagian evaluator mereka sendiri, dikelompokkan berdasarkan penyedia, terpisah dari kelompok Third-party evaluator bawaan. Bagian ini runtuh secara default.

Untuk membuat evaluator kustom yang berasal dari evaluator dasar, gunakan aliran Create custom evaluator yang ada dan pilih Third-party library sebagai jenis definisi evaluator. Opsi ini menghapus bagian instruksi dan skala yang ditampilkan untuk LLM-as-a-judge, karena evaluator dasar memiliki prompt dan penilaian. Pilih pustaka dan metrik, lalu berikan parameter model dan inferensi. Tingkat evaluasi ditampilkan hanya baca, diatur oleh metrik.