Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Third-party evaluator
AgentCore Evaluasi menawarkan evaluator dari pust DeepEval aka AutoEval open source. Jika Anda sudah menggunakan pustaka ini, Anda dapat menjalankan metrik yang sama di dalam AgentCore Evaluasi. Layanan ini menangani hosting dan kode evaluasi untuk Anda. Dengan opsi terkelola, layanan juga memilih model dan menjalankan inferensi, seperti halnya untuk evaluator bawaan.
Ada dua cara untuk menggunakan evaluator pihak ketiga:
-
Dik elola — Pilih evaluator pihak ketiga berdasarkan ID dan terapkan. Layanan menjalankannya, memilih model, dan mengelola versi pustaka.
-
Kustom — Buat evaluator yang menjalankan logika evaluator yang ada — evaluator pihak ketiga bawaan atau terkelola — pada model dan inferensi Anda sendiri. Untuk informasi selengkapnya, lihat Evaluator khusus yang berasal dari evalu ator dasar.
Kualitas evaluator
AgentCore evaluator bawaan diuji dan diukur untuk kinerja. DeepEval dan AutoEval merupakan evaluator sumber terbuka, dan kami tidak membuat klaim tentang kualitasnya.
Topik
Identitas evaluator
Dua bidang bersama-sama mengidentifikasi setiap evaluator, termasuk evaluator pihak ketiga:
-
evaluatorTypeJenis sumber daya: siapa yang menyediakannya dan bagaimana.BuiltindanThirdPartymerupakan evaluator global yang AWS dikelola yang Anda referensikan tetapi tidak dibuat.Custom,CustomCode, danCustomDerivedmerupakan evaluator yang Anda buat. -
provider— Dari mana logika evaluasi berasal:AWSuntuk evaluator AWS yang ditulis, atau untuk perpustakaan pihak ketiga yang sesuai,DeepEvalatauAutoEvaluntuk evaluator yang AndaCustomtulis sendiri.
Kedua bidang tersebut independen, sehingga setiap evaluator adalah satu (evaluatorType, provider) pasangan:
| Evaluator | Jenis Evaluator | penyedia |
|---|---|---|
|
Terkelola bawaan |
|
|
|
Pihak ketiga yang dikelola |
|
|
|
Evaluator kustom berasal dari bawaan |
|
|
|
Evaluator kustom berasal dari evaluator pihak ketiga |
|
|
|
Evaluator berbasis kode khusus |
|
|
|
LLM-as-a-judge Evaluator kustom |
|
|
ID evaluator pihak ketiga yang dikelola mengikuti ThirdParty.<Provider>.<Metric> format—misalnya, atau. ThirdParty.DeepEval.TaskCompletion ThirdParty.AutoEval.Security Ini mencerminkan Builtin.<Metric> format yang digunakan untuk evaluator bawaan pihak pertama.
Temukan evaluator yang tersedia
Third-party evaluator dikembalikan oleh ListEvaluators API bersama evaluator bawaan pihak pertama dan evaluator khusus apa pun di akun Anda.
{ "evaluators": [ { "evaluatorId": "Builtin.Helpfulness", "evaluatorType": "Builtin", "provider": "AWS", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.DeepEval.TaskCompletion", "evaluatorType": "ThirdParty", "provider": "DeepEval", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.AutoEval.Security", "evaluatorType": "ThirdParty", "provider": "AutoEval", "level": "TRACE", "status": "ACTIVE" } ] }
Evaluator pihak ketiga yang dikelola
Gunakan evaluator pihak ketiga yang dikelola persis seperti evaluator bawaan: pilih berdasarkan ID, dan layanan menjalankannya pada model yang dioperasikannya. Anda tidak menyediakan model, prompt, atau konfigurasi.
-
Model: Evaluator pihak ketiga yang dikelola berjalan pada model yang sama dengan evaluator bawaan di Amazon Bedrock. AgentCore Tidak ada bidang model dan tidak ada konfigurasi model untuk disetel.
-
Pembuatan versi: Tidak ada pilihan versi untuk evaluator pihak ketiga yang dikelola. Layanan menjalankan versi pustaka yang telah divalidasi dan mengelola peningkatan itu sendiri.
Anda dapat meneruskan ID evaluator pihak ketiga yang dikelola di mana pun Anda akan meneruskan ID evaluator bawaan:
-
On-demand evaluasi — Meneruskan ID dalam permintaan
EvaluateAPI. -
Evaluasi online — Tambahkan ID ke
evaluatorsdaftar konfigurasi evaluasi online. Ini bercampur secara bebas dengan evaluator bawaan dan khusus, dan diatur oleh aturan pengambilan sampel dan pemfilteran yang sama. -
Evaluasi batch — Meneruskan ID dalam
evaluatorsdaftar pekerjaan evaluasi batch.
Contoh berikut menjalankan evaluator pihak ketiga yang dikelola dengan Evaluate API:
import boto3 client = boto3.client('bedrock-agentcore') response = client.evaluate( evaluatorId="ThirdParty.DeepEval.TaskCompletion", evaluationInput={"sessionSpans": session_span_logs} ) for result in response["evaluationResults"]: print(f"Value: {result.get('value')}") print(f"Explanation: {result.get('explanation', '')}")
Evaluator kustom berasal dari evaluator dasar
Gunakan evaluator turunan khusus untuk menjalankan evaluator yang ada — evaluator pihak ketiga bawaan atau dikelola — pada model Anda sendiri. Alih-alih menggunakan model yang dipilih layanan, Anda menyediakan parameter model dan inferensi. Evaluator dasar memberikan prompt dan penilaian. Ini hanya berlaku untuk LLM-based evaluator.
Untuk membuat evaluator turunan khusus, tent derived ukan anggota evaluatorConfig dengan ID evaluator dasar dan konfigurasi model Anda. Simpan yang berikut ini sebagaiderived_evaluator_config.json:
{ "derived": { "baseEvaluatorId": "ThirdParty.DeepEval.TaskCompletion", "modelConfig": { "bedrockEvaluatorModelConfig": { "modelId": "global.anthropic.claude-sonnet-4-5-20250929-v1:0", "inferenceConfig": { "temperature": 0.0, "topP": 1.0, "maxTokens": 2048 } } } } }
Anda juga dapat memperoleh evaluator kustom dari evaluator bawaan dengan menyetel baseEvaluatorId ke Builtin.
ID alih-alih ID. ThirdParty.
Buat evaluator dengan AWS CLI:
aws bedrock-agentcore-control create-evaluator \ --evaluator-name 'my_task_completion' \ --evaluator-config file://derived_evaluator_config.json
Evaluator yang dihasilkan telah evaluatorType menetapkan keCustomDerived. Layanan berasal provider secara otomatis dari evaluator dasar: AWS untuk Builtin.
basis, atau nama penyedia untuk ThirdParty. basis. Anda tidak menyet level el — layanan mendapatkannya dari evaluator dasar, dan diaktifkan hanya baca. GetEvaluator Anda juga tidak mengatur instructions atau ratingScale karena evaluator dasar memiliki keduanya.
Setelah Anda membuat evaluator, gunakan persis seperti evaluator kustom lainnya: berikan ID evaluatornya keEvaluate, atau tambahkan ke evaluators daftar evaluasi online atau batch.
-
Model: Model Bedrock apa pun, diatur.
bedrockEvaluatorModelConfig -
Kepemilikan inferensi: Model berjalan menggunakan AWS akun dan kredensial Anda sendiri—peran eksekusi untuk evaluasi online, atau kredenSIAL penelepon untuk evaluasi sesuai permintaan. Ini adalah perbedaan utama dari evaluator pihak ketiga yang dikelola, di mana layanan menjalankan model pada kapasitasnya sendiri.
-
Kepemilikan kualitas: Karena Anda memilih model, kualitas evaluasi mencerminkan pilihan itu. Layanan tidak memvalidasi model terhadap setiap metrik.
Hasil
Third-party evaluator mengembalikan bentuk hasil yang sama dengan evaluator bawaan dan kustom, di lokasi yang sama. Untuk informasi selengkapnya, lihat Hasil dan keluaran.
Kumpulan evaluator awal
Evaluator berikut tersedia saat peluncuran.
DeepEval
| Metrik | Apa yang diperiksa |
|---|---|
|
Bias |
Apakah output menunjukkan bias gender, politik, ras, atau geografis. |
|
Toksisitas |
Apakah output berisi serangan, ejekan, kebencian, atau ancaman. |
|
Piileakage |
Apakah tanggapan tersebut mengekspos informasi pribadi. |
|
Ringkasan |
Apakah ringkasannya setia dan komprehensif. |
|
TaskCompletion |
Apakah agen mencapai tujuan pengguna. |
|
ConversationCompleteness |
Apakah semua permintaan pengguna di seluruh percakapan ditangani. |
|
KnowledgeRetention |
Apakah agen mengingat informasi yang dibagikan sebelumnya. |
|
TurnRelevancy |
Apakah setiap balasan tetap relevan dengan giliran sebelumnya. |
|
GoalAccuracy |
Apakah agen mencapai tujuannya melalui percakapan multi-putaran. |
|
ToolUse |
Apakah agen memilih alat yang tepat dan memberikan argumen yang benar. |
AutoEval
| Metrik | Apa yang diperiksa |
|---|---|
|
Keamanan |
Apakah responsnya berbahaya. |
|
Humor |
Apakah jawabannya lucu. |
|
Kemungkinan |
Apakah agen mencoba solusi atau menyatakan tugas itu tidak mungkin. |
Konsol
Di pemilih evaluator, evaluator pihak ketiga muncul di bagian evaluator mereka sendiri, dikelompokkan berdasarkan penyedia, terpisah dari kelompok Third-party evaluator bawaan. Bagian ini runtuh secara default.
Untuk membuat evaluator kustom yang berasal dari evaluator dasar, gunakan aliran Create custom evaluator yang ada dan pilih Third-party library sebagai jenis definisi evaluator. Opsi ini menghapus bagian instruksi dan skala yang ditampilkan untuk LLM-as-a-judge, karena evaluator dasar memiliki prompt dan penilaian. Pilih pustaka dan metrik, lalu berikan parameter model dan inferensi. Tingkat evaluasi ditampilkan hanya baca, diatur oleh metrik.