Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Evaluasi kebenaran dasar
Kebenaran dasar adalah jawaban benar yang diketahui atau perilaku yang diharapkan untuk masukan yang diberikan — “standar emas” yang Anda bandingkan dengan hasil aktual. Untuk evaluasi agen, kebenaran dasar mengubah penilaian kualitas subjektif menjadi pengukuran objektif, memungkinkan deteksi regresi, kumpulan data benchmark, dan kebenaran spesifik domain yang tidak dapat disediakan sendiri oleh evaluator generik.
Dengan evaluasi kebenaran dasar, Anda memberikan input referensi di samping rentang sesi Anda saat memanggil Evaluate API. Layanan menggunakan input referensi ini untuk menilai perilaku aktual agen Anda terhadap perilaku yang diharapkan. Evaluator yang tidak menggunakan bidang kebenaran dasar tertentu mengabaikannya dan melaporkan bidang mana yang tidak digunakan dalam respons.
Evaluator bawaan yang didukung dan bidang kebenaran dasar
Tabel berikut menunjukkan evaluator bawaan mana yang mendukung kebenaran dasar dan bidang mana yang mereka gunakan.
| Evaluator | Tingkat | Bidang kebenaran dasar | Deskripsi |
|---|---|---|---|
|
|
Jejak |
|
Mengukur seberapa akurat respons agen cocok dengan jawaban yang diharapkan. Menggunakan LLM-as-a-Judge penilaian. |
|
|
Sesi |
|
Memvalidasi apakah perilaku agen memenuhi pernyataan bahasa alami di seluruh sesi. Menggunakan LLM-as-a-Judge penilaian. |
|
|
Sesi |
|
Memeriksa apakah urutan panggilan alat yang sebenarnya cocok dengan urutan yang diharapkan persis — alat yang sama, urutan yang sama, tidak ada tambahan. Penilaian terprogram (tidak ada panggilan LLM). |
|
|
Sesi |
|
Memeriksa apakah semua alat yang diharapkan muncul secara berurutan dalam urutan aktual, tetapi memungkinkan alat tambahan di antara mereka. Penilaian terprogram. |
|
|
Sesi |
|
Memeriksa apakah semua alat yang diharapkan hadir dalam urutan aktual, terlepas dari urutannya. Alat tambahan diperbolehkan. Penilaian terprogram. |
catatan
Evaluator kustom juga mendukung bidang kebenaran dasar melalui placeholder dalam instruksi evaluasi mereka. Lihat kebenaran dasar di evaluator khusus untuk detailnya.
Tabel berikut menjelaskan bidang kebenaran dasar.
| Bidang | Tipe | Lingkup | Deskripsi |
|---|---|---|---|
|
|
String |
Jejak |
Respons agen yang diharapkan untuk giliran tertentu. Dicakup ke jejak menggunakan |
|
|
Daftar string |
Sesi |
Pernyataan bahasa alami yang seharusnya benar tentang perilaku agen di seluruh sesi. |
|
|
Daftar nama alat |
Sesi |
Urutan panggilan alat yang diharapkan untuk sesi. |
-
Bidang kebenaran dasar bersifat opsional. Jika Anda menghilangkannya, evaluator kembali ke mode bebas kebenaran dasar mereka (misalnya,
Builtin.Correctnessmasih berfungsi tanpanyaexpectedResponse, itu hanya mengevaluasi berdasarkan konteks saja). -
Anda dapat menyediakan semua bidang kebenaran dasar dalam satu permintaan. Layanan memilih bidang yang relevan untuk setiap evaluator dan melaporkan
ignoredReferenceInputFieldsdalam tanggapan untuk bidang apa pun yang tidak digunakan. -
Anda tidak perlu menyediakan
expectedResponsesetiap jejak. Jejak tanpa kebenaran dasar dievaluasi menggunakan varian bebas kebenaran dasar dari evaluator.
Prasyarat
-
Python 3.10+
-
Agen yang dibangun dengan kerangka kerja yang didukung dan pustaka instrumentasi. Untuk informasi selengkapnya tentang kerangka kerja dan pustaka instrumentasi yang didukung, lihat Kerangka kerja agen yang didukung.
-
Agen yang digunakan pada AgentCore Runtime dengan pengamatan diaktifkan, atau agen yang dibangun dengan kerangka kerja yang didukung dikonfigurasi dengan AgentCore Observability, termasuk Pencarian Transaksi. Untuk informasi selengkapnya tentang pengaturan telemetri, lihat Pengaturan dan pengiriman telemetri.
-
AWS kredenSIAL dikonfigurasi dengan izin untuk
bedrock-agentcorebedrock-agentcore-control,, danlogs(CloudWatch)
Untuk petunjuk tentang cara mengunduh rentang sesi, lihat Memulai evaluasi sesuai permintaan.
Tentang contohnya
Contoh di halaman ini menggunakan agen sampel dari tutorial AgentCore Evaluasicalculator dan weather — dan digunakan pada AgentCore Runtime dengan pengamatan diaktifkan.
Contoh-contoh mengasumsikan sesi dua putaran:
-
Putaran 1: “Apa itu 15 + 27?” — agen menggunakan
calculatoralat dan merespons dengan hasilnya. -
Putaran 2: “Bagaimana cuacanya?” — agen menggunakan
weatheralat dan merespons dengan cuaca saat ini.
Sebelum menjalankan evaluasi, hubungi agen Anda dan tunggu 2-5 menit untuk menyerap data CloudWatch telemetri.
Konstanta berikut digunakan di seluruh contoh di halaman ini. Ganti dengan nilai-nilai Anda sendiri:
REGION = "<region-code>" AGENT_ID = "my-agent-id" SESSION_ID = "my-session-id" TRACE_ID_1 = "<trace-id-1>" # Turn 1: "What is 15 + 27?" TRACE_ID_2 = "<trace-id-2>" # Turn 2: "What's the weather?"
Kebenaran dengan respons yang diharapkan
Builtin.Correctnessadalah evaluator tingkat jejak yang mengukur seberapa akurat respons agen cocok dengan jawaban yang diharapkan. Ketika Anda memberikanexpectedResponse, evaluator membandingkan respons aktual agen dengan kebenaran dasar Anda menggunakan LLM-as-a-Judge penilaian.
contoh
GoalSuccessRate dengan pernyataan
Builtin.GoalSuccessRateadalah evaluator tingkat sesi yang memvalidasi apakah perilaku agen memenuhi serangkaian pernyataan bahasa alami. Pernyataan dapat memeriksa penggunaan alat, konten respons, urutan tindakan, atau perilaku lain yang dapat diamati di seluruh percakapan.
catatan
Contoh di bawah ini menggunakan pernyataan yang memvalidasi penggunaan alat, tetapi pernyataan adalah bahasa alami bentuk bebas - Anda dapat menggunakannya untuk menegaskan aspek perilaku agen apa pun, seperti nada respons, akurasi faktual, kepatuhan keselamatan, atau logika bisnis.
contoh
Pencocokan lintasan dengan lintasan yang diharapkan
Evaluator lintasan membandingkan urutan panggilan alat aktual agen dengan urutan nama alat yang diharapkan. Tiga varian tersedia, masing-masing dengan ketetatan pencocokan yang berbeda. Ketiganya adalah evaluator tingkat sesi dan menggunakan penilaian terprogram (tidak ada panggilan LLM, jadi penggunaan token nol).
| Evaluator | Aturan pencocokan | Contoh |
|---|---|---|
|
|
Aktual harus sesuai dengan yang diharapkan persis — alat yang sama, urutan yang sama, tidak ada tambahan |
Diharapkan: |
|
|
Alat yang diharapkan harus muncul secara berurutan, tetapi alat tambahan diperbolehkan di antara mereka |
Diharapkan: |
|
|
Semua alat yang diharapkan harus ada, pesanan tidak masalah, tambahan diperbolehkan |
Diharapkan: |
contoh
Menggabungkan semua bidang kebenaran dasar dalam satu permintaan
Anda dapat meneruskan semua bidang kebenaran dasar bersama-sama dalam satu panggilan evaluasi. Layanan merutekan setiap bidang ke evaluator yang sesuai dan mengabaikan bidang yang tidak digunakan evaluator tertentu. Ini berarti Anda dapat membuat input referensi Anda sekali dan menggunakannya kembali di evaluator yang berbeda tanpa memodifikasi muatan.
contoh
Memahami bidang input referensi yang diabaikan
Saat Anda memberikan bidang kebenaran dasar yang tidak digunakan evaluator, respons menyertakan ignoredReferenceInputFields array yang mencantumkan bidang yang tidak digunakan. Ini informasi, bukan kesalahan - evaluasi masih berhasil diselesaikan.
Misalnya, jika Anda menelep Builtin.Helpfulness on dengan expectedResponse disediakan, evaluator mengabaikan kebenaran dasar (Bantuan tidak menggunakannya) dan mengembalikan:
{ "evaluatorId": "Builtin.Helpfulness", "value": 0.83, "label": "Very Helpful", "explanation": "...", "ignoredReferenceInputFields": ["expectedResponse"] }
Perilaku ini dirancang - ini memungkinkan Anda untuk membuat satu set input referensi dan menggunakannya di beberapa evaluator tanpa menyesuaikan muatan untuk masing-masing.
Kebenaran dasar dalam evaluator khusus
Evaluator kustom dapat menggunakan bidang kebenaran dasar melalui placeholder dalam instruksi evaluasi mereka. Saat membuat evaluator kustom, Anda dapat mereferensikan placeholder berikut:
-
Session-level evaluator kustom:
{context},,{available_tools},{actual_tool_trajectory},{expected_tool_trajectory}{assertions} -
Trace-level evaluator kustom:
{context},,{assistant_turn}{expected_response}
Misalnya, evaluator tingkat jejak khusus yang memeriksa kesamaan respons mungkin menggunakan:
Compare the agent's response with the expected response. Agent response: {assistant_turn} Expected response: {expected_response} Rate how closely the agent's response matches the expected response on a scale of 0 to 1.
Ketika evaluator ini dipanggil dengan expectedResponse input referensi, layanan menggantikan placeholder dengan nilai kebenaran dasar aktual sebelum penilaian.
Untuk detail tentang membuat evaluator kustom, lihat Evaluator kustom.
catatan
Evaluator kustom yang menggunakan placeholder kebenaran dasar ({assertions},{expected_response},{expected_tool_trajectory}) tidak dapat digunakan dalam konfigurasi evaluasi online, karena evaluasi online memantau lalu lintas produksi langsung di mana nilai kebenaran dasar tidak tersedia.