Evaluasi set data
catatan
Evaluasi dataset dalam pratinjau publik. Fitur dan API dapat berubah sebelum ketersediaan umum.
Evaluasi kumpulan data memungkinkan Anda menjalankan agen Anda terhadap serangkaian skenario dan secara otomatis mengevaluasi hasilnya. Alih-alih memanggil agen Anda secara manual, mengumpulkan rentang, dan memanggil Evaluate API, runner dataset mengatur seluruh siklus hidup dalam satu panggilan: memanggil agen, menunggu konsumsi telemetri, dan mengevaluasi.
Ini berguna untuk pengujian regresi, kumpulan data benchmark, CI/CD pipeline, pengukuran dasar, dan perbandingan setelah perubahan konfigurasi. pre/post
AgentCore SDK menyediakan dua pelari kumpulan data yang berbagi skema kumpulan data dan format kebenaran dasar yang sama tetapi berbeda dalam hal evaluasi terjadi:
-
On-demand dataset runner (
OnDemandEvaluationDatasetRunner) — Mengumpulkan rentang dan memanggil sisi klien Evaluate API. Terbaik untuk iterasi waktu pengembangan dan kumpulan data kecil. -
Batch dataset runner (
BatchEvaluationRunner) — Mendelegasikan pengumpulan dan evaluasi rentang ke layanan melalui API evaluasi batch. Terbaik untuk kumpulan data besar dan garis dasar produksi.
Memilih pelari
| Aspek | On-demand pelari | Pelari Batch |
|---|---|---|
|
Koleksi rentang |
SDK-side melalui |
Server-side; layanan membaca dari CloudWatch langsung |
|
Evaluasi panggilan API |
Panggilan SDK |
Panggilan SDK sekali |
|
Model eksekusi |
Pipa tiga fase sinkron (panggil, tunggu, evaluasi) |
Pipa empat fase asinkron (panggil, tunggu, kirim, polling) |
|
Hasil |
Terstruktur |
Agregat |
|
Terbaik untuk |
Dev-time iterasi, CI/CD, kumpulan data kecil, saat Anda membutuhkan detail per skenario segera |
Pengukuran dasar, kumpulan data besar, pre/post perbandingan, ketika skor agregat cukup |
Prasyarat
Kedua pelari membutuhkan:
-
Python 3.10+
-
Agen yang digunakan pada AgentCore Runtime dengan kemampuan observabilitas diaktifkan, atau agen yang dibuat dengan kerangka kerja yang didukung yang dikonfigurasi dengan Observability. AgentCore Kerangka kerja yang didukung:
-
Agen Helai
-
LangGraph dengan
opentelemetry-instrumentation-langchainatauopeninference-instrumentation-langchain
-
-
Pencarian Transaksi diaktifkan di CloudWatch; lihat Mengaktifkan Pencarian Transaksi
-
AgentCore SDK diinstal:
pip install bedrock-agentcore -
AWS kredensional yang dikonfigurasi dengan izin untuk
bedrock-agentcore,bedrock-agentcore-control, dan ()logsCloudWatch