View a markdown version of this page

Evaluasi set data - Batu Dasar Amazon AgentCore

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Evaluasi set data

catatan

Evaluasi dataset dalam pratinjau publik. Fitur dan API dapat berubah sebelum ketersediaan umum.

Evaluasi dataset memungkinkan Anda menjalankan agen terhadap serangkaian skenario dan secara otomatis mengevaluasi hasilnya. Alih-alih memanggil agen Anda secara manual, mengumpulkan rentang, dan memanggil Evaluate API, pelari dataset mengatur seluruh siklus hidup dalam satu panggilan: panggil agen, tunggu penyerapan telemetri, dan evaluasi.

Ini berguna untuk pengujian regresi, kumpulan data benchmark, CI/CD pipeline, pengukuran dasar, dan pre/post perbandingan setelah perubahan konfigurasi.

AgentCore SDK menyediakan dua pelari dataset yang berbagi skema dataset dan format kebenaran dasar yang sama tetapi berbeda di mana evaluasi terjadi:

  • On-demand dataset runner (OnDemandEvaluationDatasetRunner) — Mengumpulkan rentang dan memanggil sisi klien Evaluate API. Terbaik untuk iterasi waktu pengembangan dan kumpulan data kecil.

  • Batch dataset runner (BatchEvaluationRunner) — Mendelegasikan pengumpulan rentang dan evaluasi ke layanan melalui API evaluasi batch. Terbaik untuk kumpulan data besar dan garis dasar produksi.

Memilih pelari

Aspek On-demand pelari Pelari batch

Koleksi Span

SDK-side melalui AgentSpanCollector

Server-side; layanan membaca dari CloudWatch langsung

Mengevaluasi panggilan API

Panggilan SDK evaluate() per evaluator per skenario

Panggilan SDK startBatchEvaluation() sekali

Model eksekusi

Pipa tiga fase sinkron (memanggil, menunggu, mengevaluasi)

Pipa empat fase asinkron (memanggil, tunggu, kirim, jajak pendapat)

Hasil

Terstruktur EvaluationResult dengan detail per-skenario, per-evaluator

Agregat BatchEvaluationSummary dengan rata-rata per evaluator, ditambah detail per sesi di CloudWatch

Terbaik untuk

Dev-time iterasi, CI/CD, kumpulan data kecil, saat Anda membutuhkan detail per skenario segera

Pengukuran dasar, kumpulan data besar, pre/post perbandingan, ketika skor agregat cukup

Prasyarat

Kedua pelari membutuhkan:

  • Python 3.10+

  • Agen yang dibangun dengan kerangka kerja yang didukung dan pustaka instrumentasi. Untuk informasi selengkapnya tentang kerangka kerja dan pustaka instrumentasi yang didukung, lihat Kerangka kerja agen yang didukung.

  • Agen yang digunakan pada AgentCore Runtime dengan pengamatan diaktifkan, atau agen yang dibangun dengan kerangka kerja yang didukung dikonfigurasi dengan AgentCore Observability, termasuk Pencarian Transaksi. Untuk informasi selengkapnya tentang pengaturan telemetri, lihat Pengaturan dan pengiriman telemetri.

  • AgentCore SDK diinstal: pip install bedrock-agentcore

  • AWS kredenSIAL dikonfigurasi dengan izin untuk bedrock-agentcorebedrock-agentcore-control,, dan logs (CloudWatch)