View a markdown version of this page

Evaluasi batch - Batu Dasar Amazon AgentCore

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Evaluasi batch

Evaluasi batch menjalankan evaluator terhadap beberapa sesi agen dalam satu pekerjaan dengan orkestrasi sisi server. Tidak seperti evaluasi sesuai permintaan di mana Anda mengumpulkan rentang dan memanggil Evaluate API sendiri, evaluasi batch menangani penemuan sesi, pengumpulan rentang, dan penilaian sepenuhnya di sisi layanan. Anda mengirimkan pekerjaan, dan layanan memproses semua sesi pencocokan dan mengembalikan hasil agregat.

Gunakan evaluasi batch saat Anda perlu:

  • Ukur garis dasar sebelum membuat perubahan pada prompt, alat, atau model agen Anda.

  • Validasi perbaikan dengan membandingkan skor sebelum dan sesudah perubahan konfigurasi.

  • Jalankan tes regresi di serangkaian sesi atau skenario yang dikuratori.

  • Pantau kualitas secara berkala di seluruh sesi produksi dari jendela waktu tertentu.

Cara kerjanya

Pekerjaan evaluasi batch mengikuti alur ini:

  1. Anda memulai pekerjaan dengan menentukan sumber sesi (tempat menemukan sesi agen) dan konfigurasi evaluasi (evaluator mana yang akan dijalankan). Secara opsional, Anda memberikan metadata kebenaran dasar untuk penilaian berbasis referensi.

  2. Layanan menemukan sesi dari Log berdasarkan grup CloudWatch log dan filter yang Anda tentukan.

  3. Layanan menjalankan evaluator terhadap setiap sesi yang ditemukan. Setiap evaluator menilai setiap sesi secara independen. Jika kebenaran dasar diberikan, evaluator yang mendukung penilaian berbasis referensi menggunakannya.

  4. Anda melakukan polling untuk hasil. Transisi pekerjaan melalui PENDING → IN_PROGRESS → COMPLETED (atauFAILED). Setelah selesai, respons mencakup ringkasan agregat dengan skor rata-rata per evaluator, jumlah sesi, dan penggunaan token.

  5. Per-session detail tersedia di CloudWatch Log di lokasi yang ditentukan outputDataConfig dalam respons.

Perbandingan dengan jenis evaluasi lainnya

Aspek On-demand Online Batch

Pemicu

Caller-initiated, sinkron

Berkelanjutan, didorong oleh peristiwa

Caller-initiated, asinkron

Sumber sesi

Penelepon menyediakan rentang sebaris

Menonton grup log

Layanan menemukan dari CloudWatch Log

Lingkup

Sesi tunggal

Semua sesi yang cocok dengan aturan sampling

Beberapa sesi (rentang waktu, ID sesi, atau grup log penuh)

Kebenaran dasar

Melalui evaluationReferenceInputs

Tidak didukung

Melalui sessionMetadata dengan kebenaran dasar sebaris

Hasil

Respon sinkron

CloudWatch metrik dan dasbor

Ringkasan agregat dengan rata-rata per evaluator, ditambah detail per sesi di CloudWatch

Kasus penggunaan

Dev-time pemeriksaan tempat, CI/CD

Pemantauan produksi

Pengukuran dasar, pre/post perbandingan, pengujian regresi