View a markdown version of this page

Evaluasi Batch - Batuan Dasar Amazon AgentCore

Evaluasi Batch

Evaluasi Batch menjalankan evaluator terhadap beberapa sesi agen dalam satu pekerjaan dengan orkestrasi sisi server. Tidak seperti evaluasi berdasarkan permintaan di mana Anda mengumpulkan bentang dan memanggil API Evaluate sendiri, evaluasi batch menangani penemuan sesi, pengumpulan rentang, dan penilaian sepenuhnya di sisi layanan. Anda mengirimkan pekerjaan, dan layanan memproses semua sesi yang cocok dan mengembalikan hasil agregat.

Gunakan evaluasi batch saat Anda perlu:

  • Ukur garis dasar sebelum membuat perubahan pada prompt, alat, atau model agen Anda.

  • Validasi perbaikan dengan membandingkan skor sebelum dan sesudah perubahan konfigurasi.

  • Jalankan tes regresi di serangkaian sesi atau skenario yang dikuratori.

  • Pantau kualitas secara berkala di seluruh sesi produksi dari jendela waktu tertentu.

Cara kerjanya

Pekerjaan evaluasi batch mengikuti alur ini:

  1. Anda memulai pekerjaan dengan menentukan sumber sesi (di mana menemukan sesi agen) dan konfigurasi evaluasi (evaluator mana yang akan dijalankan). Secara opsional, Anda memberikan metadata kebenaran dasar untuk penilaian berbasis referensi.

  2. Layanan menemukan sesi dari CloudWatch Log berdasarkan grup log dan filter yang Anda tentukan.

  3. Layanan menjalankan evaluator terhadap setiap sesi yang ditemukan. Setiap evaluator menilai setiap sesi secara independen. Jika kebenaran dasar diberikan, evaluator yang mendukung penilaian berbasis referensi menggunakannya.

  4. Anda polling untuk hasil. Transisi pekerjaan melalui PENDINGIN_PROGRESSCOMPLETED (atauFAILED). Saat selesai, respons mencakup ringkasan agregat dengan skor rata-rata per evaluator, jumlah sesi, dan penggunaan token.

  5. Per-session detail tersedia di CloudWatch Log di lokasi yang ditentukan outputDataConfig dalam respons.

Perbandingan dengan jenis evaluasi lainnya

Aspek On-demand Online Batch

Pemicu

Caller-initiated, sinkron

Terus menerus, didorong oleh peristiwa

Caller-initiated, asinkron

Sumber sesi

Penelepon menyediakan bentang inline

Menonton grup log

Layanan menemukan dari CloudWatch Log

Lingkup

Sesi tunggal

Semua sesi yang cocok dengan aturan pengambilan sampel

Beberapa sesi (rentang waktu, ID sesi, atau grup log penuh)

Kebenaran dasar

Melalui evaluationReferenceInputs

Tidak didukung

Via sessionMetadata dengan kebenaran inline ground

Hasil

Respon sinkron

CloudWatch metrik dan dasbor

Ringkasan agregat dengan rata-rata per evaluator, ditambah detail per sesi di CloudWatch

Kasus penggunaan

Dev-time cek spot, CI/CD

Pemantauan produksi

Pengukuran dasar, pre/post perbandingan, pengujian regresi