Evaluasi Batch
Evaluasi Batch menjalankan evaluator terhadap beberapa sesi agen dalam satu pekerjaan dengan orkestrasi sisi server. Tidak seperti evaluasi berdasarkan permintaan di mana Anda mengumpulkan bentang dan memanggil API Evaluate sendiri, evaluasi batch menangani penemuan sesi, pengumpulan rentang, dan penilaian sepenuhnya di sisi layanan. Anda mengirimkan pekerjaan, dan layanan memproses semua sesi yang cocok dan mengembalikan hasil agregat.
Gunakan evaluasi batch saat Anda perlu:
-
Ukur garis dasar sebelum membuat perubahan pada prompt, alat, atau model agen Anda.
-
Validasi perbaikan dengan membandingkan skor sebelum dan sesudah perubahan konfigurasi.
-
Jalankan tes regresi di serangkaian sesi atau skenario yang dikuratori.
-
Pantau kualitas secara berkala di seluruh sesi produksi dari jendela waktu tertentu.
Cara kerjanya
Pekerjaan evaluasi batch mengikuti alur ini:
-
Anda memulai pekerjaan dengan menentukan sumber sesi (di mana menemukan sesi agen) dan konfigurasi evaluasi (evaluator mana yang akan dijalankan). Secara opsional, Anda memberikan metadata kebenaran dasar untuk penilaian berbasis referensi.
-
Layanan menemukan sesi dari CloudWatch Log berdasarkan grup log dan filter yang Anda tentukan.
-
Layanan menjalankan evaluator terhadap setiap sesi yang ditemukan. Setiap evaluator menilai setiap sesi secara independen. Jika kebenaran dasar diberikan, evaluator yang mendukung penilaian berbasis referensi menggunakannya.
-
Anda polling untuk hasil. Transisi pekerjaan melalui
PENDING→IN_PROGRESS→COMPLETED(atauFAILED). Saat selesai, respons mencakup ringkasan agregat dengan skor rata-rata per evaluator, jumlah sesi, dan penggunaan token. -
Per-session detail tersedia di CloudWatch Log di lokasi yang ditentukan
outputDataConfigdalam respons.
Perbandingan dengan jenis evaluasi lainnya
| Aspek | On-demand | Online | Batch |
|---|---|---|---|
|
Pemicu |
Caller-initiated, sinkron |
Terus menerus, didorong oleh peristiwa |
Caller-initiated, asinkron |
|
Sumber sesi |
Penelepon menyediakan bentang inline |
Menonton grup log |
Layanan menemukan dari CloudWatch Log |
|
Lingkup |
Sesi tunggal |
Semua sesi yang cocok dengan aturan pengambilan sampel |
Beberapa sesi (rentang waktu, ID sesi, atau grup log penuh) |
|
Kebenaran dasar |
Melalui |
Tidak didukung |
Via |
|
Hasil |
Respon sinkron |
CloudWatch metrik dan dasbor |
Ringkasan agregat dengan rata-rata per evaluator, ditambah detail per sesi di CloudWatch |
|
Kasus penggunaan |
Dev-time cek spot, CI/CD |
Pemantauan produksi |
Pengukuran dasar, pre/post perbandingan, pengujian regresi |