Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Evaluasi batch
Evaluasi batch menjalankan evaluator terhadap beberapa sesi agen dalam satu pekerjaan dengan orkestrasi sisi server. Tidak seperti evaluasi sesuai permintaan di mana Anda mengumpulkan rentang dan memanggil Evaluate API sendiri, evaluasi batch menangani penemuan sesi, pengumpulan rentang, dan penilaian sepenuhnya di sisi layanan. Anda mengirimkan pekerjaan, dan layanan memproses semua sesi pencocokan dan mengembalikan hasil agregat.
Gunakan evaluasi batch saat Anda perlu:
-
Ukur garis dasar sebelum membuat perubahan pada prompt, alat, atau model agen Anda.
-
Validasi perbaikan dengan membandingkan skor sebelum dan sesudah perubahan konfigurasi.
-
Jalankan tes regresi di serangkaian sesi atau skenario yang dikuratori.
-
Pantau kualitas secara berkala di seluruh sesi produksi dari jendela waktu tertentu.
Cara kerjanya
Pekerjaan evaluasi batch mengikuti alur ini:
-
Anda memulai pekerjaan dengan menentukan sumber sesi (tempat menemukan sesi agen) dan konfigurasi evaluasi (evaluator mana yang akan dijalankan). Secara opsional, Anda memberikan metadata kebenaran dasar untuk penilaian berbasis referensi.
-
Layanan menemukan sesi dari Log berdasarkan grup CloudWatch log dan filter yang Anda tentukan.
-
Layanan menjalankan evaluator terhadap setiap sesi yang ditemukan. Setiap evaluator menilai setiap sesi secara independen. Jika kebenaran dasar diberikan, evaluator yang mendukung penilaian berbasis referensi menggunakannya.
-
Anda melakukan polling untuk hasil. Transisi pekerjaan melalui
PENDING→IN_PROGRESS→COMPLETED(atauFAILED). Setelah selesai, respons mencakup ringkasan agregat dengan skor rata-rata per evaluator, jumlah sesi, dan penggunaan token. -
Per-session detail tersedia di CloudWatch Log di lokasi yang ditentukan
outputDataConfigdalam respons.
Perbandingan dengan jenis evaluasi lainnya
| Aspek | On-demand | Online | Batch |
|---|---|---|---|
|
Pemicu |
Caller-initiated, sinkron |
Berkelanjutan, didorong oleh peristiwa |
Caller-initiated, asinkron |
|
Sumber sesi |
Penelepon menyediakan rentang sebaris |
Menonton grup log |
Layanan menemukan dari CloudWatch Log |
|
Lingkup |
Sesi tunggal |
Semua sesi yang cocok dengan aturan sampling |
Beberapa sesi (rentang waktu, ID sesi, atau grup log penuh) |
|
Kebenaran dasar |
Melalui |
Tidak didukung |
Melalui |
|
Hasil |
Respon sinkron |
CloudWatch metrik dan dasbor |
Ringkasan agregat dengan rata-rata per evaluator, ditambah detail per sesi di CloudWatch |
|
Kasus penggunaan |
Dev-time pemeriksaan tempat, CI/CD |
Pemantauan produksi |
Pengukuran dasar, pre/post perbandingan, pengujian regresi |