View a markdown version of this page

A/B pengujian - Batu Dasar Amazon AgentCore

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

A/B pengujian

A/B pengujian membagi lalu lintas produksi langsung antara dua varian dan terus mengevaluasi kinerja dengan signifikansi statistik. AgentCore Gateway menangani perutean lalu lintas; kode agen Anda tidak berubah.

A/B pengujian adalah langkah validasi dalam loop peningkatan peng AgentCore optimalan. Setelah membuat rekomendasi dan memvalidasinya dengan evaluasi batch offline, Anda menjalankan A/B pengujian untuk mengonfirmasi bahwa perubahan meningkatkan kinerja pada lalu lintas langsung sebelum melakukan peluncuran penuh. Anda dapat merutekan lalu lintas ke AgentCore Runtimes terpisah (berbasis target) atau mengirimkan konfigurasi yang berbeda ke Run AgentCore time yang sama (bundel konfigurasi).

Kapan menggunakan A/B pengujian

Gunakan A/B pengujian saat Anda perlu:

  • Validasi rekomendasi sebelum merutekan semua lalu lintas produksi ke konfigurasi yang dioptimalkan.

  • Bandingkan dua versi model (misalnya, berpindah dari satu model dasar ke model pondasi lainnya) pada lalu lintas langsung dengan ketelitian statistik.

  • Ukur dampak perubahan cepat di seluruh sesi pengguna nyata daripada set pengujian yang dikuratori.

  • Secara bertahap luncurkan kemampuan baru (alat baru, prompt sistem yang diperbarui) dengan memvalidasinya pada subset lalu lintas langsung sebelum penerapan penuh.

Cara kerjanya

A/B Tes mengikuti aliran ini:

  1. Anda memulai A/B pengujian denganagentcore run ab-test, menentukan AgentCore Gateway yang sudah digunakan, dua varian (kontrol dan perawatan), bobot lalu lintas, dan konfigurasi evaluasi online untuk penilaian. (Peran eksekusi bersifat opsional — --role-arn lewati untuk membawanya sendiri, atau biarkan CLI membuatnya.) Setiap varian mereferensi AgentCore kan target Gateway atau versi bundel konfigurasi. Tes mulai BERJALAN segera setelah perintah kembali (gunakan --disable-on-create untuk memulainya berhenti).

  2. AgentCore Gateway membagi lalu lintas. Setelah pengujian berjalan, gateway membagi lalu lintas masuk antara dua varian berdasarkan ID sesi runtime. Penugasan bersifat lengket; ID sesi yang diberikan selalu mengarahkan ke varian yang sama.

  3. Nilai evaluasi online setiap sesi. Konfigurasi evaluasi online yang Anda tentukan menjalankan evaluator terhadap setiap sesi saat selesai. Pipa agregasi A/B uji memetakan skor ke varian.

  4. Layanan menghitung signifikansi statistik. Seiring bertambahnya ukuran sampel, layanan menghitung metrik per evaluator untuk setiap varian: skor rata-rata, perubahan absolut dan persen, nilai-p, interval kepercayaan, dan tanda signifikansi. Nilai p di bawah 0,05 menunjukkan perbedaannya signifikan secara statistik. Hasil jajak pendapat dengan agentcore view ab-test <id> kapan saja tanpa mempengaruhi validitas statistik.

  5. Anda mempromosikan varian pengobatan. Ketika hasilnya signifikan, jalankan agentcore promote ab-test -i <id> untuk menghentikan tes dan tulis varian perawatan ke dalamagentcore.json, lalu agentcore deploy luncurkan. (Anda juga bisa agentcore stop ab-test -i <id> tanpa mempromosikan.)

A/B pola uji

A/B tes mendukung dua pola konfigurasi varian:

Target-based varian

Gunakan saat perubahan termasuk perubahan kode, peningkatan kerangka kerja, atau ketika Anda ingin membandingkan implementasi agen yang sama sekali berbeda. Setiap varian merutekan ke target AgentCore Gateway yang berbeda yang menunjuk ke titik akhir runtime yang berbeda.

Varian bundel konfigurasi

Gunakan bila perubahan murni konfigurasi (prompt sistem, ID model, atau deskripsi alat). Kedua varian berjalan pada AgentCore Runtime yang sama dengan versi bundel konfigurasi yang berbeda. AgentCore Gateway menyuntikkan referensi bundel ke setiap permintaan melalui header bagasi W3C, yang dapat digunakan runtime untuk menarik konfigurasi menggunakan SDK. AgentCore

Memilih pola
Aspek Target-based varian Varian bundel konfigurasi

Apa yang bervariasi

Seluruh titik akhir runtime (kode, kerangka kerja, model)

Prompt sistem, deskripsi alat, parameter model

Perutean

Target berbeda per varian

Target yang sama, bundel konfigurasi yang berbeda

Konfigurasi evaluasi

Satu konfigurasi eval online per AgentCore Runtime

Konfigurasi eval online tunggal yang dibagikan

Kapan harus digunakan

Perubahan kode, peningkatan kerangka kerja, membandingkan agen yang berbeda

Configuration-only perubahan pada AgentCore Runtime tunggal

Topik