View a markdown version of this page

Mengevaluasi kinerja agen dengan Amazon Bedrock AgentCore Evaluations - Batu Dasar Amazon AgentCore

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Mengevaluasi kinerja agen dengan Amazon Bedrock AgentCore Evaluations

Amazon Bedrock AgentCore Evaluations menyediakan alat penilaian otomatis untuk mengukur seberapa baik agen atau alat Anda melakukan tugas tertentu, menangani kasus tepi, dan menjaga konsistensi di berbagai input dan konteks. Layanan ini memungkinkan pengoptimalan berbasis data dan memastikan agen Anda memenuhi standar kualitas sebelum dan sesudah penerapan.

AgentCore Evaluasi terintegrasi dengan kerangka kerja agen populer termasuk Strands dan LangGraph dengan OpenTelemetry dan perpustakaan OpenInference instrumentasi. Di bawah tenda, jejak dari agen ini dikonversi ke format terpadu dan dinilai menggunakan LLM-as-a-Judge teknik untuk evaluator bawaan dan khusus.

Setiap evaluator memiliki Nama Sumber Daya Amazon (ARN) yang unik dan kebijakan sumber daya yang melekat padanya. ARN evaluator mengikuti format ini:

arn:aws:bedrock-agentcore:::evaluator/Builtin.Helpfulness (for built-in evaluators)
arn:aws:bedrock-agentcore:region:account:evaluator/my-evaluator-id (for custom evaluators)

Built-in evaluator bersifat publik dan dapat diakses oleh semua pengguna. Sumber daya evaluasi khusus bersifat pribadi dan hanya dapat diakses oleh pengguna yang secara eksplisit diberikan akses. Untuk memberikan akses, Anda dapat menggunakan kebijakan berbasis sumber daya IAM untuk evaluator dan konfigurasi evaluasi, dan kebijakan berbasis identitas IAM untuk pengguna dan peran.

Secara default, Anda dapat membuat hingga 1.000 konfigurasi evaluasi per AWS Wilayah dalam AWS akun. Layanan ini mendukung hingga 1 juta token input dan output per menit per akun untuk wilayah besar.