View a markdown version of this page

Evaluasi kinerja agen dengan Amazon Bedrock AgentCore Evaluations - Batuan Dasar Amazon AgentCore

Evaluasi kinerja agen dengan Amazon Bedrock AgentCore Evaluations

Amazon Bedrock AgentCore Evaluations menyediakan alat penilaian otomatis untuk mengukur seberapa baik agen atau alat Anda melakukan tugas tertentu, menangani kasus tepi, dan menjaga konsistensi di berbagai input dan konteks. Layanan ini memungkinkan pengoptimalan berbasis data dan memastikan agen Anda memenuhi standar kualitas sebelum dan sesudah penerapan.

AgentCore Evaluasi terintegrasi dengan kerangka kerja agen populer termasuk Strands dan LangGraphdengan OpenTelemetrydan OpenInferencepustaka instrumentasi. Di bawah tenda, jejak dari agen ini dikonversi ke format terpadu dan dinilai menggunakan LLM-as-a-Judge teknik untuk evaluator bawaan dan kustom.

Setiap evaluator memiliki Nama Sumber Daya Amazon (ARN) unik dan kebijakan sumber daya yang melekat padanya. ARN Evaluator mengikuti format ini:

arn:aws:bedrock-agentcore:::evaluator/Builtin.Helpfulness (for built-in evaluators)
arn:aws:bedrock-agentcore:region:account:evaluator/my-evaluator-id (for custom evaluators)

Built-in evaluator bersifat publik dan dapat diakses oleh semua pengguna. Sumber evaluasi kustom bersifat pribadi dan hanya dapat diakses oleh pengguna yang secara eksplisit diberikan akses. Untuk memberikan akses, Anda dapat menggunakan kebijakan berbasis sumber daya IAM untuk evaluator dan konfigurasi evaluasi, serta kebijakan berbasis identitas IAM untuk pengguna dan peran.

Secara default, Anda dapat membuat hingga 1.000 konfigurasi evaluasi per AWS Wilayah dalam AWS akun, dengan hingga 100 aktif kapan saja. Layanan ini mendukung hingga 1 juta token input dan output per menit per akun untuk wilayah yang luas.