Terminologi evaluasi
Memahami konsep dan terminologi kunci sangat penting untuk menggunakan AgentCore Evaluasi secara efektif. Istilah-istilah berikut mendefinisikan komponen inti dan proses yang terlibat dalam evaluasi agen.
Topik
Kerangka Agen
Kerangka kerja agen menyediakan komponen dasar untuk membangun, mengatur, dan menjalankan aplikasi berbasis agen. Kerangka kerja mendefinisikan struktur seperti langkah, alat, aliran kontrol, dan manajemen memori. Kerangka kerja industri yang umum termasuk Strands Agents
AgentCore Evaluasi saat ini mendukung Strands Agents dan kerangka kerja LangGraphagen.
Perpustakaan Instrumentasi
Pustaka instrumentasi merekam telemetri yang dihasilkan oleh agen Anda selama eksekusi. Telemetri ini dapat mencakup jejak, bentang, panggilan alat, pemanggilan model, dan langkah perantara. Pustaka seperti OpenTelemetrydan OpenInferencemenawarkan API standar dan konvensi semantik yang memungkinkan Anda menangkap perilaku agen dengan sedikit perubahan kode. Instrumentasi diperlukan untuk pengumpulan dan evaluasi jejak.
AgentCore Evaluasi saat ini mendukung OpenTelemetrydan OpenInferencesebagai pustaka instrumentasi.
Agen Instrumentasi
Agen instrumentasi secara otomatis menangkap telemetri dari kode aplikasi, memprosesnya, dan mengekspornya ke layanan backend untuk penyimpanan atau evaluasi. Alat seperti ADOT (AWS Distro for OpenTelemetry) menyediakan agen instrumentasi otomatis yang netral vendor dan siap produksi yang secara dinamis menyuntikkan bytecode untuk menangkap jejak tanpa perubahan kode. Agen adalah komponen kunci dalam memungkinkan evaluasi otomatis.
AgentCore Evaluasi saat ini mendukung ADOT (AWS Distro for OpenTelemetry) sebagai agen instrumentasi.
Sesi
Sesi merupakan pengelompokan logis interaksi terkait dari satu pengguna atau alur kerja. Sesi mungkin berisi satu atau lebih jejak. Sesi membantu Anda melihat dan mengevaluasi perilaku agen di seluruh interaksi multi-langkah, daripada berfokus pada permintaan individu.
Jejak
Jejak adalah catatan lengkap dari eksekusi atau permintaan agen tunggal. Sebuah jejak berisi satu atau lebih bentang, yang mewakili operasi individu yang dilakukan selama eksekusi itu. Jejak memberikan visibilitas ujung ke ujung ke dalam keputusan agen dan penggunaan alat.
Panggilan Alat
Panggilan alat adalah rentang yang mewakili pemanggilan fungsi eksternal, API, atau kemampuan agen. Rentang panggilan alat biasanya menangkap informasi seperti nama alat, parameter input, waktu eksekusi, dan output. Detail panggilan alat digunakan untuk mengevaluasi apakah agen memilih dan menggunakan alat dengan benar dan efisien.
Referensi Free Large Language Models (LLM) sebagai juri
Large Language Models (LLM) sebagai juri mengacu pada metode evaluasi yang menggunakan model bahasa besar (LLM) untuk secara otomatis menilai kualitas, kebenaran, atau efektivitas agen atau output model lain. Alih-alih mengandalkan tinjauan manual atau pemeriksaan berbasis aturan, LLM diminta dengan kriteria evaluasi dan menghasilkan skor, label, atau penjelasan berdasarkan input dan output yang dievaluasi. Tidak seperti evaluasi tradisional yang mengandalkan data kebenaran dasar, LLM-as-a-judge metode bergantung pada pengetahuan internal model untuk membuat penilaian. Pendekatan ini memungkinkan penilaian kualitatif yang terukur, konsisten, dan dapat disesuaikan, seperti kebenaran, kualitas penalaran, atau kepatuhan instruksi, di sejumlah besar interaksi agen atau respons model.