Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Mengevaluasi kinerja sumber daya Amazon Bedrock
Gunakan evaluasi Amazon Bedrock untuk mengevaluasi kinerja dan efektivitas model Amazon Bedrock dan basis pengetahuan, serta model dan sumber Retrieval Augmented Generation (RAG) di luar Amazon Bedrock. Amazon Bedrock dapat menghitung metrik kinerja seperti ketahanan semantik model dan kebenaran basis pengetahuan dalam mengambil informasi dan menghasilkan respons. Untuk evaluasi model, Anda juga dapat menggunakan tim pekerja manusia untuk menilai dan memberikan masukan mereka untuk evaluasi.
Evaluasi otomatis, termasuk evaluasi yang menggunakan Model Bahasa Besar (LLM), menghasilkan skor dan metrik yang dihitung yang membantu Anda menilai efektivitas model dan basis pengetahuan. Human-based evaluasi menggunakan tim orang yang memberikan peringkat dan preferensi mereka dalam kaitannya dengan metrik tertentu.
- Pekerjaan evaluasi model terprogram
-
Pekerjaan evaluasi model terprogram memungkinkan Anda untuk dengan cepat mengevaluasi kemampuan model untuk melakukan tugas. Anda dapat menyediakan kumpulan data prompt kustom Anda sendiri yang telah disesuaikan dengan kasus penggunaan tertentu, atau Anda dapat menggunakan dataset bawaan yang tersedia.
- Model pekerjaan evaluasi yang menggunakan pekerja manusia
-
Pekerjaan evaluasi model yang menggunakan pekerja manusia memungkinkan Anda membawa masukan manusia ke proses evaluasi model. Mereka bisa menjadi karyawan perusahaan Anda atau sekelompok ahli materi pelajaran dari industri Anda.
- Model pekerjaan evaluasi yang menggunakan model juri
-
Pekerjaan evaluasi model yang menggunakan model juri memungkinkan Anda untuk dengan cepat mengevaluasi respons model melalui menggunakan LLM kedua. LLM kedua menilai respons dan memberikan penjelasan untuk setiap respons.
- Evaluasi RAG yang menggunakan Model Bahasa Besar (LLM)
-
LLM-based evaluasi menghitung metrik kinerja untuk basis pengetahuan. Metrik mengungkapkan apakah sumber RAG atau Pangkalan Pengetahuan Amazon Bedrock mampu mengambil informasi yang sangat relevan dan menghasilkan tanggapan yang berguna dan sesuai. Anda menyediakan kumpulan data yang berisi petunjuk atau kueri pengguna untuk mengevaluasi bagaimana basis pengetahuan mengambil informasi dan menghasilkan tanggapan untuk kueri yang diberikan. Dataset juga harus menyertakan 'kebenaran dasar' atau teks yang diharapkan diambil dan tanggapan untuk kueri sehingga evaluasi dapat memeriksa apakah basis pengetahuan Anda selaras dengan apa yang diharapkan.
Dukungan pekerjaan evaluasi model menggunakan jenis model Amazon Bedrock berikut:
-
Model fondasi
Model Amazon Bedrock Marketplace
-
Model pondasi yang disesuaikan
-
Model pondasi yang diimpor
-
Router yang cepat
-
Model yang telah Anda beli Provisioned Throughput
Topik
Membuat pekerjaan evaluasi model yang menggunakan pekerja manusia di Amazon Bedrock
Mengevaluasi kinerja model menggunakan LLM lain sebagai juri
Mengevaluasi kinerja sumber RAG menggunakan evaluasi Amazon Bedrock
Izin Cross Origin Resource Sharing (CORS) yang diperlukan pada bucket S3
Tinjau laporan pekerjaan evaluasi model dan metrik di Amazon Bedrock
Manajemen data dan enkripsi dalam pekerjaan evaluasi Amazon Bedrock
CloudTrail peristiwa manajemen dalam pekerjaan evaluasi model