Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Mengevaluasi kinerja model menggunakan LLM lain sebagai juri
Dengan pekerjaan evaluasi model yang menggunakan model juri, Amazon Bedrock menggunakan LLM untuk menilai respons model lain dan memberikan penjelasan tentang bagaimana skor masing-masing prompt dan respons pasangan. Skor dan penjelasan tersedia di konsol Amazon Bedrock melalui halaman
Evaluasi model semacam ini membutuhkan dua model yang berbeda, model generator dan model evaluator. Anda menentukan prompt untuk model generator dalam kumpulan data, dan model evaluator menilai respons terhadap prompt tersebut berdasarkan metrik yang Anda pilih.
Kartu ringkasan metrik di konsol menampilkan histogram yang menunjukkan berapa kali respons menerima skor tertentu, dan penjelasan skor untuk lima prompt pertama yang ditemukan dalam kumpulan data Anda. Laporan pekerjaan evaluasi lengkap tersedia di bucket Amazon S3 yang Anda tentukan saat membuat pekerjaan evaluasi model.
Saat membuat pekerjaan evaluasi model, Anda dapat memilih model Amazon Bedrock sebagai model generator, atau Anda dapat mengevaluasi model non-Amazon Bedrock dengan memberikan data respons inferensi Anda sendiri dalam kumpulan data prompt. Jika Anda memberikan data respons Anda sendiri, Amazon Bedrock melewatkan langkah pemanggilan model dan langsung mengevaluasi data yang Anda berikan.
Untuk menilai respons model generator, Amazon Bedrock menyediakan satu set metrik bawaan yang dapat Anda pilih. Setiap metrik menggunakan prompt yang berbeda untuk model evaluator. Anda juga dapat menentukan metrik khusus Anda sendiri untuk kasus bisnis khusus Anda. Lihat Gunakan metrik untuk memahami kinerja model untuk mempelajari selengkapnya.
Model yang didukung
Model evaluator yang didukung (metrik bawaan)
Untuk membuat pekerjaan evaluasi yang menggunakan LLM sebagai juri dengan metrik bawaan Amazon Bedrock, Anda memerlukan akses ke setidaknya salah satu model juri dalam daftar berikut. Untuk mempelajari lebih lanjut tentang mendapatkan akses ke model dan ketersediaan Wilayah, lihatMinta akses ke model.
-
Amazon Nova Pro –
amazon.nova-pro-v1:0 -
Amazon Nova 2 Lite —
amazon.nova-2-lite-v1:0 -
Amazon Nova Mikro —
amazon.nova-micro-v1:0 -
Amazon Nova Premier —
amazon.nova-premier-v1:0 -
AnthropicClaude 3.5 Sonnetv-1 —
anthropic.claude-3-5-sonnet-20240620-v1:0 -
AnthropicClaude 3.5 SonnetV2 —
anthropic.claude-3-5-sonnet-20241022-v2:0 -
Anthropic Claude 3.7 Sonnet –
anthropic.claude-3-7-sonnet-20250219-v1:0 -
Anthropic Claude Sonnet 4 –
anthropic.claude-sonnet-4-20250514-v1:0 -
Anthropic Claude 3 Haiku –
anthropic.claude-3-haiku-20240307-v1:0 -
Anthropic Claude 3.5 Haiku –
anthropic.claude-3-5-haiku-20241022-v1:0 -
Antropik Claude Haiku 4.5 —
anthropic.claude-haiku-4-5-20251001-v1:0 -
Antropik Claude Opus 4.5 —
anthropic.claude-opus-4-5-20251101-v1:0 -
OpenAI — GPT-5.4
openai.gpt-5.4 -
OpenAI — GPT-5.5
openai.gpt-5.5 -
Claude Sonet Antropik 4.6 —
anthropic.claude-sonnet-4-6 -
Antropik Claude Opus 4.6 —
anthropic.claude-opus-4-6-v1 -
Antropik Claude Opus 4.7 —
anthropic.claude-opus-4-7 -
Antropik Claude Opus 4.8 —
anthropic.claude-opus-4-8 -
Antropik Claude Sonnet 4.0 —
anthropic.claude-sonnet-4-20250514-v1:0 -
Claude Sonet Antropik 4.5 —
anthropic.claude-sonnet-4-5-20250929-v1:0 -
Meta Llama 3.1 70B Instruct –
meta.llama3-1-70b-instruct-v1:0 -
Mistral Large –
mistral.mistral-large-2402-v1:0
Rute permintaan inferensi model lintas Wilayah AWS dengan inferensi lintas wilayahProfil inferensi lintas wilayah didukung untuk model yang terdaftar. Untuk mempelajari selengkapnya, lihat Profil inferensi lintas wilayah yang didukung.
Model evaluator yang didukung (metrik khusus)
Untuk membuat pekerjaan evaluasi yang menggunakan LLM sebagai juri dengan metrik khusus, Anda memerlukan akses ke setidaknya salah satu model juri dalam daftar berikut.
-
Mistral Large24.02 —
mistral.mistral-large-2402-v1:0 -
Mistral Large24.07 —
mistral.mistral-large-2407-v1:0 -
AnthropicClaude 3.5 Sonnetv-1 —
anthropic.claude-3-5-sonnet-20240620-v1:0 -
AnthropicClaude 3.5 SonnetV2 —
anthropic.claude-3-5-sonnet-20241022-v2:0 -
Anthropic Claude 3.7 Sonnet –
anthropic.claude-3-7-sonnet-20250219-v1:0 -
Anthropic Claude Sonnet 4 –
anthropic.claude-sonnet-4-20250514-v1:0 -
AnthropicClaude 3 Haiku3 —
anthropic.claude-3-haiku-20240307-v1:0 -
AnthropicClaude 3 Haiku3.5 —
anthropic.claude-3-5-haiku-20241022-v1:0 -
Meta Llama 3.1 70B Instruct –
meta.llama3-1-70b-instruct-v1:0 -
Meta Llama 3.3 70B Instruct –
meta.llama3-3-70b-instruct-v1:0 -
Amazon Nova Pro –
amazon.nova-pro-v1:0 -
Amazon Nova 2 Lite —
amazon.nova-2-lite-v1:0 -
Amazon Nova Mikro —
amazon.nova-micro-v1:0 -
Amazon Nova Premier —
amazon.nova-premier-v1:0 -
Antropik Claude Haiku 4.5 —
anthropic.claude-haiku-4-5-20251001-v1:0 -
Antropik Claude Opus 4.5 —
anthropic.claude-opus-4-5-20251101-v1:0 -
OpenAI — GPT-5.4
openai.gpt-5.4 -
OpenAI — GPT-5.5
openai.gpt-5.5 -
Claude Sonet Antropik 4.6 —
anthropic.claude-sonnet-4-6 -
Antropik Claude Opus 4.6 —
anthropic.claude-opus-4-6-v1 -
Antropik Claude Opus 4.7 —
anthropic.claude-opus-4-7 -
Antropik Claude Opus 4.8 —
anthropic.claude-opus-4-8 -
Antropik Claude Sonnet 4.0 —
anthropic.claude-sonnet-4-20250514-v1:0 -
Claude Sonet Antropik 4.5 —
anthropic.claude-sonnet-4-5-20250929-v1:0
Rute permintaan inferensi model lintas Wilayah AWS dengan inferensi lintas wilayahProfil inferensi lintas wilayah didukung untuk model yang terdaftar. Untuk mempelajari selengkapnya, lihat Profil inferensi lintas wilayah yang didukung.
Model generator yang didukung
Anda dapat menggunakan jenis model berikut di Amazon Bedrock sebagai model generator dalam pekerjaan evaluasi. Anda juga dapat membawa data respons inferensi Anda sendiri dari model non-Amazon Bedrock.
-
Model pondasi — Menggunakan model dengan Bedrock
-
Model yang dipanggil melalui OpenAI Responses API di
bedrock-mantletitik akhir — API Respons pada titik akhir mantel batuan dasar -
Model Amazon Bedrock Marketplace - Amazon Bedrock Marketplace
-
Model pondasi yang disesuaikan - Sesuaikan model Anda untuk meningkatkan kinerjanya untuk kasus penggunaan Anda
-
Model pondasi yang diimpor - Gunakan Impor model khusus untuk mengimpor model sumber terbuka yang disesuaikan ke Amazon Bedrock
-
Router yang cepat — Memahami perutean prompt cerdas di Amazon Bedrock
-
Model yang telah Anda beli Provisioned Throughput — Tingkatkan kapasitas pemanggilan model dengan Provisioned Throughput di Amazon Bedrock
OpenAI Dukungan konsol API Tanggapan tidak tersedia
Anda dapat menggunakan model generator yang dipanggil melalui OpenAI Responses API hanya melalui AWS CLI dan Amazon Bedrock API. Konsol Amazon Bedrock tidak mendukung pemilihan model ini.