Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Mengevaluasi model dasar pembuatan teks di Studio
catatan
Evaluasi Model Yayasan (FMEval) sedang dalam rilis pratinjau untuk Amazon SageMaker Clarify dan dapat berubah.
penting
Untuk menggunakan Evalu SageMaker asi Model Clarify Foundation, Anda harus meningkatkan ke pengalaman Studio baru. Pada 30 November 2023, pengalaman Amazon SageMaker Studio sebelumnya sekarang bernama Amazon SageMaker Studio Classic. Fitur evaluasi pondasi hanya dapat digunakan dalam pengalaman yang diperbarui. Untuk informasi tentang cara memperbarui Studio, lihatMigrasi dari Amazon SageMaker Studio Classic. Untuk informasi tentang menggunakan aplikasi Studio Classic, lihatAmazon SageMaker Studio Klasik.
Amazon SageMaker JumpStart memiliki integrasi dengan Evaluasi Model SageMaker Clarify Foundation (FMEval) di Studio. Jika JumpStart model memiliki kemampuan evaluasi bawaan yang tersedia, Anda dapat memilih Evaluasi di sudut kanan atas halaman detail model di JumpStart Studio UI. Untuk informasi selengkapnya tentang menavigasi UI JumpStart Studio, lihatBuka JumpStart di Studio,
Gunakan Amazon SageMaker JumpStart untuk mengevaluasi model dasar berbasis teks dengan FMEval. Anda dapat menggunakan evaluasi model ini untuk membandingkan kualitas model dan metrik tanggung jawab untuk satu model, antara dua model, atau antara versi berbeda dari model yang sama, untuk membantu Anda mengukur risiko model. FMEval dapat mengevaluasi model berbasis teks yang melakukan tugas-tugas berikut:
-
Open-ended Gener asi — Produksi respons alami manusia terhadap teks yang tidak memiliki struktur yang telah ditentukan sebelumnya.
-
Ringkasan teks - Pembuatan ringkasan ringkas dan ringkas sambil mempertahankan makna dan informasi kunci yang terkandung dalam teks yang lebih besar.
-
Pertanyaan Menjawab — Generasi jawaban dalam bahasa alami untuk sebuah pertanyaan.
-
Klasifikasi — Penugasan kelas, seperti
positiveversusnegativeke bagian teks berdasarkan isinya.
Anda dapat menggunakan FMEval untuk mengevaluasi respons model secara otomatis berdasarkan tolok ukur tertentu. Anda juga dapat mengevaluasi respons model terhadap kriteria Anda sendiri dengan membawa kumpulan data prompt Anda sendiri. FMEval menyediakan antarmuka pengguna (UI) yang memandu Anda melalui pengaturan dan konfigurasi pekerjaan evaluasi. Anda juga dapat menggunakan pustaka FMEval di dalam kode Anda sendiri.
Setiap evaluasi membutuhkan kuota untuk dua contoh:
-
Instance hosting — Sebuah instance yang meng-host dan menerapkan LLM.
-
Instance evaluasi — Sebuah instance yang digunakan untuk meminta dan melakukan evaluasi LLM pada instans hosting.
Jika LLM Anda sudah digunakan, berikan titik akhir, dan SageMaker AI akan menggunakan instance hosting Anda untuk meng-host dan menerapkan LLM.
Jika Anda mengevaluasi JumpStart model yang belum diterapkan ke akun Anda, FMEval membuat instance hosting sementara untuk Anda di akun Anda, dan menyimpannya hanya digunakan selama evaluasi Anda. FMEval menggunakan instance default yang JumpStart merekomendasikan untuk LLM yang dipilih sebagai instans hosting Anda. Anda harus memiliki kuota yang cukup untuk contoh yang direkomendasikan ini.
Setiap evaluasi juga menggunakan contoh evaluasi untuk memberikan petunjuk dan menilai tanggapan dari LLM. Anda juga harus memiliki kuota dan memori yang cukup untuk menjalankan algoritma evaluasi. Persyaratan kuota dan memori dari instance evaluasi umumnya lebih kecil daripada yang diperlukan untuk instance hosting. Kami sarankan memilih ml.m5.2xlarge instance. Untuk informasi selengkapnya tentang kuota dan memori, lihatMengatasi kesalahan saat membuat pekerjaan evaluasi model di Amazon SageMaker AI.
Evaluasi otomatis dapat digunakan untuk menilai LLM di dimensi berikut:
-
Akurasi - Untuk ringkasan teks, jawaban pertanyaan, dan klasifikasi teks
-
Kekokohan semantik - Untuk pembuatan terbuka, ringkasan teks, dan tugas klasifikasi teks
-
Pengetahuan faktual — Untuk generasi terbuka
-
Stereotip cepat - Untuk generasi terbuka
-
Toksisitas — Untuk generasi terbuka, ringkasan teks, dan jawaban pertanyaan
Anda juga dapat menggunakan evaluasi manusia untuk mengevaluasi respons model secara manual. UI FMEval memandu Anda melalui alur kerja memilih satu atau lebih model, menyediakan sumber daya, dan menulis instruksi untuk dan menghubungi tenaga kerja manusia Anda. Setelah evaluasi manusia selesai, hasilnya ditampilkan di FMEval.
Anda dapat mengakses evaluasi model melalui halaman JumpStart arahan di Studio dengan memilih model untuk dievaluasi dan kemudian memilih Evaluate. Perhatikan bahwa tidak semua JumpStart model memiliki kemampuan evaluasi yang tersedia. Untuk informasi selengkapnya tentang cara mengonfigurasi, menyediakan, dan menjalankan FMEval, lihat Apa itu Evaluasi Model Dasar?