Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Mengevaluasi model terlatih Anda
Resep evaluasi adalah file konfigurasi YAML yang menentukan bagaimana pekerjaan evaluasi model Amazon Nova Anda dijalankan. Dengan resep ini, Anda dapat menilai kinerja model dasar atau terlatih terhadap tolok ukur umum atau kumpulan data kustom Anda sendiri. Metrik dapat disimpan di Amazon S3 atau TensorBoard. Evaluasi menyediakan metrik kuantitatif yang membantu Anda menilai kinerja model di berbagai tugas untuk menentukan apakah penyesuaian lebih lanjut diperlukan.
Evaluasi model adalah proses offline, di mana model diuji terhadap tolok ukur tetap dengan jawaban yang telah ditentukan sebelumnya. Mereka tidak dinilai secara real-time atau terhadap interaksi pengguna langsung. Untuk evaluasi real-time, Anda dapat mengevaluasi model setelah digunakan ke Amazon Bedrock dengan memanggil API runtime Amazon Bedrock.
catatan
Anda juga dapat mengevaluasi model Anda menggunakan Inspect AI, kerangka evaluasi sumber terbuka yang mendukung tolok ukur standar dan tugas evaluasi khusus.
penting
Wadah evaluasi hanya mendukung pos pemeriksaan yang diproduksi oleh platform pelatihan yang sama. Pos pemeriksaan yang dibuat dengan hanya SageMaker HyperPod dapat dievaluasi menggunakan alur kerja SageMaker HyperPod evaluasi, dan pos pemeriksaan yang dibuat dengan pekerjaan SageMaker pelatihan hanya dapat dievaluasi menggunakan alur kerja evaluasi pekerjaan SageMaker pelatihan. Mencoba mengevaluasi pos pemeriksaan dari platform yang berbeda akan mengakibatkan kegagalan.