Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Membuat pekerjaan evaluasi model menggunakan metrik khusus
Untuk membuat pekerjaan evaluasi yang menggunakan metrik khusus, Anda perlu memberikan yang berikut:
-
Prompt yang berisi instruksi terperinci untuk model hakim untuk digunakan
-
Model evaluator yang ingin Anda gunakan untuk metrik kustom Anda
Anda juga dapat menentukan skala peringkat (skema keluaran) yang dapat digunakan model juri untuk menilai respons model generator.
Anda dapat membuat pekerjaan evaluasi dengan metrik khusus menggunakan Konsol Manajemen AWS, AWS Command Line Interface (AWS CLI), atau menggunakan Amazon Bedrock API. Gunakan petunjuk berikut untuk membuat pekerjaan evaluasi Anda. Untuk petunjuk dan panduan tentang membuat prompt untuk metrik Anda dan menentukan skala peringkat yang Anda tentukan selama pembuatan, lihatMembuat prompt untuk metrik kustom.
Saat Anda membuat pekerjaan evaluasi dengan satu atau beberapa metrik khusus, Amazon Bedrock menyimpan definisi metrik Anda sebagai file JSON di bucket S3 keluaran yang Anda tentukan. Anda dapat mengakses file-file ini dengan menavigasi kes3://. Untuk melihat format definisi JSON dari metrik khusus, lihatMembuat file JSON untuk membuat metrik khusus.S3-output-bucket-name/job-name/job-uuid/custom_metrics
Untuk membuat pekerjaan menggunakan instruksi berikut, Anda juga memerlukan dataset prompt. Jika Anda belum membuatnya, lihatBuat kumpulan data cepat untuk pekerjaan evaluasi model yang menggunakan model sebagai hakim.
Gunakan petunjuk berikut untuk membuat pekerjaan evaluasi model-as-a-juri dengan satu atau beberapa metrik khusus
- Console
-
-
Buka konsol https://console.aws.amazon.com/bedrock/home
Amazon Bedrock. -
Di panel sebelah kiri di bawah Inferensi dan penilaian, pilih Evaluasi.
-
Di panel Evaluasi model, pilih Buat dan pilih Otomatis: Model sebagai juri.
-
Masukkan detail evaluasi model Anda dengan melakukan hal berikut:
-
Di panel detail evaluasi model di bawah Nama evaluasi, masukkan nama untuk pekerjaan evaluasi Anda. Nama yang Anda pilih harus unik di dalam Anda Wilayah AWS.
-
Secara opsional, di bawah Deskripsi - opsional , masukkan deskripsi untuk pekerjaan evaluasi Anda.
-
Di bawah Model Evaluator, pilih Pilih model dan pilih model juri yang ingin Anda lakukan untuk melakukan pekerjaan evaluasi Anda. Perhatikan bahwa model yang Anda pilih di sini digunakan untuk mengevaluasi model generator Anda terhadap metrik bawaan yang Anda pilih. Anda dapat memilih model evaluator yang berbeda untuk digunakan untuk metrik kustom Anda di langkah selanjutnya.
-
-
Masukkan sumber inferensi untuk pekerjaan evaluasi Anda. Dengan evaluasi model Amazon Bedrock, Anda dapat mengevaluasi kinerja model Amazon Bedrock, atau model lain dengan menyediakan data respons inferensi Anda sendiri dalam kumpulan data prompt. Buat kumpulan data cepat untuk pekerjaan evaluasi model yang menggunakan model sebagai hakim Untuk memilih model Amazon Bedrock, lakukan hal berikut:
-
Di panel sumber inferensi, di bawah Pilih sumber pilih model batuan dasar.
-
Di bawah Pilih model, pilih Pilih model.
-
Di pop-up, pilih model yang ingin Anda evaluasi dan pilih Ter apkan.
-
(Opsional) untuk mengubah parameter inferensi model, untuk Konfigurasi inferensi, pilih update.
-
-
Untuk membawa data respons inferensi Anda sendiri, lakukan hal berikut:
-
Di panel sumber inferensi, di bawah Pilih sumber pilih B awa respons inferensi Anda sendiri.
-
Untuk Nama Sumber, masukkan nama untuk model yang Anda gunakan untuk membuat data respons. Nama yang Anda masukkan harus sesuai dengan
modelIdentifierparameter dalam dataset prompt Anda.
-
-
Pilih metrik bawaan yang ingin model evaluator menilai respons model generator Anda dengan memilihnya di panel Metrik.
-
Untuk menambahkan satu metrik khusus lagi, mulailah dengan memilih model evaluator yang ingin Anda gunakan untuk mengevaluasi metrik Anda. Di panel Metrik kustom, lakukan hal berikut:
-
Pilih Pilih model.
-
Di pop-up, pilih model yang ingin Anda gunakan.
-
Pilih Terapkan.
-
-
Di bawah Nama metrik, masukkan nama untuk metrik Anda.
-
Anda dapat mengonfigurasi metrik Anda dengan tiga cara: dengan menyediakan file JSON yang menentukan metrik, dengan mengedit prompt metrik bawaan yang ada dari template, atau dengan memasukkan prompt langsung di konsol untuk digunakan model evaluator.
Untuk membuat metrik dari file JSON, lakukan hal berikut:
-
Di bawah Pilih jenis metrik, pilih Impor file JSON.
-
Di bawah Impor file JSON, pilih Pilih file.
-
Menggunakan pemilih file, pilih file JSON dengan definisi metrik kustom Anda dan pilih Buka. Untuk mempelajari tentang skema untuk menentukan metrik khusus menggunakan file JSON, dan untuk melihat beberapa contoh file, lihatMembuat file JSON untuk membuat metrik khusus.
-
(Opsional) untuk membuat metrik lain, pilih Tambahkan metrik khusus. Anda dapat membuat hingga 10 metrik khusus untuk pekerjaan evaluasi.
Setelah selesai membuat metrik kustom, lanjutkan ke langkah 13 untuk mengonfigurasi kumpulan data untuk pekerjaan evaluasi.
-
-
Untuk membuat metrik kustom dari template bawaan, lakukan hal berikut:
-
Di bawah Pilih jenis metrik, pilih Gunakan templat.
-
Di bawah Pilih templat, gunakan daftar dropdown untuk memilih prompt metrik bawaan yang ada untuk digunakan sebagai titik awal untuk metrik kustom Anda.
-
Di bawah Instruk si edit prompt yang Anda pilih agar sesuai dengan kasus penggunaan Anda sendiri. Untuk praktik terbaik dan untuk daftar elemen yang diperlukan saat membuat prompt metrik kustom, lihatMembuat prompt untuk metrik kustom.
-
Jika Anda ingin pekerjaan evaluasi Anda menampilkan output terstruktur dengan skor peringkat, biarkan skema Output diaktifkan (disarankan) dic entang. Konfigurasi metrik Anda tidak perlu menyertakan skema keluaran, tetapi sebaiknya Anda mendefinisikannya. Jika Anda tidak menggunakan skema, hasil yang Anda lihat hanya akan menyertakan penjelasan tanpa skor atau visualisasi data.
-
Di bawah Jenis skala, pilih Numerik atau String sesuai dengan kasus penggunaan Anda, dan masukkan definisi skala dan deskripsi Anda di kotak teks. Untuk panduan dan praktik terbaik tentang menentukan skala keluaran, lihatMenentukan skema keluaran (skala peringkat).
-
(Opsional) untuk membuat metrik lain, pilih Tambahkan metrik khusus. Anda dapat membuat hingga 10 metrik khusus untuk pekerjaan evaluasi.
Setelah selesai membuat metrik kustom, lanjutkan ke langkah 13 untuk mengonfigurasi kumpulan data untuk pekerjaan evaluasi.
-
-
Untuk membuat metrik khusus dari awal di konsol, lakukan hal berikut:
-
Di bawah Pilih jenis metrik, pilih Kustom.
-
Di bawah Instruksi, masukkan prompt untuk metrik kustom Anda langsung di kotak teks. Untuk praktik terbaik dan untuk daftar elemen yang diperlukan saat membuat prompt metrik kustom, lihatKonstruksi yang cepat dan praktik terbaik.
-
Jika Anda ingin pekerjaan evaluasi Anda menampilkan output terstruktur dengan skor peringkat, biarkan skema Output diaktifkan (disarankan) dic entang. Konfigurasi metrik Anda tidak perlu menyertakan skema keluaran, tetapi sebaiknya Anda mendefinisikannya. Jika Anda tidak menggunakan skema, hasil yang Anda lihat hanya akan menyertakan penjelasan tanpa skor atau visualisasi data.
-
Di bawah Jenis skala, pilih numerik atau String sesuai dengan kasus penggunaan Anda, dan masukkan definisi skala dan deskripsi Anda di kotak teks. Untuk panduan dan praktik terbaik tentang menentukan skala keluaran, lihatMenentukan skema keluaran (skala peringkat).
-
(Opsional) untuk membuat yang lain, pilih Tambahkan metrik khusus. Anda dapat membuat hingga 10 metrik khusus untuk pekerjaan evaluasi.
Setelah selesai membuat metrik kustom, lanjutkan ke langkah berikutnya untuk mengonfigurasi kumpulan data untuk pekerjaan evaluasi.
-
-
Tentukan lokasi input dan output Anda untuk dataset dan hasil Anda dengan melakukan hal berikut:
-
Di panel Kumpulan Data di bawah Pilih dataset prompt, masukkan URI Amazon S3 untuk kumpulan data prompt Anda, atau pilih Jelajahi S3 dan pilih file Anda. Untuk melihat definisi format dataset prompt yang diperlukan untuk pekerjaan evaluasi model-as-a-hakim, lihat. Buat kumpulan data cepat untuk pekerjaan evaluasi model yang menggunakan model sebagai hakim
-
Di bawah Hasil evaluasi, masukkan lokasi Amazon S3 untuk Amazon Bedrock untuk menyimpan hasil Anda, atau pilih Jelajahi S3 untuk memilih lokasi.
-
-
Di bawah Peran IAM Amazon Bedrock - Izin, pilih Buat dan gunakan peran layanan baru agar Amazon Bedrock membuat peran IAM baru untuk pekerjaan evaluasi, atau pilih Gunakan peran layanan yang ada untuk memilih peran IAM yang ada. Untuk daftar izin yang diperlukan untuk membuat dan menjalankan pekerjaan evaluasi, lihatPrasyarat.
-
(Opsional) untuk menggunakan kunci KMS Anda sendiri untuk mengenkripsi data evaluasi Anda, di bawah KMS key - Opsional , centang Ku stomisasi pengaturan enkripsi (lanjutan) dan pilih kunci Anda. AWS KMS Secara default, Amazon Bedrock mengenkripsi data pekerjaan evaluasi Anda dengan kunci KMS yang AWS dimiliki.
-
Pilih Buat untuk menyelesaikan pembuatan pekerjaan evaluasi Anda.
-
- AWS CLI
-
Contoh berikut menunjukkan cara membuat
create-evaluation-jobpermintaan menggunakan AWS CLI untuk pekerjaan yang menyertakan metrik khusus. Pastikan ituapplicationTypeditentukan sebagaiModelEvaluation.Anda dapat mengevaluasi kinerja model di Amazon Bedrock, atau Anda dapat mengevaluasi model lain dengan menyediakan data respons inferensi Anda sendiri sebagai bagian dari kumpulan data prompt. Untuk mempelajari lebih lanjut tentang cara membuat dataset prompt menggunakan respons inferensi Anda sendiri, lihatBuat kumpulan data cepat untuk pekerjaan evaluasi model yang menggunakan model sebagai hakim.
contoh AWS CLI perintah dan file JSON untuk membuat pekerjaan evaluasi dengan metrik khusus untuk model Amazon Bedrock
aws bedrock create-evaluation-job --cli-input-json file://my_eval_job.json{ "jobName": "custom-metrics-maaj", "applicationType": "ModelEvaluation", "roleArn": "arn:aws:iam::111122223333:role/service-role/Amazon-Bedrock-Custom-Metric", "evaluationConfig": { "automated": { "datasetMetricConfigs": [{ "taskType": "General", "dataset": { "name": "text_dataset", "datasetLocation": { "s3Uri": "s3://amzn-s3-demo-bucket/input_datasets/text_dataset_input.jsonl" } }, "metricNames": [ "CustomMetric-Correctness-FloatRatingScale" ] }], "customMetricConfig": { "customMetrics": [{ "customMetricDefinition": { "name": "CustomMetric-Correctness-FloatRatingScale", "instructions": "<Your complete custom metric prompt including at least one {{input variable}}>", "ratingScale": [{ "definition": "Not at all", "value": { "floatValue": 0 } }, { "definition": "Somewhat", "value": { "floatValue": 1 } }, { "definition": "Mostly", "value": { "floatValue": 2 } } ] } } ], "evaluatorModelConfig": { "bedrockEvaluatorModels": [{ "modelIdentifier": "anthropic.claude-3-haiku-20240307-v1:0" }] } }, "evaluatorModelConfig": { "bedrockEvaluatorModels": [{ "modelIdentifier": "mistral.mistral-large-2402-v1:0" }] } } }, "inferenceConfig": { "models": [{ "bedrockModel": { "modelIdentifier": "anthropic.claude-v2", "inferenceParams": "{\"textGenerationConfig\":{\"maxTokenCount\":256,\"temperature\":0.25,\"topP\":0.25}}" } }] }, "outputDataConfig": { "s3Uri": "s3://amzn-s3-demo-destination-bucket/output/" } }catatan
Contoh file JSON berisi dua
evaluatorModelConfigobjek. Yang ada di dalamcustomMetricConfigobjek menentukan model evaluator yang akan digunakan dengan metrik khusus. Contoh lain menentukan model yang akan digunakan untuk metrik bawaan. Berhati-hatilah untuk menentukan kedua objek ini dengan benar.contoh AWS CLI perintah dan file JSON untuk membuat pekerjaan evaluasi dengan metrik khusus tempat Anda memberikan data respons inferensi Anda sendiri
aws bedrock create-evaluation-job --cli-input-json file://my_eval_job.json{ "jobName": "custom-metrics-maaj", "applicationType": "ModelEvaluation", "roleArn": "arn:aws:iam::111122223333:role/service-role/Amazon-Bedrock-Custom-Metric", "evaluationConfig": { "automated": { "datasetMetricConfigs": [{ "taskType": "General", "dataset": { "name": "text_dataset", "datasetLocation": { "s3Uri": "s3://amzn-s3-demo-bucket/input_datasets/text_dataset_input.jsonl" } }, "metricNames": [ "CustomMetric-Correctness-FloatRatingScale" ] }], "customMetricConfig": { "customMetrics": [{ "customMetricDefinition": { "name": "CustomMetric-Correctness-FloatRatingScale", "instructions": "<Your complete custom metric prompt including at least one {{input variable}}>", "ratingScale": [{ "definition": "Not at all", "value": { "floatValue": 0 } }, { "definition": "Somewhat", "value": { "floatValue": 1 } }, { "definition": "Mostly", "value": { "floatValue": 2 } } ] } } ], "evaluatorModelConfig": { "bedrockEvaluatorModels": [{ "modelIdentifier": "anthropic.claude-3-haiku-20240307-v1:0" }] } }, "evaluatorModelConfig": { "bedrockEvaluatorModels": [{ "modelIdentifier": "mistral.mistral-large-2402-v1:0" }] } } }, "inferenceConfig": { "models": [ { "precomputedInferenceSource": { "inferenceSourceIdentifier": "my_model" } } ] }, "outputDataConfig": { "s3Uri": "s3://amzn-s3-demo-destination-bucket/output/" } }catatan
Contoh file JSON berisi dua
evaluatorModelConfigobjek. Yang ada di dalamcustomMetricConfigobjek menentukan model evaluator yang akan digunakan dengan metrik khusus. Contoh lain menentukan model yang akan digunakan untuk metrik bawaan. Berhati-hatilah untuk menentukan kedua objek ini dengan benar.