Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Memahami parameter resep
Jalankan konfigurasi
Berikut ini adalah konfigurasi run umum dan penjelasan parameter yang terlibat.
run: name: eval_job_name model_type: amazon.nova-micro-v1:0:128k model_name_or_path: nova-micro/prod replicas: 1 data_s3_path: "" output_s3_path: s3://output_path mlflow_tracking_uri: "" mlflow_experiment_name : "" mlflow_run_name : ""
-
name: (Diperlukan) Nama deskriptif untuk pekerjaan evaluasi Anda. Ini membantu mengidentifikasi pekerjaan Anda di AWS konsol. -
model_type: (Diperlukan) Menentukan varian model Amazon Nova yang akan digunakan. Jangan memodifikasi bidang ini secara manual. Opsinya meliputi:-
amazon.nova-micro-v1:0:128k -
amazon.nova-lite-v1:0:300k -
amazon.nova-pro-v1:0:300k -
amazon.nova-2-lite-v1:0:256k
-
-
model_name_or_path: (Diperlukan) Jalur ke model dasar atau jalur S3 untuk pos pemeriksaan pasca-pelatihan. Opsinya meliputi:-
nova-micro/prod -
nova-lite/prod -
nova-pro/prod -
nova-lite-2/prod -
(Jalur S3 untuk pos pemeriksaan pasca-pelatihan)
s3://<escrow bucket>/<job id>/outputs/checkpoints
-
-
replicas: (Diperlukan) Jumlah instance komputasi yang akan digunakan untuk pelatihan terdistribusi. Anda harus mengatur nilai ini ke 1 karena multi-node tidak didukung. -
data_s3_path: (Diperlukan) Jalur S3 ke dataset input. Biarkan parameter ini kosong kecuali Anda menggunakan dataset bawa sendiri atau LLM sebagai resep juri. -
output_s3_path: (Diperlukan) Jalur S3 untuk menyimpan artefak evaluasi keluaran. Perhatikan bahwa bucket S3 keluaran harus dibuat oleh akun yang sama yang membuat pekerjaan. -
mlflow_tracking_uri: (Opsional) Server pelacakan MLFlow ARN untuk melacak ML runs/experiments Flow. Pastikan Anda memiliki izin untuk mengakses server pelacakan dari peran eksekusi SageMaker AI
Konfigurasi evaluasi
Berikut ini adalah konfigurasi evaluasi model dan penjelasan parameter yang terlibat.
evaluation: task: mmlu strategy: zs_cot subtask: mathematics metric: accuracy
-
task: (Diperlukan) Menentukan tolok ukur evaluasi atau tugas yang akan digunakan.Daftar tugas yang didukung:
-
mmlu
-
mmlu_pro
-
bbh
-
GpqA
-
matematika
-
kuat_menolak
-
gen_qa
-
ifeval
-
llm_juri
-
kemanusiaan
-
mm_llm_hakim
-
rubric_llm_juri
-
tujuan_2024
-
penjadwalan kalender
-
kemanusiaan
-
-
strategy: (Diperlukan) Mendefinisikan pendekatan evaluasi:-
zs_cot: Zero-shot Chain-of-Thought - Pendekatan untuk meminta model bahasa besar yang mendorong penalaran langkah demi langkah tanpa memerlukan contoh eksplisit.
-
zs: Zero-shot - Pendekatan untuk memecahkan masalah tanpa contoh pelatihan sebelumnya.
-
gen_qa: Strategi khusus untuk membawa resep dataset Anda sendiri.
-
hakim: Strategi khusus untuk Amazon Nova LLM sebagai Hakim dan mm_llm_jury.
-
-
subtask: (Opsional dan Dapat Dilepas) Menentukan subtugas tertentu untuk tugas evaluasi tertentu. Hapus ini dari resep Anda jika tugas Anda tidak memiliki subtugas. -
metric: (Diperlukan) Metrik evaluasi yang akan digunakan.-
akurasi: Persentase jawaban yang benar
-
exact_match: (Untuk
mathbenchmark), mengembalikan tingkat di mana string prediksi input persis cocok dengan referensi mereka. -
defleksi: (Untuk
strong rejectbenchmark), mengembalikan defleksi relatif ke model dasar dan perbedaan metrik signifikansi. -
pass @1: (Untuk
humanevalbenchmark) adalah metrik yang digunakan untuk mengukur persentase kasus di mana prediksi kepercayaan tertinggi model cocok dengan jawaban yang benar. -
all: Mengembalikan metrik berikut:-
Untuk
gen_qadan bawa tolok ukur dataset Anda sendiri, kembalikan metrik berikut:-
rouge1: Mengukur tumpang tindih unigram (kata tunggal) antara teks yang dihasilkan dan teks referensi. -
rouge2: Mengukur tumpang tindih bigram (dua kata berturut-turut) antara teks yang dihasilkan dan teks referensi. -
rougeL: Mengukur urutan umum terpanjang antara teks, memungkinkan kesenjangan dalam pencocokan. -
exact_match: Skor biner (0 atau 1) menunjukkan apakah teks yang dihasilkan cocok dengan teks referensi persis, karakter demi karakter. -
quasi_exact_match: Mirip dengan kecocokan persis tetapi lebih lunak, biasanya mengabaikan perbedaan huruf besar, tanda baca, dan spasi putih. -
f1_score: Rata-rata harmonis presisi dan ingatan, mengukur tumpang tindih kata antara jawaban yang diprediksi dan referensi. -
f1_score_quasi: Mirip dengan f1_score tetapi dengan pencocokan yang lebih lunak, menggunakan perbandingan teks yang dinormalisasi yang mengabaikan perbedaan kecil. -
bleu: Mengukur ketepatan kecocokan n-gram antara teks yang dihasilkan dan teks referensi, yang biasa digunakan dalam evaluasi terjemahan.
-
-
Untuk
llm_judgedanmm_llm_judge, bawa tolok ukur dataset Anda sendiri, kembalikan metrik berikut:-
a_scores: Jumlah kemenangan untuk lolresponse_Aos evaluasi maju dan mundur. -
a_scores_stderr: Kesalahan standar dariresponse_A scorespenilaian berpasangan. -
b_scores: Jumlah kemenangan untuk lolresponse_Bos evaluasi maju dan mundur. -
b_scores_stderr: Kesalahan standar dariresponse_B scorespenilaian berpasangan. -
ties: Jumlah penilaian di manaresponse_Adanresponse_Bdievaluasi sebagai sama. -
ties_stderr: Kesalahan standar ikatan di seluruh penilaian berpasangan. -
inference_error: Hitungan penilaian yang tidak dapat dievaluasi dengan benar. -
inference_error_stderr: Kesalahan standar kesalahan inferensi di seluruh penilaian. -
score: Skor agregat berdasarkan kemenangan dari umpan maju dan mundur untukresponse_B. -
score_stderr: Kesalahan standar skor agregat di seluruh penilaian berpasangan. -
winrate: probabilitas bahwa response_b akan lebih disukai daripada response_A dihitung menggunakan probabilitas. Bradley-Terry -
lower_rate: Batas bawah (persentil ke-2,5) dari perkiraan tingkat kemenangan dari pengambilan sampel bootstrap.
-
-
-
Konfigurasi inferensi
Berikut ini adalah konfigurasi inferensi dan penjelasan parameter yang terlibat. Semua parameter bersifat opsional.
inference: max_new_tokens: 200 top_k: -1 top_p: 1.0 temperature: 0 top_logprobs: 10 reasoning_effort: null # options: low/high to enable reasoning or null to disable reasoning
-
max_new_tokens: Jumlah maksimum token yang akan dihasilkan. Ini harus bilangan bulat. -
top_k: Jumlah token probabilitas tertinggi untuk dipertimbangkan. Ini harus bilangan bulat. -
top_p: Ambang probabilitas kumulatif untuk pengambilan sampel token. Ini harus berupa float antara 0.0 dan 1.0, inklusif. -
temperature: Keacakan dalam pemilihan token. Nilai yang lebih besar memperkenalkan lebih banyak keacakan. Gunakan 0 untuk membuat hasil deterministik. Nilai ini harus float dengan nilai minimum 0. -
top_logprobs: Jumlah logprob teratas yang akan dikembalikan dalam respons inferensi. Nilai ini harus berupa bilangan bulat dari 0 hingga 20. Logprob berisi token keluaran yang dipertimbangkan dan probabilitas log dari setiap token keluaran yang dikembalikan dalam konten pesan. -
reasoning_effort: mengontrol perilaku penalaran untuk model yang mampu bernalar. Setelreasoning_efforthanya ketikamodel_typemenentukan model yang mampu penalaran (saat iniamazon.nova-2-lite-v1:0:256k). Opsi yang tersedia adalahnull(nilai default jika tidak disetel; menonaktifkan penalaran),low, atauhigh.
Perhatikan bahwa untukhumaneval, kami merekomendasikan konfigurasi inferensi berikut:
inference: top_k: 1 max_new_tokens: 1600 temperature: 0.0
Konfigurasi MLFlow
Berikut ini adalah konfigurasi MLFlow dan penjelasan parameter yang terlibat. Semua parameter bersifat opsional.
run: mlflow_tracking_uri: "" mlflow_experiment_name: "" mlflow_run_name: ""
-
mlflow_tracking_uri: Opsional) Lokasi server pelacakan MLFlow (hanya diperlukan di SMHP) -
mlflow_experiment_name: (Opsional) Nama percobaan untuk mengelompokkan ML terkait berjalan bersama -
mlflow_run_name: (Opsional) Nama khusus untuk latihan tertentu yang dijalankan dalam percobaan