View a markdown version of this page

Mengevaluasi SageMaker AI-trained model Anda - Amazon Nova

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Mengevaluasi SageMaker AI-trained model Anda

Tujuan dari proses evaluasi adalah untuk menilai kinerja model terlatih terhadap tolok ukur atau kumpulan data khusus. Proses evaluasi biasanya melibatkan langkah-langkah untuk membuat resep evaluasi yang menunjuk ke model terlatih, menentukan kumpulan data evaluasi dan metrik, mengirimkan pekerjaan terpisah untuk evaluasi, dan mengevaluasi terhadap tolok ukur standar atau data khusus. Proses evaluasi akan menampilkan metrik kinerja yang disimpan di bucket Amazon S3 Anda.

catatan

Anda juga dapat mengevaluasi model Anda menggunakan Inspect AI, kerangka evaluasi sumber terbuka yang mendukung tolok ukur standar dan tugas evaluasi khusus.

catatan

Proses evaluasi yang dijelaskan dalam topik ini adalah proses offline. Model ini diuji terhadap tolok ukur tetap dengan jawaban yang telah ditentukan, daripada dinilai secara real-time atau melalui interaksi pengguna langsung. Untuk evaluasi real-time, Anda dapat menguji model setelah digunakan ke Amazon Bedrock dengan memanggil Amazon Bedrock Runtime API.

Prasyarat

Sebelum Anda memulai pekerjaan pelatihan evaluasi, perhatikan hal berikut.

  • Model SageMaker AI-trained Amazon Nova yang ingin Anda evaluasi kinerjanya.

  • Resep dasar Amazon Nova untuk evaluasi. Untuk informasi selengkapnya, lihat Mendapatkan resep Amazon Nova.

Tugas benchmark yang tersedia

Paket kode sampel tersedia yang menunjukkan cara menghitung metrik tolok ukur menggunakan fitur evaluasi model SageMaker AI untuk Amazon Nova. Untuk mengakses paket kode, lihat contoh- Nova-lighteval-custom-task.

Berikut adalah daftar tolok ukur standar industri yang tersedia yang didukung. Anda dapat menentukan tolok ukur berikut dalam eval_task parameter.

Tolok ukur yang tersedia untuk evaluasi model

Tolok Ukur Modalitas Deskripsi Metrik-metrik Strategi Subtugas tersedia
mmlu

Teks

Multi-task Pemahaman Bahasa — Menguji pengetahuan di 57 mata pelajaran.

ketepatan

zs_cot Ya
mmlu_pro Teks

MMLU - Subset Profesional - Berfokus pada domain profesional seperti hukum, kedokteran, akuntansi, dan teknik.

ketepatan zs_cot Tidak
bbh Teks

Tugas Penalaran Lanjutan — Kumpulan masalah menantang yang menguji keterampilan kognitif dan pemecahan masalah tingkat tinggi.

ketepatan fs_cot Ya
GpqA Teks

Menjawab Pertanyaan Fisika Umum — Menilai pemahaman konsep fisika dan kemampuan pemecahan masalah terkait.

ketepatan zs_cot Tidak
matematika Teks

Pemecahan Masalah Matematika — Mengukur penalaran matematika di seluruh topik termasuk aljabar, kalkulus, dan masalah kata.

pencocokan yang tepat zs_cot Ya
kuat_menolak Teks

Quality-Control Tugas — Menguji kemampuan model untuk mendeteksi dan menolak konten yang tidak pantas, berbahaya, atau salah.

defleksi zs Ya
ifeval Teks

Instruction-Following Evaluasi — Mengukur seberapa akurat model mengikuti instruksi yang diberikan dan menyelesaikan tugas sesuai spesifikasi.

ketepatan zs Tidak
gen_qa Multi-Modal (gambar)

Evaluasi Dataset Kustom - Memungkinkan Anda menyediakan dataset Anda sendiri untuk pembandingan, membandingkan keluaran model untuk referensi jawaban dengan metrik seperti ROUGE dan BLEU. gen_qamendukung inferensi gambar untuk model berbasis Amazon Nova Lite atau Amazon Nova Pro. Juga mendukung Bring-Your-Own Metrics lambda. (Untuk evaluasi RFT, silakan gunakan resep eval RFT)

all gen_qa Tidak
mmmmm Multi-Modal

Massive Multidisiplin Multimodal Understanding (MMMU) — College-level tolok ukur yang terdiri dari pertanyaan pilihan ganda dan terbuka dari 30 disiplin ilmu.)

ketepatan zs_cot Ya
llm_juri Teks

LLM-as-a-Judge Perbandingan Preferensi — Menggunakan model Nova Judge untuk menentukan preferensi antara respons berpasangan (B dibandingkan dengan A) untuk prompt Anda, menghitung probabilitas B lebih disukai daripada A.

all hakim Tidak

mm_llm_hakim

Multi-Modal (gambar)

Tolok ukur baru ini berperilaku sama dengan berbasis teks di atasllm_judge. Satu-satunya perbedaan adalah bahwa ia mendukung inferensi gambar.

all hakim Tidak

rubric_llm_juri

Teks

Rubrik Judge adalah model LLM-as-a-judge evaluasi yang disempurnakan yang dibangun di atas Nova 2.0 Lite. Tidak seperti model hakim asli yang hanya memberikan putusan preferensi, Hakim Rubrik secara dinamis menghasilkan kriteria evaluasi khusus yang disesuaikan dengan setiap prompt dan menetapkan skor granular di berbagai dimensi.

all

hakim

Tidak

tujuan_2024

Teks

AIME 2024 - Masalah Ujian Matematika Invitasional Amerika menguji penalaran matematika tingkat lanjut dan pemecahan masalah

pencocokan yang tepat

zs_cot

Tidak

penjadwalan kalender

Teks

Natural Plan - Kalender Kemampuan perencanaan pengujian tugas penjadwalan untuk menjadwalkan rapat di beberapa hari dan orang

pencocokan yang tepat

f

Tidak

kemanusiaan

Teks

HumanEval - Dataset benchmark yang dirancang untuk mengevaluasi kemampuan pembuatan kode model bahasa besar

lulus @1

zs Tidak

Konfigurasi khusus evaluasi

Di bawah ini adalah rincian komponen utama dalam resep dan panduan tentang cara memodifikasinya untuk kasus penggunaan Anda.

Memahami dan memodifikasi resep Anda

Konfigurasi jalankan umum

run: name: eval_job_name model_type: amazon.nova-2-lite-v1:0:256k model_name_or_path: nova-lite-2/prod # or s3://escrow_bucket/model_location replicas: 1 data_s3_path: "" mlflow_tracking_uri: "" mlflow_experiment_name : "" mlflow_run_name : ""
  • name: Nama deskriptif untuk pekerjaan evaluasi Anda.

  • model_type: Menentukan varian model Nova yang akan digunakan. Jangan memodifikasi bidang ini secara manual. Opsinya meliputi:

    • amazon.nova-mikro-v 1:0:128k

    • amazon.nova-lite-v 1:0:300k

    • amazon.nova-pro-v 1:0:300k

    • amazon.nova-2-lite-v 1:0:256k

  • model_name_or_path: Jalur ke model dasar atau jalur s3 untuk pos pemeriksaan pasca terlatih. Opsinya meliputi:

    • new- micro/prod

    • new- lite/prod

    • new- pro/prod

    • nova-lite- 2/prod

    • Jalur S3 untuk jalur pos pemeriksaan terlatih () s3:customer-escrow-111122223333-smtj-<unique_id>/<training_run_name>

      catatan

      Mengevaluasi model pasca-pelatihan

      Untuk mengevaluasi model pasca-pelatihan setelah pekerjaan pelatihan Nova SFT, ikuti langkah-langkah ini setelah menjalankan pekerjaan pelatihan yang sukses. Di akhir log pelatihan, Anda akan melihat pesan log “Pelatihan selesai”. Anda juga akan menemukan manifest.json file di bucket keluaran Anda yang berisi lokasi pos pemeriksaan Anda. File ini akan ditempatkan di dalam output.tar.gz file di lokasi S3 keluaran Anda. Untuk melanjutkan evaluasi, gunakan pos pemeriksaan ini dengan menyetelnya sebagai nilai untuk run.model_name_or_path dalam konfigurasi resep Anda.

  • replica: Jumlah instance komputasi yang digunakan untuk inferensi terdistribusi (menjalankan inferensi di beberapa node). Setel replica > 1 untuk mengaktifkan inferensi multi-node, yang mempercepat evaluasi. Jika keduanya instance_count dan replica ditentukan, diut instance_count amakan. Perhatikan bahwa beberapa replika hanya berlaku untuk pekerjaan pelatihan SageMaker AI, tidak SageMaker HyperPod.

  • data_s3_path: Dataset input jalur Amazon S3. Bidang ini wajib diisi tetapi harus selalu dibiarkan kosong.

  • mlflow_tracking_uri: (Opsional) Lokasi server pelacakan MLFlow (hanya diperlukan di SMHP)

  • mlflow_experiment_name: (Opsional) Nama percobaan untuk mengelompokkan ML terkait berjalan bersama

  • mlflow_run_name: (Opsional) Nama khusus untuk latihan tertentu yang dijalankan dalam percobaan

Konfigurasi evaluasi

evaluation: task: mmlu strategy: zs_cot subtask: abstract_algebra metric: accuracy
  • task: Menentukan tolok ukur evaluasi atau tugas yang akan digunakan. Tugas yang didukung meliputi:

    • mmlu

    • mmlu_pro

    • bbh

    • gpqa

    • math

    • strong_reject

    • gen_qa

    • ifeval

    • mmmu

    • llm_judge

    • mm_llm_judge

    • rubric_llm_judge

    • aime_2024

    • calendar_scheduling

    • humaneval

  • strategy: Mendefinisikan pendekatan evaluasi.

    • zs_cot: Zero-shot Chain of Thought - pendekatan untuk mendorong model bahasa besar yang mendorong penalaran langkah demi langkah tanpa memerlukan contoh eksplisit.

    • fs_cot Few-shot RanTAI PEMIKIRAN — pendekatan yang memberikan beberapa contoh penalaran langkah demi langkah sebelum meminta model untuk memecahkan masalah baru.

    • zs: Zero-shot - pendekatan untuk memecahkan masalah tanpa contoh pelatihan sebelumnya.

    • gen_qa: Strategi khusus untuk membawa dataset Anda sendiri.

    • judge: Strategi khusus untuk Nova LLM sebagai Hakim danmm_llm_judge.

  • subtask: Opsional. Komponen spesifik dari tugas evaluasi. Untuk daftar lengkap subtugas yang tersedia, lihatSubtugas yang tersedia.

    • Periksa subtugas yang didukung di Tugas tolok ukur yang tersedia.

    • Harus menghapus bidang ini jika tidak ada tolok ukur subtugas.

  • metric: Metrik evaluasi yang akan digunakan.

    • accuracy: Persentase jawaban yang benar.

    • exact_match: Untuk tolok ukur matematika, mengembalikan tingkat di mana string yang diprediksi input persis cocok dengan referensi mereka.

    • deflection: Untuk tolok ukur penolakan yang kuat, mengembalikan defleksi relatif ke model dasar dan metrik signifikansi perbedaan.

    • all:

      Untukgen_qa, bawa tolok ukur dataset Anda sendiri, kembalikan metrik berikut:

      • rouge1: Mengukur tumpang tindih unigram (kata tunggal) antara teks yang dihasilkan dan teks referensi.

      • rouge2: Mengukur tumpang tindih bigram (dua kata berturut-turut) antara teks yang dihasilkan dan teks referensi.

      • rougeL: Mengukur urutan umum terpanjang antara teks, memungkinkan kesenjangan dalam pencocokan.

      • exact_match: Skor biner (0 atau 1) menunjukkan apakah teks yang dihasilkan cocok dengan teks referensi persis, karakter demi karakter.

      • quasi_exact_match: Mirip dengan kecocokan persis tetapi lebih lunak, biasanya mengabaikan perbedaan huruf besar, tanda baca, dan spasi putih.

      • f1_score: Rata-rata harmonis presisi dan ingatan, mengukur tumpang tindih kata antara jawaban yang diprediksi dan referensi.

      • f1_score_quasi: Mirip dengan f1_score tetapi dengan pencocokan yang lebih lunak, menggunakan perbandingan teks yang dinormalisasi yang mengabaikan perbedaan kecil.

      • bleu: Mengukur ketepatan kecocokan n-gram antara teks yang dihasilkan dan teks referensi, yang biasa digunakan dalam evaluasi terjemahan.

      Untuk llm_judge danmm_llm_judge, bawa tolok ukur dataset Anda sendiri, kembalikan metrik berikut:

      • a_scores: Jumlah kemenangan untuk lol response_A os evaluasi maju dan mundur.

      • a_scores_stderr: Kesalahan standar dari response_A_scores penilaian berpasangan.

      • b_scores: Mengukur Jumlah kemenangan untuk lol response_B os evaluasi maju dan mundur.

      • a_scores_stderr: Kesalahan standar dari response_B_scores penilaian berpasangan.

      • ties: Jumlah penilaian di mana response_A dan response_B dievaluasi sebagai sama.

      • ties_stderr: Kesalahan standar dari ties penilaian berpasangan.

      • inference_error: Hitungan penilaian yang tidak dapat dievaluasi dengan benar.

      • score: Skor agregat berdasarkan kemenangan dari umpan maju dan mundur untukresponse_B.

      • score_stderr: Skor agregat berdasarkan kemenangan dari umpan maju dan mundur untukresponse_B.

      • inference_error_stderr: Kesalahan standar skor agregat di seluruh penilaian berpasangan.

      • winrate: Probabilitas yang response_B akan lebih disukai daripada response_A dihitung menggunakan Bradley-Terry probabilitas.

      • lower_rate: Batas bawah (persentil ke-2,5) dari perkiraan tingkat kemenangan dari pengambilan sampel bootstrap.

      • upper_rate: Batas atas (persentil 97.5) dari perkiraan tingkat kemenangan dari sampling bootstrap.

Konfigurasi inferensi (opsional)

inference: max_new_tokens: 2048 top_k: -1 top_p: 1.0 temperature: 0 top_logprobs: 10 reasoning_effort: null # options: low/high to enable reasoning or null to disable reasoning
  • max_new_tokens: Jumlah maksimum token yang akan dihasilkan. Harus berupa bilangan bulat. (Tidak tersedia untuk Hakim LLM)

  • top_k: Jumlah token probabilitas tertinggi untuk dipertimbangkan. Harus berupa bilangan bulat.

  • top_p: Ambang probabilitas kumulatif untuk pengambilan sampel token. Harus float antara 1.0 hingga 0.0.

  • temperature: Keacakan dalam pemilihan token (lebih tinggi = lebih acak), pertahankan 0 untuk membuat hasilnya deterministik. Jenis float, nilai minimal adalah 0.

  • top_logprobs: Jumlah logprob teratas yang akan dikembalikan dalam respons inferensi. Nilai ini harus berupa bilangan bulat dari 0 hingga 20. Logprob berisi token keluaran yang dipertimbangkan dan probabilitas log dari setiap token keluaran yang dikembalikan dalam konten pesan.

  • reasoning_effort: mengontrol perilaku penalaran untuk model yang mampu bernalar. Setel reasoning_effort hanya ketika model_type menentukan model yang mampu penalaran (saat iniamazon.nova-2-lite-v1:0:256k). Opsi yang tersedia adalah null (nilai default jika tidak disetel; menonaktifkan penalaran), rendah, atau tinggi.

Format Output Probabilitas Log

Ketika top_logprobs dikonfigurasi dalam pengaturan inferensi Anda, output evaluasi menyertakan probabilitas log tingkat token dalam file parket. Setiap posisi token berisi kamus token kandidat teratas dengan probabilitas log mereka dalam struktur berikut:

{ "Ġint": {"logprob_value": -17.8125, "decoded_value": " int"}, "Ġthe": {"logprob_value": -2.345, "decoded_value": " the"} }

Setiap entri token berisi:

  • logprob_value: Nilai probabilitas log untuk token

  • decoded_value: Representasi string yang didekodekan yang dapat dibaca manusia dari token

Token tokenizer mentah digunakan sebagai kunci kamus untuk memastikan keunikan, sementara decoded_value memberikan interpretasi yang dapat dibaca.

Contoh resep evaluasi

Amazon Nova menyediakan empat jenis resep evaluasi yang berbeda. Semua resep tersedia di GitHub repositori SageMaker HyperPod resep.

Resep evaluasi

    Resep-resep ini memungkinkan Anda mengevaluasi kemampuan mendasar model Amazon Nova di seluruh rangkaian tolok ukur teks saja yang komprehensif.

    Format resep:xxx_general_text_benchmark_eval.yaml.

    Resep ini memungkinkan Anda membawa kumpulan data Anda sendiri untuk pembandingan dan membandingkan keluaran model untuk referensi jawaban menggunakan berbagai jenis metrik.

    Format resep:xxx_ bring_your_own_dataset_eval.yaml.

    Bawa persyaratan dataset Anda sendiri

    Format berkas:

    • gen_qa.jsonlFile tunggal berisi contoh evaluasi. Nama file harus tepatgen_qa.jsonl.

    • Anda harus mengunggah dataset Anda ke lokasi S3 tempat pekerjaan pelatihan SageMaker AI dapat diakses.

    • File harus mengikuti format skema yang diperlukan untuk kumpulan data Tanya Jawab umum.

    Persyaratan format skema - Setiap baris dalam .jsonl file harus berupa objek JSON dengan bidang berikut.

    • Bidang wajib diisi.

      query: String yang berisi pertanyaan atau instruksi yang membutuhkan jawaban.

      response: String yang berisi output model yang diharapkan.

    • Bidang opsional.

      system: String yang berisi prompt sistem yang menetapkan perilaku, peran, atau kepribadian model AI sebelum memproses kueri.

      images: Array berisi daftar objek dengan atribut data (string gambar yang dikodekan Base64).

      metadata: String berisi metadata yang terkait dengan entri untuk tujuan penandaan.

    Entri contoh

    { "system":"You are an English major with top marks in class who likes to give minimal word responses: ", "query":"What is the symbol that ends the sentence as a question", "response":"?" }{ "system":"You are a pattern analysis specialist who provides succinct answers: ", "query":"What is the next number in this series? 1, 2, 4, 8, 16, ?", "response":"32" }{ "system":"You have great attention to detail and follow instructions accurately: ", "query":"Repeat only the last two words of the following: I ate a hamburger today and it was kind of dry", "response":"of dry" }{ "system": "Image inference: ", "query": "What is the number in the image? Please just use one English word to answer.", "response": "two", "images": [ { "data": "data:image/png;Base64,iVBORw0KGgoA ..." } ] }

    Untuk menggunakan kumpulan data kustom Anda, ubah resep evaluasi Anda dengan menambahkan kolom wajib berikut tanpa mengubah konfigurasi yang ada:

    evaluation: task: gen_qa strategy: gen_qa metric: all

    Batasan

    • Hanya satu .jsonl file yang diperbolehkan per evaluasi.

    • File harus benar-benar mengikuti skema yang ditentukan.

    Bawa metrik Anda sendiri

    Anda dapat membawa metrik Anda sendiri untuk sepenuhnya menyesuaikan alur kerja evaluasi model Anda dengan kemampuan prapemrosesan, pasca pemrosesan, dan metrik khusus. Prapemrosesan memungkinkan Anda memproses data input sebelum mengirimkannya ke server inferensi, dan postprocessing memungkinkan Anda menyesuaikan perhitungan metrik dan mengembalikan metrik khusus berdasarkan kebutuhan Anda.

    Ikuti langkah-langkah berikut untuk membawa metrik Anda sendiri dengan SDK evaluasi khusus.

    1. Jika Anda belum melakukannya, buat AWS Lambda fungsi Akun AWS pertama Anda.

    2. Unduh nova-custom-eval-layer.zip file yang sudah dibuat sebelumnya dari GitHub repositori. Anda dapat menggunakan SDK evaluasi kustom Nova sumber terbuka ini untuk memvalidasi muatan input dan output untuk fungsi kustom Anda dan menyediakan antarmuka terpadu untuk diintegrasikan dengan Nova membawa evaluasi metrik Anda sendiri selama pelatihan.

    3. Unggah layer Lambda kustom menggunakan perintah berikut:

      aws lambda publish-layer-version \ --layer-name nova-custom-eval-layer \ --zip-file fileb://nova-custom-eval-layer.zip \ --compatible-runtimes python3.12 python3.11 python3.10 python3.9
    4. Tambahkan layer ini sebagai layer kustom ke fungsi Lambda Anda, bersama dengan layer yang diperlukan AWS : AWSLambdaPowertoolsPythonV3-python312-arm64 (diperlukan untuk pydantic ketergantungan).

    5. Perbarui kode Lambda Anda menggunakan contoh yang disediakan, memodifikasi kode sesuai kebutuhan. Kode contoh ini membuat fungsi Lambda untuk evaluasi kustom Nova dengan langkah-langkah prapemrosesan dan pasca pemrosesan untuk evaluasi model.

      from nova_custom_evaluation_sdk.processors.decorators import preprocess, postprocess from nova_custom_evaluation_sdk.lambda_handler import build_lambda_handler @preprocess def preprocessor(event: dict, context) -> dict: data = event.get('data', {}) return { "statusCode": 200, "body": { "system": data.get("system"), "prompt": data.get("prompt", ""), "gold": data.get("gold", "") } } @postprocess def postprocessor(event: dict, context) -> dict: # data is already validated and extracted from event data = event.get('data', []) inference_output = data.get('inference_output', '') gold = data.get('gold', '') metrics = [] inverted_accuracy = 0 if inference_output.lower() == gold.lower() else 1.0 metrics.append({ "metric": "inverted_accuracy_custom", "value": accuracy }) # Add more metrics here return { "statusCode": 200, "body": metrics } # Build Lambda handler lambda_handler = build_lambda_handler( preprocessor=preprocessor, postprocessor=postprocessor )
    6. Berikan akses Lambda ke pekerjaan evaluasi. Pastikan peran eksekusi yang ditentukan untuk pekerjaan evaluasi menyertakan kebijakan untuk memanggil fungsi Lambda Anda. Berikut adalah contoh kebijakan.

      JSON
      { "Version":"2012-10-17", "Statement": [ { "Sid": "LambdaAccess", "Effect": "Allow", "Action": [ "lambda:InvokeFunction" ], "Resource": "arn:aws:lambda:us-east-1:111122223333:function:ExampleFunction", "Condition": { "StringLike": { "aws:PrincipalArn": "arn:aws:iam::111122223333:role/service-role/AmazonSageMaker-ExecutionRole-ARN" } } }, { "Sid": "DenyNonAWSEventSourcesForLambda", "Effect": "Deny", "Action": [ "lambda:InvokeFunction" ], "Resource": "arn:aws:lambda:us-east-1:111122223333:function:ExampleFunction", "Condition": { "Null": { "lambda:EventSourceToken": false } } } ] }
    7. Tinjau skema muatan Lambda. Tabel berikut mencantumkan skema permintaan dan respons Lambda. Anda dapat memvalidasi skema Anda menggunakan SDK evaluasi kustom Nova.

      Muatan Permintaan Lambda Muatan Respons Lambda
      Preprosesor
      { "process_type": "preprocess", "data": { "system": "You are a helpful assistant", "prompt": "What is 2+2?", "gold": "4" } }
      { "statusCode": 200, "body": { "system": "You are a helpful assistant that can substitute * for addition", "prompt": "What is 2*2?", "gold": "4" } }
      Postprocessor
      { "process_type": "postprocess", "data": { "prompt": "What is 2+2?", "inference_output": "2+2=4", "gold": "4" } }
      { "statusCode": 200, "body": [ {"metric": "accuracy", "value": 1.0}, {"metric": "f1_score", "value": 1.0}, {"metric": "exact_match", "value": 1}, {"metric": "length_ratio", "value": 0.8} ] }
    8. Ubah file resep. Inilah contohnya.

      processor: lambda_arn: arn:aws:lambda:us-east-1:111122223333:function:name lambda_type: "custom_metrics" preprocessing: enabled: true postprocessing: enabled: true aggregation: average
      • lambda-arn: Nama Sumber Daya Amazon (ARN) untuk fungsi Lambda Anda yang menangani preprocessing dan postprocessing.

      • lambda_type: “custom_metrics” atau “rft”.

      • preprocessing: Apakah akan mengaktifkan operasi pra-pemrosesan khusus.

      • postprocessing: Apakah akan mengaktifkan operasi pasca-pemrosesan khusus.

      • aggregation: fungsi Built-in agregasi (opsi yang valid: min, maks, rata-rata, jumlah).

    Batasan

    • Bawa metrik Anda sendiri hanya berlaku untuk kumpulan data input teks.

    • Multi-modal kumpulan data input tidak didukung.

    • Langkah pra-pemrosesan tidak memproses bidang metadata.

    penting

    llm_judgedan hanya mm_llm_judge dapat dijalankan terhadap model dasar Amazon Nova (misalnya,nova-micro/prod,nova-lite/prod,nova-pro/prod, ataunova-lite-2/prod). Mereka tidak didukung pada pos pemeriksaan model yang disesuaikan.

    rubric_llm_judgehanya dapat dijalankan terhadap model dasar Amazon Nova 2.0 (misalnya,nova-lite-2/prod). Ini tidak didukung pada model dasar Amazon Nova 1.0 atau pada pos pemeriksaan model yang disesuaikan.

    Untuk mengevaluasi model yang disesuaikan dengan alur kerja hakim, pertama-tama gunakan model khusus Anda untuk menghasilkan kumpulan data prompt dan respons, lalu jalankan alur kerja juri terhadap model dasar Amazon Nova menggunakan kumpulan data tersebut sebagai masukan.

    Nova LLM Judge adalah fitur evaluasi model yang memungkinkan Anda membandingkan kualitas tanggapan dari satu model terhadap respons model dasar menggunakan kumpulan data khusus. Ini menerima kumpulan data yang berisi prompt, tanggapan dasar, dan tanggapan penantang, kemudian menggunakan model Nova Judge untuk memberikan metrik tingkat kemenangan berdasarkan Bradley-Terry probabilitas melalui perbandingan berpasangan. Format resep:xxx_llm_judge_eval.yaml.

    Persyaratan dataset Nova LLM

    Format file:

    • llm_judge.jsonlFile tunggal berisi contoh evaluasi. Nama file harus tepatllm_judge.jsonl.

    • Anda harus mengunggah dataset Anda ke lokasi S3 tempat pekerjaan pelatihan SageMaker AI dapat diakses.

    • File harus mengikuti format skema yang diperlukan untuk llm_judge dataset.

    • Dataset input harus memastikan semua catatan berada di bawah panjang konteks 12 k.

    Format skema - Setiap baris dalam .jsonl file harus berupa objek JSON dengan bidang berikut.

    • Bidang wajib.

      prompt: String yang berisi prompt untuk respons yang dihasilkan.

      response_A: String yang berisi respons dasar.

      response_B: String yang berisi respons alternatif dibandingkan dengan respons dasar.

    Entri contoh

    { "prompt": "What is the most effective way to combat climate change?", "response_A": "The most effective way to combat climate change is through a combination of transitioning to renewable energy sources and implementing strict carbon pricing policies. This creates economic incentives for businesses to reduce emissions while promoting clean energy adoption.", "response_B": "We should focus on renewable energy. Solar and wind power are good. People should drive electric cars. Companies need to pollute less." } { "prompt": "Explain how a computer's CPU works", "response_A": "CPU is like brain of computer. It does math and makes computer work fast. Has lots of tiny parts inside.", "response_B": "A CPU (Central Processing Unit) functions through a fetch-execute cycle, where instructions are retrieved from memory, decoded, and executed through its arithmetic logic unit (ALU). It coordinates with cache memory and registers to process data efficiently using binary operations." } { "prompt": "How does photosynthesis work?", "response_A": "Plants do photosynthesis to make food. They use sunlight and water. It happens in leaves.", "response_B": "Photosynthesis is a complex biochemical process where plants convert light energy into chemical energy. They utilize chlorophyll to absorb sunlight, combining CO2 and water to produce glucose and oxygen through a series of chemical reactions in chloroplasts." }

    Untuk menggunakan kumpulan data kustom Anda, ubah resep evaluasi Anda dengan bidang wajib berikut, jangan ubah konten apa pun:

    evaluation: task: llm_judge strategy: judge metric: all

    Batasan

    • Hanya satu .jsonl file yang diperbolehkan per evaluasi.

    • File harus benar-benar mengikuti skema yang ditentukan.

    • Model Nova Judge sama di seluruh spesifikasi mikro/lite/pro.

    • Model juri khusus saat ini tidak didukung.

    Nova LLM sebagai Juri untuk resep tolok ukur multi-modal (gambar)

    Nova LLM Judge untuk multi-modal (gambar), kependekan dari Nova MM_LLM Judge, adalah fitur evaluasi model yang memungkinkan Anda membandingkan kualitas tanggapan dari satu model terhadap respons model dasar menggunakan kumpulan data khusus. Ini menerima kumpulan data yang berisi prompt, respons dasar, dan respons penantang, dan gambar dalam bentuk Base64-encoded string, kemudian menggunakan model Nova Judge untuk memberikan metrik tingkat kemenangan berdasarkan Bradley-Terry probabilitas melalui perbandingan berpasangan. Format resep:xxx_mm_llm_judge_eval.yaml.

    Persyaratan dataset Nova LLM

    Format file:

    • mm_llm_judge.jsonlFile tunggal berisi contoh evaluasi. Nama file harus tepatllm_judge.jsonl.

    • Anda harus mengunggah dataset Anda ke lokasi S3 tempat pekerjaan pelatihan SageMaker AI dapat mengaksesnya.

    • File harus mengikuti format skema yang diperlukan untuk mm_llm_judge dataset.

    • Dataset input harus memastikan semua catatan berada di bawah panjang konteks 12 k, tidak termasuk atribut gambar.

    Format skema - Setiap baris dalam .jsonl file harus berupa objek JSON dengan bidang berikut.

    • Bidang wajib.

      prompt: String yang berisi prompt untuk respons yang dihasilkan.

      images: Array berisi daftar objek dengan atribut data (nilai adalah string Base64-encoded gambar).

      response_A: String yang berisi respons dasar.

      response_B: String yang berisi respons alternatif dibandingkan dengan respons dasar.

    Entri contoh

    Untuk keterbacaan, contoh berikut mencakup baris dan lekukan baru, tetapi dalam kumpulan data aktual, setiap catatan harus berada pada satu baris.

    { "prompt": "What is in the image?", "images": [ { "data": "data:image/jpeg;Base64,/9j/2wBDAAQDAwQDAwQEAwQFBAQFBgo..." } ], "response_A": "a dog.", "response_B": "a cat.", } { "prompt": "How many animals are in each of the images?", "images": [ { "data": "data:image/jpeg;Base64,/9j/2wBDAAQDAwQDAwQEAwQFBAQFBgo..." }, { "data": "data:image/jpeg;Base64,/DKEafe3gihn..." } ], "response_A": "The first image contains one cat and the second image contains one dog", "response_B": "The first image has one aminal and the second has one animal" }

    Untuk menggunakan kumpulan data kustom Anda, ubah resep evaluasi Anda dengan bidang wajib berikut, jangan ubah konten apa pun:

    evaluation: task: mm_llm_judge strategy: judge metric: all

    Batasan

    • Hanya satu .jsonl file yang diperbolehkan per evaluasi.

    • File harus benar-benar mengikuti skema yang ditentukan.

    • Model Nova MM Judge hanya mendukung referensi gambar.

    • Model Nova MM Judge sama di seluruh spesifikasi Amazon Nova Micro, Amazon Nova Lite, dan Amazon Nova Pro.

    • Model juri khusus saat ini tidak didukung.

    • URI gambar Amazon S3 tidak didukung.

    • Dataset input harus memastikan semua catatan berada di bawah panjang konteks 12 k, tidak termasuk atribut gambar.

    Evaluasi pada model CPT (berkelanjutan pra-terlatih) dapat menjadi lebih menantang daripada model yang telah menjalani SFT (fine tuning) karena model CPT secara teratur tidak memiliki kemampuan untuk mengikuti instruksi. Alih-alih mengikuti instruksi, model CPT akan beroperasi sebagai model penyelesaian, yang berarti mereka hanya akan mencoba melanjutkan pola yang disediakan dengan urutan token input. Mengingat keterbatasan ini, kumpulan data evaluasi tipikal mungkin tidak berfungsi dengan benar karena format “Tanya Jawab” dari input — alih-alih menjawab pertanyaan, model hanya akan mencoba melanjutkan pertanyaan yang sama. Namun, dengan memformat kumpulan data dengan cara tertentu untuk meminta model dalam gaya penyelesaian, kita bisa mendapatkan pemahaman tentang kinerja model.

    Ikuti langkah-langkah di bawah ini untuk memahami cara melakukan evaluasi pada model pra-terlatih berkelanjutan menggunakan alur kerja evaluasi Nova Forge.

    Persiapan dan Pemformatan Dataset

    Mengevaluasi model CPT memanfaatkan alur kerja Bring Your Own Dataset yang sudah ada yang sudah disediakan dalam pengalaman evaluasi model Nova Forge. Namun, kueri dalam dataset harus diformat dalam format “penyelesaian” murni karena model CPT tidak akan menanggapi permintaan gaya pertanyaan standar dengan cara yang sama seperti model SFT.

    Keterbatasan penting lainnya dari model yang telah mengalami CPT semata-mata adalah ketidakmampuan mereka untuk menghasilkan token STOP atau akhir urutan — ini berarti bahwa model akan terus menghasilkan token sampai dihentikan secara paksa (seperti dengan parameter max_new_tokens). Mengingat keterbatasan ini, praktik terbaik adalah mengevaluasi model menggunakan respons token tunggal (seperti pilihan ganda) untuk memastikan model tidak terus menghasilkan output sampah yang tidak diperlukan setelah diminta.

    Misalnya, kumpulan data evaluasi tipikal (seperti MMLU, GPQA, MATH, dll), mungkin meminta model dengan pertanyaan seperti:

    Early settlements and high population density along coastlines and rivers are best attributed to which of the following? A: "Poor climate conditions" B: "Limited forest cover" C: "Cars" D: "Access to trade routes" (Expected answer is D.)

    Namun, model CPT tidak akan mengerti bagaimana menanggapi pertanyaan ini dengan benar karena kurangnya penyetelan halus pada instruksi berikut. Oleh karena itu, model CPT harus diminta dalam gaya penyelesaian, seperti:

    Early settlements and high population density along coastlines and rivers are best attributed to which of the following? A: Poor climate conditions B: Limited forest cover C: Cars D: Access to trade routes The correct answer to this question is option (Expected answer is D.)

    Setelah inferensi memeriksa logprob keluaran yang dihasilkan oleh model akan memberikan detail tentang apakah model memproses input dengan benar dan menghasilkan respons yang benar. Tidak dijamin bahwa model akan selalu menghasilkan respons yang tepat (dalam hal ini, huruf D) yang diharapkan, namun, model tersebut harus ada di dalam logprobs jika model berfungsi dengan benar.

    Contoh prompt gaya penyelesaian pilihan non-ganda lainnya:

    The capital of France is (Expected answer of Paris)

    Kami berharap model menghasilkan respons “Paris” atau melihat token yang sesuai dengan “Paris” di suatu tempat di output logprobs.

    Pemformatan Dataset

    Evaluasi CPT memanfaatkan alur kerja Bring Your Own Dataset yang ada. Data harus diformat dalam format “respons kueri” dalam file JSONL yang dipisahkan oleh baris baru.

    Contoh dataset dengan 4 entri di dalamnya:

    {"query": "The capital of France is", "response": "Paris"} {"query": "2 + 2 =", "response": "4"} {"query": "The mitochondria is the powerhouse of the", "response": "cell"} {"query": "What is the largest planet?\nA: Mars\nB: Jupiter\nC: Saturn\nD: Earth\nAnswer:", "response": "B"}

    Setiap baris harus berisi:

    • query: Teks prompt untuk penyelesaian

    • response: Penyelesaian yang diharapkan (kebenaran dasar)

    Model akan menerima input teks mentah tanpa pemformatan obrolan. Model CPT biasanya belum dilatih pada token khusus dan tidak akan merespons templat obrolan dengan benar, jadi ketika meminta model HANYA string yang disediakan dalam kueri yang akan dikirim ke model (dengan [BOS] token tambahan ditambahkan padanya secara otomatis.)

    Konfigurasi Resep

    Berikut adalah contoh resep yang dikonfigurasi untuk mengevaluasi model CPT:

    run: name: cpt_eval_job model_type: amazon.nova-2-lite-v1:0:256k model_name_or_path: s3://bucket/path/to/cpt-checkpoint/ evaluation: task: gen_qa # Required for CPT - bring your own dataset strategy: gen_qa metric: all # Returns rouge1, rouge2, rougeL, exact_match, f1_score, bleu inference: checkpoint_is_instruction_tuned: "false" # Required for CPT checkpoints top_logprobs: 5 # Change to desired amount of logprobs to calculate max_new_tokens: 1 # Keep low for completion tasks temperature: 0.0

    Perubahan utama untuk evaluasi CPT:

    • checkpoint_is_instruction_tuned: "false"

      Ini adalah parameter baru yang ditambahkan khusus untuk mendukung evaluasi berjalan pada pos pemeriksaan CPT. Menyetel checkpoint_is_instruction_ke false akan menonaktifkan template obrolan Amazon Nova default yang biasanya membungkus prompt input.

    • top_logprobs: 5

      Probabilitas log (logprobs) mengungkapkan distribusi kepercayaan model di seluruh kemungkinan token berikutnya, membantu Anda menilai apakah model telah mempelajari penyelesaian yang diharapkan selama pra-pelatihan. Biasanya, jika model berkinerja sebagaimana dimaksud, kita harus melihat respons yang diharapkan (yaitu, “A”, “B”, dll) sebagai token keluaran yang dihasilkan atau token di logprobs.

    • max_new_tokens: 1

      Model CPT biasanya belum dilatih untuk menghasilkan token “berhenti” atau “akhir urutan” khusus yang belum memberi sinyal kapan harus menghentikan inferensi. Ini berarti model biasanya akan terus menghasilkan token baru sampai panjang token maksimum tertentu tercapai sehingga menghasilkan inferensi yang tidak perlu. Biasanya membatasi max_new_tokens menjadi 1 dan memberikan prompt yang dapat mengevaluasi model pada satu respons (seperti pertanyaan pilihan ganda) adalah cara paling efisien untuk meminta model. Menyetel max_new_tokens ke 1 memastikan bahwa token sampah tambahan tidak dihasilkan.

    Parameter Kunci
    • checkpoint_is_instruction_: Harus disetel ke (atau sebagai boolean) untuk menonaktifkan templat obrolan "false" false

    • top_logprobs: 5, disarankan untuk melihat bagaimana model belajar selama CPT

    • tugas: Harus gen_qa - Model CPT tidak dapat menggunakan tolok ukur mengikuti instruksi seperti MMLU atau MATH

    • Strategi: Harus gen_qa

    • max_new_tokens: Disarankan untuk tetap rendah (1-5) karena model CPT melakukan penyelesaian, bukan pembuatan

    Menjalankan pekerjaan pelatihan evaluasi

    Mulai pekerjaan pelatihan menggunakan contoh notebook Jupyter berikut. Silakan lihat buku catatan di bawah ini sebagai contoh untuk menjalankan pekerjaan pelatihan evaluasi. Untuk informasi selengkapnya, lihat Menggunakan estimator SageMaker AI untuk menjalankan pekerjaan pelatihan.

    Tabel referensi

    Sebelum menjalankan buku catatan, lihat tabel referensi berikut untuk memilih URI gambar dan konfigurasi instance.

    Memilih URI gambar

    Resep URI citra

    URI gambar evaluasi

    708977205387.dkr.ecr.us-east-1.amazonaws.com/nova-evaluation-repo:SM-TJ-Eval-V2-latest

    Memilih jenis dan jumlah instance

    Model Jenis Tugas Tipe instans Jumlah instans yang disarankan Jumlah instans yang diizinkan
    Amazon Nova Mikro Evaluasi (SFT/DPO)

    g5.12xlarge

    1 1 - 16
    Amazon Nova Lite Evaluasi (SFT/DPO)

    g5.12xlarge

    1 1 - 16
    Amazon Nova Pro Evaluasi (SFT/DPO)

    p5.48xlarge

    1 1 - 16
    Nova 2 Lite Evaluasi (SFT/DPO)

    p5.48xlarge

    1 1 - 16

    Contoh notebook

    Contoh buku catatan berikut menunjukkan cara menjalankan pekerjaan pelatihan evaluasi.

    # install python SDK # Do not use sagemaker v3, as sagemaker v3 introduced breaking changes !pip install sagemaker==2.254.1 import os import sagemaker,boto3 from sagemaker.inputs import TrainingInput from sagemaker.pytorch import PyTorch sagemaker_session = sagemaker.Session() role = sagemaker.get_execution_role() # Download recipe from https://github.com/aws/sagemaker-hyperpod-recipes/tree/main/recipes_collection/recipes/evaluation/nova to local # Assume the file name be `recipe.yaml` # Populate parameters # input_s3_uri = "s3://<path>/input/" # (Optional) Only used for multi-modal dataset or bring your own dataset s3 location output_s3_uri= "s3://<path>/output/" # Output data s3 location, a zip containing metrics json and tensorboard metrics files will be stored to this location instance_type = "instance_type" # ml.g5.16xlarge as example instance_count = 1 # The number of instances for inference (set instance_count > 1 for multi-node inference to accelerate evaluation) job_name = "your job name" recipe_path = "recipe path" # ./recipe.yaml as example image_uri = "708977205387.dkr.ecr.us-east-1.amazonaws.com/nova-evaluation-repo:SM-TJ-Eval-V2-latest" # Do not change output_kms_key = "<KMS key arn to encrypt trained model in Amazon-owned S3 bucket>" # optional, leave blank for Amazon managed encryption # (Optional) To bring your own dataset and LLM judge for evaluation # evalInput = TrainingInput( # s3_data=input_s3_uri, # distribution='FullyReplicated', # s3_data_type='S3Prefix' #) estimator = PyTorch( output_path=output_s3_uri, base_job_name=job_name, role=role, instance_type=instance_type, instance_count=instance_count, training_recipe=recipe_path, sagemaker_session=sagemaker_session, image_uri=image_uri, output_kms_key=output_kms_key ) estimator.fit() # If input dataset exist, pass in inputs # estimator.fit(inputs={"train": evalInput})

    Menilai dan menganalisis hasil evaluasi

    Setelah pekerjaan evaluasi Anda selesai dengan sukses, Anda dapat menilai dan menganalisis hasilnya menggunakan langkah-langkah berikut.

    Untuk menilai dan menganalisis hasil, ikuti langkah-langkah ini.
    1. Memahami struktur lokasi keluaran. Hasil disimpan di lokasi keluaran Amazon S3 yang Anda tentukan sebagai file terkompresi:

      s3://your-bucket/output/benchmark-name/ └── job_name/ └── output/ └── output.tar.gz
    2. Unduh output.tar.gz file dari bucket Anda. Ekstrak konten untuk mengungkapkan.

      run_name/ ├── eval_results/ | └── results_[timestamp].json │ └── inference_output.jsonl (only present for gen_qa) | └── details/ | └── model/ | └── <execution-date-time>/ | └──details_<task_name>_#_<datetime>.parquet └── tensorboard_results/ └── eval/ └── events.out.tfevents.[timestamp]
      • results_[timestamp].json- File JSON metrik keluaran

      • details_<task_name>_#_<datetime>.parquet- File output inferensi (kecuali untukstrong_reject)

      • events.out.tfevents.[timestamp]- file TensorBoard keluaran

      • inference_output.jsonl- Berkas output inferensi yang dibersihkan (hanya untuk gen_qa tugas)

    3. Lihat hasil di TensorBoard. Untuk memvisualisasikan metrik evaluasi Anda:

      1. Unggah folder yang diekstrak ke bucket S3

      2. Arahkan ke SageMaker AI TensorBoard

      3. Pilih “folder S3” Anda

      4. Tambahkan jalur folder S3

      5. Tunggu hingga sinkronisasi selesai

    4. Menganalisis output inferensi. Semua tugas evaluasi, kecuali llm_judge danstrong_reject, akan memiliki bidang berikut untuk analisis dalam output inferensi.

      • full_prompt- Prompt pengguna lengkap dikirim ke model yang digunakan untuk tugas evaluasi.

      • gold- Bidang yang berisi jawaban yang benar seperti yang ditentukan oleh dataset.

      • metrics- Bidang yang berisi metrik yang dievaluasi pada inferensi individu. Nilai yang memerlukan agregasi tidak akan memiliki nilai pada output inferensi individu.

      • predictions- Bidang yang berisi daftar output model untuk prompt yang diberikan.

      • pred_logits- Bidang yang berisi token keluaran yang dipertimbangkan dan probabilitas log dari setiap token keluaran yang dikembalikan dalam konten pesan.

      Dengan melihat bidang-bidang ini, Anda dapat menentukan penyebab perbedaan metrik dan memahami perilaku model yang disesuaikan.

      Untukllm_judge, file output inferensi berisi bidang berikut di bawah bidang metrik per pasangan evaluasi.

      • forward_output- Preferensi mentah hakim saat mengevaluasi secara berurutan (response_A, response_b).

      • backward_output- Preferensi mentah hakim saat mengevaluasi dalam urutan terbalik (response_b, response_A).

      • Pairwise metrics- Metrik yang dihitung per pasangan evaluasi maju dan mundur termasuka_scores,b_scores,ties, inference-score danscore.

        catatan

        Metrik agregat seperti hanya winrate tersedia di file hasil ringkasan, bukan per penilaian individu.

      Untukgen_qa, inference_output.jsonl file berisi bidang berikut untuk setiap objek JSON:

      • prompt - Prompt terakhir yang dikirimkan ke model

      • inferensi - Output inferensi mentah dari model

      • emas - Respons target dari dataset input

      • metadata - String metadata dari dataset input jika disediakan

    Evaluasi praktik terbaik dan pemecahan masalah

    Praktik terbaik

    Berikut ini mencantumkan beberapa praktik terbaik untuk proses evaluasi.

    • Jaga agar jalur keluaran Anda diatur berdasarkan model dan jenis benchmark.

    • Pertahankan konvensi penamaan yang konsisten untuk memudahkan pelacakan.

    • Simpan hasil yang diekstraksi di lokasi yang aman.

    • Pantau status TensorBoard sinkronisasi agar pemuatan data berhasil.

    Pemecahan masalah

    Anda dapat menggunakan grup CloudWatch log /aws/sagemaker/TrainingJobs untuk melatih log kesalahan pekerjaan.

    Kegagalan inti mesin

    Masalah:

    Jika Anda melihat:

    RuntimeError: Engine core initialization failed.

    Penyebab:

    Meskipun ini adalah kesalahan umum yang dapat memiliki beberapa penyebab, biasanya terjadi ketika ada ketidakcocokan antara pos pemeriksaan model yang Anda coba muat dan jenis model yang ditentukan. E.g. Anda ingin mengevaluasi pos pemeriksaan model Nova 2.0 lite yang disetel dengan baik tetapi jenis model yang Anda berikan adalah tipe model 1.0. mis. amazon.nova-micro-v1:0:128k

    Pemetaan yang benar harus

    model_type: amazon.nova-2-lite-v1:0:256k model_name_or_path: nova-lite-2/prod # or s3://escrow_bucket/model_location

    Pencegahan:

    Periksa ulang model_name_or_path apakah dipetakan ke kanan model_type sebelum mengirimkan pekerjaan evaluasi.

    Subtugas yang tersedia

    Berikut daftar subtugas yang tersedia untuk evaluasi model di beberapa domain termasuk MMLU (Massive Multitask Language Understanding), BBH (Big Bench Hard), MATH, dan MMMU (Massive Multimodal Understanding). Multi-discipline Subtugas ini memungkinkan Anda menilai kinerja model Anda pada kemampuan dan area pengetahuan tertentu.

    MMLU

    MMLU_SUBTASKS = [ "abstract_algebra", "anatomy", "astronomy", "business_ethics", "clinical_knowledge", "college_biology", "college_chemistry", "college_computer_science", "college_mathematics", "college_medicine", "college_physics", "computer_security", "conceptual_physics", "econometrics", "electrical_engineering", "elementary_mathematics", "formal_logic", "global_facts", "high_school_biology", "high_school_chemistry", "high_school_computer_science", "high_school_european_history", "high_school_geography", "high_school_government_and_politics", "high_school_macroeconomics", "high_school_mathematics", "high_school_microeconomics", "high_school_physics", "high_school_psychology", "high_school_statistics", "high_school_us_history", "high_school_world_history", "human_aging", "human_sexuality", "international_law", "jurisprudence", "logical_fallacies", "machine_learning", "management", "marketing", "medical_genetics", "miscellaneous", "moral_disputes", "moral_scenarios", "nutrition", "philosophy", "prehistory", "professional_accounting", "professional_law", "professional_medicine", "professional_psychology", "public_relations", "security_studies", "sociology", "us_foreign_policy", "virology", "world_religions" ]

    BBH

    BBH_SUBTASKS = [ "boolean_expressions", "causal_judgement", "date_understanding", "disambiguation_qa", "dyck_languages", "formal_fallacies", "geometric_shapes", "hyperbaton", "logical_deduction_five_objects", "logical_deduction_seven_objects", "logical_deduction_three_objects", "movie_recommendation", "multistep_arithmetic_two", "navigate", "object_counting", "penguins_in_a_table", "reasoning_about_colored_objects", "ruin_names", "salient_translation_error_detection", "snarks", "sports_understanding", "temporal_sequences", "tracking_shuffled_objects_five_objects", "tracking_shuffled_objects_seven_objects", "tracking_shuffled_objects_three_objects", "web_of_lies", "word_sorting" ]

    Matematika

    MATH_SUBTASKS = [ "algebra", "counting_and_probability", "geometry", "intermediate_algebra", "number_theory", "prealgebra", "precalculus",

    MMMU

    MATH_SUBTASKS = [ "Accounting", "Agriculture", "Architecture_and_Engineering", "Art", "Art_Theory", "Basic_Medical_Science", "Biology", "Chemistry", "Clinical_Medicine", "Computer_Science", "Design", "Diagnostics_and_Laboratory_Medicine", "Economics", "Electronics", "Energy_and_Power", "Finance", "Geography", "History", "Literature", "Manage", "Marketing", "Materials", "Math", "Mechanical_Engineering", "Music", "Pharmacy", "Physics", "Psychology", "Public_Health", "Sociology",

    Evaluasi model Nova Anda yang disesuaikan menggunakan berbagai metode evaluasi dan metrik.