View a markdown version of this page

Mempersiapkan data untuk RFT di Amazon Nova 2 - Amazon Nova

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Mempersiapkan data untuk RFT di Amazon Nova 2

RFT di Amazon Nova 2 saat ini mendukung data pelatihan berbasis teks. Halaman ini menjelaskan format data, fitur yang didukung, batasan, dan praktik terbaik untuk menyiapkan data pelatihan RFT untuk model Amazon Nova 2 Understanding.

Tip

Untuk memvalidasi format dataset Anda sebelum memulai pekerjaan pelatihan, lihatAlat validasi.

Format data

Data pelatihan RFT mengikuti format Penguatan OpenAI. Fine-Tuning https://developers.openai.com/api/docs/guides/reinforcement-fine-tuning#prepare-your-dataset Setiap baris dalam file pelatihan JSONL Anda adalah objek JSON dengan bidang tingkat atas berikut. Perluas bagian untuk mempelajari lebih lanjut:

Wajib. Serangkaian pergantian percakapan menggunakansystem,user, dan assistant peran opsional.

  • peran - Diperlukan. Nilai umum: system (instruksi untuk model) dan user (tugas atau input).

  • konten - Diperlukan. Isi teks pesan. Untuk giliran sistem ini adalah instruksi; untuk giliran pengguna ini adalah tugas atau input.

"messages": [ { "role": "system", "content": "instructions" }, { "role": "user", "content": "prompt" } ]

Wajib. Output yang diharapkan atau kriteria evaluasi yang digunakan fungsi hadiah Anda untuk menilai respons model. Bidang ini tidak terbatas pada output terstruktur - dapat berisi format apa pun yang membantu fungsi hadiah Anda mengevaluasi kualitas.

"reference_answer": { "field": "value" }

Tidak wajib. Array spesifikasi alat yang tersedia untuk model selama contoh ini. Setiap item mendefinisikan antarmuka alat dan metadata. Untuk contoh lengkap, lihatPanggilan alat.

"tools": [ { "type": "function", "function": { "name": "tool-name", "description": "tool-description", "parameters": { ... } } } ]

Format data RFT mendukung bidang khusus di luar messages danreference_answer. Sertakan data tambahan apa pun yang dibutuhkan fungsi hadiah Anda untuk evaluasi yang tepat. Anda tidak perlu mengonfigurasi ini dalam resep Anda — mereka diteruskan ke fungsi hadiah Anda di metadata lapangan saat runtime.

Contoh umumnya meliputi:

Metadata

  • id— Pengidentifikasi unik untuk pelacakan

  • task_id— pengi Task-level dentifikasi

  • difficulty_level— Indikator kompleksitas masalah

  • domain— Bidang atau kategori subjek

  • expected_reasoning_steps— Jumlah langkah dalam solusi

Kriteria evaluasi

  • evaluation_criteria— Rubrik penilaian khusus

  • custom_scoring_weights- Pentingnya relatif dari berbagai aspek

  • context_data— Informasi latar belakang untuk masalah

  • external_references— Tautan ke dokumentasi atau sumber daya yang relevan

Memvalidasi data Anda

Sebelum mengirimkan pekerjaan pelatihan Anda, validasi dataset Anda untuk menangkap masalah pemformatan lebih awal. Untuk alat validasi yang tersedia, lihatAlat validasi.

Sampel masukan

Berikut ini adalah contoh lengkap objek JSON yang menunjukkan cara menggabungkan bidang untuk kasus penggunaan RFT yang berbeda.

Chemistry problem
{ "id": "chem-01", "messages": [ { "role": "system", "content": "You are a helpful chemistry assistant" }, { "role": "user", "content": "Calculate the molecular weight of caffeine (C8H10N4O2)" } ], "reference_answer": { "molecular_weight": 194.19, "unit": "g/mol", "calculation": "8(12.01) + 10(1.008) + 4(14.01) + 2(16.00) = 194.19" } }
Math problem
{ "id": "math-001", "messages": [ { "role": "system", "content": "You are a math tutor" }, { "role": "user", "content": "Solve: 2x + 5 = 13" } ], "reference_answer": { "solution": "x = 4", "steps": ["2x = 13 - 5", "2x = 8", "x = 4"] } }
Code problem
{ "id": "code-002", "messages": [ { "role": "system", "content": "You are a helpful programming assistant" }, { "role": "user", "content": "Write a Python function that reverses a string without using built-in reverse methods" } ], "reference_answer": { "code": "def reverse_string(s):\n result = ''\n for i in range(len(s) - 1, -1, -1):\n result += s[i]\n return result", "test_cases": [ { "input": "hello", "expected_output": "olleh" }, { "input": "", "expected_output": "" }, { "input": "a", "expected_output": "a" }, { "input": "Python123", "expected_output": "321nohtyP" } ], "all_tests_pass": true } }
Tool usage
{ "id": "tool-001", "messages": [ { "role": "system", "content": "You are a helpful game master assistant" }, { "role": "user", "content": "Generate a strength stat for a warrior character. Apply a +2 racial bonus modifier." } ], "tools": [ { "type": "function", "function": { "name": "StatRollAPI", "description": "Generates character stats by rolling 4d6, dropping the lowest die result, and applying a modifier.", "parameters": { "type": "object", "properties": { "modifier": { "description": "An integer representing the modifier to apply to the total of the stat roll.", "type": "integer" } }, "required": ["modifier"] } } } ], "reference_answer": { "tool_called": "StatRollAPI", "tool_parameters": { "modifier": 2 }, "expected_behavior": "Call StatRollAPI with modifier=2 and return the calculated stat value" } }
With additional properties

Contoh berikut mencakup bidang metadata khusus yang diteruskan ke fungsi hadiah Anda selama evaluasi, memungkinkan logika penilaian canggih yang disesuaikan dengan kasus penggunaan spesifik Anda.

{ "messages": [ { "role": "system", "content": "You are a math tutor" }, { "role": "user", "content": "Solve: 2x + 5 = 13" } ], "reference_answer": { "solution": "x = 4", "steps": ["2x = 13 - 5", "2x = 8", "x = 4"] }, "task_id": "algebra_001", "difficulty_level": "easy", "domain": "algebra", "expected_reasoning_steps": 3 }

Fitur yang didukung

Tabel berikut merangkum dukungan fitur untuk RFT di Amazon Nova 2.

Dukungan fitur RFT
Fitur RFT di Amazon Nova 2
Pemahaman teks Didukung pada Nova 2.0 Lite. Lihat General/Text pengertian.
Pemahaman gambar Tidak didukung
Pemahaman video Tidak didukung
Pemahaman dokumen Tidak didukung
Panggilan alat Didukung pada Nova 2.0 Lite. Lihat Panggilan alat.
Penalaran Didukung pada Nova 2.0 Lite. Lihat Penalaran.

General/Text pengertian

Bagian ini merangkum kendala umum dan praktik terbaik untuk menyiapkan data pelatihan RFT di Amazon Nova 2.

Batasan

Kendala kumpulan data umum
Kendala Rincian
Format kumpulan data JSONL (satu objek JSON per baris).
Contoh pelatihan minimum 100
Contoh evaluasi minimum 100
Modalitas yang didukung Teks saja

Praktik terbaik

  • Kami sarankan memulai dengan ukuran kumpulan data minimum (100 pelatihan dan 100 contoh evaluasi) dan meningkatkan skala setelah Anda memvalidasi fungsi hadiah Anda dan mengonfirmasi bahwa RFT sesuai untuk kasus penggunaan Anda.

  • Kami merekomendasikan pendekatan evaluasi pertama. Sebelum berinvestasi dalam pelatihan RFT skala besar, evaluasi kinerja dasar model Anda:

    • Kinerja tinggi (> 95% imbalan) - RFT mungkin tidak diperlukan karena model Anda sudah berkinerja baik.

    • Kinerja yang sangat buruk (hadiah 0%) - Beralih ke SFT terlebih dahulu untuk menetapkan kemampuan dasar.

    • Kinerja moderat - RFT kemungkinan sesuai.

  • Memulai dengan kumpulan data kecil membantu Anda memvalidasi bahwa fungsi hadiah Anda bebas bug, mengonfirmasi bahwa RFT adalah pendekatan yang tepat, mengidentifikasi dan memperbaiki masalah lebih awal, dan menguji alur kerja sebelum meningkatkan.

  • Prioritaskan data input berkualitas tinggi dan fungsi hadiah yang andal yang dieksekusi secara konsisten pada respons model.

Sampel masukan

{ "id": "math-001", "messages": [ { "role": "system", "content": "You are a math tutor" }, { "role": "user", "content": "Solve: 2x + 5 = 13" } ], "reference_answer": { "solution": "x = 4", "steps": ["2x = 13 - 5", "2x = 8", "x = 4"] } }

Panggilan alat

RFT mendukung model pelatihan tentang pola pemanggilan alat, memungkinkan model Anda mempelajari kapan dan bagaimana memanggil alat atau fungsi eksternal.

Batasan

Kendala pemanggilan alat
Kendala Rincian
Lokasi definisi alat Alat dideklarasikan dalam tools array tingkat atas dari contoh pelatihan.
Format definisi alat Setiap alat harus menyertakantype,function.name,function.description, dan Skema JSON yang valid difunction.parameters.
Jawaban referensi Gunakan reference_answer untuk menentukan pemanggilan alat yang diharapkan (misalnya,tool_called,tool_parameters) sehingga fungsi hadiah Anda dapat mengevaluasi kebenaran.

Praktik terbaik

  • Pastikan definisi alat Anda konsisten di semua sampel pelatihan.

  • Model mempelajari pola pemanggilan alat dari demonstrasi yang Anda berikan.

  • Sertakan beragam contoh kapan harus menggunakan setiap alat dan kapan tidak menggunakan alat.

Sampel masukan

{ "id": "tool-001", "messages": [ { "role": "system", "content": "You are a helpful game master assistant" }, { "role": "user", "content": "Generate a strength stat for a warrior character. Apply a +2 racial bonus modifier." } ], "tools": [ { "type": "function", "function": { "name": "StatRollAPI", "description": "Generates character stats by rolling 4d6, dropping the lowest die result, and applying a modifier.", "parameters": { "type": "object", "properties": { "modifier": { "description": "An integer representing the modifier to apply to the total of the stat roll.", "type": "integer" } }, "required": ["modifier"] } } } ], "reference_answer": { "tool_called": "StatRollAPI", "tool_parameters": { "modifier": 2 }, "expected_behavior": "Call StatRollAPI with modifier=2 and return the calculated stat value" } }

Penalaran

RFT di Amazon Nova 2 mendukung mode penalaran, di mana model menghasilkan token pemikiran eksplisit sebelum menghasilkan jawaban akhir. Anda mengontrol perilaku penalaran selama reasoning_effort pelatihan dengan bidang konfigurasi pelatihan.

Batasan

Kendala penalaran
Kendala Rincian
Mode yang tersedia none(hilangkan reasoning_effort bidang),low, danhigh. Tidak ada medium opsi untuk RFT.
Perilaku default Jika reasoning_effort bidang tidak ada dalam konfigurasi Anda, penalaran dinonaktifkan.
Batas token Saat penalaran diaktifkan, atur max_new_tokens ke 32768 untuk mengakomodasi keluaran penalaran yang diperluas.

Kapan menggunakan setiap mode

Gunakan high alasan untuk:

  • Tugas analitis yang kompleks

  • Pemecahan masalah matematika

  • Multi-step deduksi logis

  • Tugas di mana pemikiran langkah demi langkah menambah nilai

Gunakan none (hilangkanreasoning_effort) atau alasan low untuk:

  • Pertanyaan faktual sederhana

  • Klasifikasi langsung

  • Optimalisasi kecepatan dan biaya

  • Jawaban pertanyaan langsung

Pengorbanan biaya dan kinerja

Mode penalaran yang lebih tinggi meningkat:

  • Waktu dan biaya pelatihan

  • Latensi inferensi dan biaya

  • Kemampuan model untuk tugas penalaran yang kompleks

Karakteristik data pelatihan yang efektif

Kejelasan dan konsistensi

Contoh RFT yang baik memerlukan data input yang jelas dan tidak ambigu yang memungkinkan perhitungan hadiah yang akurat di seluruh keluaran model yang berbeda. Hindari kebisingan dalam data Anda, termasuk:

  • Pemformatan yang tidak konsisten

  • Label atau instruksi yang kontradiktif

  • Petunjuk ambigu

  • Jawaban referensi yang bertentangan

Setiap ambiguitas akan menyesatkan proses pelatihan dan menyebabkan model mempelajari perilaku yang tidak diinginkan.

Keanekaragaman

Dataset Anda harus menangkap keragaman penuh kasus penggunaan produksi untuk memastikan kinerja dunia nyata yang kuat. Termasuk:

  • Format input dan casing tepi yang berbeda

  • Petakan pola penggunaan produksi aktual dari log dan analisis pengguna

  • Sampel di seluruh jenis pengguna, wilayah geografis, dan variasi musiman

  • Sertakan tingkat kesulitan dari masalah sederhana hingga kompleks

Pertimbangan fungsi hadiah

Rancang fungsi hadiah Anda untuk pelatihan yang efisien:

  • Jalankan dalam hitungan detik (bukan menit)

  • Paralelisasi secara efektif dengan Lambda

  • Kembalikan skor yang konsisten dan dapat diandalkan

  • Tangani berbagai jenis output model dengan anggun

Fungsi hadiah yang cepat dan dapat diskalakan memungkinkan iterasi cepat dan eksperimen hemat biaya.

Pelatihan RFT menggunakan LLM sebagai hakim

Gambaran umum

Model bahasa besar (LLM) semakin banyak digunakan sebagai juri dalam alur kerja penguatan fine tuning (RFT), memberikan sinyal hadiah otomatis yang memandu pengoptimalan model. Dalam pendekatan ini, LLM mengevaluasi keluaran model terhadap kriteria yang ditentukan — apakah menilai kebenaran, kualitas, kepatuhan gaya, atau kesetaraan semantik — dan memberikan penghargaan yang mendorong proses pembelajaran penguatan.

Ini sangat berharga untuk tugas-tugas di mana fungsi penghargaan tradisional sulit untuk didefinisikan secara terprogram, seperti menentukan apakah representasi yang berbeda (seperti "1/3“, “0,333", dan “sepertiga”) setara secara semantik, atau mengevaluasi kualitas bernuansa seperti koherensi dan relevansi. Dengan menggunakan j LLM-based uri sebagai fungsi hadiah, Anda dapat menskalakan RFT ke domain kompleks tanpa memerlukan anotasi manusia yang ekstensif, memungkinkan iterasi cepat dan peningkatan berkelanjutan model Anda di berbagai kasus penggunaan di luar masalah penyelarasan tradisional.

Memvalidasi hakim LLM Anda

Sebelum menerapkan LLM-as-a-judge dalam produksi, validasi bahwa evaluasi model hakim selaras dengan penilaian manusia. Ini melibatkan:

  • Mengukur tingkat kesepakatan antara hakim LLM dan evaluator manusia pada sampel yang representatif dari tugas Anda

  • Memastikan bahwa perjanjian LLM dengan manusia memenuhi atau melebihi tingkat kesepakatan antar manusia

  • Mengidentifikasi bias potensial dalam model hakim

  • Membangun keyakinan bahwa sinyal hadiah memandu model Anda ke arah yang diinginkan

Langkah validasi ini membantu memastikan proses evaluasi otomatis akan menghasilkan model yang memenuhi kriteria kualitas produksi Anda.

Konfigurasi lambda untuk hakim LLM

Menggunakan LLM sebagai juri adalah perpanjangan dari penggunaan fungsi Lambda untuk Pembelajaran Penguatan dengan Hadiah Verifikasi (RLVR). Di dalam fungsi Lambda, Anda melakukan panggilan ke salah satu model yang dihosting di Amazon Bedrock.

Persyaratan konfigurasi penting:

Konfigurasi Persyaratan Rincian
Throughput Amazon Bedrock Kuota yang cukup Pastikan kuota throughput Anda untuk model Amazon Bedrock yang digunakan cukup untuk beban kerja pelatihan Anda
Batas waktu Lambda Waktu tunggu yang diperpanjang Konfigurasikan batas waktu fungsi Lambda Anda hingga maksimum 15 menit. Pengaturan default adalah 3 detik, yang tidak cukup untuk respons model Amazon Bedrock
Lambda konkurensi Peningkatan konkurensi Lambda dipanggil secara paralel selama pelatihan. Tingkatkan konkurensi untuk memaksimalkan throughput yang tersedia
Konfigurasi resep Cocokkan pengaturan Lambda Batas konkurensi harus dikonfigurasi dalam resep Anda