Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Mempersiapkan data untuk RFT di Amazon Nova 2
RFT di Amazon Nova 2 saat ini mendukung data pelatihan berbasis teks. Halaman ini menjelaskan format data, fitur yang didukung, batasan, dan praktik terbaik untuk menyiapkan data pelatihan RFT untuk model Amazon Nova 2 Understanding.
Tip
Untuk memvalidasi format dataset Anda sebelum memulai pekerjaan pelatihan, lihatAlat validasi.
Topik
Format data
Data pelatihan RFT mengikuti format Penguatan OpenAI. Fine-Tuning https://developers.openai.com/api/docs/guides/reinforcement-fine-tuning#prepare-your-dataset
Wajib. Serangkaian pergantian percakapan menggunakansystem,user, dan assistant peran opsional.
-
peran - Diperlukan. Nilai umum:
system(instruksi untuk model) danuser(tugas atau input). -
konten - Diperlukan. Isi teks pesan. Untuk giliran sistem ini adalah instruksi; untuk giliran pengguna ini adalah tugas atau input.
"messages": [ { "role": "system", "content": "instructions" }, { "role": "user", "content": "prompt" } ]
Wajib. Output yang diharapkan atau kriteria evaluasi yang digunakan fungsi hadiah Anda untuk menilai respons model. Bidang ini tidak terbatas pada output terstruktur - dapat berisi format apa pun yang membantu fungsi hadiah Anda mengevaluasi kualitas.
"reference_answer": { "field": "value" }
Tidak wajib. Array spesifikasi alat yang tersedia untuk model selama contoh ini. Setiap item mendefinisikan antarmuka alat dan metadata. Untuk contoh lengkap, lihatPanggilan alat.
"tools": [ { "type": "function", "function": { "name": "tool-name", "description": "tool-description", "parameters": {...} } } ]
Format data RFT mendukung bidang khusus di luar messages danreference_answer. Sertakan data tambahan apa pun yang dibutuhkan fungsi hadiah Anda untuk evaluasi yang tepat. Anda tidak perlu mengonfigurasi ini dalam resep Anda — mereka diteruskan ke fungsi hadiah Anda di metadata lapangan saat runtime.
Contoh umumnya meliputi:
Metadata
id— Pengidentifikasi unik untuk pelacakantask_id— pengi Task-level dentifikasidifficulty_level— Indikator kompleksitas masalahdomain— Bidang atau kategori subjekexpected_reasoning_steps— Jumlah langkah dalam solusi
Kriteria evaluasi
evaluation_criteria— Rubrik penilaian khususcustom_scoring_weights- Pentingnya relatif dari berbagai aspekcontext_data— Informasi latar belakang untuk masalahexternal_references— Tautan ke dokumentasi atau sumber daya yang relevan
Memvalidasi data Anda
Sebelum mengirimkan pekerjaan pelatihan Anda, validasi dataset Anda untuk menangkap masalah pemformatan lebih awal. Untuk alat validasi yang tersedia, lihatAlat validasi.
Sampel masukan
Berikut ini adalah contoh lengkap objek JSON yang menunjukkan cara menggabungkan bidang untuk kasus penggunaan RFT yang berbeda.
Fitur yang didukung
Tabel berikut merangkum dukungan fitur untuk RFT di Amazon Nova 2.
| Fitur | RFT di Amazon Nova 2 |
|---|---|
| Pemahaman teks | Didukung pada Nova 2.0 Lite. Lihat General/Text pengertian. |
| Pemahaman gambar | Tidak didukung |
| Pemahaman video | Tidak didukung |
| Pemahaman dokumen | Tidak didukung |
| Panggilan alat | Didukung pada Nova 2.0 Lite. Lihat Panggilan alat. |
| Penalaran | Didukung pada Nova 2.0 Lite. Lihat Penalaran. |
General/Text pengertian
Bagian ini merangkum kendala umum dan praktik terbaik untuk menyiapkan data pelatihan RFT di Amazon Nova 2.
Batasan
| Kendala | Rincian |
|---|---|
| Format kumpulan data | JSONL (satu objek JSON per baris). |
| Contoh pelatihan minimum | 100 |
| Contoh evaluasi minimum | 100 |
| Modalitas yang didukung | Teks saja |
Praktik terbaik
Kami sarankan memulai dengan ukuran kumpulan data minimum (100 pelatihan dan 100 contoh evaluasi) dan meningkatkan skala setelah Anda memvalidasi fungsi hadiah Anda dan mengonfirmasi bahwa RFT sesuai untuk kasus penggunaan Anda.
Kami merekomendasikan pendekatan evaluasi pertama. Sebelum berinvestasi dalam pelatihan RFT skala besar, evaluasi kinerja dasar model Anda:
Kinerja tinggi (> 95% imbalan) - RFT mungkin tidak diperlukan karena model Anda sudah berkinerja baik.
Kinerja yang sangat buruk (hadiah 0%) - Beralih ke SFT terlebih dahulu untuk menetapkan kemampuan dasar.
Kinerja moderat - RFT kemungkinan sesuai.
Memulai dengan kumpulan data kecil membantu Anda memvalidasi bahwa fungsi hadiah Anda bebas bug, mengonfirmasi bahwa RFT adalah pendekatan yang tepat, mengidentifikasi dan memperbaiki masalah lebih awal, dan menguji alur kerja sebelum meningkatkan.
Prioritaskan data input berkualitas tinggi dan fungsi hadiah yang andal yang dieksekusi secara konsisten pada respons model.
Sampel masukan
{ "id": "math-001", "messages": [ { "role": "system", "content": "You are a math tutor" }, { "role": "user", "content": "Solve: 2x + 5 = 13" } ], "reference_answer": { "solution": "x = 4", "steps": ["2x = 13 - 5", "2x = 8", "x = 4"] } }
Panggilan alat
RFT mendukung model pelatihan tentang pola pemanggilan alat, memungkinkan model Anda mempelajari kapan dan bagaimana memanggil alat atau fungsi eksternal.
Batasan
| Kendala | Rincian |
|---|---|
| Lokasi definisi alat | Alat dideklarasikan dalam tools array tingkat atas dari contoh pelatihan. |
| Format definisi alat | Setiap alat harus menyertakantype,function.name,function.description, dan Skema JSON yang valid difunction.parameters. |
| Jawaban referensi | Gunakan reference_answer untuk menentukan pemanggilan alat yang diharapkan (misalnya,tool_called,tool_parameters) sehingga fungsi hadiah Anda dapat mengevaluasi kebenaran. |
Praktik terbaik
Pastikan definisi alat Anda konsisten di semua sampel pelatihan.
Model mempelajari pola pemanggilan alat dari demonstrasi yang Anda berikan.
Sertakan beragam contoh kapan harus menggunakan setiap alat dan kapan tidak menggunakan alat.
Sampel masukan
{ "id": "tool-001", "messages": [ { "role": "system", "content": "You are a helpful game master assistant" }, { "role": "user", "content": "Generate a strength stat for a warrior character. Apply a +2 racial bonus modifier." } ], "tools": [ { "type": "function", "function": { "name": "StatRollAPI", "description": "Generates character stats by rolling 4d6, dropping the lowest die result, and applying a modifier.", "parameters": { "type": "object", "properties": { "modifier": { "description": "An integer representing the modifier to apply to the total of the stat roll.", "type": "integer" } }, "required": ["modifier"] } } } ], "reference_answer": { "tool_called": "StatRollAPI", "tool_parameters": { "modifier": 2 }, "expected_behavior": "Call StatRollAPI with modifier=2 and return the calculated stat value" } }
Penalaran
RFT di Amazon Nova 2 mendukung mode penalaran, di mana model menghasilkan token pemikiran eksplisit sebelum menghasilkan jawaban akhir. Anda mengontrol perilaku penalaran selama reasoning_effort pelatihan dengan bidang konfigurasi pelatihan.
Batasan
| Kendala | Rincian |
|---|---|
| Mode yang tersedia | none(hilangkan reasoning_effort bidang),low, danhigh. Tidak ada medium opsi untuk RFT. |
| Perilaku default | Jika reasoning_effort bidang tidak ada dalam konfigurasi Anda, penalaran dinonaktifkan. |
| Batas token | Saat penalaran diaktifkan, atur max_new_tokens ke 32768 untuk mengakomodasi keluaran penalaran yang diperluas. |
Kapan menggunakan setiap mode
Gunakan high alasan untuk:
Tugas analitis yang kompleks
Pemecahan masalah matematika
Multi-step deduksi logis
Tugas di mana pemikiran langkah demi langkah menambah nilai
Gunakan none (hilangkanreasoning_effort) atau alasan low untuk:
Pertanyaan faktual sederhana
Klasifikasi langsung
Optimalisasi kecepatan dan biaya
Jawaban pertanyaan langsung
Pengorbanan biaya dan kinerja
Mode penalaran yang lebih tinggi meningkat:
Waktu dan biaya pelatihan
Latensi inferensi dan biaya
Kemampuan model untuk tugas penalaran yang kompleks
Karakteristik data pelatihan yang efektif
Kejelasan dan konsistensi
Contoh RFT yang baik memerlukan data input yang jelas dan tidak ambigu yang memungkinkan perhitungan hadiah yang akurat di seluruh keluaran model yang berbeda. Hindari kebisingan dalam data Anda, termasuk:
Pemformatan yang tidak konsisten
Label atau instruksi yang kontradiktif
Petunjuk ambigu
Jawaban referensi yang bertentangan
Setiap ambiguitas akan menyesatkan proses pelatihan dan menyebabkan model mempelajari perilaku yang tidak diinginkan.
Keanekaragaman
Dataset Anda harus menangkap keragaman penuh kasus penggunaan produksi untuk memastikan kinerja dunia nyata yang kuat. Termasuk:
Format input dan casing tepi yang berbeda
Petakan pola penggunaan produksi aktual dari log dan analisis pengguna
Sampel di seluruh jenis pengguna, wilayah geografis, dan variasi musiman
Sertakan tingkat kesulitan dari masalah sederhana hingga kompleks
Pertimbangan fungsi hadiah
Rancang fungsi hadiah Anda untuk pelatihan yang efisien:
Jalankan dalam hitungan detik (bukan menit)
Paralelisasi secara efektif dengan Lambda
Kembalikan skor yang konsisten dan dapat diandalkan
Tangani berbagai jenis output model dengan anggun
Fungsi hadiah yang cepat dan dapat diskalakan memungkinkan iterasi cepat dan eksperimen hemat biaya.
Pelatihan RFT menggunakan LLM sebagai hakim
Gambaran umum
Model bahasa besar (LLM) semakin banyak digunakan sebagai juri dalam alur kerja penguatan fine tuning (RFT), memberikan sinyal hadiah otomatis yang memandu pengoptimalan model. Dalam pendekatan ini, LLM mengevaluasi keluaran model terhadap kriteria yang ditentukan — apakah menilai kebenaran, kualitas, kepatuhan gaya, atau kesetaraan semantik — dan memberikan penghargaan yang mendorong proses pembelajaran penguatan.
Ini sangat berharga untuk tugas-tugas di mana fungsi penghargaan tradisional sulit untuk didefinisikan secara terprogram, seperti menentukan apakah representasi yang berbeda (seperti "1/3“, “0,333", dan “sepertiga”) setara secara semantik, atau mengevaluasi kualitas bernuansa seperti koherensi dan relevansi. Dengan menggunakan j LLM-based uri sebagai fungsi hadiah, Anda dapat menskalakan RFT ke domain kompleks tanpa memerlukan anotasi manusia yang ekstensif, memungkinkan iterasi cepat dan peningkatan berkelanjutan model Anda di berbagai kasus penggunaan di luar masalah penyelarasan tradisional.
Memvalidasi hakim LLM Anda
Sebelum menerapkan LLM-as-a-judge dalam produksi, validasi bahwa evaluasi model hakim selaras dengan penilaian manusia. Ini melibatkan:
Mengukur tingkat kesepakatan antara hakim LLM dan evaluator manusia pada sampel yang representatif dari tugas Anda
Memastikan bahwa perjanjian LLM dengan manusia memenuhi atau melebihi tingkat kesepakatan antar manusia
Mengidentifikasi bias potensial dalam model hakim
Membangun keyakinan bahwa sinyal hadiah memandu model Anda ke arah yang diinginkan
Langkah validasi ini membantu memastikan proses evaluasi otomatis akan menghasilkan model yang memenuhi kriteria kualitas produksi Anda.
Konfigurasi lambda untuk hakim LLM
Menggunakan LLM sebagai juri adalah perpanjangan dari penggunaan fungsi Lambda untuk Pembelajaran Penguatan dengan Hadiah Verifikasi (RLVR). Di dalam fungsi Lambda, Anda melakukan panggilan ke salah satu model yang dihosting di Amazon Bedrock.
Persyaratan konfigurasi penting:
| Konfigurasi | Persyaratan | Rincian |
|---|---|---|
| Throughput Amazon Bedrock | Kuota yang cukup | Pastikan kuota throughput Anda untuk model Amazon Bedrock yang digunakan cukup untuk beban kerja pelatihan Anda |
| Batas waktu Lambda | Waktu tunggu yang diperpanjang | Konfigurasikan batas waktu fungsi Lambda Anda hingga maksimum 15 menit. Pengaturan default adalah 3 detik, yang tidak cukup untuk respons model Amazon Bedrock |
| Lambda konkurensi | Peningkatan konkurensi | Lambda dipanggil secara paralel selama pelatihan. Tingkatkan konkurensi untuk memaksimalkan throughput yang tersedia |
| Konfigurasi resep | Cocokkan pengaturan Lambda | Batas konkurensi harus dikonfigurasi dalam resep Anda |