Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Kustomisasi berkelanjutan
Dengan kustomisasi berkelanjutan, Anda dapat membangun model yang sebelumnya disesuaikan dengan menerapkan pelatihan tambahan — baik dengan teknik yang berbeda atau teknik yang sama dengan data baru. Misalnya, mulailah dengan SFT untuk mengajarkan pengetahuan domain, kemudian terapkan DPO untuk menyelaraskan dengan preferensi pengguna, lalu terapkan RLVR untuk meningkatkan akurasi faktual.
penting
Kustomisasi berkelanjutan berbeda dari MTRL (Reinfor Multi-Turn cement Learning). Pekerjaan pelatihan rantai kustomisasi berkelanjutan lintas teknik. MTRL melatih agen untuk tugas penggunaan alat multi-langkah dalam satu pekerjaan pelatihan.
Cara kerjanya
Memu at bobot adaptor LoRa dari pekerjaan pelatihan sebelumnya
Mengatur ulang pengoptimal, penjadwal, dan penghitung langkah (pelatihan baru dengan teknik atau data baru)
Output pekerjaan sebelumnya menjadi titik awal untuk menjalankan pelatihan baru
catatan
Transisi teknik yang didukung
Tabel berikut menunjukkan semua kombinasi yang didukung untuk penyesuaian berkelanjutan:
| Dari teknik | Untuk teknik | Didukung |
|---|---|---|
| SFT | DPO | ✓ |
| SFT | RLVR | ✓ |
| SFT | RLAIF | ✓ |
| SFT | SFT (data baru) | ✓ |
| SFT | MTRL | ✓ |
| DPO | DPO (data baru) | ✓ |
| DPO | RLVR | ✓ |
| DPO | RLAIF | ✓ |
| DPO | SFT | ✓ |
| RLVR | DPO | ✓ |
| RLVR | RLVR (data baru) | ✓ |
| RLAIF | DPO | ✓ |
| RLAIF | RLAIF (data baru) | ✓ |
Kustomisasi berkelanjutan vs pelatihan resume
| Kustomisasi berkelanjutan | Lanjutkan pelatihan | |
|---|---|---|
| Teknik | Teknik yang berbeda atau sama | Teknik yang sama saja |
| Status pengoptimal | Setel ulang (awal baru) | Dipulihkan dari pos pemeriksaan |
| Kasus penggunaan | Teknik rantai (SFT → DPO → RLVR) | Lanjutkan pelatihan yang terputus |
| Jenis pelatihan | LoRaHanya LoRa | LoRaHanya LoRa |
Memulai
Kustomisasi berkelanjutan tersedia melalui Python SDK. Berikan jalur keluaran dari pekerjaan pelatihan sebelumnya sebagai teknik berikutnya. resume_from_path
from sagemaker.modules.train import DPOTrainer # Continue from a previous SFT job with DPO trainer = DPOTrainer( model_id="meta-textgeneration-llama-3-1-8b-instruct", train_data="s3://my-bucket/dpo-preferences.jsonl", resume_from_path="s3://my-bucket/previous-sft-output/", hyperparameters={ "max_epochs": 2, "learning_rate": 1e-5, "lora_rank": 16, } ) trainer.train()
Contoh alur kerja
- SFT → DPO
Ajarkan pengetahuan domain terlebih dahulu, lalu selaraskan dengan preferensi pengguna
- SFT → RLVR
Ajarkan format tugas terlebih dahulu, lalu optimalkan untuk kebenaran faktual
- SFT → DPO → RLVR
Pipa penuh — pengetahuan → preferensi → akurasi
- SFT → MTRL
Ajarkan kemampuan dasar, lalu latih untuk tugas agen multi-putaran
- DPO → DPO (data baru)
Perbaiki preferensi secara berulang dengan data umpan balik baru