View a markdown version of this page

Kustomisasi berkelanjutan - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Kustomisasi berkelanjutan

Dengan kustomisasi berkelanjutan, Anda dapat membangun model yang sebelumnya disesuaikan dengan menerapkan pelatihan tambahan — baik dengan teknik yang berbeda atau teknik yang sama dengan data baru. Misalnya, mulailah dengan SFT untuk mengajarkan pengetahuan domain, kemudian terapkan DPO untuk menyelaraskan dengan preferensi pengguna, lalu terapkan RLVR untuk meningkatkan akurasi faktual.

penting

Kustomisasi berkelanjutan berbeda dari MTRL (Reinfor Multi-Turn cement Learning). Pekerjaan pelatihan rantai kustomisasi berkelanjutan lintas teknik. MTRL melatih agen untuk tugas penggunaan alat multi-langkah dalam satu pekerjaan pelatihan.

Cara kerjanya

  • Memu at bobot adaptor LoRa dari pekerjaan pelatihan sebelumnya

  • Mengatur ulang pengoptimal, penjadwal, dan penghitung langkah (pelatihan baru dengan teknik atau data baru)

  • Output pekerjaan sebelumnya menjadi titik awal untuk menjalankan pelatihan baru

catatan

Kustomisasi berkelanjutan saat ini tersedia melalui MTRL dan alur kerja kustomisasi berkelanjutan hanya menggunakan SDK. Python Ini didukung dengan jenis pelatihan LoRa. Kustomisasi berkelanjutan di berbagai teknik dengan FFT tidak didukung.

Transisi teknik yang didukung

Tabel berikut menunjukkan semua kombinasi yang didukung untuk penyesuaian berkelanjutan:

Dari teknik Untuk teknik Didukung
SFTDPO
SFTRLVR
SFTRLAIF
SFTSFT (data baru)
SFTMTRL
DPODPO (data baru)
DPORLVR
DPORLAIF
DPOSFT
RLVRDPO
RLVRRLVR (data baru)
RLAIFDPO
RLAIFRLAIF (data baru)

Kustomisasi berkelanjutan vs pelatihan resume

Kustomisasi berkelanjutan Lanjutkan pelatihan
Teknik Teknik yang berbeda atau sama Teknik yang sama saja
Status pengoptimal Setel ulang (awal baru) Dipulihkan dari pos pemeriksaan
Kasus penggunaan Teknik rantai (SFT → DPO → RLVR) Lanjutkan pelatihan yang terputus
Jenis pelatihan LoRaHanya LoRa LoRaHanya LoRa

Memulai

Kustomisasi berkelanjutan tersedia melalui Python SDK. Berikan jalur keluaran dari pekerjaan pelatihan sebelumnya sebagai teknik berikutnya. resume_from_path

from sagemaker.modules.train import DPOTrainer # Continue from a previous SFT job with DPO trainer = DPOTrainer( model_id="meta-textgeneration-llama-3-1-8b-instruct", train_data="s3://my-bucket/dpo-preferences.jsonl", resume_from_path="s3://my-bucket/previous-sft-output/", hyperparameters={ "max_epochs": 2, "learning_rate": 1e-5, "lora_rank": 16, } ) trainer.train()

Contoh alur kerja

SFT → DPO

Ajarkan pengetahuan domain terlebih dahulu, lalu selaraskan dengan preferensi pengguna

SFT → RLVR

Ajarkan format tugas terlebih dahulu, lalu optimalkan untuk kebenaran faktual

SFT → DPO → RLVR

Pipa penuh — pengetahuan → preferensi → akurasi

SFT → MTRL

Ajarkan kemampuan dasar, lalu latih untuk tugas agen multi-putaran

DPO → DPO (data baru)

Perbaiki preferensi secara berulang dengan data umpan balik baru