Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Teknik kustomisasi
Teknik penyesuaian menentukan bagaimana model Anda belajar dari data. Setiap teknik memerlukan format dataset yang berbeda dan memiliki hyperparameter sendiri. Pilih berdasarkan data apa yang Anda miliki dan perilaku apa yang ingin Anda capai.
SFT(Diawasi Fine-Tuning) - Latih pasangan respon cepat berlabel. Terbaik untuk mengajarkan model gaya, format, atau pengetahuan domain tertentu.
DPO(Pengoptimalan Preferensi Langsung) — Latih pasangan respons yang disukai vs yang ditolak. Terbaik untuk menyelaraskan dengan preferensi manusia dan menghindari output yang tidak diinginkan.
RFT(Penguatan Fine-Tuning) - Optimalkan melalui sinyal hadiah: verifikasi berbasis kode (RLVR) atau hakim LLM (RLAIF). Terbaik untuk meningkatkan akurasi faktual atau kualitas subjektif.
Multi-turn pembelajaran penguatan(Pem Multi-Turn belajaran Penguatan) - Latih agen untuk tugas agen multi-langkah dengan konteks yang berkembang.
Kustomisasi berkelanjutan(Kustomisasi Berkelanjutan) — Rantau beberapa teknik secara berurutan (misalnya, SFT → DPO → RLVR). Membutuhkan jenis pelatihan LoRa.
Setiap teknik dapat dikombinasikan dengan jenis pelatihan LoRa atau FFT. Lihat Jenis pelatihan untuk detail tentang memilih di antara mereka.