Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Multi-turn pembelajaran penguatan
Multi-turn pembelajaran penguatan (RL) melatih agen untuk membuat keputusan yang baik di seluruh urutan langkah, tidak hanya dalam satu saat. Agen mengamati lingkungannya, mengambil tindakan, menerima hadiah, dan pindah ke keadaan baru, mengulangi proses ini selama banyak timesteps waktu. Tujuannya adalah untuk mempelajari kebijakan (perilaku model) yang memaksimalkan imbalan kumulatif di seluruh urutan daripada mengoptimalkan satu langkah dalam isolasi. Pendekatan ini semakin banyak digunakan untuk melatih model bahasa pada penalaran multi-langkah dan tugas agen, di mana model mengambil tindakan seperti panggilan alat, eksekusi kode, atau pencarian web di beberapa putaran dan dihargai berdasarkan keseluruhan urutan. Ini berbeda dari putaran tunggal RLHF/RLAIF, di mana hadiah diberikan ke satu output pada satu waktu.
Analogi sederhana
Bayangkan Anda adalah agen layanan pelanggan yang menangani tiket dukungan. Anda tidak menyelesaikannya dalam satu pesan. Anda mengajukan pertanyaan klarifikasi, mencari akun pelanggan, mencoba memperbaiki, memeriksa apakah berhasil, dan menindaklanjuti jika tidak. Pada akhirnya, pelanggan merasa puas atau tidak. Seiring waktu, Anda menjadi lebih baik dalam mengenali urutan langkah mana yang cenderung mengarah pada resolusi yang baik.
Multi-turn RL melatih model dengan cara yang sama. Alih-alih menilai model pada satu respons, ini memungkinkan model bekerja melalui tugas di beberapa langkah dan memberi penghargaan berdasarkan keseluruhan urutan. Model mempelajari keputusan mana yang sebelumnya dalam percakapan yang benar-benar penting.
Terminologi kunci
-
Agen: entitas pengambilan keputusan dalam sistem. Ia mengamati situasi saat ini, memutuskan tindakan apa yang harus diambil, dan belajar dari waktu ke waktu untuk meningkatkan strateginya. Dalam praktiknya, agen ini didukung oleh model AI, tetapi keduanya bukan hal yang sama. Model adalah jaringan saraf yang mendasarinya; agen adalah sistem yang lebih luas yang menggunakannya untuk memahami, memutuskan, dan bertindak. Secara sederhana: perwakilan layanan pelanggan yang menangani tiket.
-
Environment/Agentic Aplikasi: semua yang berinteraksi dengan agen, termasuk riwayat percakapan, detail akun pelanggan, dan alat apa pun yang dapat digunakan agen. Secara sederhana: platform dukungan, pelanggan, dan semua informasi yang tersedia untuk perwakilan.
-
Status: cuplikan situasi saat ini yang diamati agen sebelum memutuskan apa yang harus dilakukan selanjutnya. Secara sederhana: apa yang diketahui perwakilan saat ini, seperti masalah pelanggan, apa yang sudah dicoba, dan balasan terbaru.
-
Tindakan: apa yang dilakukan agen pada setiap langkah, seperti mengajukan pertanyaan klarifikasi, memanggil alat, atau mengirim tanggapan. Secara sederhana: langkah perwakilan selanjutnya, apakah itu mengajukan pertanyaan, mencari sesuatu, atau mengirim perbaikan.
-
Hadiah: sinyal umpan balik yang diterima agen, baik di setiap langkah atau di akhir tugas, menunjukkan seberapa baik semuanya berjalan. Secara sederhana: apakah pelanggan pergi puas? Hasil itu adalah pahala.
-
Kebijakan: strategi yang telah dipelajari agen. Ini memetakan keadaan tertentu untuk tindakan yang paling mungkin mengarah pada hasil yang baik. Secara sederhana: pengetahuan perwakilan dibangun dari pengalaman, mengetahui apa yang cenderung bekerja dalam situasi tertentu.
-
Episode: satu tugas yang lengkap dari awal hingga akhir. Secara sederhana: satu percakapan dukungan penuh, dari pesan pertama pelanggan hingga resolusi.
-
Giliran: pertukaran tunggal dalam satu episode, biasanya satu tindakan yang diambil oleh agen dan respons yang diterimanya dari lingkungan. Dalam percakapan, ini adalah satu pesan dan jawabannya. Secara sederhana: satu langkah dalam percakapan dukungan, seperti agen mengajukan pertanyaan dan pelanggan merespons.
-
Lintasan: urutan lengkap status, tindakan, dan hadiah yang direkam di seluruh episode. Ini adalah catatan lengkap tentang apa yang dilakukan agen dan apa yang terjadi sebagai hasilnya, digunakan untuk menghitung hadiah dan memperbarui kebijakan. Secara sederhana: seluruh transkrip percakapan dukungan dari awal hingga akhir, termasuk setiap keputusan yang dibuat agen dan bagaimana segala sesuatunya terungkap.
-
Hadiah kumulatif: total hadiah yang terakumulasi di semua langkah dalam sebuah episode, yang pada akhirnya coba maksimalkan oleh agen. Secara sederhana: bukan hanya apakah satu langkah berjalan dengan baik, tetapi apakah seluruh percakapan berjalan dengan baik secara keseluruhan.
Gunakan kasus untuk pembelajaran penguatan multi-putaran
Multi-turn RL adalah pendekatan yang tepat ketika satu respons tidak cukup untuk menyelesaikan tugas dengan baik. Jika kasus penggunaan Anda melibatkan urutan langkah, keputusan yang bergantung pada yang sebelumnya, RL multi-putaran layak dipertimbangkan.
Berikut adalah beberapa sinyal yang mengarah ke sana:
-
Tugas Anda membutuhkan interaksi bolak-balik: Model perlu mengajukan pertanyaan, mengumpulkan informasi, dan beradaptasi berdasarkan apa yang dipelajarinya di sepanjang jalan. Siklus prompt respons tunggal tidak cukup. Contoh: agen dukungan yang mendiagnosis masalah dengan mengajukan pertanyaan tindak lanjut sebelum menyarankan perbaikan.
-
Kualitas hasil tergantung pada urutan tindakan: Mendapatkan jawaban yang benar di akhir membutuhkan membuat gerakan yang tepat. Menghargai hanya hasil akhir tidak cukup jika jalan menuju ke sana penting. Contoh: asisten pengkodean yang merencanakan, menulis, menjalankan, dan men-debug kode di beberapa langkah.
-
Model perlu menggunakan alat di beberapa langkah: Model memanggil alat eksternal seperti pencarian, API, atau eksekusi kode, dan hasil dari satu panggilan alat memengaruhi apa yang dilakukannya selanjutnya. Contoh: asisten peneliti yang mencari informasi, mengevaluasi hasil, dan menyempurnakan kuerinya sebelum menghasilkan ringkasan.
-
Kesalahan di tengah tugas harus dapat dipulihkan: Anda ingin model mengenali kapan sesuatu tidak berfungsi dan benar, daripada berkomitmen pada jalan yang buruk sejak awal. Contoh: agen yang mencoba solusi, memeriksa apakah itu berhasil, dan mencoba pendekatan yang berbeda jika tidak.
-
Anda melihat kinerja satu putaran yang baik tetapi penyelesaian tugas ujung ke ujung yang buruk: Jika model Anda menangani langkah-langkah individu dengan baik tetapi berjuang untuk menyatukannya menjadi hasil yang koheren dan sukses, RL multi-putaran dapat membantu menjembatani kesenjangan itu.
Model, harga, dan wilayah yang didukung
Model yang didukung
| Model | Region |
|---|---|
| Nova Lite 2.0 | IAD (us-east-1), PDX (us-west-2) |
| GPT-OSS-20B | IAD (us-east-1), PDX (us-west-2) |
| Gemma-4-31B-it | PDX (us-west-2) |
| Qwen 3.6 27B | PDX (us-west-2) |
Harga
Untuk detail harga lengkap, lihat halaman harga publik
-
Prefill: biaya pemrosesan token input yang dimasukkan ke dalam model pada awal setiap langkah pelatihan. Ini termasuk prompt, riwayat percakapan, dan konteks apa pun yang diterima model sebelum menghasilkan respons.
-
Sampel: biaya token yang dihasilkan model selama peluncuran pelatihan. Di sinilah model menghasilkan responsnya, yang kemudian dievaluasi dan digunakan untuk menghitung sinyal hadiah.
-
Kereta: biaya pass mundur, di mana bobot model diperbarui berdasarkan sinyal hadiah. Ini adalah langkah pembelajaran inti dalam proses RL.