Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial ilmu komputer

Open AccessOA2026

GVPO++: Optimasi Kebijakan Varians Grup untuk Pasca-pelatihan LLM dan Distilasi On-Policy

Kerangka maksimalisasi reward dengan kendala KL yang menghilangkan importance sampling untuk pasca-pelatihan LLM dan distilasi on-policy yang stabil
Kaichen Zhang; Yuzhong Hong; Junwei Bao; Hongfei Jiang; Yang Song; Dingqian Hong; Hui Xiongยท 2026ยท DOI 10.48550/arXiv.2609.21432

Masalah inti

Pasca-pelatihan sangat penting untuk meningkatkan kemampuan penalaran dan keahlian spesifik tugas pada large language model (LLM). Kemajuan terkini seperti Group Relative Policy Optimization (GRPO) telah meningkatkan pasca-pelatihan, namun penerapan praktisnya masih terhambat oleh ketidakstabilan pelatihan yang timbul dari ketergantungan pada importance sampling. Ketidakstabilan ini berasal dari varians tinggi yang muncul ketika distribusi sampling menyimpang dari distribusi target, hal yang umum terjadi pada pelatihan LLM iteratif. Penulis memperkenalkan Group Variance Policy Optimization (GVPO), metode pasca-pelatihan baru yang mengintegrasikan solusi analitis maksimalisasi reward dengan kendala KL ke dalam skema pembobotan gradiennya. GVPO memberikan interpretasi intuitif: gradiennya sesuai dengan mean squared error antara jarak sentral dari reward implisit dan jarak sentral dari reward aktual. Formulasi ini menjamin solusi optimal yang unik tepat pada tujuan maksimalisasi reward dengan kendala KL dan memungkinkan distribusi sampling yang fleksibel tanpa memerlukan importance sampling. Di luar pasca-pelatihan umum, GVPO secara alami diperluas ke distilasi on-policy (OPD) dan mem

Inovasi

Penulis mengevaluasi GVPO pada berbagai tugas pasca-pelatihan LLM, termasuk tolok ukur penalaran dan fine-tuning spesifik tugas. Hasil eksperimen menunjukkan bahwa GVPO mencapai stabilitas pelatihan yang lebih unggul dibandingkan GRPO, dengan varians estimasi gradien yang jauh lebih rendah. Pada tolok ukur penalaran standar, GVPO menyamai atau melampaui kinerja GRPO sambil memerlukan langkah pelatihan yang lebih sedikit untuk konvergen. Penghapusan importance sampling memungkinkan GVPO menggunakan data off-policy secara lebih efektif, sehingga meningkatkan efisiensi sampel. Dalam eksperimen distilasi on-policy, GVPO secara efektif mentransfer pengetahuan dari model guru yang lebih besar ke model siswa yang lebih kecil, mengungguli metode distilasi baseline. Metode ini juga menunjukkan ketahanan terhadap pilihan hyperparameter, khususnya koefisien penalti KL . Hasil kuantitatif menunjukkan bahwa GVPO mengurangi varians pembaruan kebijakan sebesar satu orde besaran relatif terhadap GRPO, diukur dengan standar deviasi loss di seluruh iterasi pelatihan. Lebih lanjut, jaminan solusi optimal unik GVPO memastikan bahwa kebijakan konvergen ke optimum dengan kendala KL yang diinginka
Pasca-pelatihan sangat penting untuk meningkatkan kemampuan penalaran dan keahlian spesifik tugas pada large language model (LLM). Kemajuan terkini seperti Group Relative Policy Optimization (GRPO) telah meningkatkan pasca-pelatihan, namun penerapan praktisnya masih terhambat oleh ketidakstabilan pelatihan yang timbul dari ketergantungan pada importance sampling. Ketidakstabilan ini berasal dari varians tinggi yang muncul ketika distribusi sampling menyimpang dari distribusi target, hal yang umum terjadi pada pelatihan LLM iteratif. Penulis memperkenalkan Group Variance Policy Optimization (GVPO), metode pasca-pelatihan baru yang mengintegrasikan solusi analitis maksimalisasi reward dengan kendala KL ke dalam skema pembobotan gradiennya. GVPO memberikan interpretasi intuitif: gradiennya sesuai dengan mean squared error antara jarak sentral dari reward implisit dan jarak sentral dari reward aktual. Formulasi ini menjamin solusi optimal yang unik tepat pada tujuan maksimalisasi reward dengan kendala KL dan memungkinkan distribusi sampling yang fleksibel tanpa memerlukan importance sampling. Di luar pasca-pelatihan umum, GVPO secara alami diperluas ke distilasi on-policy (OPD) dan memungkinkan optimasi keluarga luas tujuan OPD yang diperluas, memberikan landasan berprinsip untuk desain tujuan yang beragam.
GVPO merumuskan ulang tujuan pasca-pelatihan dengan menyematkan solusi analitis maksimalisasi reward dengan kendala KL langsung ke dalam pembobotan gradien. Ide intinya adalah menghindari importance sampling dengan memanfaatkan ekspresi bentuk tertutup untuk kebijakan optimal. Misalkan fungsi reward adalah dan kebijakan referensi adalah . Tujuan maksimalisasi reward dengan kendala KL adalah:

Mengapa penting

Kontribusi teoretis utama GVPO adalah jaminannya atas solusi optimal yang unik tepat pada tujuan maksimalisasi reward dengan kendala KL. Hal ini berbeda dengan GRPO, yang bergantung pada importance sampling dan mungkin konvergen ke solusi suboptimal akibat varians tinggi. Interpretasi gradien sebagai mean squared error antara jarak sentral memberikan pemahaman intuitif: kebijakan diperbarui untuk menyelaraskan keunggulan relatif dari reward implisit dengan keunggulan relatif dari reward aktual. Formulasi ini juga memungkinkan distribusi sampling yang fleksibel, artinya distribusi apa pun dapat digunakan untuk menghasilkan respons tanpa menimbulkan bias. Perluasan ke distilasi on-policy bersifat alami: dengan menetapkan reward ke log-probabilitas keluaran guru, GVPO mengoptimalkan tujuan distilasi yang berprinsip dan stabil. Penulis lebih lanjut menunjukkan bahwa GVPO dapat mengoptimalkan keluarga luas tujuan OPD yang diperluas, seperti yang menggabungkan regularisasi entropi atau pencocokan fitur perantara, dengan mendefinisikan fungsi reward secara tepat. Fleksibilitas ini memberikan landasan untuk merancang tujuan pasca-pelatihan yang beragam. Batasan meliputi kebutuhan untuk menghitung fungsi partisi , yang mungkin tidak dapat diselesaikan untuk ruang aksi yang besar; namun, penulis mengaproksimasinya menggunakan sampling Monte Carlo. Pekerjaan selanjutnya dapat mengeksplorasi aproksimasi yang lebih efisien dan aplikasi pada model multi-modal. Secara keseluruhan, GVPO menetapkan paradigma baru untuk pasca-pelatihan LLM dan distilasi on-policy yang andal dan serbaguna.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ