Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial ilmu komputer

Open AccessOA2026

Fine-Tuning LLM Pasca-RL yang Mempertahankan Penalaran dengan Null-Basis LoRA

Metode adaptasi hemat parameter yang membatasi pembaruan LoRA pada ruang nol aproksimatif dari aktivasi penalaran, mempertahankan penalaran yang diperoleh dari RL sekaligus menyamai kinerja adaptasi LoRA standar.
Wenzhi Fang; Nicholas Tzou; Lazar Valkov; Srinivas Chappidiยท 2026ยท DOI 10.48550/arXiv.2609.25618

Masalah inti

Post-training berbasis reinforcement learning (RL) telah menjadi pendekatan yang efektif untuk memunculkan kemampuan penalaran pada large language model (LLM). Namun, mengadaptasi model pasca-RL ke domain pengetahuan atau perilaku baru melalui supervised fine-tuning (SFT) berikutnya dapat menimpa kemampuan tersebut secara parah. Pendekatan yang ada meredam kelupaan semacam itu melalui experience replay, inisialisasi khusus, atau optimisasi berkendala menggunakan proyeksi gradien, tetapi semuanya memberikan pemeliharaan yang terbatas atau menimbulkan overhead pelatihan yang besar.

Makalah oleh Wenzhi Fang, Nicholas Tzou, Lazar Valkov, dan Srinivas Chappidi menangani trade-off ini secara langsung. Analisis mereka menunjukkan bahwa aktivasi penalaran terkonsentrasi pada subruang berdimensi rendah, menyisakan kapasitas ruang nol yang besar untuk adaptasi, dan bahwa ruang nol aproksimatif yang bersesuaian dapat diestimasi secara andal dari sejumlah kecil contoh. Berdasarkan pengamatan tersebut, mereka mengusulkan Null-Basis Low-Rank Adaptation (NB-LoRA), metode hemat parameter untuk mengadaptasi LLM pasca-RL sambil mempertahankan kemampuan penalaran yang telah diperolehnya. Pertanyaan

Inovasi

Eksperimen ekstensif pada berbagai LLM yang dilatih RL dan beragam tugas hilir menunjukkan bahwa NB-LoRA menyamai LoRA standar dalam kinerja adaptasi, mempertahankan akurasi penalaran mendekati tingkat pra-fine-tuning, dan menggeneralisasi pemeliharaan ini ke tolok ukur penalaran yang disisihkan.

Pola yang dilaporkan konsisten di seluruh keluarga model dan jenis tugas: metrik tugas hilir di bawah NB-LoRA secara statistik sebanding dengan LoRA standar, menunjukkan bahwa kendala ruang nol tidak mengorbankan kapasitas adaptasi. Pada saat yang sama, akurasi penalaran tetap dekat dengan baseline pra-fine-tuning, sedangkan LoRA standar menunjukkan degradasi yang substansial. Efek pemeliharaan juga bertransfer ke tolok ukur penalaran yang tidak digunakan selama estimasi basis, menunjukkan bahwa ruang nol yang diestimasi menangkap sifat umum dari representasi penalaran model alih-alih overfitting pada himpunan estimasi. Penulis menekankan bahwa keuntungan ini dicapai tanpa overhead pelatihan yang terkait dengan experience replay atau optimisasi berkendala proyeksi gradien.

Post-training berbasis reinforcement learning (RL) telah menjadi pendekatan yang efektif untuk memunculkan kemampuan penalaran pada large language model (LLM). Namun, mengadaptasi model pasca-RL ke domain pengetahuan atau perilaku baru melalui supervised fine-tuning (SFT) berikutnya dapat menimpa kemampuan tersebut secara parah. Pendekatan yang ada meredam kelupaan semacam itu melalui experience replay, inisialisasi khusus, atau optimisasi berkendala menggunakan proyeksi gradien, tetapi semuanya memberikan pemeliharaan yang terbatas atau menimbulkan overhead pelatihan yang besar.
Makalah oleh Wenzhi Fang, Nicholas Tzou, Lazar Valkov, dan Srinivas Chappidi menangani trade-off ini secara langsung. Analisis mereka menunjukkan bahwa aktivasi penalaran terkonsentrasi pada subruang berdimensi rendah, menyisakan kapasitas ruang nol yang besar untuk adaptasi, dan bahwa ruang nol aproksimatif yang bersesuaian dapat diestimasi secara andal dari sejumlah kecil contoh. Berdasarkan pengamatan tersebut, mereka mengusulkan Null-Basis Low-Rank Adaptation (NB-LoRA), metode hemat parameter untuk mengadaptasi LLM pasca-RL sambil mempertahankan kemampuan penalaran yang telah diperolehnya. Pertanyaan utamanya adalah apakah seseorang dapat melakukan fine-tuning model pasca-RL pada tugas baru tanpa menghapus sirkuit penalaran yang dipasang oleh post-training RL.

Mengapa penting

Wawasan intinya bersifat geometris: aktivasi penalaran terkonsentrasi pada subruang berdimensi rendah, menyisakan kapasitas ruang nol yang besar untuk adaptasi. Jika informasi penalaran berada pada subruang berdimensi rendah, maka pembaruan yang ortogonal terhadap subruang tersebut seharusnya tidak mengganggunya. NB-LoRA mengoperasionalkan hal ini dengan mengestimasi basis nol aproksimatif dari sejumlah kecil contoh dan mereparameterisasi pembaruan LoRA melaluinya.

Ini menghasilkan tiga keuntungan praktis. Pertama, pemeliharaan ditegakkan secara struktural sepanjang fine-tuning alih-alih melalui penalti yang harus disetel per langkah. Kedua, basis yang tetap menghindari biaya per langkah dari proyeksi gradien, menjaga overhead pelatihan tetap dekat dengan LoRA standar. Ketiga, karena basis diestimasi sekali, metode ini mudah diintegrasikan ke dalam pipeline LoRA yang ada.

Batasan muncul dari aproksimasi tersebut. Ruang nol bersifat aproksimatif dan diestimasi dari sampel yang terbatas, sehingga kualitasnya bergantung pada seberapa representatif contoh-contoh itu terhadap perilaku penalaran yang ingin dipertahankan. Jika fine-tuning hilir memerlukan pembaruan yang benar-benar tumpang tindih dengan subruang penalaran, kendala tersebut dapat membatasi adaptasi. Hasil makalah menunjukkan tumpang tindih ini kecil dalam praktik, tetapi kondisi batasnya masih menjadi pertanyaan terbuka. Secara keseluruhan, NB-LoRA merumuskan ulang pemeliharaan penalaran sebagai masalah kendala subruang dan menunjukkan bahwa reparameterisasi berbasis tetap yang ringan dapat mempertahankan penalaran yang diperoleh RL sekaligus menyamai LoRA standar pada tugas baru.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ