Editorial Ilmu Komputer & AI
Latih di Tempat Model Terkuantisasi Berada: Distilasi On-Policy untuk Penalaran Bit Rendah
Masalah inti
Large language model (LLM) semakin banyak digunakan di bawah kuantisasi agresif untuk mengurangi memori dan komputasi, tetapi kuantisasi di bawah 3 bit sangat menurunkan penalaran kompleks. Distilasi sadar kuantisasi (QAD) memulihkan sebagian besar performa tanya-jawab bentuk pendek yang hilang, namun penalaran matematika dan kode tetap terganggu secara substansial. Penulis mengidentifikasi mode kegagalan utama: generasi panjang sering merosot menjadi loop berulang, menghabiskan anggaran decoding tanpa menyelesaikan solusi.
Makalah ini melacak kesenjangan ini ke **bias paparan yang diperkuat kuantisasi**. QAD berlatih pada prefiks korpus tetap, sementara deviasi yang diinduksi kuantisasi menumpuk sepanjang lintasan autoregresif model itu sendiri. Karena siswa tidak pernah dilatih pada keadaan yang sebenarnya dikunjunginya saat deployment, kesalahan menumpuk dan penalaran runtuh. Untuk mengatasi ketidaksesuaian ini, penulis memperkenalkan tahap **distilasi on-policy (OPD)** yang menempatkan supervisi guru di tempat model terkuantisasi sebenarnya berada. Dimulai dari checkpoint QAD, siswa menghasilkan melalui jalur maju terkuantisasi yang digunakan saat deployment dan menerima umpan
Inovasi
Penulis melaporkan peningkatan substansial dalam penalaran panjang di berbagai benchmark. Hasil utama dirangkum di bawah ini.
| Model | Bit Efektif | Retensi MATH-500 (BF16) | Retensi HumanEval (BF16) |
|-------|----------------|---------------------------|----------------------------|
| Baseline QAD | 2,79 / 1,88 | 35% | 66% |
| + OPD | 2,79 / 1,88 | **70%** | **91%** |
- **MATH-500:** Retensi performa BF16 rata-rata meningkat dari 35% menjadi 70%.
- **HumanEval:** Retensi performa BF16 rata-rata meningkat dari 66% menjadi 91%.
- **Performa bentuk pendek:** Dipertahankan, menunjukkan bahwa OPD tidak mengorbankan kemampuan luas.
- **Perbandingan dengan QAD lanjutan:** Keuntungan penalaran jauh melebihi keuntungan QAD teacher-forced lanjutan dalam perbandingan anggaran yang setara.
Hasil ini menunjukkan bahwa OPD secara efektif memulihkan penalaran panjang sambil mempertahankan manfaat inisialisasi bit rendah yang stabil dari QAD. Keuntungannya konsisten di empat model dan dua lebar bit efektif (2,79 dan 1,88 bit).
Mengapa penting
Wawasan utama makalah ini adalah bahwa **bias paparan yang diperkuat kuantisasi** adalah penyebab utama degradasi penalaran pada model di bawah 3 bit. QAD berlatih pada prefiks korpus tetap, tetapi saat inferensi model menghasilkan tokennya sendiri, dan kesalahan kuantisasi menumpuk sepanjang lintasan yang dihasilkan sendiri ini. Ketidaksesuaian ini menyebabkan loop berulang dan solusi yang tidak lengkap.
OPD mengatasi ini dengan berlatih pada lintasan terkuantisasi siswa sendiri. Guru memberikan supervisi padat tingkat token pada prefiks on-policy ini, sementara reward verifier tugas mendorong jawaban akhir yang benar. Kombinasi ini memastikan bahwa siswa belajar pulih dari kesalahannya sendiri, secara efektif menutup kesenjangan antara kondisi pelatihan dan deployment.
Keberhasilan kerangka kerja ini di empat model pada 2,79 dan 1,88 bit efektif menunjukkan bahwa distilasi on-policy adalah solusi umum dan skalabel untuk penalaran bit rendah. Dengan menggabungkan inisialisasi stabil QAD dengan pemulihan on-policy OPD, penulis menyediakan solusi di bawah 3 bit yang komprehensif yang mempertahankan kemampuan luas sekaligus memulihkan penalaran panjang.
**Batasan dan pekerjaan masa depan.** Makalah ini tidak merinci arsitektur model yang tepat atau set benchmark lengkap yang digunakan. Pekerjaan masa depan dapat mengeksplorasi penerapan OPD pada lebar bit yang bahkan lebih rendah, domain penalaran lain, dan skema kuantisasi yang berbeda. Selain itu, biaya komputasi untuk rollout on-policy dan umpan balik guru dapat menjadi pertimbangan praktis untuk deployment skala besar.
Siapa yang sebaiknya membaca
Membuka konten memberโฆ