Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Latih di Tempat Model Terkuantisasi Berada: Distilasi On-Policy untuk Penalaran Bit Rendah

Tahap distilasi on-policy memulihkan penalaran panjang pada LLM terkuantisasi di bawah 3 bit dengan menyupervisi siswa pada lintasan terkuantisasi miliknya sendiri.
Yuanteng Chen; Zhilei Liu; Peisong Wang; Yuantian Shao; Chuangyi Li; Weining Wang; Shuang Qiu; Gang Li; Jing Liu; Jian Chengยท 2026ยท DOI 10.48550/arXiv.2609.26708

Masalah inti

Large language model (LLM) semakin banyak digunakan di bawah kuantisasi agresif untuk mengurangi memori dan komputasi, tetapi kuantisasi di bawah 3 bit sangat menurunkan penalaran kompleks. Distilasi sadar kuantisasi (QAD) memulihkan sebagian besar performa tanya-jawab bentuk pendek yang hilang, namun penalaran matematika dan kode tetap terganggu secara substansial. Penulis mengidentifikasi mode kegagalan utama: generasi panjang sering merosot menjadi loop berulang, menghabiskan anggaran decoding tanpa menyelesaikan solusi.

Makalah ini melacak kesenjangan ini ke **bias paparan yang diperkuat kuantisasi**. QAD berlatih pada prefiks korpus tetap, sementara deviasi yang diinduksi kuantisasi menumpuk sepanjang lintasan autoregresif model itu sendiri. Karena siswa tidak pernah dilatih pada keadaan yang sebenarnya dikunjunginya saat deployment, kesalahan menumpuk dan penalaran runtuh. Untuk mengatasi ketidaksesuaian ini, penulis memperkenalkan tahap **distilasi on-policy (OPD)** yang menempatkan supervisi guru di tempat model terkuantisasi sebenarnya berada. Dimulai dari checkpoint QAD, siswa menghasilkan melalui jalur maju terkuantisasi yang digunakan saat deployment dan menerima umpan

Inovasi

Penulis melaporkan peningkatan substansial dalam penalaran panjang di berbagai benchmark. Hasil utama dirangkum di bawah ini.

| Model | Bit Efektif | Retensi MATH-500 (BF16) | Retensi HumanEval (BF16) |
|-------|----------------|---------------------------|----------------------------|
| Baseline QAD | 2,79 / 1,88 | 35% | 66% |
| + OPD | 2,79 / 1,88 | **70%** | **91%** |

- **MATH-500:** Retensi performa BF16 rata-rata meningkat dari 35% menjadi 70%.
- **HumanEval:** Retensi performa BF16 rata-rata meningkat dari 66% menjadi 91%.
- **Performa bentuk pendek:** Dipertahankan, menunjukkan bahwa OPD tidak mengorbankan kemampuan luas.
- **Perbandingan dengan QAD lanjutan:** Keuntungan penalaran jauh melebihi keuntungan QAD teacher-forced lanjutan dalam perbandingan anggaran yang setara.

Hasil ini menunjukkan bahwa OPD secara efektif memulihkan penalaran panjang sambil mempertahankan manfaat inisialisasi bit rendah yang stabil dari QAD. Keuntungannya konsisten di empat model dan dua lebar bit efektif (2,79 dan 1,88 bit).

Large language model (LLM) semakin banyak digunakan di bawah kuantisasi agresif untuk mengurangi memori dan komputasi, tetapi kuantisasi di bawah 3 bit sangat menurunkan penalaran kompleks. Distilasi sadar kuantisasi (QAD) memulihkan sebagian besar performa tanya-jawab bentuk pendek yang hilang, namun penalaran matematika dan kode tetap terganggu secara substansial. Penulis mengidentifikasi mode kegagalan utama: generasi panjang sering merosot menjadi loop berulang, menghabiskan anggaran decoding tanpa menyelesaikan solusi.
Makalah ini melacak kesenjangan ini ke **bias paparan yang diperkuat kuantisasi**. QAD berlatih pada prefiks korpus tetap, sementara deviasi yang diinduksi kuantisasi menumpuk sepanjang lintasan autoregresif model itu sendiri. Karena siswa tidak pernah dilatih pada keadaan yang sebenarnya dikunjunginya saat deployment, kesalahan menumpuk dan penalaran runtuh. Untuk mengatasi ketidaksesuaian ini, penulis memperkenalkan tahap **distilasi on-policy (OPD)** yang menempatkan supervisi guru di tempat model terkuantisasi sebenarnya berada. Dimulai dari checkpoint QAD, siswa menghasilkan melalui jalur maju terkuantisasi yang digunakan saat deployment dan menerima umpan balik dari guru presisi penuh yang dibekukan pada prefiksnya sendiri, menggabungkan panduan padat tingkat token dengan reward verifier tugas.

Mengapa penting

Wawasan utama makalah ini adalah bahwa **bias paparan yang diperkuat kuantisasi** adalah penyebab utama degradasi penalaran pada model di bawah 3 bit. QAD berlatih pada prefiks korpus tetap, tetapi saat inferensi model menghasilkan tokennya sendiri, dan kesalahan kuantisasi menumpuk sepanjang lintasan yang dihasilkan sendiri ini. Ketidaksesuaian ini menyebabkan loop berulang dan solusi yang tidak lengkap.

OPD mengatasi ini dengan berlatih pada lintasan terkuantisasi siswa sendiri. Guru memberikan supervisi padat tingkat token pada prefiks on-policy ini, sementara reward verifier tugas mendorong jawaban akhir yang benar. Kombinasi ini memastikan bahwa siswa belajar pulih dari kesalahannya sendiri, secara efektif menutup kesenjangan antara kondisi pelatihan dan deployment.

Keberhasilan kerangka kerja ini di empat model pada 2,79 dan 1,88 bit efektif menunjukkan bahwa distilasi on-policy adalah solusi umum dan skalabel untuk penalaran bit rendah. Dengan menggabungkan inisialisasi stabil QAD dengan pemulihan on-policy OPD, penulis menyediakan solusi di bawah 3 bit yang komprehensif yang mempertahankan kemampuan luas sekaligus memulihkan penalaran panjang.

**Batasan dan pekerjaan masa depan.** Makalah ini tidak merinci arsitektur model yang tepat atau set benchmark lengkap yang digunakan. Pekerjaan masa depan dapat mengeksplorasi penerapan OPD pada lebar bit yang bahkan lebih rendah, domain penalaran lain, dan skema kuantisasi yang berbeda. Selain itu, biaya komputasi untuk rollout on-policy dan umpan balik guru dapat menjadi pertimbangan praktis untuk deployment skala besar.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ