Editorial Ilmu Komputer & AI
Open AccessOA2026
Greedy Decoding Tidak Invarian terhadap Presisi: Divergensi Output Lintas Presisi pada Inferensi LLM
Analisis propagasi galat empiris mengungkap bahwa divergensi BF16 vs FP16 pada greedy decoding ditentukan oleh margin logit dua teratas, sehingga memungkinkan komputasi ulang LM head FP32 selektif berbiaya rendah yang meningkatkan kesepakatan eksak hingga 36 poin persentase.
Gaoyuan Du; Anam Nawaz Khan; Rex Zhou; Xiaoyang Liu; Deepayan Chakrabarti; Fnu Suya; Xueping Liยท 2026ยท DOI 10.48550/arXiv.2609.26621
Masalah inti
Greedy decoding dari large language model (LLM) umumnya diperlakukan sebagai operasi deterministik: dengan bobot model, prompt, dan algoritma decoding yang sama, orang mengharapkan output yang identik. Makalah ini menantang asumsi tersebut dengan menunjukkan bahwa greedy decoding **tidak invarian terhadap presisi**. Model, prompt, dan algoritma decoding yang sama menghasilkan output berbeda ketika dijalankan pada BF16 versus FP16 di perangkat keras yang identik. Pada enam model (1,1Bโ7B parameter, empat keluarga; divergensi juga dikarakterisasi pada 12B) dan tiga benchmark, penulis menemukan bahwa 49โ100% prompt mengalami divergensi antara kedua presisi tersebut. Satu pembalikan token sering kali berjenjang menjadi divergensi tingkat lintasan, ketika token-token berikutnya berbeda sepenuhnya. Fenomena ini melemahkan reproduksibilitas dan keandalan pada inferensi LLM, terutama pada aplikasi yang memerlukan pencocokan output eksak. Penulis mengembangkan analisis propagasi galat empiris untuk menjelaskan mengapa divergensi ini terjadi dan mengusulkan intervensi bertarget untuk meredamnya. Pekerjaan ini dimotivasi oleh kebutuhan akan solusi praktis yang mempertahankan efisiensi komputa
Inovasi
Eksperimen mengungkap bahwa divergensi lintas presisi bersifat merata: 49โ100% prompt mengalami divergensi pada enam model dan tiga benchmark. Satu pembalikan token sering kali berjenjang menjadi divergensi tingkat lintasan, ketika seluruh output berikutnya berbeda. Analisis propagasi galat menunjukkan bahwa galat body terakumulasi selama 22 lapisan tidak memprediksi pembalikan; sebaliknya, margin logit dua teratas pada LM head adalah faktor kritisnya. Kelima prediksi yang diturunkan dari analisis tersebut semuanya terkonfirmasi secara eksperimental. Misalnya, komputasi FP32 yang lebih luas (misalnya menerapkan FP32 pada lebih banyak lapisan) memperburuk kesepakatan, seperti yang diprediksi. Intervensi berbiaya rendah dengan kinerja terbaik, yaitu komputasi ulang LM head FP32 selektif, memberikan **+22โ36 poin persentase (pp) kesepakatan eksak pada A10G**, **+12โ21 pp pada L4 dan A100**, dengan **overhead latensi kurang dari 4%** pada inferensi aliran tunggal batch rendah (ukuran batch โค 4). Manfaat metode ini hilang ketika galat yang berasal dari body mendominasi, termasuk pada ukuran batch โฅ 8 dan pada FP8 end-to-end dalam pengujian. Penulis memetakan batas keberlakuan pada enam
Greedy decoding dari large language model (LLM) umumnya diperlakukan sebagai operasi deterministik: dengan bobot model, prompt, dan algoritma decoding yang sama, orang mengharapkan output yang identik. Makalah ini menantang asumsi tersebut dengan menunjukkan bahwa greedy decoding **tidak invarian terhadap presisi**. Model, prompt, dan algoritma decoding yang sama menghasilkan output berbeda ketika dijalankan pada BF16 versus FP16 di perangkat keras yang identik. Pada enam model (1,1Bโ7B parameter, empat keluarga; divergensi juga dikarakterisasi pada 12B) dan tiga benchmark, penulis menemukan bahwa 49โ100% prompt mengalami divergensi antara kedua presisi tersebut. Satu pembalikan token sering kali berjenjang menjadi divergensi tingkat lintasan, ketika token-token berikutnya berbeda sepenuhnya. Fenomena ini melemahkan reproduksibilitas dan keandalan pada inferensi LLM, terutama pada aplikasi yang memerlukan pencocokan output eksak. Penulis mengembangkan analisis propagasi galat empiris untuk menjelaskan mengapa divergensi ini terjadi dan mengusulkan intervensi bertarget untuk meredamnya. Pekerjaan ini dimotivasi oleh kebutuhan akan solusi praktis yang mempertahankan efisiensi komputasi sekaligus meningkatkan kesepakatan lintas presisi.
Penulis melakukan studi empiris sistematis tentang divergensi lintas presisi pada greedy decoding. Mereka mengevaluasi enam model mulai dari 1,1B hingga 7B parameter pada empat keluarga model, dengan karakterisasi tambahan pada 12B parameter. Tiga benchmark digunakan untuk menilai tingkat divergensi. Metodologi intinya melibatkan menjalankan prompt identik melalui model yang sama pada BF16 dan FP16 di perangkat keras yang identik dan membandingkan urutan token yang dihasilkan. Untuk memahami penyebab yang mendasarinya, mereka melakukan analisis propagasi galat di seluruh lapisan model. Mereka menemukan bahwa 22 lapisan galat body terakumulasi tidak membedakan langkah yang membalik dari yang tidak membalik. Sebaliknya, hasilnya terutama bergantung pada **margin logit dua teratas** pada LM head relatif terhadap perturbasi terarah antara dua kandidat teratas. Wawasan ini menghasilkan lima prediksi yang dapat diuji tentang hasil intervensi, termasuk prediksi kontraintuitif bahwa penerapan komputasi FP32 yang lebih banyak (cakupan lebih luas) justru memperburuk kesepakatan. Eksperimen cocok dengan kelima prediksi tersebut. Berdasarkan analisis ini, mereka merancang intervensi berbiaya rendah: **komputasi ulang LM head FP32 selektif**, yang dipicu hanya ketika margin berada di bawah ambang batas. Mereka mengevaluasi metode ini pada enam model dan empat ukuran batch, mengukur kesepakatan eksak dan overhead latensi. Analisis dapat diformalkan sebagai berikut: misalkan dan adalah dua logit teratas, dan misalkan adalah margin. Perturbasi terarah antara dua kandidat teratas pada presisi tereduksi menentukan apakah pembalikan terjadi. Pembalikan terjadi ketika . Komputasi ulang selektif dipicu ketika , dengan adalah ambang batas. Intervensi ini menghitung ulang LM head dalam FP32 untuk langkah-langkah tersebut, sehingga mengurangi perturbasi efektif. Penulis juga memetakan batas keberlakuan pada berbagai model dan ukuran batch, dengan hipotesis bahwa stabilitas presisi saat pelatihan merupakan faktor penentu.
Mengapa penting
Studi ini menunjukkan bahwa greedy decoding tidak invarian terhadap presisi, dengan implikasi signifikan bagi reproduksibilitas dan keandalan pada inferensi LLM. Analisis propagasi galat memberikan penjelasan mekanistik: margin logit dua teratas relatif terhadap perturbasi terarah menentukan apakah pembalikan token terjadi. Wawasan ini kontraintuitif karena menunjukkan bahwa galat body terakumulasi bukanlah pendorong utama; sebaliknya, komputasi LM head final justru kritis. Kelima prediksi yang terkonfirmasi memvalidasi analisis tersebut dan menyoroti bahwa komputasi FP32 yang lebih luas dapat merugikan. Komputasi ulang LM head FP32 selektif menawarkan mitigasi praktis, dengan peningkatan substansial pada kesepakatan eksak dan overhead latensi minimal. Namun, ini merupakan **mitigasi parsial**, bukan jaminan determinisme universal. Manfaatnya hilang ketika galat yang berasal dari body mendominasi, seperti pada ukuran batch โฅ 8 atau pada FP8 end-to-end. Penulis memetakan batas keberlakuan pada berbagai model dan ukuran batch, memberikan panduan kapan intervensi efektif. Mereka berhipotesis bahwa stabilitas presisi saat pelatihan merupakan faktor penentu, tetapi penelitian lebih lanjut masih diperlukan. Pekerjaan ini membuka jalan bagi sistem inferensi yang sadar presisi dan menyerukan evaluasi ulang atas asumsi tentang determinisme dalam penerapan LLM. Kandidat taksonomi (Architecture, Cybersecurity, Network, Cryptography) relevan: divergensi presisi berdampak pada aplikasi yang sensitif terhadap keamanan (misalnya protokol kriptografi) dan reproduksibilitas inferensi jaringan. Pekerjaan selanjutnya dapat mengeksplorasi strategi presisi adaptif dan intervensi saat pelatihan untuk meningkatkan stabilitas.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten memberโฆ