Editorial Ilmu Komputer & AI
Open AccessOA2026
SiFAR: All-Reduce Tanpa Sinkronisasi untuk Inferensi LLM Latensi Rendah
Menghilangkan overhead barrier pada all-reduce tensor-parallel untuk mempercepat pembangkitan token LLM penalaran dan agentic
Hritvik Taneja; Anish Saxena; Abhishek Revinipati; Jae Hyung Ju; Neal C. Crago; Moinuddin Qureshi· 2026· DOI 10.48550/arXiv.2607.08973
Masalah inti
Meningkatnya model penalaran dan sistem agentic menjadikan latensi pembangkitan token LLM sebagai hambatan utama. Berbeda dengan chatbot, yang keuntungan latensinya jenuh pada kecepatan baca manusia, sistem ini menghasilkan token penalaran perantara yang tidak dikonsumsi manusia. Dengan demikian, latensi per token secara langsung menentukan waktu respons end-to-end. Inferensi latensi rendah memakai batching minimal, sehingga pembangkitan token terbatas oleh bandwidth. Tensor Parallelism (TP) mengatasi hal ini dengan memecah bobot model ke beberapa GPU dan memuatnya secara paralel. Namun, penskalaan ke lebih banyak GPU memunculkan overhead All-Reduce yang tumbuh seiring jumlah GPU. Penulis melaporkan bahwa menghapus All-Reduce meningkatkan throughput token sebesar 43% untuk Llama-3.1-8B pada 8 GPU H200, yang memotivasi desain tanpa sinkronisasi. Makalah ini mengusulkan Synchronization-Free All-Reduce (SiFAR), yang mengurangi overhead sinkronisasi selama inferensi latensi rendah. Karya ini menyasar dua algoritma all-reduce dominan dalam rezim ini—oneshot dan twoshot—dan secara sistematis menghapus biaya barrier-nya melalui perancangan bersama komunikasi dan eksekusi model, reduksi di
Inovasi
Penulis mengevaluasi SiFAR pada Llama-3.1-8B dan Qwen3.5-397B-17B pada TP=8. SiFAR memangkas latensi All-Reduce hingga 52% dan meningkatkan throughput end-to-end sebesar 18,6% untuk Llama-3.1-8B dan 13,1% untuk Qwen3.5-397B-17B pada TP=8. Abstrak juga mencatat bahwa menghapus All-Reduce sepenuhnya meningkatkan throughput token sebesar 43% untuk Llama-3.1-8B pada 8 GPU H200, yang menetapkan batas atas manfaat penghapusan sinkronisasi. Keuntungan ini dicapai tanpa mengubah semantik model, karena kebenaran dipertahankan melalui dual buffering, reduksi di dalam switch, dan validasi ringan untuk transfer spekulatif.
Meningkatnya model penalaran dan sistem agentic menjadikan latensi pembangkitan token LLM sebagai hambatan utama. Berbeda dengan chatbot, yang keuntungan latensinya jenuh pada kecepatan baca manusia, sistem ini menghasilkan token penalaran perantara yang tidak dikonsumsi manusia. Dengan demikian, latensi per token secara langsung menentukan waktu respons end-to-end. Inferensi latensi rendah memakai batching minimal, sehingga pembangkitan token terbatas oleh bandwidth. Tensor Parallelism (TP) mengatasi hal ini dengan memecah bobot model ke beberapa GPU dan memuatnya secara paralel. Namun, penskalaan ke lebih banyak GPU memunculkan overhead All-Reduce yang tumbuh seiring jumlah GPU. Penulis melaporkan bahwa menghapus All-Reduce meningkatkan throughput token sebesar 43% untuk Llama-3.1-8B pada 8 GPU H200, yang memotivasi desain tanpa sinkronisasi. Makalah ini mengusulkan Synchronization-Free All-Reduce (SiFAR), yang mengurangi overhead sinkronisasi selama inferensi latensi rendah. Karya ini menyasar dua algoritma all-reduce dominan dalam rezim ini—oneshot dan twoshot—dan secara sistematis menghapus biaya barrier-nya melalui perancangan bersama komunikasi dan eksekusi model, reduksi di dalam switch, dan reduksi spekulatif.
SiFAR menyerang tiga sumber overhead sinkronisasi. Pertama, barrier bawah pada oneshot memberlakukan dependensi write-after-write (WAW); SiFAR menghapusnya dengan merancang bersama komunikasi dan eksekusi model untuk memungkinkan dual buffering. Namun, oneshot kurang baik diskalakan seiring jumlah GPU. Twoshot berkinerja lebih baik pada derajat TP yang lebih tinggi tetapi menimbulkan barrier bawah yang tak terhindarkan. Untuk mengatasinya, SiFAR memanfaatkan reduksi di dalam switch pada switch modern dan mengusulkan **redundant pull**, di mana setiap GPU mereduksi seluruh payload All-Reduce di switch. Ini meningkatkan skalabilitas oneshot sekaligus mempertahankan keunggulan tanpa barrier bawah. Terakhir, untuk mengurangi overhead barrier atas, penulis mengamati bahwa setiap langkah decode mengeluarkan beberapa operasi All-Reduce, sehingga GPU tetap tersinkronisasi ketat setelah operasi pertama. Karena itu, mereka mengusulkan **speculative reduction**, yang memulai transfer data sebelum barrier atas dan menjamin kebenaran melalui validasi ringan.
Mengapa penting
Kontribusi SiFAR ada tiga: (1) mengidentifikasi dan menghapus barrier bawah yang diberlakukan WAW pada oneshot melalui dual buffering yang dirancang bersama eksekusi model; (2) memperkenalkan redundant pull untuk menggabungkan sifat tanpa barrier bawah milik oneshot dengan skalabilitas twoshot pada derajat TP yang lebih tinggi memakai reduksi di dalam switch; dan (3) mengusulkan speculative reduction untuk menyembunyikan overhead barrier atas dengan memulai transfer lebih awal dan memvalidasi kebenaran secara murah. Hasilnya menunjukkan bahwa sinkronisasi, bukan bandwidth mentah, merupakan hambatan tingkat pertama pada inferensi tensor-parallel latensi rendah. Pendekatan ini sangat relevan untuk beban kerja penalaran dan agentic di mana latensi per token mendominasi waktu respons end-to-end. Batasannya adalah redundant pull bergantung pada dukungan reduksi di dalam switch pada switch modern, dan speculative reduction memerlukan logika validasi ringan; keduanya dapat membatasi penerapan pada fabric interkoneksi lama. Pekerjaan selanjutnya dapat memperluas perancangan bersama ini ke operasi kolektif lain dan ke topologi multi-node di luar satu domain switch.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten member…