Editorial Ilmu Komputer & AI
Open AccessOA2026
Dekomposisi Birkhoff dan Interkoneksi Fotonik: Tunggu! Jangan Lupakan Komputasi!
Meninjau ulang penjadwalan sirkuit untuk komunikasi all-to-all pada Mixture-of-Experts
Eliezer Amponsah; Vamsi Addankiยท 2026ยท DOI 10.48550/arXiv.2605.26845
Masalah inti
Permintaan yang terus meningkat akan komunikasi efisien dalam pelatihan dan inferensi terdistribusi telah memicu minat besar terhadap interkoneksi fotonik yang dapat dikonfigurasi ulang, baik di lingkungan akademik maupun industri. Model Mixture-of-Experts (MoE), dengan pola komunikasinya yang sangat miring, menghadirkan peluang alami bagi fabric circuit-switched semacam itu. Namun, pendekatan yang ada sebagian besar mengoptimalkan komunikasi secara terpisah, mengabaikan interaksi antara komunikasi dan komputasi expert yang mengikutinya. Dalam makalah ini, kami meninjau ulang penjadwalan sirkuit untuk komunikasi all-to-all dalam eksekusi MoE. Kami menunjukkan bahwa struktur dispatch--compute--combine secara fundamental menantang teknik penjadwalan klasik seperti dekomposisi Birkhoff--von Neumann (BvN).
Inovasi
Evaluasi kami menunjukkan bahwa dekomposisi greedy max-weight secara signifikan meningkatkan efisiensi overlap dan mengurangi overhead komputasi dibandingkan jadwal berbasis BvN. Secara spesifik, pendekatan ini mendekati performa all-to-all ideal tanpa kongesti. Jumlah matching dibatasi, sehingga mencegah fragmentasi eksekusi yang berlebihan menjadi batch kecil. Hal ini menghasilkan ukuran batch yang lebih besar per matching, sehingga mengurangi overhead eksekusi tetap. Pendekatan ini sederhana namun efektif, menunjukkan keuntungan substansial dalam skenario pelatihan dan inferensi MoE.
Permintaan yang terus meningkat akan komunikasi efisien dalam pelatihan dan inferensi terdistribusi telah memicu minat besar terhadap interkoneksi fotonik yang dapat dikonfigurasi ulang, baik di lingkungan akademik maupun industri. Model Mixture-of-Experts (MoE), dengan pola komunikasinya yang sangat miring, menghadirkan peluang alami bagi fabric circuit-switched semacam itu. Namun, pendekatan yang ada sebagian besar mengoptimalkan komunikasi secara terpisah, mengabaikan interaksi antara komunikasi dan komputasi expert yang mengikutinya. Dalam makalah ini, kami meninjau ulang penjadwalan sirkuit untuk komunikasi all-to-all dalam eksekusi MoE. Kami menunjukkan bahwa struktur dispatch--compute--combine secara fundamental menantang teknik penjadwalan klasik seperti dekomposisi Birkhoff--von Neumann (BvN).
Kami menganalisis pola komunikasi all-to-all dalam eksekusi MoE, di mana token dikirim ke expert, dihitung, lalu digabungkan. Matriks komunikasi merepresentasikan fraksi token yang dikirim dari sumber ke tujuan . Dekomposisi BvN klasik menyatakan matriks doubly stochastic sebagai kombinasi konveks dari matriks permutasi:
, dengan adalah matriks permutasi dan . Namun, matriks komunikasi MoE jarang bersifat doubly stochastic, sehingga menimbulkan gelembung penjadwalan. Kami mengusulkan strategi dekomposisi greedy max-weight yang membatasi jumlah matching sekaligus mempertahankan ukuran batch besar per matching. Algoritma ini secara iteratif memilih matriks permutasi yang memaksimalkan bobot lalu lintas yang tersisa, lalu mengurangi kontribusinya, sehingga setiap matching membawa fraksi substansial dari total volume komunikasi.
Mengapa penting
Struktur dispatch--compute--combine pada MoE secara fundamental menantang teknik penjadwalan klasik. Pertama, matriks komunikasi MoE jarang bersifat doubly stochastic, sehingga menimbulkan gelembung penjadwalan yang signifikan pada jadwal berbasis BvN. Kedua, meskipun dekomposisi memungkinkan overlap komunikasi--komputasi, jumlah matching berlebihan yang dihasilkan BvN memecah eksekusi menjadi batch kecil, yang menyebabkan inefisiensi komputasi parah akibat overhead eksekusi tetap. Dekomposisi greedy max-weight kami mengatasi kedua masalah tersebut dengan membatasi jumlah matching sekaligus mempertahankan ukuran batch besar. Karya ini menyoroti pentingnya mempertimbangkan overhead komputasi dalam penjadwalan komunikasi untuk interkoneksi fotonik. Arah ke depan mencakup perluasan pendekatan ke beban kerja dinamis dan integrasi dengan arsitektur interkoneksi fotonik lainnya.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten memberโฆ