Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

TerraceMoE: Model Biaya untuk Komunikasi All-to-All MoE Hierarkis

Model biaya pada tingkat panggilan komunikasi untuk menyaring dispatch dua-hop hierarkis dalam pelatihan Mixture-of-Experts paralel-ahli, dibatasi oleh gerbang validasi yang mencabut kapabilitas di dalam kode ketika gagal.
Weicheng Xue; Bingqiang Wang; Li Yuan; Huihui Zhou; Yonghong Tianยท 2026ยท DOI 10.48550/arXiv.2608.27874

Masalah inti

Pelatihan Mixture-of-Experts (MoE) paralel-ahli bergantung pada komunikasi all-to-all untuk mengirim token ke expert yang dipilih. Dispatch dua-hop hierarkis adalah kandidat optimasi: token pertama-tama dirutekan di dalam grup lokal lalu diteruskan antar grup, yang dapat mengurangi lalu lintas pada fabric lambat. Namun, manfaat ini tidak gratis. Hierarki memperkenalkan operasi kolektif kedua dan rantai operator sisi kedatangan, yang keduanya mengonsumsi waktu dan sumber daya. Pertanyaan utamanya adalah apakah penghematan fabric lambat melebihi overhead tambahan.

TerraceMoE menjawab pertanyaan ini dengan model biaya yang beroperasi pada tingkat panggilan komunikasi. Alih-alih memprediksi throughput pelatihan end-to-end, model ini menyaring trade-off pada granularitas panggilan komunikasi individual. Penulis menekankan bahwa hasil mereka adalah hasil sensitivitas rasio saja, bukan prediksi penerapan. Mereka membatasi model dengan gerbang validasi yang mencabut kapabilitas di dalam kode ketika gagal, bukan sekadar melaporkan catatan. Pilihan desain ini memastikan klaim yang tidak didukung tidak dibuat.

Batasan routing yang memungkinkan menetapkan fan-out per token dan kuota per grup

Inovasi

Rasio breakeven hierarki efektif terkoreksi adalah hasil kuantitatif utama. Pada geometri referensi, rantai kedatangan PyTorch terukur menghasilkan rasio breakeven 3,98. Ini berarti dispatch hierarkis hanya menguntungkan jika rasio lalu lintas fabric lambat terhadap fabric cepat melebihi 3,98. Untuk rantai kedatangan fused hipotetis, rasio breakeven turun menjadi 1,49, dan pada overhead implementasi nol turun menjadi 1,10. Rasio-rasio ini adalah hasil sensitivitas, bukan prediksi penerapan.

Penulis melaporkan pengukuran spesifik platform. Platform A mengukur rasio hierarki 1,03, yang berada di bawah ketiga nilai breakeven, menunjukkan bahwa dispatch hierarkis tidak akan menguntungkan pada platform tersebut. Platform B tidak memiliki pengukuran fabric cepat/lambat yang terpisah, sehingga rasio hierarkinya tidak dapat dihitung. Tidak ada mesin yang diukur di sini yang mencapai rezim hierarkis, yang berarti rasio hierarki aktual berada di bawah ambang breakeven dalam semua kasus terukur.

Gerbang validasi menghasilkan hasil yang beragam. Empat korpus tingkat komunikasi lolos gerbangnya, memberikan keyakinan pada prediksi tingkat komunikasi. Namun, drift probe gagal, dan gerbang tingk

Pelatihan Mixture-of-Experts (MoE) paralel-ahli bergantung pada komunikasi all-to-all untuk mengirim token ke expert yang dipilih. Dispatch dua-hop hierarkis adalah kandidat optimasi: token pertama-tama dirutekan di dalam grup lokal lalu diteruskan antar grup, yang dapat mengurangi lalu lintas pada fabric lambat. Namun, manfaat ini tidak gratis. Hierarki memperkenalkan operasi kolektif kedua dan rantai operator sisi kedatangan, yang keduanya mengonsumsi waktu dan sumber daya. Pertanyaan utamanya adalah apakah penghematan fabric lambat melebihi overhead tambahan.
TerraceMoE menjawab pertanyaan ini dengan model biaya yang beroperasi pada tingkat panggilan komunikasi. Alih-alih memprediksi throughput pelatihan end-to-end, model ini menyaring trade-off pada granularitas panggilan komunikasi individual. Penulis menekankan bahwa hasil mereka adalah hasil sensitivitas rasio saja, bukan prediksi penerapan. Mereka membatasi model dengan gerbang validasi yang mencabut kapabilitas di dalam kode ketika gagal, bukan sekadar melaporkan catatan. Pilihan desain ini memastikan klaim yang tidak didukung tidak dibuat.

Mengapa penting

Hasilnya menyoroti kesenjangan kritis antara potensi teoretis dan realisasi praktis. Meskipun dispatch dua-hop hierarkis dapat mengurangi lalu lintas fabric lambat, kolektif kedua dan rantai operator sisi kedatangan yang ditambahkan menimbulkan overhead yang sering melebihi penghematan. Rasio breakeven menunjukkan bahwa hanya ketika lalu lintas fabric lambat jauh lebih tinggi daripada lalu lintas fabric cepat (dengan faktor 3,98 untuk rantai PyTorch terukur) barulah hierarki menguntungkan. Dengan rantai kedatangan fused, rasio yang dibutuhkan turun menjadi 1,49, dan dengan overhead nol menjadi 1,10. Ini menunjukkan bahwa efisiensi implementasi sangat penting.

Pengukuran platform memperkuat kesimpulan ini. Rasio hierarki Platform A sebesar 1,03 berada di bawah bahkan breakeven tanpa overhead sebesar 1,10, yang berarti hierarki tidak akan membantu bahkan dalam implementasi ideal. Platform B tidak memiliki pengukuran yang diperlukan untuk dievaluasi. Tidak ada platform yang mencapai rezim hierarkis, sehingga prediksi model tetap belum teruji dalam skenario penerapan nyata.

Gerbang validasi berfungsi sebagai mekanisme integritas ilmiah. Dengan menegakkan kegagalan gerbang tingkat langkah di dalam kode, penulis mencegah diri mereka sendiri dan orang lain memperluas penerapan model secara berlebihan. Kegagalan drift probe lebih lanjut memperingatkan agar tidak mengasumsikan bahwa model menggeneralisasi di luar cakupan yang divalidasi. Biaya validation-loss kecil dari batasan routing (+0,0034 nats) adalah pengingat bahwa bahkan kondisi yang memungkinkan pun memiliki harga.

Provenans estimator yang tidak lengkap untuk ekuivalensi hilir adalah batasan. Tanpa provenans penuh, peneliti independen tidak dapat merekonstruksi klaim ekuivalensi. Transparansi tentang batasan ini patut dipuji tetapi juga menunjukkan bahwa artefak tersebut bukan solusi lengkap. Pekerjaan selanjutnya dapat berfokus pada peningkatan rantai operator sisi kedatangan, pengembangan pengukuran pemisahan fabric cepat/lambat yang lebih baik, dan perluasan gerbang validasi untuk mencakup perilaku tingkat langkah.

Sebagai ringkasan, TerraceMoE menyediakan model biaya yang ketat dan dibatasi gerbang untuk menyaring strategi komunikasi MoE hierarkis. Kontribusi utamanya bukan rekomendasi penerapan melainkan kerangka untuk mengevaluasi kapan hierarki mungkin membantu, bersama dengan pernyataan jelas tentang kondisi di mana prediksi model valid.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ