Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2026

EStream: Prefill MoE Cepat dan Hemat Memori melalui Virtualisasi Expert pada NPU Seluler

Satu graf expert terkompilasi ditambah virtualisasi expert berbasis UFS memungkinkan prefill MoE dinamis pada ponsel pintar Snapdragon komersial, menghasilkan percepatan TTFT hingga 27,57× dan pengurangan memori 12,29×.
Junming Zhang; Zhenzhe Zheng; Fan Wu; Xiaoyao Huang; Jie Wu· 2026· DOI 10.48550/arXiv.2609.06551

Masalah inti

Vendor seluler dan pengembang aplikasi semakin banyak menerapkan large language model (LLM) pada ponsel pintar untuk berbagai layanan prefill-only. Namun, sistem saat ini terutama bergantung pada model dense yang komputasinya teratur dan memetakan secara efisien ke neural processing unit (NPU) seluler, sehingga model Mixture-of-Experts (MoE) yang lebih mumpuni kurang dimanfaatkan. Prefill MoE tidak cocok untuk NPU seluler karena dua alasan struktural. Pertama, graf NPU ditetapkan pada waktu kompilasi, sedangkan MoE memilih expert saat runtime. Kedua, satu permintaan menyentuh sebagian besar expert, melebihi memori yang dapat ditampung ponsel. EStream mengatasi keduanya dengan memisahkan apa yang harus ditetapkan NPU dari apa yang diputuskan MoE saat runtime. Pekerjaan ini menyasar beban kerja prefill-only pada ponsel pintar Snapdragon komersial dan mengevaluasi tiga MoE 7B–16B pada prompt 256–4.096 token, dengan skala yang ditunjukkan hingga 46,7B parameter.

Inovasi

Pada 18 pengaturan komparatif yang mencakup tiga MoE 7B–16B dan prompt 256–4.096 token, EStream dievaluasi pada ponsel pintar Snapdragon komersial. Dibandingkan dengan baseline tercepat pada setiap pengaturan, EStream mencapai percepatan TTFT prefill murni 2,25–27,57× dan mengurangi memori fisik puncak sebesar 1,19–12,29×. EStream juga berskala hingga model MoE dengan parameter hingga 46,7B. Hasil ini menunjukkan bahwa eksekusi MoE dinamis dapat sepenuhnya dialihkan ke NPU tanpa padding atau fallback CPU/GPU, sementara memori tetap dibatasi oleh arena berukuran tetap, bukan oleh ukuran model.
Vendor seluler dan pengembang aplikasi semakin banyak menerapkan large language model (LLM) pada ponsel pintar untuk berbagai layanan prefill-only. Namun, sistem saat ini terutama bergantung pada model dense yang komputasinya teratur dan memetakan secara efisien ke neural processing unit (NPU) seluler, sehingga model Mixture-of-Experts (MoE) yang lebih mumpuni kurang dimanfaatkan. Prefill MoE tidak cocok untuk NPU seluler karena dua alasan struktural. Pertama, graf NPU ditetapkan pada waktu kompilasi, sedangkan MoE memilih expert saat runtime. Kedua, satu permintaan menyentuh sebagian besar expert, melebihi memori yang dapat ditampung ponsel. EStream mengatasi keduanya dengan memisahkan apa yang harus ditetapkan NPU dari apa yang diputuskan MoE saat runtime. Pekerjaan ini menyasar beban kerja prefill-only pada ponsel pintar Snapdragon komersial dan mengevaluasi tiga MoE 7B–16B pada prompt 256–4.096 token, dengan skala yang ditunjukkan hingga 46,7B parameter.
EStream memperkenalkan dua mekanisme inti. Pertama, satu graf expert terkompilasi melayani setiap expert, dengan token yang dirutekan dan alamat bobot setiap expert diikat pada waktu pemanggilan. Hal ini memungkinkan eksekusi MoE dinamis berjalan sepenuhnya di NPU tanpa padding atau fallback CPU/GPU. Kedua, virtualisasi expert menyimpan kumpulan expert di penyimpanan flash UFS dan memindahkannya melalui arena berukuran tetap yang dapat dialamati NPU, kelompok demi kelompok, dengan pemuatan disembunyikan di balik komputasi, sehingga memori dibatasi oleh arena, bukan oleh model. Algoritma konfigurasi yang sadar perangkat keras secara otomatis mengonfigurasi pipeline UFS–NPU dan memaksimalkan tumpang tindih pemuatan–komputasi.

Mengapa penting

Wawasan kunci EStream adalah pemisahan struktur graf NPU yang tetap pada waktu kompilasi dari keputusan MoE saat runtime. Dengan mengompilasi satu graf expert dan mengikat token yang dirutekan serta alamat bobot pada waktu pemanggilan, EStream menghilangkan kebutuhan akan padding atau fallback, yang merupakan sumber overhead umum pada sistem sebelumnya. Virtualisasi expert lebih lanjut memisahkan penggunaan memori dari ukuran model, memungkinkan MoE yang lebih besar pada ponsel pintar dengan memori terbatas. Algoritma konfigurasi yang sadar perangkat keras memastikan pemuatan UFS disembunyikan di balik komputasi NPU, memaksimalkan tumpang tindih. Pendekatan ini sangat relevan untuk layanan prefill-only, di mana latensi dan memori sangat kritis. Evaluasi pada ponsel pintar Snapdragon komersial mengonfirmasi kelayakan praktis dari desain ini. Pekerjaan selanjutnya dapat memperluas EStream ke fase decode atau akselerator seluler lainnya, dan kandidat taksonomi (Architecture, Cybersecurity, Network, Cryptography) menunjukkan potensi aplikasi lintas domain dalam AI seluler yang aman dan berjaringan.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…