APC-RLNC mengelompokkan peer secara dinamis berdasarkan reliabilitas EWMA dan menerapkan hierarchical random linear network coding untuk meningkatkan pengiriman paket, latensi, dan retensi node di jaringan nirkabel terdesentralisasi. Siste…
Metode
APC-RLNC beroperasi dalam tiga tahap: (1) estimasi reliabilitas melalui EWMA kualitas tautan, (2) pengelompokan peer adaptif, dan (3) encoding/decoding RLNC bertingkat. Setiap pee…
Hasil
Evaluasi pada jaringan kendaraan bermobilitas tinggi, kanal burst-error, dan interferensi adversarial menunjukkan keunggulan yang konsisten dibandingkan baseline state-of-the-art. APC-RLNC mencapai p…
Makalah ini mengusulkan menjadikan wide area network sebagai peserta aktif dalam pelatihan terdistribusi dengan menggabungkan replikasi multicast, agregasi FPGA in-line, dan kerangka optimisasi yang menghasilkan jadwal sinkronisasi rotatin…
Metode
Metodologi ini menggabungkan arsitektur sistem dengan kerangka optimisasi formal. Di sisi sistem, jaringan diperkaya dengan dua kemampuan. Pertama, teknologi multicast mereplikasi…
Hasil
Para penulis melaporkan hasil pada topologi sembilan kota yang dimodelkan pada jaringan DoubleZero, sebuah WAN yang dapat diprogram dan aktif yang dilengkapi teknologi multicast dan FPGA in-line. Eva…
PRO-RAN memperkenalkan kerangka kerja terkendali yang memprofilkan fungsi Open RAN Centralized Unit (CU) dan Distributed Unit (DU) yang disebarkan secara independen pada kondisi perangkat keras dan lalu lintas yang setara. Dengan Intel VTu…
Metode
Platform eksperimen mengintegrasikan implementasi Linux Foundation OCUDU dengan User Equipment yang diemulasi, antarmuka radio berbasis ZeroMQ, dan core Open5GS. Validasi otomatis…
Hasil
Di bawah beban lalu lintas, waktu CPU proses terakumulasi meningkat dari 17,3 s menjadi 37,4 s untuk CU dan dari 462,0 s menjadi 628,4 s untuk DU selama interval profiling yang sama selama 300 s. Ang…
Mirza Samad Ahmed Baig; Syeda Anshrah Gillani; Abdul Akbar Khan; Muhammad Omer Khan
Ringkasan
Randomized benchmarking standar menyembunyikan korelasi derau temporal klasik karena respons Clifford-twirling-nya genap terhadap fase derau. Pengukuran siklus fase delapan setelan atas kovarians fase-sinus terhubung memulihkan korelasi in…
Metode
Para penulis membangun pengukuran siklus fase delapan setelan atas kovarians fase-sinus terhubung di bawah Clifford twirling ideal dan dephasing idle klasik. Protokol ini menyiklu…
Hasil
Dua akuisisi pada prosesor IBM membandingkan fase tanda-bersama yang direkayasa dengan fase yang direset secara independen yang memiliki marginal identik. Kontras utamanya adalah 0,254 dan 0,211, den…
PACO adalah kerangka kerja FFT paralel yang menjalankan LocalFFT → OneGlobalPermutation → LocalFFT, mencapai kompleksitas cache lokal yang optimal secara asimtotik dan tepat satu putaran redistribusi global. Kerangka ini menunda transforma…
Metode
PACO menjalankan tiga tahap: LocalFFT → OneGlobalPermutation → LocalFFT. Tahap lokal secara rekursif mempartisi dimensi transformasi dan batch tanpa pengetahuan tentang parameter …
Hasil
Di bawah dekomposisi slab basis-b yang eksak dalam model hybrid ideal-cache/BSP, PACO menghitung DFT N-titik secara eksak dengan kerja maksimum per prosesor $\Theta((N/p) \log N)$ dan kompleksitas ca…
Pelatihan deep learning terdistribusi pada sistem HPC berbagi satu fabric jaringan antara komunikasi kolektif dan I/O filesystem paralel, sehingga menimbulkan dua penalti penyimpanan yang berbeda. Staging NVMe node-local melalui DYAD mengh…
Metode
Penulis melakukan eksperimen pada sistem Slingshot-11 menggunakan beban kerja pelatihan GNN nyata. Mereka membandingkan tiga konfigurasi penyimpanan: pembacaan Lustre langsung, pe…
Hasil
Eksperimen mengungkap dua penalti penyimpanan yang berbeda. Pertama, stall DataLoader berekor berat: waktu tunggu DataLoader yang tipikal hanya 15 ms pada kondisi steady state, namun melonjak hingga …
Junming Zhang; Zhenzhe Zheng; Fan Wu; Xiaoyao Huang; Jie Wu
Ringkasan
EStream mengatasi ketidaksesuaian antara graf NPU seluler yang tetap pada waktu kompilasi dan pemilihan expert saat runtime pada prefill MoE dengan mengikat token yang dirutekan dan alamat bobot pada waktu pemanggilan, sambil memindahkan k…
Metode
EStream memperkenalkan dua mekanisme inti. Pertama, satu graf expert terkompilasi melayani setiap expert, dengan token yang dirutekan dan alamat bobot setiap expert diikat pada wa…
Hasil
Pada 18 pengaturan komparatif yang mencakup tiga MoE 7B–16B dan prompt 256–4.096 token, EStream dievaluasi pada ponsel pintar Snapdragon komersial. Dibandingkan dengan baseline tercepat pada setiap p…
Karya ini mengembangkan backend akselerator kompatibel HIP untuk FBPIC, sehingga eksekusi efisien pada platform DCU dapat dilakukan sambil mempertahankan antarmuka Python. Backend ini mencapai percepatan 1,32–1,54× dibandingkan implementas…
Metode
Metodologi yang dipakai melibatkan penggantian backend Numba CUDA dengan implementasi yang kompatibel dengan HIP. Model pemrograman HIP memungkinkan kode portabel di seluruh GPU A…
Hasil
Untuk beban kerja LWFA yang dievaluasi, backend kompatibel HIP yang diusulkan mencapai percepatan 1,32–1,54× dibandingkan implementasi FBPIC asli pada GPU NVIDIA V100. Hal ini menunjukkan bahwa backe…
Qiushi Lin; Phillip B. Gibbons; Jovan Stojkovic; Yiwei Zhao
Ringkasan
Gutenberg adalah sistem CPU+NDP untuk layanan cloud mutable yang berkritis latensi yang menampung pembaruan subhalaman dalam delta buffer yang berada di CPU, memakai helper core CPU, dan menggunakan pengendali daring untuk memutuskan secar…
Metode
Metodologi Gutenberg menggabungkan mekanisme arsitektural dengan kebijakan daring berbasis teori kendali dan verifikasi formal. **Replikasi berpenyangga delta.** Alih-alih menyink…
Hasil
Para penulis mengevaluasi Gutenberg pada TailBench menggunakan ZSim dengan pengaturan waktu memori yang dikalibrasi Ramulator. Pada layanan yang dievaluasi, Gutenberg mengungguli sistem sebelumnya, m…
Yaojian Chen; Yuxuan Li; Wubing Wan; Lin Gan; Guangwen Yang; Zhiyuan Liu
Ringkasan
ForgeStencil menggantikan dua dekade metode stensil umum yang dapat digunakan ulang dengan sintesis kode otomatis per kasus, menghasilkan percepatan kernel geometric mean 2,35x pada A100 dan percepatan end-to-end median 1,41x di 100 aplika…
Metode
ForgeStencil dibangun di atas pipeline sintesis agentic dua tingkat. Pada tingkat kernel, **Kernel Agent** menerima konfigurasi stensil—yang ditentukan oleh bentuk stensil, bentuk…
Hasil
Pada NVIDIA A100, peta operator per konfigurasi yang dihasilkan Kernel Agent mengalahkan baseline publik terkuat dalam **37 dari 37 kasus**. Percepatan geometric mean adalah **2,35x** terhadap baseli…