APC-RLNC dynamically clusters peers by EWMA reliability and applies hierarchical random linear network coding to improve packet delivery, latency, and node retention in decentralized wireless networks. It proves O(√T) regret for online rec…
Method
APC-RLNC beroperasi dalam tiga tahap: (1) estimasi reliabilitas melalui EWMA kualitas tautan, (2) pengelompokan peer adaptif, dan (3) encoding/decoding RLNC bertingkat. Setiap pee…
Results
Evaluasi pada jaringan kendaraan bermobilitas tinggi, kanal burst-error, dan interferensi adversarial menunjukkan keunggulan yang konsisten dibandingkan baseline state-of-the-art. APC-RLNC mencapai p…
This paper proposes turning the wide area network into an active participant in distributed training by combining multicast replication, in-line FPGA aggregation, and an optimization framework that produces rotating-clique synchronization …
Method
Metodologi ini menggabungkan arsitektur sistem dengan kerangka optimisasi formal. Di sisi sistem, jaringan diperkaya dengan dua kemampuan. Pertama, teknologi multicast mereplikasi…
Results
Para penulis melaporkan hasil pada topologi sembilan kota yang dimodelkan pada jaringan DoubleZero, sebuah WAN yang dapat diprogram dan aktif yang dilengkapi teknologi multicast dan FPGA in-line. Eva…
PRO-RAN introduces a controlled framework that profiles independently deployed Open RAN Centralized Unit (CU) and Distributed Unit (DU) functions under matched hardware and traffic conditions. Using Intel VTune Hotspots and Top-Down Microa…
Method
Platform eksperimen mengintegrasikan implementasi Linux Foundation OCUDU dengan User Equipment yang diemulasi, antarmuka radio berbasis ZeroMQ, dan core Open5GS. Validasi otomatis…
Results
Di bawah beban lalu lintas, waktu CPU proses terakumulasi meningkat dari 17,3 s menjadi 37,4 s untuk CU dan dari 462,0 s menjadi 628,4 s untuk DU selama interval profiling yang sama selama 300 s. Ang…
Mirza Samad Ahmed Baig; Syeda Anshrah Gillani; Abdul Akbar Khan; Muhammad Omer Khan
Summary
Standard randomized benchmarking hides classical temporal noise correlations because its Clifford-twirled response is even in the noise phase. An eight-setting phase-cycle measurement of the connected sine-phase covariance recovers these c…
Method
Para penulis membangun pengukuran siklus fase delapan setelan atas kovarians fase-sinus terhubung di bawah Clifford twirling ideal dan dephasing idle klasik. Protokol ini menyiklu…
Results
Dua akuisisi pada prosesor IBM membandingkan fase tanda-bersama yang direkayasa dengan fase yang direset secara independen yang memiliki marginal identik. Kontras utamanya adalah 0,254 dan 0,211, den…
PACO is a parallel FFT framework that executes LocalFFT → OneGlobalPermutation → LocalFFT, achieving asymptotically optimal local cache complexity and exactly one global redistribution round. It defers recursive layout transformations, fus…
Method
PACO menjalankan tiga tahap: LocalFFT → OneGlobalPermutation → LocalFFT. Tahap lokal secara rekursif mempartisi dimensi transformasi dan batch tanpa pengetahuan tentang parameter …
Results
Di bawah dekomposisi slab basis-b yang eksak dalam model hybrid ideal-cache/BSP, PACO menghitung DFT N-titik secara eksak dengan kerja maksimum per prosesor $\Theta((N/p) \log N)$ dan kompleksitas ca…
Distributed deep learning training on HPC systems shares one network fabric between collective communication and parallel-filesystem I/O, imposing two distinct storage penalties. Node-local NVMe staging via DYAD eliminates both effects, ac…
Method
Penulis melakukan eksperimen pada sistem Slingshot-11 menggunakan beban kerja pelatihan GNN nyata. Mereka membandingkan tiga konfigurasi penyimpanan: pembacaan Lustre langsung, pe…
Results
Eksperimen mengungkap dua penalti penyimpanan yang berbeda. Pertama, stall DataLoader berekor berat: waktu tunggu DataLoader yang tipikal hanya 15 ms pada kondisi steady state, namun melonjak hingga …
Junming Zhang; Zhenzhe Zheng; Fan Wu; Xiaoyao Huang; Jie Wu
Summary
EStream resolves the mismatch between compile-time-fixed mobile NPU graphs and runtime expert selection in MoE prefill by binding routed tokens and weight addresses at call time, while paging the expert pool from UFS flash through a fixed-…
Method
EStream memperkenalkan dua mekanisme inti. Pertama, satu graf expert terkompilasi melayani setiap expert, dengan token yang dirutekan dan alamat bobot setiap expert diikat pada wa…
Results
Pada 18 pengaturan komparatif yang mencakup tiga MoE 7B–16B dan prompt 256–4.096 token, EStream dievaluasi pada ponsel pintar Snapdragon komersial. Dibandingkan dengan baseline tercepat pada setiap p…
This work develops a HIP-compatible accelerator backend for FBPIC, enabling efficient execution on DCU platforms while preserving the Python interface. It achieves 1.32–1.54× speedups over the original implementation on NVIDIA V100 and dem…
Method
Metodologi yang dipakai melibatkan penggantian backend Numba CUDA dengan implementasi yang kompatibel dengan HIP. Model pemrograman HIP memungkinkan kode portabel di seluruh GPU A…
Results
Untuk beban kerja LWFA yang dievaluasi, backend kompatibel HIP yang diusulkan mencapai percepatan 1,32–1,54× dibandingkan implementasi FBPIC asli pada GPU NVIDIA V100. Hal ini menunjukkan bahwa backe…
Qiushi Lin; Phillip B. Gibbons; Jovan Stojkovic; Yiwei Zhao
Summary
Gutenberg is a CPU+NDP system for mutable, latency-critical cloud services that stages subpage updates in a CPU-resident delta buffer, uses CPU helper cores, and employs an online controller to jointly decide page placement, replication, e…
Method
Metodologi Gutenberg menggabungkan mekanisme arsitektural dengan kebijakan daring berbasis teori kendali dan verifikasi formal. **Replikasi berpenyangga delta.** Alih-alih menyink…
Results
Para penulis mengevaluasi Gutenberg pada TailBench menggunakan ZSim dengan pengaturan waktu memori yang dikalibrasi Ramulator. Pada layanan yang dievaluasi, Gutenberg mengungguli sistem sebelumnya, m…
Yaojian Chen; Yuxuan Li; Wubing Wan; Lin Gan; Guangwen Yang; Zhiyuan Liu
Summary
ForgeStencil replaces two decades of reusable general stencil methods with automated per-case code synthesis, delivering 2.35x geometric mean kernel speedup on A100 and 1.41x median end-to-end speedup across 100 real industrial and scienti…
Method
ForgeStencil dibangun di atas pipeline sintesis agentic dua tingkat. Pada tingkat kernel, **Kernel Agent** menerima konfigurasi stensil—yang ditentukan oleh bentuk stensil, bentuk…
Results
Pada NVIDIA A100, peta operator per konfigurasi yang dihasilkan Kernel Agent mengalahkan baseline publik terkuat dalam **37 dari 37 kasus**. Percepatan geometric mean adalah **2,35x** terhadap baseli…