PRO-RAN introduces a controlled framework that profiles independently deployed Open RAN Centralized Unit (CU) and Distributed Unit (DU) functions under matched hardware and traffic conditions. Using Intel VTune Hotspots and Top-Down Microa…
Method
Platform eksperimen mengintegrasikan implementasi Linux Foundation OCUDU dengan User Equipment yang diemulasi, antarmuka radio berbasis ZeroMQ, dan core Open5GS. Validasi otomatis…
Results
Di bawah beban lalu lintas, waktu CPU proses terakumulasi meningkat dari 17,3 s menjadi 37,4 s untuk CU dan dari 462,0 s menjadi 628,4 s untuk DU selama interval profiling yang sama selama 300 s. Ang…
Mirza Samad Ahmed Baig; Syeda Anshrah Gillani; Abdul Akbar Khan; Muhammad Omer Khan
Summary
Standard randomized benchmarking hides classical temporal noise correlations because its Clifford-twirled response is even in the noise phase. An eight-setting phase-cycle measurement of the connected sine-phase covariance recovers these c…
Method
Para penulis membangun pengukuran siklus fase delapan setelan atas kovarians fase-sinus terhubung di bawah Clifford twirling ideal dan dephasing idle klasik. Protokol ini menyiklu…
Results
Dua akuisisi pada prosesor IBM membandingkan fase tanda-bersama yang direkayasa dengan fase yang direset secara independen yang memiliki marginal identik. Kontras utamanya adalah 0,254 dan 0,211, den…
PACO is a parallel FFT framework that executes LocalFFT → OneGlobalPermutation → LocalFFT, achieving asymptotically optimal local cache complexity and exactly one global redistribution round. It defers recursive layout transformations, fus…
Method
PACO menjalankan tiga tahap: LocalFFT → OneGlobalPermutation → LocalFFT. Tahap lokal secara rekursif mempartisi dimensi transformasi dan batch tanpa pengetahuan tentang parameter …
Results
Di bawah dekomposisi slab basis-b yang eksak dalam model hybrid ideal-cache/BSP, PACO menghitung DFT N-titik secara eksak dengan kerja maksimum per prosesor $\Theta((N/p) \log N)$ dan kompleksitas ca…
Distributed deep learning training on HPC systems shares one network fabric between collective communication and parallel-filesystem I/O, imposing two distinct storage penalties. Node-local NVMe staging via DYAD eliminates both effects, ac…
Method
Penulis melakukan eksperimen pada sistem Slingshot-11 menggunakan beban kerja pelatihan GNN nyata. Mereka membandingkan tiga konfigurasi penyimpanan: pembacaan Lustre langsung, pe…
Results
Eksperimen mengungkap dua penalti penyimpanan yang berbeda. Pertama, stall DataLoader berekor berat: waktu tunggu DataLoader yang tipikal hanya 15 ms pada kondisi steady state, namun melonjak hingga …
Junming Zhang; Zhenzhe Zheng; Fan Wu; Xiaoyao Huang; Jie Wu
Summary
EStream resolves the mismatch between compile-time-fixed mobile NPU graphs and runtime expert selection in MoE prefill by binding routed tokens and weight addresses at call time, while paging the expert pool from UFS flash through a fixed-…
Method
EStream memperkenalkan dua mekanisme inti. Pertama, satu graf expert terkompilasi melayani setiap expert, dengan token yang dirutekan dan alamat bobot setiap expert diikat pada wa…
Results
Pada 18 pengaturan komparatif yang mencakup tiga MoE 7B–16B dan prompt 256–4.096 token, EStream dievaluasi pada ponsel pintar Snapdragon komersial. Dibandingkan dengan baseline tercepat pada setiap p…
This work develops a HIP-compatible accelerator backend for FBPIC, enabling efficient execution on DCU platforms while preserving the Python interface. It achieves 1.32–1.54× speedups over the original implementation on NVIDIA V100 and dem…
Method
Metodologi yang dipakai melibatkan penggantian backend Numba CUDA dengan implementasi yang kompatibel dengan HIP. Model pemrograman HIP memungkinkan kode portabel di seluruh GPU A…
Results
Untuk beban kerja LWFA yang dievaluasi, backend kompatibel HIP yang diusulkan mencapai percepatan 1,32–1,54× dibandingkan implementasi FBPIC asli pada GPU NVIDIA V100. Hal ini menunjukkan bahwa backe…
Qiushi Lin; Phillip B. Gibbons; Jovan Stojkovic; Yiwei Zhao
Summary
Gutenberg is a CPU+NDP system for mutable, latency-critical cloud services that stages subpage updates in a CPU-resident delta buffer, uses CPU helper cores, and employs an online controller to jointly decide page placement, replication, e…
Method
Metodologi Gutenberg menggabungkan mekanisme arsitektural dengan kebijakan daring berbasis teori kendali dan verifikasi formal. **Replikasi berpenyangga delta.** Alih-alih menyink…
Results
Para penulis mengevaluasi Gutenberg pada TailBench menggunakan ZSim dengan pengaturan waktu memori yang dikalibrasi Ramulator. Pada layanan yang dievaluasi, Gutenberg mengungguli sistem sebelumnya, m…
Yaojian Chen; Yuxuan Li; Wubing Wan; Lin Gan; Guangwen Yang; Zhiyuan Liu
Summary
ForgeStencil replaces two decades of reusable general stencil methods with automated per-case code synthesis, delivering 2.35x geometric mean kernel speedup on A100 and 1.41x median end-to-end speedup across 100 real industrial and scienti…
Method
ForgeStencil dibangun di atas pipeline sintesis agentic dua tingkat. Pada tingkat kernel, **Kernel Agent** menerima konfigurasi stensil—yang ditentukan oleh bentuk stensil, bentuk…
Results
Pada NVIDIA A100, peta operator per konfigurasi yang dihasilkan Kernel Agent mengalahkan baseline publik terkuat dalam **37 dari 37 kasus**. Percepatan geometric mean adalah **2,35x** terhadap baseli…
This paper proposes a constrained Bayesian Optimization framework to configure Hierarchical Federated Learning deployments for IoT-based plant disease classification, achieving near-optimal solutions while exploring only 11.11% of the sear…
Method
Kerangka kerja yang diusulkan merumuskan konfigurasi HFL sebagai masalah optimisasi kotak hitam terkendala. Misalkan $\mathbf{x} = (a, s, r)$ menyatakan vektor konfigurasi, dengan…
Results
Hasil eksperimen pada 30 eksekusi optimisasi independen menunjukkan bahwa kerangka kerja BO terkendala hanya menjelajahi 11,11% dari ruang pencarian penuh sambil secara konsisten mengidentifikasi sol…
This paper reduces the number of synchronous mobile agents required to locate a black hole in a dynamic network from $2\delta_{BH}+17$ to $2\delta_{BH}+3$, nearly matching the known lower bound of $2\delta_{BH}+1$.
Method
Penulis mempertimbangkan sekelompok agen bergerak sinkron dalam jaringan berlabel port yang dimodelkan sebagai graf dinamis terhubung 1-interval 1-bounded. Pada graf semacam itu, …
Results
Hasil utamanya adalah $2\delta_{BH}+3$ agen cukup untuk menyelesaikan masalah pencarian lubang hitam dari konfigurasi tersebar pada graf dinamis terhubung 1-interval 1-bounded. Ini meningkatkan batas…