Aaron Gregory presents a schedule for three-point stencil computations on a single interval whose endpoints move arbitrarily, achieving work O((B+N) log T log(N+B)) and span O(T log T log(N+B)), where B is the horizon plus total variation …
Method
Metodologi ini dibangun di atas penyusunan langkah waktu berbasis FFT. Tantangan utamanya adalah menangani interval bergerak yang koefisien stensilnya dapat berubah terhadap waktu…
Results
Hasil utamanya adalah jadwal dengan kerja $O((B+N) \log T \log(N+B))$ dan span $O(T \log T \log(N+B))$, dengan $B$ adalah horizon ditambah variasi total lintasan batas. Nilai terhitungnya eksak. Ini …
This paper proposes DDQN-Proactive, a double deep Q-Network-based autoscaling method with a Resource Removal Strategy (RRS) that decouples action selection from value evaluation to achieve more stable and adaptive scaling. Experiments show…
Method
Pendekatan yang diusulkan, DDQN-Proactive, memanfaatkan double deep Q-Network (DDQN) untuk membuat keputusan penskalaan proaktif. DDQN adalah teknik reinforcement learning yang me…
Results
Hasil eksperimen menunjukkan bahwa metode DDQN+RRS yang diusulkan mengungguli pendekatan reaktif maupun proaktif yang ada. Metrik kinerja utama dirangkum sebagai berikut: - **Tingkat pelanggaran SLA*…
This paper introduces an agentic autoscaling framework that orchestrates a dynamic pool of LLM workers for text classification, achieving up to 99.5% accuracy on SMS Spam and 90.5% on AG News while outperforming static baselines in resourc…
Method
Kerangka kerja yang diusulkan terdiri dari empat komponen utama: (1) **priority task queue** yang menyangga permintaan klasifikasi yang masuk dan mengurutkannya berdasarkan priori…
Results
Hasil eksperimen menunjukkan bahwa kerangka kerja yang diusulkan secara konsisten mengungguli pendekatan baseline dalam efisiensi sumber daya sekaligus mempertahankan performa klasifikasi yang tinggi…
Two single-GPU 27B vLLM replicas sharing a 256 GiB LMCache pool cut median cross-replica time-to-first-content-token from 31.715 s to 0.605 s at 128k input and from 92.047 s to 0.790 s at 256k. The gains hold only when requests alternate r…
Method
Testbed terdiri dari dua replika vLLM satu-GPU yang melayani model berparameter 27B, terhubung ke pool memori host LMCache bersama berukuran 256 GiB. Permintaan dirutekan antar-re…
Results
Hasil kebenarannya tidak ambigu. Uji byte terkendali gagal ketika penundaan diterapkan pada jalur cadangan pointer mentah, dan lulus setelah dependensi pada CUDA stream saat ini dipulihkan. Alokator …
External cache transfers can succeed while a hybrid language model resumes from an inconsistent state. This work validates a checkpoint-alignment repair for GLM-5.3-Flash with vLLM and LMCache, improving generation agreement from 34/36 to …
Method
Penulis menyelaraskan pemulihan melalui pencarian strict-prefix dan menetapkan perbandingan numerik menggunakan koreksi komputasi bersama, penjadwalan checkpoint yang dipasangkan,…
Results
Dalam beban kerja serial sembilan panjang, kesesuaian dengan kontrol komputasi ulang yang dimodifikasi meningkat dari 34/36 menjadi 36/36 generasi, masing-masing berisi 64 token ID. Proses instrument…
Joseph Isaacs; Francesco Gargiulo; Peter Boncz; Robert Kruszewski; Nicholas Gates; Rossano Venturini; Will Manning; Mar…
Summary
FastPair is a GPU decoder that reorganizes dictionary lookups and assembles decoded substrings for contiguous output writes, decoding ten real-world columns 2.4 to 4.2× faster than NVIDIA's Decompression Engine on a B300, reaching up to 1.…
Method
FastPair mengoptimalkan proses dekode kamus yang ada dengan menata ulang pencarian dan menyusun substring hasil dekode untuk penulisan keluaran yang berurutan. Ide intinya adalah …
Results
Pada GPU B300, FastPair mendekode sepuluh kolom dunia nyata 2,4 hingga 4,2× lebih cepat daripada Decompression Engine, mencapai hingga 1,6 TB/s. Percepatan ini konsisten di seluruh kolom yang dievalu…
Tristan Chenaille; Francesca Cuteri; Rapha{ë}l Prat; Guillaume Latu; Thomas Helfer
Summary
This study addresses the challenge of solving millions of tiny (dimension < 32) general linear systems on GPUs, as required in constitutive law evaluation. It compares double-precision LUpp solvers from GPU libraries and custom CUDA kernel…
Method
Penelitian ini mengevaluasi beberapa solver LUpp presisi ganda untuk sistem linear berukuran sangat kecil pada GPU NVIDIA. Solver tersebut mencakup implementasi dari pustaka aljab…
Results
Eksperimen pada GPU NVIDIA H100 menunjukkan bahwa solver LUpp khusus yang diusulkan dalam penelitian ini dapat mengungguli pendekatan terkini yang ada untuk kelas beban kerja ini. Percepatan yang dic…
Rui Lu; Rui Ge; Huanghuang Liang; Xiaobo Zhou; Dan Wang
Summary
ETCInfer is a thermal-aware scheduler for LLM inference that jointly controls cooling setpoints and GPU execution parameters, reducing total job energy by up to 33.1% and thermal throttle exposure by up to 92.9% while keeping SLO violation…
Method
ETCInfer membangun model kendali ringkas berbasis fisika dengan mengkalibrasi empat hubungan kunci dari telemetri: pembangkitan panas GPU, disipasi panas chassis, konsumsi daya CR…
Results
Evaluasi pada simulasi jejak nyata dan eksperimen validasi menunjukkan bahwa ETCInfer menurunkan total energi pekerjaan hingga 33,1%, paparan throttling termal hingga 92,9%, dan menjaga tingkat pelan…
FlashGPU-sim is an open-source, execution-driven, cycle-accurate GPU simulator that models modern hardware features like asynchronous data movement, tensor cores, and distributed shared memory. It achieves a cycle-level MAPE of 5.24% acros…
Method
FlashGPU-sim dirancang sebagai simulator execution-driven, cycle-accurate yang memodelkan fitur perangkat keras GPU modern yang utama. Simulator ini menggabungkan: - **Perpindahan…
Results
FlashGPU-sim dievaluasi pada 131 konfigurasi beban kerja di tiga arsitektur GPU modern: RTX 5090, H100, dan B200. Hasil utamanya adalah: - **Akurasi tingkat siklus**: Simulator mencapai MAPE 5,24%, y…
Trofimov and Novikov show that AI agent workflows can fail even when every tool call succeeds, because shared agent-tool interfaces lack the semantics needed to exclude eight recurring external-effect anomalies. An analysis of 98,291 MCP t…
Method
Makalah ini berlangsung dalam tiga tahap: pemodelan, penurunan anomali, dan pengukuran empiris. Pertama, para penulis mendefinisikan model riwayat efek. Misalkan $E$ adalah himpun…
Results
Analisis empiris terhadap 98.291 alat MCP menunjukkan bahwa kosakata anotasi standar banyak dihasilkan. Namun, bidang-bidang tersebut hanya memberikan petunjuk tingkat panggilan yang kasar. Tidak ada…