Aaron Gregory menyajikan jadwal untuk komputasi stensil tiga titik pada satu interval yang kedua titik ujungnya bergerak secara arbitrer, mencapai kerja O((B+N) log T log(N+B)) dan span O(T log T log(N+B)), dengan B adalah horizon ditambah…
Metode
Metodologi ini dibangun di atas penyusunan langkah waktu berbasis FFT. Tantangan utamanya adalah menangani interval bergerak yang koefisien stensilnya dapat berubah terhadap waktu…
Hasil
Hasil utamanya adalah jadwal dengan kerja $O((B+N) \log T \log(N+B))$ dan span $O(T \log T \log(N+B))$, dengan $B$ adalah horizon ditambah variasi total lintasan batas. Nilai terhitungnya eksak. Ini …
Makalah ini mengusulkan DDQN-Proactive, metode autoscaling berbasis double deep Q-Network dengan Resource Removal Strategy (RRS) yang memisahkan pemilihan aksi dari evaluasi nilai untuk mencapai penskalaan yang lebih stabil dan adaptif. Ek…
Metode
Pendekatan yang diusulkan, DDQN-Proactive, memanfaatkan double deep Q-Network (DDQN) untuk membuat keputusan penskalaan proaktif. DDQN adalah teknik reinforcement learning yang me…
Hasil
Hasil eksperimen menunjukkan bahwa metode DDQN+RRS yang diusulkan mengungguli pendekatan reaktif maupun proaktif yang ada. Metrik kinerja utama dirangkum sebagai berikut: - **Tingkat pelanggaran SLA*…
Makalah ini memperkenalkan kerangka kerja autoscaling agentik yang mengorkestrasi pool dinamis worker LLM untuk klasifikasi teks, mencapai akurasi hingga 99,5% pada SMS Spam dan 90,5% pada AG News sekaligus mengungguli baseline statis dala…
Metode
Kerangka kerja yang diusulkan terdiri dari empat komponen utama: (1) **priority task queue** yang menyangga permintaan klasifikasi yang masuk dan mengurutkannya berdasarkan priori…
Hasil
Hasil eksperimen menunjukkan bahwa kerangka kerja yang diusulkan secara konsisten mengungguli pendekatan baseline dalam efisiensi sumber daya sekaligus mempertahankan performa klasifikasi yang tinggi…
Dua replika vLLM 27B satu-GPU yang berbagi pool LMCache 256 GiB memangkas median waktu ke token konten pertama antar-replika dari 31,715 s menjadi 0,605 s pada input 128k dan dari 92,047 s menjadi 0,790 s pada 256k. Keuntungan hanya bertah…
Metode
Testbed terdiri dari dua replika vLLM satu-GPU yang melayani model berparameter 27B, terhubung ke pool memori host LMCache bersama berukuran 256 GiB. Permintaan dirutekan antar-re…
Hasil
Hasil kebenarannya tidak ambigu. Uji byte terkendali gagal ketika penundaan diterapkan pada jalur cadangan pointer mentah, dan lulus setelah dependensi pada CUDA stream saat ini dipulihkan. Alokator …
Transfer cache eksternal dapat berhasil sementara model bahasa hibrida melanjutkan dari keadaan yang tidak konsisten. Penelitian ini memvalidasi perbaikan penyelarasan checkpoint untuk GLM-5.3-Flash dengan vLLM dan LMCache, meningkatkan ke…
Metode
Penulis menyelaraskan pemulihan melalui pencarian strict-prefix dan menetapkan perbandingan numerik menggunakan koreksi komputasi bersama, penjadwalan checkpoint yang dipasangkan,…
Hasil
Dalam beban kerja serial sembilan panjang, kesesuaian dengan kontrol komputasi ulang yang dimodifikasi meningkat dari 34/36 menjadi 36/36 generasi, masing-masing berisi 64 token ID. Proses instrument…
Joseph Isaacs; Francesco Gargiulo; Peter Boncz; Robert Kruszewski; Nicholas Gates; Rossano Venturini; Will Manning; Mar…
Ringkasan
FastPair adalah dekoder GPU yang menata ulang pencarian kamus dan menyusun substring hasil dekode untuk penulisan keluaran yang berurutan, mendekode sepuluh kolom dunia nyata 2,4 hingga 4,2× lebih cepat daripada Decompression Engine NVIDIA…
Metode
FastPair mengoptimalkan proses dekode kamus yang ada dengan menata ulang pencarian dan menyusun substring hasil dekode untuk penulisan keluaran yang berurutan. Ide intinya adalah …
Hasil
Pada GPU B300, FastPair mendekode sepuluh kolom dunia nyata 2,4 hingga 4,2× lebih cepat daripada Decompression Engine, mencapai hingga 1,6 TB/s. Percepatan ini konsisten di seluruh kolom yang dievalu…
Tristan Chenaille; Francesca Cuteri; Rapha{ë}l Prat; Guillaume Latu; Thomas Helfer
Ringkasan
Penelitian ini membahas tantangan menyelesaikan jutaan sistem linear umum berukuran sangat kecil (dimensi < 32) pada GPU, sebagaimana diperlukan dalam evaluasi hukum konstitutif. Penelitian ini membandingkan solver LUpp presisi ganda dari …
Metode
Penelitian ini mengevaluasi beberapa solver LUpp presisi ganda untuk sistem linear berukuran sangat kecil pada GPU NVIDIA. Solver tersebut mencakup implementasi dari pustaka aljab…
Hasil
Eksperimen pada GPU NVIDIA H100 menunjukkan bahwa solver LUpp khusus yang diusulkan dalam penelitian ini dapat mengungguli pendekatan terkini yang ada untuk kelas beban kerja ini. Percepatan yang dic…
Rui Lu; Rui Ge; Huanghuang Liang; Xiaobo Zhou; Dan Wang
Ringkasan
ETCInfer adalah penjadwal sadar termal untuk inferensi LLM yang secara bersama mengendalikan setpoint pendinginan dan parameter eksekusi GPU, menurunkan total energi pekerjaan hingga 33,1% dan paparan throttling termal hingga 92,9% sambil …
Metode
ETCInfer membangun model kendali ringkas berbasis fisika dengan mengkalibrasi empat hubungan kunci dari telemetri: pembangkitan panas GPU, disipasi panas chassis, konsumsi daya CR…
Hasil
Evaluasi pada simulasi jejak nyata dan eksperimen validasi menunjukkan bahwa ETCInfer menurunkan total energi pekerjaan hingga 33,1%, paparan throttling termal hingga 92,9%, dan menjaga tingkat pelan…
FlashGPU-sim adalah simulator GPU open-source, execution-driven, cycle-accurate yang memodelkan fitur perangkat keras modern seperti perpindahan data asinkron, tensor core, dan distributed shared memory. Simulator ini mencapai MAPE tingkat…
Metode
FlashGPU-sim dirancang sebagai simulator execution-driven, cycle-accurate yang memodelkan fitur perangkat keras GPU modern yang utama. Simulator ini menggabungkan: - **Perpindahan…
Hasil
FlashGPU-sim dievaluasi pada 131 konfigurasi beban kerja di tiga arsitektur GPU modern: RTX 5090, H100, dan B200. Hasil utamanya adalah: - **Akurasi tingkat siklus**: Simulator mencapai MAPE 5,24%, y…
Trofimov dan Novikov menunjukkan bahwa alur kerja agen AI dapat gagal meskipun setiap panggilan alat berhasil, karena antarmuka agen-alat bersama tidak memiliki semantik yang diperlukan untuk mengecualikan delapan anomali efek eksternal ya…
Metode
Makalah ini berlangsung dalam tiga tahap: pemodelan, penurunan anomali, dan pengukuran empiris. Pertama, para penulis mendefinisikan model riwayat efek. Misalkan $E$ adalah himpun…
Hasil
Analisis empiris terhadap 98.291 alat MCP menunjukkan bahwa kosakata anotasi standar banyak dihasilkan. Namun, bidang-bidang tersebut hanya memberikan petunjuk tingkat panggilan yang kasar. Tidak ada…