Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2026

Backend akselerator kompatibel HIP untuk simulasi Fourier-Bessel particle-in-cell pada klaster heterogen CPU/DCU

Mem-porting FBPIC ke akselerator DCU dengan HIP: kinerja, skalabilitas, dan pelajaran yang diperoleh
Jingliang Fan; Ruiqing He; Yang Wan; Jiandong Shang; Hengliang Guo; Qiang Chen· 2026· DOI 10.48550/arXiv.2609.06680

Masalah inti

FBPIC (Fourier-Bessel particle-in-cell) adalah kode simulasi berkinerja tinggi untuk fisika plasma relativistik dan fisika akselerator. Backend akselerator aslinya bergantung pada Numba CUDA, yang membatasi penerapan langsungnya pada akselerator yang memakai lingkungan pemrograman HIP (Heterogeneous-Compute Interface for Portability), seperti akselerator DCU (Deep Computing Unit). Karya ini mengatasi keterbatasan tersebut dengan mengembangkan backend akselerator yang kompatibel dengan HIP sehingga FBPIC dapat berjalan efisien pada platform DCU sambil mempertahankan antarmuka pengguna Python dan alur kerja simulasi tingkat tingginya. Tujuan utamanya adalah mengevaluasi kinerja dan skalabilitas backend yang diusulkan pada beban kerja laser-wakefield acceleration (LWFA), membandingkannya dengan implementasi FBPIC asli pada GPU NVIDIA V100, dan menunjukkan eksekusi efisien pada platform DCU. Studi ini juga merangkum pelajaran utama dari porting FBPIC ke platform DCU, sebagai rujukan praktis untuk porting dan optimasi aplikasi komputasi ilmiah lain yang dikembangkan dengan Python pada platform akselerator heterogen.

Inovasi

Untuk beban kerja LWFA yang dievaluasi, backend kompatibel HIP yang diusulkan mencapai percepatan 1,32–1,54× dibandingkan implementasi FBPIC asli pada GPU NVIDIA V100. Hal ini menunjukkan bahwa backend HIP tidak hanya memungkinkan portabilitas tetapi juga meningkatkan kinerja pada perangkat keras NVIDIA. Pada platform DCU, backend ini memungkinkan eksekusi efisien, menunjukkan bahwa FBPIC dapat diterapkan pada akselerator DCU tanpa mengorbankan kinerja. Eksperimen multi-DCU menunjukkan percepatan strong scaling 1,88× pada empat akselerator, yang berarti penggunaan empat DCU memangkas waktu eksekusi dengan faktor 1,88 dibandingkan satu DCU. Throughput agregat meningkat 2,72× pada efisiensi weak scaling sekitar 68%. Efisiensi weak scaling didefinisikan sebagai rasio waktu eksekusi pada satu akselerator terhadap waktu eksekusi pada akselerator ketika ukuran masalah berskala dengan . Efisiensi 68% menunjukkan bahwa overhead komunikasi dan sinkronisasi bertambah seiring jumlah akselerator, tetapi sistem tetap memberikan keuntungan throughput yang substansial. Analisis komunikasi mengidentifikasi komunikasi antar-node dan sinkronisasi sebagai batasan skalabilitas utama. Metrik per
FBPIC (Fourier-Bessel particle-in-cell) adalah kode simulasi berkinerja tinggi untuk fisika plasma relativistik dan fisika akselerator. Backend akselerator aslinya bergantung pada Numba CUDA, yang membatasi penerapan langsungnya pada akselerator yang memakai lingkungan pemrograman HIP (Heterogeneous-Compute Interface for Portability), seperti akselerator DCU (Deep Computing Unit). Karya ini mengatasi keterbatasan tersebut dengan mengembangkan backend akselerator yang kompatibel dengan HIP sehingga FBPIC dapat berjalan efisien pada platform DCU sambil mempertahankan antarmuka pengguna Python dan alur kerja simulasi tingkat tingginya. Tujuan utamanya adalah mengevaluasi kinerja dan skalabilitas backend yang diusulkan pada beban kerja laser-wakefield acceleration (LWFA), membandingkannya dengan implementasi FBPIC asli pada GPU NVIDIA V100, dan menunjukkan eksekusi efisien pada platform DCU. Studi ini juga merangkum pelajaran utama dari porting FBPIC ke platform DCU, sebagai rujukan praktis untuk porting dan optimasi aplikasi komputasi ilmiah lain yang dikembangkan dengan Python pada platform akselerator heterogen.
Metodologi yang dipakai melibatkan penggantian backend Numba CUDA dengan implementasi yang kompatibel dengan HIP. Model pemrograman HIP memungkinkan kode portabel di seluruh GPU AMD dan NVIDIA, serta akselerator DCU. Proses porting memerlukan penyesuaian peluncuran kernel, manajemen memori, dan primitif sinkronisasi terhadap API HIP sambil mempertahankan antarmuka Python dan alur kerja simulasi. Backend ini diintegrasikan ke dalam FBPIC tanpa mengubah API Python yang dihadapi pengguna, sehingga skrip simulasi yang ada tetap kompatibel. Evaluasi kinerja dilakukan menggunakan beban kerja LWFA, yang representatif untuk simulasi fisika plasma relativistik dan fisika akselerator. Eksperimen membandingkan backend HIP yang diusulkan dengan backend Numba CUDA asli pada GPU NVIDIA V100. Selain itu, eksperimen multi-DCU dilakukan untuk menilai strong scaling dan weak scaling. Strong scaling diukur dengan menambah jumlah akselerator sementara ukuran masalah tetap, dan weak scaling diukur dengan menambah ukuran masalah dan jumlah akselerator secara proporsional. Analisis komunikasi dilakukan untuk mengidentifikasi batasan skalabilitas. Metrik kinerja utama meliputi percepatan, throughput agregat, dan efisiensi weak scaling. Formulasi matematis metode particle-in-cell tetap tidak berubah; fokusnya adalah pada backend komputasi. Untuk siklus PIC yang tipikal, pembaruan posisi dan momentum partikel dapat dinyatakan sebagai:

Mengapa penting

Hasil ini menunjukkan bahwa backend kompatibel HIP berhasil memungkinkan FBPIC berjalan pada platform DCU sambil mempertahankan antarmuka pengguna Python dan alur kerja simulasi tingkat tingginya. Percepatan pada NVIDIA V100 (1,32–1,54×) menunjukkan bahwa implementasi HIP bukan sekadar porting tetapi juga optimasi, mungkin karena konfigurasi peluncuran kernel atau pola akses memori yang lebih baik. Eksperimen multi-DCU mengungkapkan bahwa strong scaling dibatasi oleh komunikasi antar-node dan sinkronisasi, seperti ditunjukkan oleh efisiensi strong scaling 47% pada empat akselerator. Weak scaling mencapai efisiensi 68%, yang cukup baik tetapi masih menyisakan ruang perbaikan. Analisis komunikasi menunjuk komunikasi antar-node sebagai hambatan utama, sehingga pekerjaan selanjutnya dapat berfokus pada optimasi pola komunikasi, misalnya menggunakan komunikasi asinkron atau menumpang-tindihkan komputasi dengan komunikasi. Pelajaran yang diperoleh dari porting FBPIC ke platform DCU mencakup pentingnya meminimalkan transfer data antara host dan device, perlunya sinkronisasi yang cermat untuk menghindari race condition, serta manfaat mempertahankan antarmuka Python tingkat tinggi untuk produktivitas pengguna. Pendekatan yang diusulkan memberikan rujukan praktis untuk porting dan optimasi aplikasi komputasi ilmiah lain yang dikembangkan dengan Python pada platform akselerator heterogen. Kandidat taksonomi (Architecture, Cybersecurity, Network, Cryptography) tidak dibahas secara langsung dalam karya ini, tetapi metodologi untuk porting dan optimasi dapat relevan bagi penelitian jaringan dan arsitektur. Secara keseluruhan, karya ini berkontribusi pada ekosistem komputasi heterogen yang terus tumbuh untuk simulasi ilmiah.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…