Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2026

Pipeline GPU hemat memori untuk rekonstruksi non-line-of-sight waktu nyata

Kernel gabungan, kernel cincin analitik, dan penyimpanan FP16 menghasilkan percepatan hingga 42× dan jejak memori 2,5% untuk pencitraan NLOS berbasis gelombang
Alfonso López-Ruiz; Diego Royo· 2026· DOI 10.48550/arXiv.2608.28183

Masalah inti

Pencitraan non-line-of-sight (NLOS) merekonstruksi pemandangan yang tersembunyi di balik sudut dengan menganalisis cahaya tidak langsung yang ditangkap menggunakan single-photon avalanche diode (SPAD). Setiap rekonstruksi merupakan masalah invers berskala besar: miliaran stempel waktu foton harus dikelompokkan, dipindahkan melalui memori, ditransformasi, dan diinversi. Seiring meningkatnya throughput akuisisi array SPAD, rekonstruksi menjadi tahap yang membatasi. Karya ini membangun ulang eksekusi GPU dua algoritma berbasis gelombang yang mapan—migrasi f-k dan phasor-fields—untuk pemrosesan streaming maupun offline. Pertanyaan utamanya bukan akurasi algoritma, melainkan efisiensi eksekusi: bagaimana menata ulang pergerakan memori, penggabungan kernel, dan presisi agar dapat mengikuti sensor SPAD modern. Penulis melaporkan rekonstruksi streaming hingga 42× lebih cepat daripada pipeline referensi dan hingga 14× lebih cepat daripada baseline GPU tercepat yang dipublikasikan, sekaligus menurunkan penggunaan memori hingga 2,5% dari kebutuhan sebelumnya. Hasilnya memungkinkan rekonstruksi yang jauh lebih besar dan lebih halus pada perangkat keras yang sama, atau rekonstruksi yang sebandi

Inovasi

Pipeline yang dibangun ulang mencapai rekonstruksi streaming hingga 42× lebih cepat daripada pipeline streaming referensi dan hingga 14× lebih cepat daripada baseline GPU tercepat yang dipublikasikan. Penggunaan memori turun hingga 2,5% dari kebutuhan sebelumnya. Keuntungan ini konsisten pada migrasi f-k maupun phasor-fields, serta pada mode streaming dan offline. Ablasi mengisolasi kontribusi setiap pilihan: kernel gabungan, pengelompokan foton tingkat warp, transformasi batch, pemutaran ulang CUDA graph, dan penyimpanan FP16 selektif. Kernel cincin analitik untuk phasor-fields menghilangkan penyimpanan kernel padat saat runtime, mengurangi memori sekaligus bandwidth. Efek praktisnya adalah rekonstruksi yang jauh lebih besar dan lebih halus menjadi layak pada perangkat keras yang sama, atau rekonstruksi yang sebanding muat dalam anggaran memori yang jauh lebih rendah. Penulis juga mengusulkan tiga strategi denoising yang dimungkinkan oleh anggaran frame yang dihasilkan, mengarah pada pemrosesan video NLOS generasi berikutnya.
Pencitraan non-line-of-sight (NLOS) merekonstruksi pemandangan yang tersembunyi di balik sudut dengan menganalisis cahaya tidak langsung yang ditangkap menggunakan single-photon avalanche diode (SPAD). Setiap rekonstruksi merupakan masalah invers berskala besar: miliaran stempel waktu foton harus dikelompokkan, dipindahkan melalui memori, ditransformasi, dan diinversi. Seiring meningkatnya throughput akuisisi array SPAD, rekonstruksi menjadi tahap yang membatasi. Karya ini membangun ulang eksekusi GPU dua algoritma berbasis gelombang yang mapan—migrasi f-k dan phasor-fields—untuk pemrosesan streaming maupun offline. Pertanyaan utamanya bukan akurasi algoritma, melainkan efisiensi eksekusi: bagaimana menata ulang pergerakan memori, penggabungan kernel, dan presisi agar dapat mengikuti sensor SPAD modern. Penulis melaporkan rekonstruksi streaming hingga 42× lebih cepat daripada pipeline referensi dan hingga 14× lebih cepat daripada baseline GPU tercepat yang dipublikasikan, sekaligus menurunkan penggunaan memori hingga 2,5% dari kebutuhan sebelumnya. Hasilnya memungkinkan rekonstruksi yang jauh lebih besar dan lebih halus pada perangkat keras yang sama, atau rekonstruksi yang sebanding dalam anggaran memori yang jauh lebih rendah. Makalah ini juga mengusulkan tiga strategi denoising yang dimungkinkan oleh anggaran frame yang dihasilkan untuk pemrosesan video NLOS generasi berikutnya.
Penulis menata ulang pipeline GPU kedua algoritma di sekitar kernel gabungan, pengelompokan foton tingkat warp, transformasi batch, pemutaran ulang CUDA graph, dan penyimpanan FP16 yang diterapkan hanya di tempat yang mengurangi hambatan sebenarnya. Untuk phasor-fields, mereka menyusun kernel cincin-dan-radius sekali secara offline menggunakan transformasi Fourier analitik dari sebuah cincin, sehingga kernel propagasi tidak pernah ada dalam bentuk padat saat runtime. Konstruksi analitik ini mengurangi memori sekaligus bandwidth. Pipeline dapat dinyatakan sebagai rangkaian transformasi:

Mengapa penting

Hasil ini membingkai ulang rekonstruksi NLOS sebagai masalah bandwidth memori, bukan masalah yang terbatas pada komputasi. Dengan menggabungkan kernel dan memproses transformasi secara batch, pipeline mengurangi lalu lintas memori global yang berlebihan. Pengelompokan foton tingkat warp menjaga pemrosesan stempel waktu tetap dekat dengan data, sementara pemutaran ulang CUDA graph menghilangkan overhead peluncuran. Kernel cincin analitik sangat efektif karena menggantikan kernel propagasi padat dengan ekspresi bentuk tertutup, sehingga kernel tersebut tidak pernah ada dalam bentuk padat saat runtime. Penyimpanan FP16 selektif diterapkan hanya di tempat yang mengurangi hambatan sebenarnya, menghindari kehilangan presisi di tempat yang tidak akan membantu. Jejak memori 2,5% adalah hasil yang paling mencolok: artinya rekonstruksi yang sebelumnya dibatasi oleh memori GPU kini dapat diperbesar ukuran dan resolusinya. Strategi denoising yang diusulkan memanfaatkan anggaran frame yang tercipta dari rekonstruksi yang lebih cepat, menunjukkan jalan menuju video NLOS waktu nyata. Batasannya mencakup perlunya profiling yang cermat untuk memilih penempatan FP16 dan asumsi bahwa kernel cincin analitik berlaku untuk formulasi phasor-fields. Secara keseluruhan, karya ini menunjukkan bahwa penataan ulang pada tingkat eksekusi dapat memberikan keuntungan sebesar orde besaran tanpa mengubah algoritma dasarnya.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…