Editorial Ilmu Komputer & AI
Open AccessOA2026
Ilusi Kedalaman: Mengungkap Kerentanan Tersembunyi Penglihatan Stereo dalam Estimasi Kedalaman
Bagaimana pola berulang sederhana dapat menipu kamera stereo dan model kedalaman mendalam, menggeser rintangan hingga 20 meter dan memicu pengereman darurat pada sistem otonom.
Sri Hrushikesh Varma Bhupathiraju; Tetsu Ishizue; Nicholas U. Costagliola; Ozora Sako; Kentaro Yoshioka; Takeshi Sugawara; Sara Rampazzi· 2026· DOI 10.48550/arXiv.2609.16336
Masalah inti
Kamera stereo banyak digunakan dalam sistem otonom—mobil tanpa pengemudi, drone, dan robot—karena menawarkan estimasi kedalaman yang hemat biaya dan presisi dibandingkan LiDAR. Namun, karya ini mengungkap kerentanan intrinsik yang berakar pada proses pengambilan sampel piksel dan kalibrasi kamera stereo. Penyerang dapat memanipulasi kedalaman yang diestimasi dari rintangan nyata menggunakan pola berulang sederhana, tanpa pembelajaran mesin adversarial yang canggih. Kerentanan ini juga memengaruhi model estimasi kedalaman berbasis pembelajaran mendalam. Para penulis mengevaluasi serangan pada dua algoritma pencocokan stereo klasik (BM dan SGBM), tiga model pembelajaran mendalam (PSMNet, MoCha-Stereo, dan UniMatch), model fusi stereo-LiDAR (SGM-DDC), dan dua kamera stereo komersial (ZED2 dan Intel RealSense D435). Misalnya, pada kamera ZED2, penyerang dapat menggeser rintangan hingga 20 meter lebih jauh atau 12 meter lebih dekat. Dalam uji mengemudi dunia nyata, serangan singkat 0,5 detik dapat memicu pengereman darurat pada kerangka kerja mengemudi otonom yang populer. Serangan ini juga layak dilakukan pada kecepatan mengemudi hingga 40 km/jam di CARLA. Pertahanan terkini tidak efek
Inovasi
Serangan ini mencapai kontrol yang terperinci atas kedalaman yang diestimasi. Pada kamera ZED2, rintangan dapat digeser hingga 20 meter lebih jauh atau 12 meter lebih dekat. Efek serupa diamati pada Intel RealSense D435. Serangan ini efektif pada model klasik maupun pembelajaran mendalam: BM, SGBM, PSMNet, MoCha-Stereo, dan UniMatch. Dalam pengaturan mengemudi dunia nyata, serangan 0,5 detik memicu pengereman darurat pada kerangka kerja mengemudi otonom yang populer. Dalam simulasi CARLA, serangan tetap layak dilakukan pada kecepatan mengemudi hingga 40 km/jam. Model fusi stereo-LiDAR SGM-DDC juga rentan, yang menunjukkan bahwa fusi tidak secara inheren mengurangi masalah ini. Pertahanan terkini gagal mendeteksi atau mencegah serangan. Pertahanan berbasis skor kemiripan yang diusulkan menunjukkan harapan dalam mendeteksi dan menekan perbedaan kedalaman secara dinamis, tetapi validasi lebih lanjut diperlukan.
Kamera stereo banyak digunakan dalam sistem otonom—mobil tanpa pengemudi, drone, dan robot—karena menawarkan estimasi kedalaman yang hemat biaya dan presisi dibandingkan LiDAR. Namun, karya ini mengungkap kerentanan intrinsik yang berakar pada proses pengambilan sampel piksel dan kalibrasi kamera stereo. Penyerang dapat memanipulasi kedalaman yang diestimasi dari rintangan nyata menggunakan pola berulang sederhana, tanpa pembelajaran mesin adversarial yang canggih. Kerentanan ini juga memengaruhi model estimasi kedalaman berbasis pembelajaran mendalam. Para penulis mengevaluasi serangan pada dua algoritma pencocokan stereo klasik (BM dan SGBM), tiga model pembelajaran mendalam (PSMNet, MoCha-Stereo, dan UniMatch), model fusi stereo-LiDAR (SGM-DDC), dan dua kamera stereo komersial (ZED2 dan Intel RealSense D435). Misalnya, pada kamera ZED2, penyerang dapat menggeser rintangan hingga 20 meter lebih jauh atau 12 meter lebih dekat. Dalam uji mengemudi dunia nyata, serangan singkat 0,5 detik dapat memicu pengereman darurat pada kerangka kerja mengemudi otonom yang populer. Serangan ini juga layak dilakukan pada kecepatan mengemudi hingga 40 km/jam di CARLA. Pertahanan terkini tidak efektif, dan para penulis mengusulkan strategi baru menggunakan skor kemiripan untuk mendeteksi dan menekan perbedaan kedalaman secara dinamis.
Serangan ini mengeksploitasi pipeline pencocokan stereo, yang bergantung pada pengambilan sampel piksel dan kalibrasi untuk menghitung disparitas dan kedalaman. Para penulis merancang pola berulang yang memicu kesalahan sistematis dalam biaya pencocokan. Untuk algoritma klasik seperti Block Matching (BM) dan Semi-Global Block Matching (SGBM), pola tersebut menyebabkan ketidakcocokan yang konsisten. Untuk model pembelajaran mendalam (PSMNet, MoCha-Stereo, UniMatch), kerentanan tetap ada karena ketergantungan mereka pada pengambilan sampel dan pencocokan fitur yang serupa. Serangan dievaluasi pada kamera stereo komersial ZED2 dan Intel RealSense D435, serta pada model fusi stereo-LiDAR SGM-DDC. Para penulis juga menguji dalam simulator mengemudi (CARLA) dan dalam skenario mengemudi dunia nyata. Mekanisme inti dapat dijelaskan oleh hubungan disparitas-kedalaman:
Mengapa penting
Kerentanan ini berasal dari sifat fundamental penglihatan stereo: pengambilan sampel piksel dan kalibrasi. Pola berulang dapat aliasing dengan grid pengambilan sampel, menyebabkan kesalahan pencocokan yang konsisten. Ini tidak terbatas pada algoritma klasik; model pembelajaran mendalam mewarisi kelemahan yang sama karena mereka memproses data yang diambil sampelnya secara serupa. Serangan ini bersifat siluman, hanya memerlukan pola sederhana, bukan ML adversarial. Implikasinya bagi sistem otonom sangat serius: penyerang dapat menyebabkan rintangan hantu atau menyembunyikan rintangan nyata, yang mengarah pada manuver berbahaya. Ketidakefektifan pertahanan saat ini menyoroti celah kritis. Pertahanan yang diusulkan menggunakan skor kemiripan adalah langkah maju, tetapi mungkin tidak mencakup semua varian serangan. Para penulis menyerukan pemikiran ulang tentang ketahanan penglihatan stereo, dari perangkat keras hingga algoritma. Pekerjaan di masa depan harus mengeksplorasi pertahanan yang tangguh terhadap serangan berpola dan memvalidasinya dalam berbagai kondisi dunia nyata.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten member…