Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2026

Serangan Adversarial Black-box Terinspirasi Reinforcement Learning untuk Computer Vision

RIBA: Serangan Black-box Hemat Query dengan Konsep Reinforcement Learning
Florian Krone; Elena Hoemann; Sven Hallerbach· 2026· DOI 10.48550/arXiv.2609.24249

Masalah inti

Jaringan neural, termasuk arsitektur convolutional dan berbasis transformer, merupakan fondasi sistem computer vision modern. Namun, jaringan tersebut rentan terhadap perturbasi adversarial—perubahan kecil, sering kali tak terlihat, pada gambar masukan yang secara drastis mengubah prediksi model. Serangan semacam itu menimbulkan ancaman signifikan bagi aplikasi yang berorientasi keselamatan. Sebagian besar serangan yang ada beroperasi di bawah model ancaman white-box, dengan asumsi akses penuh terhadap arsitektur dan parameter model target, yang tidak realistis dalam praktik. Penelitian ini memperkenalkan pendekatan baru di bawah model ancaman black-box yang lebih realistis, di mana penyerang hanya dapat melakukan query ke model dan mengamati keluarannya. Metode yang diusulkan, Reinforcement Learning Inspired Black-box Adversarial Attack (RIBA), memanfaatkan konsep dari reinforcement learning untuk mengoptimalkan perturbasi terhadap model target yang non-diferensiabel. Dengan memanfaatkan efisiensi query algoritma reinforcement learning, RIBA bertujuan menghasilkan contoh adversarial yang berhasil dengan query lebih sedikit dibandingkan serangan black-box state-of-the-art.

Inovasi

Penulis mengevaluasi RIBA terhadap serangan black-box state-of-the-art pada dataset CIFAR-10 dan ImageNet menggunakan model ResNet-18 dan ViT-B/16. Pada CIFAR-10 dengan ResNet-18, RIBA memerlukan 25,4% lebih sedikit median query untuk menghasilkan contoh adversarial yang berhasil dibandingkan baseline terbaik. Pada ImageNet dengan ViT-B/16, RIBA mencapai pengurangan 22,5% pada median query. Selain itu, pada model yang dilatih secara adversarial, RIBA menyamai performa serangan white-box, menunjukkan efektivitasnya bahkan terhadap pertahanan. Eksperimen juga menunjukkan bahwa RIBA mempertahankan tingkat keberhasilan serangan yang tinggi sambil menjaga jumlah query tetap rendah, sehingga praktis untuk skenario black-box dunia nyata. Hasilnya dirangkum dalam tabel berikut:

| Dataset | Model | Median Query Reduction |
|-----------|------------|------------------------|
| CIFAR-10 | ResNet-18 | 25.4% |
| ImageNet | ViT-B/16 | 22.5% |

Peningkatan ini konsisten di berbagai anggaran perturbasi dan arsitektur model, menyoroti ketahanan dan generalisasi RIBA.

Jaringan neural, termasuk arsitektur convolutional dan berbasis transformer, merupakan fondasi sistem computer vision modern. Namun, jaringan tersebut rentan terhadap perturbasi adversarial—perubahan kecil, sering kali tak terlihat, pada gambar masukan yang secara drastis mengubah prediksi model. Serangan semacam itu menimbulkan ancaman signifikan bagi aplikasi yang berorientasi keselamatan. Sebagian besar serangan yang ada beroperasi di bawah model ancaman white-box, dengan asumsi akses penuh terhadap arsitektur dan parameter model target, yang tidak realistis dalam praktik. Penelitian ini memperkenalkan pendekatan baru di bawah model ancaman black-box yang lebih realistis, di mana penyerang hanya dapat melakukan query ke model dan mengamati keluarannya. Metode yang diusulkan, Reinforcement Learning Inspired Black-box Adversarial Attack (RIBA), memanfaatkan konsep dari reinforcement learning untuk mengoptimalkan perturbasi terhadap model target yang non-diferensiabel. Dengan memanfaatkan efisiensi query algoritma reinforcement learning, RIBA bertujuan menghasilkan contoh adversarial yang berhasil dengan query lebih sedikit dibandingkan serangan black-box state-of-the-art.
RIBA merumuskan pembangkitan perturbasi adversarial sebagai masalah reinforcement learning. Penyerang berinteraksi dengan model target sebagai lingkungan, menerima reward berdasarkan keberhasilan serangan (misalnya, salah klasifikasi). Jaringan policy dilatih untuk mengeluarkan perturbasi yang memaksimalkan reward sekaligus meminimalkan jumlah query. Karena model target non-diferensiabel dari perspektif penyerang, optimasi berbasis gradien tidak dapat dilakukan; sebagai gantinya, RIBA menggunakan metode policy gradient untuk memperkirakan gradien reward yang diharapkan terhadap parameter policy. Tujuan keseluruhan dapat dinyatakan sebagai:

Mengapa penting

Keberhasilan RIBA berasal dari kemampuannya mempelajari policy yang secara efisien menjelajahi ruang perturbasi. Dengan membingkai serangan sebagai masalah reinforcement learning, RIBA dapat beradaptasi dengan batas keputusan model target tanpa memerlukan gradien. Penggunaan replay buffer dan prioritized experience replay lebih lanjut meningkatkan efisiensi sampel, yang krusial dalam pengaturan black-box di mana query mahal. Penulis mencatat bahwa performa RIBA pada model yang dilatih secara adversarial sangat menjanjikan, karena menunjukkan bahwa reinforcement learning dapat mengatasi sebagian pertahanan yang mengandalkan gradient masking. Namun, ketergantungan RIBA pada sejumlah besar interaksi selama pelatihan (meskipun tidak selama serangan) dapat membatasi penerapannya dalam skenario dengan anggaran query yang ketat. Penelitian selanjutnya dapat mengeksplorasi transferabilitas policy yang dipelajari antar model dan dataset, serta memperluas RIBA ke domain lain seperti audio atau teks. Diagram Mermaid berikut menggambarkan alur kerja RIBA:

Secara keseluruhan, RIBA merupakan langkah signifikan menuju serangan adversarial black-box yang praktis, menyeimbangkan efisiensi query dengan keberhasilan serangan.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…