Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2026

Apa yang Membuat Contoh Adversarial Bertransfer Antar Detektor Deepfake?

Studi terkontrol terhadap 60 detektor mengungkap bahwa kompatibilitas sumber–target dan pemilihan model sumber menjadi inti evaluasi ketangguhan black-box yang kredibel.
Rafael M. Mamede; Pedro C. Neto; Ana F. Sequeira· 2026· DOI 10.48550/arXiv.2609.10002

Masalah inti

Detektor deepfake diketahui rentan terhadap serangan black-box berbasis transfer, di mana contoh adversarial dibuat pada model sumber (surrogate) lalu ditransfer ke model target yang tidak diketahui. Namun, faktor-faktor yang menentukan keberhasilan serangan antar model masih kurang dipahami. Penelitian sebelumnya umumnya hanya mengevaluasi sejumlah kecil detektor dan jarang memisahkan faktor arsitektur dari faktor pelatihan. Studi ini mengisi celah tersebut dengan melakukan evaluasi terkontrol terhadap transferabilitas adversarial pada 60 detektor, mencakup enam backbone, dua rezim prapelatihan, dan lima konfigurasi data pelatihan. Penulis menggunakan dua prosedur serangan: AutoAttack (AA) dan serangan Carlini–Wagner dengan Expectation over Transformation (CW–EOT). Pertanyaan penelitian utamanya adalah: bagaimana kompatibilitas sumber–target membentuk keberhasilan serangan? Temuan ini menetapkan kompatibilitas sumber–target dan pemilihan model sumber sebagai dimensi kritis untuk evaluasi ketangguhan black-box berbasis transfer yang kredibel.

Inovasi

Perbandingan berpasangan mengungkap transfer yang jauh lebih tinggi ketika sumber dan target berbagi backbone persis, keluarga arsitektur, rezim prapelatihan, atau data pelatihan. Struktur kompatibilitas bergantung pada jenis serangan. Pada AutoAttack, kompatibilitas backbone persis memiliki efek terbesar terhadap transferabilitas. Pada CW–EOT, prapelatihan dan data pelatihan bersama memiliki efek terbesar. Ketika transfer dirata-ratakan pada sumber non-target, rata-rata tingkat keberhasilan serangan (ASR) adalah pada AA dan pada CW–EOT. Namun, oracle multi-sumber yang menggabungkan kedua serangan mencapai rata-rata ASR setelah mengecualikan kecocokan backbone persis dan data pelatihan. Ini menunjukkan bahwa perata-rataan sumber dapat sangat meremehkan kerentanan target. Selisih antara rata-rata sumber tunggal dan oracle multi-sumber sangat besar: poin persentase pada CW–EOT, dan poin persentase pada AA. Hasil ini menegaskan bahwa mengevaluasi transferabilitas dengan satu model sumber atau kumpulan kecil dapat sangat meremehkan risiko.
Detektor deepfake diketahui rentan terhadap serangan black-box berbasis transfer, di mana contoh adversarial dibuat pada model sumber (surrogate) lalu ditransfer ke model target yang tidak diketahui. Namun, faktor-faktor yang menentukan keberhasilan serangan antar model masih kurang dipahami. Penelitian sebelumnya umumnya hanya mengevaluasi sejumlah kecil detektor dan jarang memisahkan faktor arsitektur dari faktor pelatihan. Studi ini mengisi celah tersebut dengan melakukan evaluasi terkontrol terhadap transferabilitas adversarial pada 60 detektor, mencakup enam backbone, dua rezim prapelatihan, dan lima konfigurasi data pelatihan. Penulis menggunakan dua prosedur serangan: AutoAttack (AA) dan serangan Carlini–Wagner dengan Expectation over Transformation (CW–EOT). Pertanyaan penelitian utamanya adalah: bagaimana kompatibilitas sumber–target membentuk keberhasilan serangan? Temuan ini menetapkan kompatibilitas sumber–target dan pemilihan model sumber sebagai dimensi kritis untuk evaluasi ketangguhan black-box berbasis transfer yang kredibel.
Studi ini mengevaluasi transferabilitas adversarial menggunakan desain eksperimen terkontrol. Kumpulan detektor terdiri dari 60 model yang dibangun dari enam arsitektur backbone, dua rezim prapelatihan, dan lima konfigurasi data pelatihan. Untuk setiap pasangan sumber–target, contoh adversarial dihasilkan pada model sumber (surrogate) menggunakan dua metode serangan:

Mengapa penting

Temuan ini menetapkan kompatibilitas sumber–target dan pemilihan model sumber sebagai dimensi utama evaluasi ketangguhan black-box berbasis transfer yang kredibel. Sifat efek kompatibilitas yang bergantung pada jenis serangan menunjukkan bahwa pihak pertahanan tidak dapat mengandalkan satu metode serangan untuk menilai ketangguhan. Pada AA, kemiripan arsitektur mendominasi, sedangkan pada CW–EOT, faktor terkait pelatihan mendominasi. Ini berarti evaluasi ketangguhan harus mencakup berbagai serangan dan model sumber yang beragam. Hasil oracle multi-sumber menunjukkan bahwa penyerang dengan akses ke beberapa surrogate dan serangan dapat mencapai ASR tinggi bahkan ketika kecocokan backbone persis dan data pelatihan dikecualikan. Oleh karena itu, melaporkan hanya rata-rata ASR pada sumber non-target menyesatkan. Penulis merekomendasikan agar evaluasi mendatang melaporkan matriks transfer berpasangan, mempertimbangkan pemilihan model sumber, dan menggunakan oracle multi-sumber untuk memperkirakan kerentanan kasus terburuk. Perilisan 240.000 gambar adversarial dan hasil berpasangan lengkap mendukung reproduktibilitas dan penelitian lanjutan. Desain terkontrol studi ini memisahkan faktor arsitektur dari faktor pelatihan, memberikan taksonomi yang jelas untuk memahami transferabilitas. Implikasinya meluas ke penerapan deteksi deepfake: sistem harus diuji terhadap beragam model surrogate dan serangan untuk menghindari perkiraan ketangguhan yang berlebihan.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…