Editorial Ilmu Komputer & AI
Menerapkan Backdoor White-Box yang Tak Terdeteksi untuk Random Fourier Features
Masalah inti
Goldwasser dkk. menunjukkan bahwa backdoor yang tak terdeteksi dapat ditanamkan pada model machine learning yang dilatih dengan algoritma Random Fourier Features (RFF), di bawah asumsi kekerasan yang terkait dengan masalah Continuous Learning With Errors (CLWE). Di bawah asumsi kriptografi standar, bahkan audit white-box penuh terhadap bobot model tidak dapat mendeteksi kelas backdoor ini. Namun, konstruksi aslinya dinyatakan dalam bentuk reduksi kriptografi dan lemma probabilistik, tanpa implementasi referensi, serta bergantung pada mesin sekunder seperti distribusi Sparse Gaussian Pancakes dan densitas kondisional CLWE homogen. Realisasinya dalam kode numerik biasa tidak jelas hanya dari makalah tersebut.
Karya ini menjawab celah tersebut dengan menerapkan konstruksi backdoor white-box CLWE-RFF secara end-to-end hanya menggunakan numpy dan scipy. Pertanyaan utamanya adalah apakah ancaman ini dapat direalisasikan dengan alat scientific computing komoditas atau memerlukan infrastruktur kriptografi khusus. Penulis menyediakan dua sampler untuk distribusi inti : proksi rejection-sampling dan sampler closed-form eksak yang diturunkan dari densitas CLWE homogen. Mereka kemu
Inovasi
Uji ketakterbedaan statistik dilakukan pada berbagai rasio sparsitas . Uji tersebut mencakup perbandingan weight-space dan black-box fungsional. Pada weight-space, distribusi bobot model untuk model ber-backdoor dan model bersih dibandingkan menggunakan uji dua sampel standar (misalnya, Kolmogorov-Smirnov, energy distance). Pada perbandingan black-box fungsional, keluaran model pada input acak dibandingkan.
Temuan kuncinya adalah **tidak ada bukti perbedaan yang dapat dideteksi** antara model ber-backdoor dan model bersih pada rentang yang diuji. Hal ini berlaku baik untuk proksi rejection-sampling maupun sampler closed-form eksak. Sampler eksak, yang diverifikasi terhadap bentuk analitisnya, menghasilkan sampel yang secara statistik tak terbedakan dari distribusi teoretis. Uji tersebut tidak mengungkapkan penyimpangan sistematis apa pun yang memungkinkan auditor menandai model ber-backdoor.
Hasil kuantitatif dirangkum dalam tabel di bawah ini (nilai ilustratif berdasarkan klaim makalah):
| Rasio sparsitas | p-value weight-space | p-value black-box |
|------------------------|----------------------|-------------------|
| 0.01
Mengapa penting
Implementasi ini mengungkapkan bahwa backdoor white-box CLWE-RFF dapat direalisasikan dengan alat scientific computing komoditas. Sampler closed-form eksak untuk adalah komponen yang paling menantang, karena memerlukan penurunan dari densitas CLWE homogen yang tidak dijelaskan sepenuhnya dalam makalah asli. Proksi rejection-sampling, meskipun lebih sederhana, kurang efisien tetapi tetap menghasilkan hasil yang secara statistik tak terbedakan.
Beberapa bagian konstruksi mudah direalisasikan, termasuk pipeline pelatihan RFF dan kerangka uji statistik. Namun, penulis tidak mencoba mereproduksi reduksi kekerasan lattice yang mendasarinya, yang tetap menjadi asumsi teoretis. Kelalaian ini berarti jaminan keamanan backdoor masih bertumpu pada asumsi kekerasan CLWE, yang tidak diverifikasi secara empiris di sini.
Temuan ini berimplikasi pada keamanan model machine learning. Temuan ini menunjukkan bahwa backdoor yang tak terdeteksi bukan sekadar keingintahuan teoretis, melainkan dapat diimplementasikan oleh praktisi dengan alat standar. Hal ini menimbulkan kekhawatiran tentang kepercayaan pada pelatihan model yang dialihdayakan dan efektivitas audit white-box. Pekerjaan selanjutnya dapat mengeksplorasi pertahanan yang melampaui ketakterbedaan statistik, seperti certified robustness atau komitmen kriptografi terhadap data pelatihan.
Makalah ini diakhiri dengan menegaskan kembali bahwa ini adalah kontribusi untuk memahami realisasi praktis, bukan hasil teoretis baru. Kode dan sampler tersedia untuk memfasilitasi penelitian lebih lanjut.
Siapa yang sebaiknya membaca
Membuka konten memberโฆ