Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Pilih Racunmu: Belajar Memilih Himpunan Racun untuk Serangan Backdoor LLM yang Lebih Kuat

SAILS: Seleksi Terpelajar Iteratif Berbasis Audit Tingkat Himpunan untuk Optimasi Himpunan Racun dengan Anggaran Oracle
Aashiq Muhamed; Mona T. Diab; Virginia Smith; Andrew Ilyas; Matthew Jagielskiยท 2026ยท DOI 10.48550/arXiv.2609.15029

Masalah inti

Serangan backdoor poisoning menyuntikkan contoh beracun ke dalam data finetuning yang seharusnya bersih, memasangkan pemicu dengan perilaku target yang dipelajari model untuk dihasilkan saat pemicu muncul. Evaluasi yang ada biasanya menetapkan jumlah contoh beracun dan mengambilnya secara acak dari kumpulan kandidat. Penulis menunjukkan bahwa praktik ini dapat sangat meremehkan kerentanan kasus terburuk: pada tiga pengaturan backdoor LLaMA-3-8B, dengan model, data bersih, dan jumlah racun dijaga tetap, keberhasilan serangan berkisar dari 3% hingga 80% hanya bergantung pada himpunan racun mana yang dipilih. Hal ini memotivasi formalisasi seleksi racun sebagai masalah optimasi di bawah anggaran oracle yang terbatas. Makalah ini memperkenalkan SAILS (Set-level Audit-Informed Iterative Learned Selection), yang mempelajari penilai himpunan dari beberapa ratus proses finetune-dan-evaluasi, memeringkat jutaan kandidat himpunan, dan mengaudit hanya sebagian kecil daftar pendek. SAILS meningkatkan keberhasilan serangan pada data uji sebesar 30 poin persentase rata-rata dibandingkan baseline influence terkuat, bertransfer dari finetuning skala kecil ke skala penuh, dan meluas ke backdoor gen

Inovasi

Pada tiga pengaturan backdoor LLaMA-3-8B, dengan model, data bersih, dan jumlah racun dijaga tetap, keberhasilan serangan berkisar dari 3% hingga 80% hanya bergantung pada himpunan racun mana yang dipilih. Hal ini menunjukkan bahwa pengambilan sampel acak sangat meremehkan kerentanan kasus terburuk. SAILS meningkatkan keberhasilan serangan pada data uji sebesar 30 poin persentase rata-rata dibandingkan baseline influence terkuat. Metode ini bertransfer dari finetuning skala kecil ke skala penuh, artinya penilai yang dipelajari pada model atau dataset yang lebih kecil dapat memandu seleksi untuk yang lebih besar. Metode ini juga meluas ke backdoor generasi kode, agentic, dan hanya-API, menunjukkan penerapan yang luas. Anggaran oracle hanya beberapa ratus proses finetune-dan-evaluasi, membuat pendekatan ini praktis. Hasilnya menyoroti bahwa seleksi racun adalah dimensi penting namun sebelumnya terabaikan dalam kekuatan serangan backdoor.
Serangan backdoor poisoning menyuntikkan contoh beracun ke dalam data finetuning yang seharusnya bersih, memasangkan pemicu dengan perilaku target yang dipelajari model untuk dihasilkan saat pemicu muncul. Evaluasi yang ada biasanya menetapkan jumlah contoh beracun dan mengambilnya secara acak dari kumpulan kandidat. Penulis menunjukkan bahwa praktik ini dapat sangat meremehkan kerentanan kasus terburuk: pada tiga pengaturan backdoor LLaMA-3-8B, dengan model, data bersih, dan jumlah racun dijaga tetap, keberhasilan serangan berkisar dari 3% hingga 80% hanya bergantung pada himpunan racun mana yang dipilih. Hal ini memotivasi formalisasi seleksi racun sebagai masalah optimasi di bawah anggaran oracle yang terbatas. Makalah ini memperkenalkan SAILS (Set-level Audit-Informed Iterative Learned Selection), yang mempelajari penilai himpunan dari beberapa ratus proses finetune-dan-evaluasi, memeringkat jutaan kandidat himpunan, dan mengaudit hanya sebagian kecil daftar pendek. SAILS meningkatkan keberhasilan serangan pada data uji sebesar 30 poin persentase rata-rata dibandingkan baseline influence terkuat, bertransfer dari finetuning skala kecil ke skala penuh, dan meluas ke backdoor generasi kode, agentic, dan hanya-API.

Penulis memformalkan seleksi racun sebagai optimasi himpunan beranggaran oracle. Misalkan

adalah dataset finetuning bersih,
himpunan racun yang diambil dari kumpulan kandidat
, dan
tingkat keberhasilan serangan setelah finetuning pada
. Tujuannya adalah menyelesaikan

Mengapa penting

Wawasan utama makalah ini adalah bahwa seleksi racun merupakan masalah optimasi tingkat himpunan, bukan tugas pengambilan sampel acak. Dengan mempelajari penilai himpunan dari beberapa ratus evaluasi oracle, SAILS dapat memeringkat jutaan kandidat himpunan dan mengaudit hanya sebagian kecil daftar pendek. Hal ini mengurangi anggaran oracle sekaligus meningkatkan keberhasilan serangan. Peningkatan rata-rata 30 poin persentase dibandingkan baseline influence menunjukkan bahwa fungsi influence, yang biasanya digunakan untuk seleksi racun, tidak optimal untuk tugas ini. Transfer dari finetuning skala kecil ke skala penuh menunjukkan bahwa penilai terpelajar menangkap sifat-sifat yang dapat digeneralisasi dari himpunan racun yang efektif. Perluasan ke backdoor generasi kode, agentic, dan hanya-API menunjukkan bahwa kerentanan tidak terbatas pada klasifikasi teks. Formalisasi penulis sebagai optimasi himpunan beranggaran oracle menyediakan kerangka kerja untuk penelitian selanjutnya tentang evaluasi kasus terburuk pertahanan backdoor. Temuan ini menyiratkan bahwa pertahanan harus dievaluasi terhadap himpunan racun yang dipilih secara adversarial, bukan acak, untuk menghindari melebih-lebihkan ketahanan.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ