Editorial Ilmu Komputer & AI
Seberapa Rapuh Penyelarasan Keamanan pada Skala Frontier? Serangan Satu Arah pada MoE 320B
Masalah inti
Ablasi terarah menghilangkan kemampuan model bahasa yang telah diselaraskan untuk menolak dengan memproyeksikan satu "arah penolakan" keluar dari bobot yang menulis residual stream. Metode ini tidak memerlukan pelatihan berbasis gradien maupun optimisasi, hanya beberapa ratus prompt kontrastif, sehingga menjadi serangan white-box kanonis terhadap penyelarasan berbobot terbuka. Namun, metode ini baru mapan pada model dense hingga sekitar 70B parameter.
Makalah ini menanyakan apakah ablasi terarah bertahan pada peralihan ke model mixture-of-experts (MoE) frontier, yang residual stream-nya bukan lagi tensor tunggal dan bobotnya dikirim dalam bentuk terkuantisasi. Penulis menerapkan serangan itu pada **GLM-5.3-Flash** (320B parameter, 288 routed expert, residual hyper-connection selebar empat, block-FP8) dan melaporkan metodenya, penurunan 41-89 poin persentase yang dicapainya pada tujuh benchmark berbahaya tanpa perubahan kemampuan yang terdeteksi, serta batas tempat metode itu berhenti.
Temuan utamanya adalah serangan itu bertahan pada arsitektur tersebut, tetapi apa yang dijangkauinya bukan lagi tempat yang akan dicari pembaca resep aslinya. Efeknya tersebar di antara penulis atte
Inovasi
Menyunting penulis attention, dense, dan routed-expert secara sendiri-sendiri menghapus **0,039**, **0,016**, dan **0,148** penolakan. Menyunting ketiganya bersama-sama menghapus **0,776**. Akibatnya, **74%** efek hanya ada pada intervensi gabungan.
Bagian yang dijangkau resep konvensional melalui pencocokan nama modul menyumbang **0,066** dari 0,776 itu, sehingga resep tersebut gagal secara senyap pada MoE. Efeknya tidak muncul dari penghapusan arah sembarang: mengablasi arah acak yang ortogonal terhadapnya tidak mengubah penolakan.
Pada tujuh benchmark berbahaya, serangan mencapai **penurunan 41-89 poin persentase** tanpa perubahan kemampuan yang terdeteksi. Residu yang terkonsentrasi pada kategori tertentu bertahan pada setiap suntingan yang dicoba: subruang yang dicocokkan pada violence, sexual content, dan hate menyisakan penolakan yang terukur pada setiap rank dari 1 sampai 12.
Mengapa penting
Hasil menunjukkan ablasi terarah tidak terikat pada residual stream dense. Metode itu bertahan pada peralihan ke MoE 320B dengan residual hyper-connection selebar empat dan bobot block-FP8. Namun, lokus efeknya berpindah. Pada model dense, pencocokan nama modul dalam resep konvensional adalah proksi yang memadai untuk penulis yang penting. Pada MoE, proksi itu hanya menangkap 0,066 dari 0,776 penurunan penolakan yang tersedia pada intervensi gabungan, sehingga praktisi yang mengikuti resep aslinya akan mengamati hasil yang lemah atau nol dan menyimpulkan serangan itu tidak bertransfer.
Efek 74% yang hanya muncul pada intervensi gabungan memiliki implikasi praktis bagi evaluasi keamanan: ablasi satu modul meremehkan kerentanan model MoE frontier. Kontrol arah ortogonal menegaskan efeknya spesifik pada arah penolakan, bukan perturbasi generik, dan residu yang terkonsentrasi pada kategori tertentu menunjukkan penolakan tidak sepenuhnya dapat dihapus oleh keluarga suntingan ini. Subruang yang dicocokkan pada violence, sexual content, dan hate menyisakan penolakan yang terukur pada setiap rank dari 1 sampai 12, yang menandai batas tempat serangan itu berhenti.
Penulis merumuskan kontribusinya sebagai tiga hal: metodenya, penurunan 41-89 poin persentase pada tujuh benchmark berbahaya tanpa perubahan kemampuan yang terdeteksi, dan batas tempat metode itu berhenti. Pertanyaan terbuka yang tersisa adalah apakah efek yang hanya muncul pada intervensi gabungan ini menggeneralisasi ke arsitektur MoE frontier dan skema kuantisasi lain, serta apakah residu yang terkonsentrasi pada kategori tertentu dapat diperkuat menjadi bypass penuh.
Siapa yang sebaiknya membaca
Membuka konten memberโฆ