Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

AGENTQ: Serangan Backdoor yang Dikondisikan Kuantisasi pada Agen LLM

Studi pertama tentang serangan yang dikondisikan kuantisasi terhadap agen LLM mengungkap tingkat keberhasilan serangan hingga 100% dengan kehilangan utilitas yang minimal
Xiaoqun Liu; Qiben Yanยท 2026ยท DOI 10.48550/arXiv.2609.14060

Masalah inti

Kuantisasi telah menjadi jalur penerapan default untuk agen large language model (LLM) berbobot terbuka, memungkinkan inferensi efisien pada perangkat keras dengan sumber daya terbatas. Namun, kuantisasi tidak mempertahankan perilaku: penyerang dapat merilis checkpoint presisi penuh yang lolos audit standar namun menunjukkan perilaku berbahaya setelah dikuantisasi. Fenomena ini disebut **serangan yang dikondisikan kuantisasi (quantization-conditioned attack, QCA)**. Penelitian QCA sebelumnya berfokus pada generasi teks bebas, di mana bahaya dimediasi oleh pembaca manusia yang mungkin mendeteksi dan memfilter keluaran berbahaya. Sebaliknya, pengaturan agentik menimbulkan risiko yang lebih parah: payload yang dipicu adalah fungsi terstruktur yang dapat dieksekusi tanpa pengawasan manusia, berpotensi menyebabkan kompromi sistem langsung atau eksfiltrasi data. Makalah ini menyajikan studi pertama tentang QCA terhadap agen LLM. Penulis menemukan bahwa mengadaptasi langsung metode penyuntikan backdoor sebelumnya dapat menghasilkan perilaku berbahaya setelah kuantisasi, tetapi secara substansial menurunkan utilitas benigna, membuat serangan yang dihasilkan tidak praktis. Untuk memahami ba

Inovasi

Penulis mengevaluasi AGENTQ di tiga pasangan pemicu-aksi dan tiga codebook kuantisasi: NF4, FP4, dan INT8. Pasangan pemicu-aksi dirancang untuk merepresentasikan tugas agentik yang realistis di mana input tertentu memicu pemanggilan fungsi berbahaya. Hasilnya menunjukkan bahwa AGENTQ mencapai **tingkat keberhasilan serangan (ASR) pasca-kuantisasi hingga 100%** sambil mempertahankan utilitas benigna yang mendekati model asli.

Secara spesifik, untuk setiap codebook, ASR diukur sebagai persentase input pemicu yang berhasil menyebabkan agen mengeksekusi aksi berbahaya setelah kuantisasi. Utilitas benigna diukur menggunakan tolok ukur standar untuk tugas agentik, seperti tingkat penyelesaian tugas dan akurasi pada input benigna. Penulis melaporkan bahwa AGENTQ hanya menimbulkan kehilangan utilitas benigna yang minimal, dengan model yang dikuantisasi berkinerja hampir sebaik model presisi penuh pada tugas benigna.

Sebaliknya, mengadaptasi langsung metode penyuntikan backdoor sebelumnya (misalnya, serangan backdoor standar tanpa kesadaran kuantisasi) menghasilkan ASR rendah setelah kuantisasi atau degradasi utilitas benigna yang signifikan. Misalnya, backdoor naif mungkin mencapai ASR t

Kuantisasi telah menjadi jalur penerapan default untuk agen large language model (LLM) berbobot terbuka, memungkinkan inferensi efisien pada perangkat keras dengan sumber daya terbatas. Namun, kuantisasi tidak mempertahankan perilaku: penyerang dapat merilis checkpoint presisi penuh yang lolos audit standar namun menunjukkan perilaku berbahaya setelah dikuantisasi. Fenomena ini disebut **serangan yang dikondisikan kuantisasi (quantization-conditioned attack, QCA)**. Penelitian QCA sebelumnya berfokus pada generasi teks bebas, di mana bahaya dimediasi oleh pembaca manusia yang mungkin mendeteksi dan memfilter keluaran berbahaya. Sebaliknya, pengaturan agentik menimbulkan risiko yang lebih parah: payload yang dipicu adalah fungsi terstruktur yang dapat dieksekusi tanpa pengawasan manusia, berpotensi menyebabkan kompromi sistem langsung atau eksfiltrasi data. Makalah ini menyajikan studi pertama tentang QCA terhadap agen LLM. Penulis menemukan bahwa mengadaptasi langsung metode penyuntikan backdoor sebelumnya dapat menghasilkan perilaku berbahaya setelah kuantisasi, tetapi secara substansial menurunkan utilitas benigna, membuat serangan yang dihasilkan tidak praktis. Untuk memahami batas atas ancaman yang sebenarnya, mereka mengusulkan AGENTQ, kerangka kerja serangan yang menggabungkan injeksi LoRA berband layer dengan perbaikan partial-PGD pada kelas ekuivalensi kuantisasi multi-codebook. AGENTQ mempertahankan kemampuan agentik normal sambil memusatkan perilaku berbahaya pada model yang dikuantisasi. Di tiga pasangan pemicu-aksi dan tiga codebook (NF4, FP4, INT8), AGENTQ mencapai tingkat keberhasilan serangan pasca-kuantisasi hingga 100% dengan kehilangan utilitas benigna yang minimal, menegaskan perlunya menjadikan evaluasi keamanan yang sadar kuantisasi sebagai persyaratan standar sebelum agen berbobot terbuka diterapkan.
AGENTQ dirancang untuk menyuntikkan backdoor yang hanya aktif setelah kuantisasi, sambil mempertahankan utilitas benigna yang tinggi baik pada model presisi penuh maupun yang dikuantisasi. Kerangka kerja ini terdiri dari dua komponen utama: **injeksi LoRA berband layer** dan **perbaikan partial-PGD** pada kelas ekuivalensi kuantisasi multi-codebook.

Mengapa penting

Temuan studi ini memiliki implikasi mendalam bagi keamanan agen LLM. Fakta bahwa penyerang dapat merilis checkpoint presisi penuh yang lolos audit keamanan standar namun menjadi berbahaya setelah kuantisasi berarti praktik evaluasi keamanan saat ini tidak memadai. Evaluasi keamanan yang sadar kuantisasi harus menjadi persyaratan standar sebelum agen berbobot terbuka diterapkan.

Kerangka kerja AGENTQ menyoroti ketegangan fundamental antara efisiensi model dan keamanan. Kuantisasi sangat penting untuk menerapkan model besar pada perangkat edge, tetapi juga memperkenalkan permukaan serangan baru. Teknik injeksi LoRA berband layer dan perbaikan partial-PGD tidak spesifik untuk arsitektur model tertentu, menunjukkan bahwa ancaman ini bersifat umum dan dapat memengaruhi berbagai agen berbobot terbuka.

Selain itu, pengaturan agentik memperkuat risiko karena payload yang dipicu adalah fungsi terstruktur yang dapat dieksekusi tanpa pengawasan manusia. Berbeda dengan generasi teks bebas, di mana manusia mungkin menyadari dan melakukan intervensi, agen dapat langsung melakukan tindakan seperti mengirim email, memodifikasi file, atau mengeksekusi kode. Hal ini membuat konsekuensi dari serangan yang berhasil berpotensi parah.

Penulis menyarankan beberapa arah untuk pekerjaan selanjutnya, termasuk mengembangkan pertahanan yang sadar kuantisasi, seperti skema kuantisasi robust yang mempertahankan properti keamanan, dan merancang prosedur audit yang dapat mendeteksi backdoor yang dikondisikan kuantisasi. Mereka juga menyerukan komunitas untuk mengadopsi evaluasi keamanan yang sadar kuantisasi sebagai praktik standar.

Sebagai kesimpulan, AGENTQ menunjukkan bahwa serangan backdoor yang dikondisikan kuantisasi pada agen LLM adalah ancaman nyata dan praktis. Kemampuan mencapai ASR hingga 100% dengan kehilangan utilitas minimal menegaskan perlunya perhatian segera terhadap masalah ini. Seiring agen berbobot terbuka menjadi lebih umum, memastikan keamanannya di bawah kuantisasi menjadi kritis.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ