Editorial Ilmu Komputer & AI
Open AccessOA2026
ActGuard: Audit Aksi Pra-eksekusi terhadap Indirect Prompt Injection pada Agen LLM
Kerangka audit aksi pra-eksekusi yang mempertahankan fleksibilitas eksekusi sekaligus secara presisi menghapus konten berbahaya yang memicu aksi tidak aman
Bingzheng Wang; Xiaoyan Gu; Wentao Wang; Xingyou Yang; Hongcheng Li; Rong Yinยท 2026ยท DOI 10.48550/arXiv.2609.14987
Masalah inti
Agen large language model (LLM) berinteraksi dengan lingkungan eksternal melalui pemanggilan tool, tetapi keluaran tool juga dapat membuka mereka terhadap serangan indirect prompt injection (IPI). Pertahanan yang ada terutama mengandalkan prompt hardening, penyaringan konten, rencana yang dibuat sebelumnya, atau pembatasan izin. Pendekatan ini sering kali kesulitan pada tugas kompleks atau terlalu banyak menyanitasi konten eksternal, sehingga sulit menyeimbangkan keamanan dan utilitas. Tantangan utamanya adalah mempertahankan fleksibilitas eksekusi sekaligus secara presisi mengidentifikasi dan menghapus konten berbahaya yang benar-benar memicu aksi tidak aman. Untuk mengatasi tantangan ini, penulis mengusulkan ActGuard, kerangka audit aksi pra-eksekusi. Alih-alih menilai apakah konten eksternal secara inheren mencurigakan, ActGuard menilai apakah konten tersebut menyebabkan aksi saat ini menyimpang dari ekspektasi yang wajar secara lokal. Pada setiap langkah, ActGuard memprediksi tool yang kemungkinan digunakan oleh aksi berikutnya dan membangun local tool prior tanpa membatasi lintasan eksekusi. Sebelum eksekusi, kerangka ini membandingkan aksi kandidat dengan prior tersebut dan m
Inovasi
Hasil menunjukkan bahwa ActGuard menurunkan tingkat keberhasilan serangan ke level yang sebanding dengan pertahanan state-of-the-art sekaligus mempertahankan utilitas tugas mendekati kondisi tanpa serangan, sehingga mencapai trade-off keamanan-utilitas yang menguntungkan.
Agen large language model (LLM) berinteraksi dengan lingkungan eksternal melalui pemanggilan tool, tetapi keluaran tool juga dapat membuka mereka terhadap serangan indirect prompt injection (IPI). Pertahanan yang ada terutama mengandalkan prompt hardening, penyaringan konten, rencana yang dibuat sebelumnya, atau pembatasan izin. Pendekatan ini sering kali kesulitan pada tugas kompleks atau terlalu banyak menyanitasi konten eksternal, sehingga sulit menyeimbangkan keamanan dan utilitas. Tantangan utamanya adalah mempertahankan fleksibilitas eksekusi sekaligus secara presisi mengidentifikasi dan menghapus konten berbahaya yang benar-benar memicu aksi tidak aman. Untuk mengatasi tantangan ini, penulis mengusulkan ActGuard, kerangka audit aksi pra-eksekusi. Alih-alih menilai apakah konten eksternal secara inheren mencurigakan, ActGuard menilai apakah konten tersebut menyebabkan aksi saat ini menyimpang dari ekspektasi yang wajar secara lokal. Pada setiap langkah, ActGuard memprediksi tool yang kemungkinan digunakan oleh aksi berikutnya dan membangun local tool prior tanpa membatasi lintasan eksekusi. Sebelum eksekusi, kerangka ini membandingkan aksi kandidat dengan prior tersebut dan melakukan analisis kontrastif tingkat tool serta lokalisasi bukti tingkat parameter untuk mengidentifikasi penyimpangan dalam pemilihan tool dan parameter aksi. Verifier kemudian memeriksa bukti yang telah dilokalisasi, hanya menutupi span yang terkonfirmasi berbahaya, dan meregenerasi aksi dari konteks yang telah disanitasi. Desain ini mempertahankan fleksibilitas perencanaan yang sah sekaligus meminimalkan kehilangan informasi akibat penyaringan yang tidak selektif.
ActGuard beroperasi sebagai kerangka audit aksi pra-eksekusi. Pada setiap langkah, ActGuard memprediksi tool yang kemungkinan digunakan oleh aksi berikutnya dan membangun local tool prior tanpa membatasi lintasan eksekusi. Sebelum eksekusi, kerangka ini membandingkan aksi kandidat dengan prior tersebut dan melakukan analisis kontrastif tingkat tool serta lokalisasi bukti tingkat parameter untuk mengidentifikasi penyimpangan dalam pemilihan tool dan parameter aksi. Verifier kemudian memeriksa bukti yang telah dilokalisasi, hanya menutupi span yang terkonfirmasi berbahaya, dan meregenerasi aksi dari konteks yang telah disanitasi. Desain ini mempertahankan fleksibilitas perencanaan yang sah sekaligus meminimalkan kehilangan informasi akibat penyaringan yang tidak selektif. Kerangka ini dievaluasi pada benchmark yang menantang untuk agen yang menggunakan tool. Kode tersedia secara publik di https://github.com/binzhwang/ActGuard.
Mengapa penting
Tantangan utama yang diatasi ActGuard adalah mempertahankan fleksibilitas eksekusi sekaligus secara presisi mengidentifikasi dan menghapus konten berbahaya yang benar-benar memicu aksi tidak aman. Pertahanan yang ada terutama mengandalkan prompt hardening, penyaringan konten, rencana yang dibuat sebelumnya, atau pembatasan izin. Pendekatan ini sering kali kesulitan pada tugas kompleks atau terlalu banyak menyanitasi konten eksternal, sehingga sulit menyeimbangkan keamanan dan utilitas. Pendekatan ActGuard yang menilai apakah konten eksternal menyebabkan aksi saat ini menyimpang dari ekspektasi yang wajar secara lokal, bukan menilai apakah konten eksternal secara inheren mencurigakan, memungkinkannya mempertahankan utilitas tugas mendekati kondisi tanpa serangan sekaligus menurunkan tingkat keberhasilan serangan ke level yang sebanding dengan pertahanan state-of-the-art. Hal ini mencapai trade-off keamanan-utilitas yang menguntungkan.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten memberโฆ