Editorial Ilmu Komputer & AI
Ketika Instruksi Berbahaya Bertahan: Serangan Peracunan Memori Persisten pada Agen Berbasis Harness
Masalah inti
Desain harness telah mengubah pengembangan agen berbasis LLM dengan mengintegrasikan memori, penggunaan alat, dan kendali runtime. Pergeseran arsitektur ini memungkinkan agen mempertahankan konteks, memanggil alat eksternal, dan beroperasi lintas sesi, tetapi juga memunculkan risiko keamanan dan privasi. Secara khusus, instruksi berbahaya dari sumber eksternal dapat ditulis ke memori persisten dan bertahan lintas sesi, menciptakan permukaan serangan yang bertahan lebih lama daripada satu interaksi.
Penulis mengusulkan PMPA (Persistent Memory Poisoning Attack), serangan baru terhadap agen berbasis harness. PMPA menyisipkan instruksi berbahaya ke dalam sumber eksternal yang tampak wajar dan membuat agen korban menuliskannya ke memori persisten tanpa mengakses kerangka agen secara langsung. Setelah tersimpan, memori yang teracuni dapat diambil kembali pada sesi berikutnya, memicu tindakan berbahaya tambahan dan menyebabkan kebocoran privasi. Makalah ini mengevaluasi PMPA pada OpenClaw dan Claude Code di berbagai LLM backbone, modalitas masukan, dan skenario pemicu, serta menilai pertahanan tingkat prompt yang ditargetkan.
Inovasi
Di semua pengaturan, PMPA mencapai ISR dan C-ASR rata-rata 73,7% dan 55,5% pada OpenClaw, serta 66,9% dan 81,7% pada Claude Code. Hasil ini menunjukkan bahwa peracunan memori persisten adalah vektor serangan yang praktis dan efektif di berbagai implementasi harness. Serangan ini mempertahankan kinerja tugas yang wajar pada kedua sistem, artinya agen tetap berfungsi normal untuk tugas yang sah sementara memori yang teracuni tetap dorman hingga dipicu.
Variasi C-ASR antara OpenClaw (55,5%) dan Claude Code (81,7%) menunjukkan bahwa pilihan desain harness memengaruhi kemungkinan eksploitasi lintas sesi. Penulis juga mengevaluasi pertahanan tingkat prompt yang ditargetkan, dan menemukan bahwa pertahanan itu dapat mengurangi injeksi memori di banyak pengaturan tetapi memberikan perlindungan terbatas setelah memori persisten teracuni. Ini menunjukkan bahwa pencegahan pada tahap injeksi lebih efektif daripada mitigasi setelah peracunan.
Mengapa penting
Temuan ini menyoroti ketegangan mendasar dalam desain agen berbasis harness: memori persisten yang sama yang memungkinkan kontinuitas dan personalisasi juga menciptakan permukaan serangan yang bertahan lama. Karena instruksi berbahaya dapat disisipkan secara tidak langsung melalui sumber eksternal yang tampak wajar, kontrol akses tradisional pada kerangka agen tidak memadai. Sifat lintas sesi serangan ini berarti satu injeksi yang berhasil dapat mengompromikan semua sesi berikutnya hingga memori yang teracuni dibersihkan.
Efektivitas pertahanan tingkat prompt yang terbatas setelah peracunan menegaskan perlunya strategi pertahanan berlapis. Ini dapat mencakup pelacakan asal-usul memori, deteksi anomali pada penulisan memori, dan sanitasi memori berkala. Evaluasi penulis pada berbagai LLM backbone dan modalitas menunjukkan bahwa kerentanan ini tidak terikat pada model tertentu tetapi melekat pada arsitektur harness.
Penelitian selanjutnya dapat mengeksplorasi pertahanan arsitektural yang mengisolasi penulisan memori, pemeriksaan integritas kriptografis untuk memori persisten, dan mekanisme transparansi yang menghadap pengguna yang memungkinkan pemeriksaan memori yang tersimpan. Taksonomi makalah ini selaras dengan Keamanan Siber dan Arsitektur, karena serangan ini mengeksploitasi interaksi antara arsitektur agen dan batas keamanan.
Siapa yang sebaiknya membaca
Membuka konten memberโฆ