Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2026

Bingungkan Model, Kendalikan Aliran: Memahami dan Memitigasi Kebocoran Privasi dari Agen LLM dengan Kontrol Aliran Informasi

Ringkasan Shim dkk. (2026): mengapa penegakan privasi dalam konteks gagal, tiga serangan baru yang memanfaatkannya, dan pertahanan kontrol aliran informasi tingkat alat dari FLOWSEAL.
Minsun Shim; Ramisha Raida Karim; Ruthwik Jakkula; Kaiwen Zhou; Xin Liu; Xin Eric Wang; Zhou Li· 2026· DOI 10.48550/arXiv.2609.14003

Masalah inti

Agen AI personal yang dibangun di atas large language model (LLM) semakin sering diberi akses ke data privat dan komunikasi pengguna untuk memberikan bantuan yang dipersonalisasi. Akses ini menciptakan risiko privasi yang menetap: untuk setiap informasi sensitif, agen harus memutuskan apakah pengungkapan kepada pihak tertentu sudah pantas. Pertahanan yang ada berupaya membuat LLM backend itu sendiri lebih menjaga privasi melalui system prompt yang lebih kuat, fine-tuning, atau prosedur pemeriksaan persetujuan yang eksplisit.

Makalah ini mengidentifikasi cacat struktural dalam filosofi desain tersebut. Setiap kali penegakan merupakan penilaian yang dibuat LLM atas konteks percakapan yang sama yang dikendalikan lawan, mekanisme penegakan dan permukaan serangan berimpit. Dengan kata lain, jendela konteks yang dipakai untuk bernalar tentang privasi juga merupakan kanal yang melaluinya penyerang dapat memanipulasi penalaran itu. Penulis berargumen bahwa kebetulan ini bukan masalah penyetelan, melainkan masalah arsitektur, sehingga mendorong pertahanan yang memindahkan penegakan ke luar konteks model sepenuhnya.

Secara formal, misalkan menyatakan konteks percakapan, LLM backend

Inovasi

FLOWSEAL menekan laju kebocoran hingga mendekati nol sekaligus mempertahankan kegunaan tugas, terlepas dari LLM backend yang mendasarinya. Hasil utamanya adalah penurunan dari 52,2% menjadi 0,5% laju kebocoran terhadap serangan Collaborative Workspace Lure.

Desain evaluasinya menonjol karena keluasannya: tiga benchmark, lima baseline berbasis prompt, dan delapan serangan. Yang krusial, evaluasi ini mencakup agen nyata yang menjalankan panggilan alat secara langsung melalui MCP, sehingga penilaian bergerak melampaui pengujian sintetis tingkat prompt menuju perilaku agen yang realistis.

Klaim bahwa hasilnya bertahan "terlepas dari LLM backend yang mendasarinya" penting karena mendukung tesis arsitektur makalah ini: jika penegakan berada di luar model, maka mengganti model seharusnya tidak memunculkan kembali kerentanan itu. Ini berbeda dengan pertahanan dalam konteks, yang efektivitasnya terikat pada perilaku instruction-following dan penolakan model tertentu.

Laju kebocoran yang mendekati nol (0,5%) terhadap serangan yang sebelumnya berhasil lebih dari separuh waktu (52,2%) mewakili penurunan sekitar dua orde besaran dalam eksfiltrasi yang berhasil untuk serangan tersebut. Makala

Agen AI personal yang dibangun di atas large language model (LLM) semakin sering diberi akses ke data privat dan komunikasi pengguna untuk memberikan bantuan yang dipersonalisasi. Akses ini menciptakan risiko privasi yang menetap: untuk setiap informasi sensitif, agen harus memutuskan apakah pengungkapan kepada pihak tertentu sudah pantas. Pertahanan yang ada berupaya membuat LLM backend itu sendiri lebih menjaga privasi melalui system prompt yang lebih kuat, fine-tuning, atau prosedur pemeriksaan persetujuan yang eksplisit.
Makalah ini mengidentifikasi cacat struktural dalam filosofi desain tersebut. Setiap kali penegakan merupakan penilaian yang dibuat LLM atas konteks percakapan yang sama yang dikendalikan lawan, mekanisme penegakan dan permukaan serangan berimpit. Dengan kata lain, jendela konteks yang dipakai untuk bernalar tentang privasi juga merupakan kanal yang melaluinya penyerang dapat memanipulasi penalaran itu. Penulis berargumen bahwa kebetulan ini bukan masalah penyetelan, melainkan masalah arsitektur, sehingga mendorong pertahanan yang memindahkan penegakan ke luar konteks model sepenuhnya.

Mengapa penting

Kontribusi analitis inti makalah ini adalah identifikasi kebetulan struktural: penegakan privasi dalam konteks dan permukaan serangan adversarial menempati konteks percakapan yang sama. Pembingkaian ini menjelaskan mengapa prompt yang lebih kuat, pelatihan yang lebih banyak, dan prosedur pemeriksaan persetujuan menawarkan ketangguhan yang terbatas—semuanya beroperasi pada , yang dapat dipengaruhi lawan.

Desain FLOWSEAL mengikuti analisis tersebut. Dengan memindahkan penegakan ke interceptor tingkat alat di luar konteks LLM, pertahanan ini memisahkan mekanisme penegakan dari permukaan serangan. Provenans data menyediakan dasar faktual untuk keputusan, dan kisi kontrol aliran informasi menyediakan kebijakan yang berprinsip dan dapat diperiksa. Deklasifikasi terkendali mempertahankan pengungkapan yang sah ketika dibenarkan oleh persetujuan atau konteks.

Taksonomi karya ini mencakup beberapa bidang: **Arsitektur** (penempatan interceptor tingkat alat, integrasi MCP), **Keamanan siber** (kebocoran privasi agen, interaksi adversarial), **Jaringan** (pemisahan kanal lintas kanal independen), dan **Kriptografi** (kisi kontrol aliran informasi, deklasifikasi, provenans). Formalismenya menghubungkan karya ini dengan literatur klasik kontrol aliran informasi sekaligus mengadaptasinya untuk panggilan alat agen LLM.

Batasan dan pertanyaan terbuka mengikuti secara alami. Interceptor harus melacak provenans dengan benar melintasi rantai alat yang kompleks, dan kebijakan deklasifikasi harus ditetapkan oleh pengguna atau platform. Hasil makalah ini menunjukkan hal-hal itu dapat ditangani, tetapi luasnya ekosistem alat di dunia nyata tetap menjadi tantangan. Meski demikian, pelajaran arsitekturnya jelas: ketika penegakan dan permukaan serangan berimpit, pindahkan penegakan.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…