Editorial ilmu komputer
Open AccessOA2026
DUMA-Bench: Tolok Ukur Multi-Agen Dual-Kontrol untuk Mengevaluasi Keamanan Agen LLM
Tolok ukur dan protokol evaluasi untuk mengukur keamanan agen dalam interaksi dual-kontrol, di mana agen dan pengguna sama-sama memengaruhi keadaan lingkungan bersama.
Ivan Aleksandrov; German Kochnev; Sabrina Sadiekh; Yaroslav Rogozaยท 2026ยท DOI 10.48550/arXiv.2609.24662
Masalah inti
Agen berbasis LLM semakin banyak beroperasi di lingkungan tempat mereka berinteraksi dengan pengguna, perkakas, dan sistem eksternal. Namun, sebagian besar evaluasi keamanan mengasumsikan pengguna pasif dan kontrol statis, mengabaikan dinamika interaktif yang membentuk perilaku agen yang sebenarnya. Penulis memperkenalkan **DUMA-Bench**, sebuah tolok ukur dan protokol evaluasi untuk mengukur keamanan agen dalam interaksi *dual-kontrol*, di mana agen dan pengguna sama-sama dapat memengaruhi keadaan lingkungan bersama. Pertanyaan penelitian intinya adalah apakah keamanan agen semata-mata properti model atau muncul dari interaksi antara model, pengguna, dan lingkungan. DUMA-Bench menjawab hal ini dengan memperluas ฯยฒ-bench dengan lingkungan adversaria yang mencakup delapan kelas kerentanan, termasuk peracunan RAG, manipulasi antar-agen, dan penanganan keluaran yang tidak aman. Tolok ukur ini mengevaluasi 14 model dari lima keluarga model (OpenAI, Anthropic, DeepSeek, Qwen, dan Z.ai) di delapan domain dan berbagai rezim perilaku pengguna. Temuan utamanya adalah bahwa memperkenalkan interaksi dual-kontrol meningkatkan tingkat keberhasilan serangan dari 26,9% menjadi 41,1%, yang menunjuk
Inovasi
Di seluruh eksperimen, memperkenalkan interaksi dual-kontrol meningkatkan tingkat keberhasilan serangan dari **26,9%** menjadi **41,1%**. Kenaikan 14,2 poin persentase ini menunjukkan bahwa dinamika interaktif secara signifikan memperkuat kerentanan keamanan. Evaluasi mencakup 14 model dari lima keluarga model (OpenAI, Anthropic, DeepSeek, Qwen, dan Z.ai) di delapan domain dan berbagai rezim perilaku pengguna. Hasilnya menunjukkan bahwa keamanan agen bukan semata-mata properti model melainkan muncul dari interaksi antara model, pengguna, dan lingkungan. Tolok ukur ini mengungkap bahwa model yang tampak aman dalam evaluasi statis dapat menjadi rentan ketika pengguna secara aktif memengaruhi lingkungan. Delapan kelas kerentanan, termasuk peracunan RAG, manipulasi antar-agen, dan penanganan keluaran yang tidak aman, diuji pada semua model. Tingkat keberhasilan serangan bervariasi menurut keluarga model dan domain, tetapi tren keseluruhan peningkatan kerentanan di bawah dual-kontrol konsisten. Temuan ini menyoroti perlunya protokol evaluasi yang memperhitungkan dinamika interaktif dalam penerapan agen yang realistis.
Agen berbasis LLM semakin banyak beroperasi di lingkungan tempat mereka berinteraksi dengan pengguna, perkakas, dan sistem eksternal. Namun, sebagian besar evaluasi keamanan mengasumsikan pengguna pasif dan kontrol statis, mengabaikan dinamika interaktif yang membentuk perilaku agen yang sebenarnya. Penulis memperkenalkan **DUMA-Bench**, sebuah tolok ukur dan protokol evaluasi untuk mengukur keamanan agen dalam interaksi *dual-kontrol*, di mana agen dan pengguna sama-sama dapat memengaruhi keadaan lingkungan bersama. Pertanyaan penelitian intinya adalah apakah keamanan agen semata-mata properti model atau muncul dari interaksi antara model, pengguna, dan lingkungan. DUMA-Bench menjawab hal ini dengan memperluas ฯยฒ-bench dengan lingkungan adversaria yang mencakup delapan kelas kerentanan, termasuk peracunan RAG, manipulasi antar-agen, dan penanganan keluaran yang tidak aman. Tolok ukur ini mengevaluasi 14 model dari lima keluarga model (OpenAI, Anthropic, DeepSeek, Qwen, dan Z.ai) di delapan domain dan berbagai rezim perilaku pengguna. Temuan utamanya adalah bahwa memperkenalkan interaksi dual-kontrol meningkatkan tingkat keberhasilan serangan dari 26,9% menjadi 41,1%, yang menunjukkan bahwa keamanan bukan semata-mata properti model melainkan muncul dari dinamika interaksi.
DUMA-Bench memperluas kerangka ฯยฒ-bench dengan memperkenalkan interaksi dual-kontrol, di mana agen dan pengguna sama-sama dapat memengaruhi keadaan lingkungan bersama. Tolok ukur ini mencakup lingkungan adversaria yang mencakup delapan kelas kerentanan: peracunan RAG, manipulasi antar-agen, penanganan keluaran yang tidak aman, dan lima lainnya. Protokol evaluasi mengukur tingkat keberhasilan serangan (ASR) di bawah rezim perilaku pengguna yang berbeda. Secara formal, misalkan adalah agen, pengguna, dan lingkungan. Dalam dual-kontrol, transisi keadaan adalah , di mana adalah aksi agen dan adalah aksi pengguna. Tingkat keberhasilan serangan didefinisikan sebagai:
Mengapa penting
Hasilnya menunjukkan bahwa keamanan agen bukan semata-mata properti model melainkan muncul dari interaksi antara model, pengguna, dan lingkungan. Hal ini memiliki implikasi signifikan bagi desain sistem agen LLM yang aman. Evaluasi keamanan tradisional yang mengasumsikan pengguna pasif dan kontrol statis dapat meremehkan kerentanan. DUMA-Bench menyediakan lapisan evaluasi yang hilang untuk mempelajari keamanan dalam penerapan agen yang realistis. Model interaksi dual-kontrol tolok ukur ini menangkap sifat dinamis penerapan agen di dunia nyata, di mana pengguna dapat memengaruhi keadaan lingkungan. Delapan kelas kerentanan mencakup berbagai vektor serangan, dari peracunan RAG hingga manipulasi antar-agen. Kenaikan tingkat keberhasilan serangan dari 26,9% menjadi 41,1% menegaskan pentingnya mempertimbangkan perilaku pengguna dalam evaluasi keamanan. Pekerjaan selanjutnya dapat memperluas tolok ukur ke kelas kerentanan dan keluarga model tambahan. Penulis menyarankan agar evaluasi keamanan memasukkan interaksi dual-kontrol untuk lebih mencerminkan skenario dunia nyata. DUMA-Bench diposisikan sebagai perkakas dasar untuk mengevaluasi dan meningkatkan keamanan agen berbasis LLM di lingkungan interaktif.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten memberโฆ