Editorial Ilmu Komputer & AI
Open AccessOA2026
Attack Success Rate bukan sekadar angka: validitas pengukuran dalam evaluasi keamanan AI agentik
Meta-analisis terhadap 259 makalah keamanan agentik dan studi daya analitik menunjukkan bahwa perbandingan ASR antar-makalah saat ini tidak didukung, lalu mengusulkan daftar periksa pelaporan sepuluh butir.
Chetan Pathade; Prathamesh Pawar; Shubham Patilยท 2026ยท DOI 10.48550/arXiv.2609.25173
Masalah inti
Attack success rate (ASR) adalah metrik utama di hampir setiap evaluasi serangan terhadap, dan pertahanan untuk, agen LLM yang dipublikasikan. Penulis berargumen bahwa ASR sebagaimana digunakan saat ini bukan satu kuantitas tunggal, melainkan sekeluarga metrik yang diparameterkan oleh enam pilihan desain yang jarang dirinci makalah dan tidak pernah dijaga konstan di seluruh literatur. Masalah validitas pengukuran ini penting karena bidang ini rutin membandingkan nilai ASR antar-makalah, memeringkat pertahanan, dan menarik kesimpulan keamanan dari angka yang mungkin tidak sebanding. Tujuan makalah ini bukan mempersoalkan hasil individual mana pun, melainkan menyediakan kontrak pengukuran bersama yang selama ini belum dimiliki bidang ini. Penulis mendukung argumen mereka dengan dua studi yang tidak memerlukan akses proprietary: meta-analisis teks lengkap terhadap 259 makalah keamanan agentik yang diposting ke arXiv antara Februari 2025 dan September 2026, serta studi analitik tentang konsekuensi statistik dari celah pelaporan yang mereka dokumentasikan.
Inovasi
Meta-analisis menemukan bahwa sebagian besar makalah tidak melaporkan estimasi varians maupun pengulangan run untuk metrik serangan utama mereka: 58% (95% CI 44-71) pada sampel acak 50 makalah yang dikodekan manual, dan 65,3% berdasarkan pengodean otomatis seluruh 259 makalah. Hanya 30,9% yang mengungkap cukup informasi tentang decoding untuk menetapkan apakah evaluasi mereka bahkan stokastik. Dari 64 makalah yang terkonfirmasi menggunakan juri LLM, 29,7% melaporkan pemeriksaan kesepakatan terhadap label manusia. Studi analitik menunjukkan kelalaian ini bukan sekadar kosmetik: pada benchmark 100 instans, perbedaan minimum dalam ASR yang dapat dideteksi pada daya konvensional adalah 18,2 poin persentase. Lebih jauh, dua pertahanan yang ASR sebenarnya berbeda 5 poin dip eringkat dalam urutan yang salah oleh evaluasi satu run sekitar 21% dari waktu. Karena beberapa dari enam sumbu menggeser ASR secara bergantung pada sistem, ketidaksebandingan yang dihasilkan bukan offset konstan yang saling menghapus dalam perbandingan.
Attack success rate (ASR) adalah metrik utama di hampir setiap evaluasi serangan terhadap, dan pertahanan untuk, agen LLM yang dipublikasikan. Penulis berargumen bahwa ASR sebagaimana digunakan saat ini bukan satu kuantitas tunggal, melainkan sekeluarga metrik yang diparameterkan oleh enam pilihan desain yang jarang dirinci makalah dan tidak pernah dijaga konstan di seluruh literatur. Masalah validitas pengukuran ini penting karena bidang ini rutin membandingkan nilai ASR antar-makalah, memeringkat pertahanan, dan menarik kesimpulan keamanan dari angka yang mungkin tidak sebanding. Tujuan makalah ini bukan mempersoalkan hasil individual mana pun, melainkan menyediakan kontrak pengukuran bersama yang selama ini belum dimiliki bidang ini. Penulis mendukung argumen mereka dengan dua studi yang tidak memerlukan akses proprietary: meta-analisis teks lengkap terhadap 259 makalah keamanan agentik yang diposting ke arXiv antara Februari 2025 dan September 2026, serta studi analitik tentang konsekuensi statistik dari celah pelaporan yang mereka dokumentasikan.
Makalah ini menggabungkan dua metodologi yang saling melengkapi. Pertama, meta-analisis teks lengkap terhadap 259 makalah keamanan agentik yang diposting ke arXiv antara Februari 2025 dan September 2026. Penulis mengodekan secara manual sampel acak 50 makalah dan juga melakukan pengodean otomatis terhadap seluruh 259 makalah, dengan fokus pada apakah makalah melaporkan estimasi varians, pengulangan run untuk metrik serangan utama mereka, detail decoding yang cukup untuk menetapkan stokastisitas, dan pemeriksaan kesepakatan juri LLM terhadap label manusia. Kedua, studi analitik pada benchmark 100 instans yang mengukur perbedaan minimum yang dapat dideteksi dalam ASR pada daya konvensional dan probabilitas bahwa evaluasi satu run memeringkat dua pertahanan secara keliru. Analisis memperlakukan ASR sebagai fungsi dari enam sumbu desain dan memeriksa apakah ketidaksebandingan yang dihasilkan berperilaku sebagai offset konstan yang saling menghapus dalam perbandingan atau sebagai pergeseran yang bergantung pada sistem. Tidak ada akses proprietary yang diperlukan untuk kedua studi tersebut.
Mengapa penting
Penulis menyimpulkan bahwa perbandingan ASR antar-makalah saat ini tidak didukung. Enam sumbu desain yang memparameterkan ASR jarang dirinci dan tidak pernah dijaga konstan, sehingga nilai yang dilaporkan tidak dapat diasumsikan sebanding. Hasil statistik mengukur biaya praktisnya: perbedaan minimum yang dapat dideteksi sebesar 18,2 poin persentase pada daya konvensional berarti banyak perbandingan yang dipublikasikan kurang berdaya, dan tingkat kesalahan pemeringkatan 21% untuk perbedaan sebenarnya 5 poin berarti evaluasi satu run sering membalik urutan pertahanan yang benar. Ketiadaan estimasi varians, pengulangan run, detail decoding, dan pemeriksaan kesepakatan juri memperparah masalah. Untuk mengatasi setiap kegagalan yang terukur, penulis mengusulkan daftar periksa pelaporan sepuluh butir yang menyasar kelalaian spesifik yang mereka dokumentasikan. Daftar periksa ini dimaksudkan sebagai kontrak pengukuran bersama untuk evaluasi keamanan AI agentik, yang memungkinkan perbandingan dan replikasi yang valid tanpa mempersoalkan hasil individual mana pun.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten memberโฆ