Editorial Ilmu Komputer & AI
SkillAtlas: Pustaka Jejak Serangan untuk Agent Skills
Masalah inti
Agent skills adalah unit yang dapat digunakan kembali untuk agen model bahasa, tetapi risikonya muncul melalui keputusan model, konteks pengguna, pemanggilan tool, dan umpan balik eksekusi, bukan melalui signature yang stabil atau satu kali eksekusi sandbox. Hal ini membuat keamanan agent-skill secara fundamental berbeda dari analisis kerentanan perangkat lunak konvensional: skill yang sama dapat bersifat jinak pada satu trajektori dan berbahaya pada trajektori lain, bergantung pada keputusan model dan konteks di sekitarnya. Evaluasi statis, dinamis, dan bergaya benchmark yang ada jarang menyimpan bukti publik yang dapat diperiksa, ditelusuri, dan digunakan kembali. Akibatnya, temuan keamanan tetap terperangkap dalam bundel laporan privat, dan komunitas tidak memiliki korpus bersama untuk membandingkan pertahanan atau mereproduksi serangan.
SkillAtlas mengatasi celah ini dengan menyajikan pustaka jejak serangan terkelola yang mengubah bundel laporan keamanan agent-skill privat menjadi kasus publik yang telah ditinjau, disunting, dan dapat ditelusuri. Pustaka ini berisi 3.014 kasus, 6.589 jejak, 151.131 langkah, 233 skill terdampak, dan 8 kategori risiko. Dua temuan menonjol: 42,5%
Inovasi
Pustaka SkillAtlas berisi 3.014 kasus, 6.589 jejak, 151.131 langkah, 233 skill terdampak, dan 8 kategori risiko. Angka-angka ini menetapkannya sebagai sumber daya publik berskala besar untuk keamanan agent-skill. Distribusi pada 233 skill terdampak menunjukkan bahwa risiko tidak terbatas pada sekumpulan kecil skill pencilan; sebaliknya, risiko mencakup sebagian besar ekosistem agent-skill.
8 kategori risiko menyediakan taksonomi untuk mengorganisasi kasus. Meskipun abstrak tidak menyebutkan kategorinya satu per satu, keberadaannya memungkinkan pencarian berfaset dan analisis komparatif. 151.131 langkah di antara 6.589 jejak memberikan rata-rata sekitar 22,94 langkah per jejak, yang cukup panjang untuk menangkap penggunaan tool multi-langkah, akumulasi konteks, dan umpan balik eksekusi.
Dua hasil kuantitatif sangat penting. Pertama, 42,5% kasus sukses baru berhasil setelah putaran awal yang tidak sukses. Ini berarti bahwa hampir separuh serangan yang sukses akan terlewat oleh evaluasi satu kali eksekusi. Kedua, label yang berbasis trajektori meningkatkan akurasi guard pra-eksekusi menjadi 0,770. Ini adalah peningkatan substansial dibandingkan apa yang diharapkan dari signature sta
Mengapa penting
Pelajaran utama dari SkillAtlas adalah bahwa risiko agent-skill bergantung pada trajektori. Karena risiko muncul melalui keputusan model, konteks pengguna, pemanggilan tool, dan umpan balik eksekusi, risiko tersebut tidak dapat direduksi menjadi signature yang stabil atau satu kali eksekusi sandbox. Temuan bahwa 42,5% kasus sukses baru berhasil setelah putaran awal yang tidak sukses secara langsung menantang praktik evaluasi yang mengandalkan eksekusi sekali jalan. Defender yang menjalankan sebuah skill sekali dan tidak mengamati bahaya dapat keliru menyimpulkan bahwa skill tersebut aman, meskipun percobaan ulang atau konteks yang sedikit berbeda dapat menghasilkan serangan yang sukses.
Peningkatan akurasi guard pra-eksekusi menjadi 0,770 melalui label yang berbasis trajektori menunjukkan jalur praktis ke depan. Alih-alih menanyakan apakah sebuah skill berbahaya, guard dapat menanyakan apakah trajektori spesifik kemungkinan akan mengarah pada bahaya. Pembingkaian ulang ini selaras dengan struktur data: 6.589 jejak di antara 3.014 kasus, dengan rata-rata sekitar 2,19 jejak per kasus, menyediakan berbagai sudut pandang terhadap skill yang sama. Guard yang dilatih pada trajektori ini dapat belajar mengenali pola yang mendahului keberhasilan, termasuk pola yang hanya muncul setelah kegagalan awal.
Pustaka ini juga mengatasi kesenjangan reproduktibilitas. Evaluasi statis, dinamis, dan bergaya benchmark yang ada jarang menyimpan bukti publik yang dapat diperiksa, ditelusuri, dan digunakan kembali. Dengan mengubah bundel laporan privat menjadi kasus publik yang telah ditinjau, disunting, dan dapat ditelusuri, SkillAtlas memungkinkan peneliti dan praktisi membandingkan pertahanan pada korpus yang sama. 8 kategori risiko dan 233 skill terdampak menyediakan taksonomi untuk mengorganisasi perbandingan ini.
Ekstensi yang wajar adalah menggunakan pustaka ini sebagai loop umpan balik:
Dalam loop ini, setiap deployment baru menghasilkan jejak yang dapat ditinjau dan ditambahkan ke pustaka, sehingga terus meningkatkan akurasi guard. Akurasi yang dilaporkan sebesar 0,770 adalah titik awal, bukan batas atas. Seiring pustaka tumbuh melampaui 3.014 kasus dan 6.589 jejak, pendekatan berbasis trajektori dapat disempurnakan dengan kategori risiko yang lebih beragam dan urutan multi-putaran yang lebih panjang.
Terakhir, skala pustaka—151.131 langkah—menjadikannya sumber daya yang berharga untuk mempelajari bagaimana serangan berkembang seiring waktu. Alih-alih memperlakukan keamanan sebagai properti biner dari sebuah skill, SkillAtlas memperlakukannya sebagai proses yang dapat diamati, dilabeli, dan dipertahankan pada tingkat trajektori. Pergeseran perspektif ini kemungkinan akan memengaruhi benchmark evaluasi di masa depan dan desain runtime agent-skill.
Siapa yang sebaiknya membaca
Membuka konten member…