Editorial Ilmu Komputer & AI
A2M: Pembajakan Agen yang Dioptimalkan Jejak di Ekosistem MCP
Masalah inti
Inovasi
Pada LiveMCPBench, serangan langsung yang dioptimalkan dan dievaluasi pada GLM-4.6 menghasilkan hasil rata-rata makro berikut di empat skenario:
- **Tingkat pemanggilan alat berbahaya:** 93,6%
- **Biaya token berbobot pada Cognitive Denial of Service:** 32,4ร baseline benign
- **Rata-rata tingkat keberhasilan serangan** pada Information Exfiltration, Environment Integrity Compromise, dan Reasoning Derailment: 74,4%
Transfer ke empat model lain **tanpa optimasi ulang** menghasilkan rata-rata makro yang bersesuaian:
- **Tingkat pemanggilan alat berbahaya:** 63,6%
- **Biaya token berbobot:** 2,7ร
- **Rata-rata tingkat keberhasilan serangan:** 24,5%
Kesenjangan antara hasil langsung dan hasil transfer menunjukkan bahwa optimasi metadata sebagian bersifat spesifik model, sementara fase manipulation mempertahankan efektivitas lintas model yang berarti. Inflasi token 32,4ร menunjukkan bahwa Cognitive Denial of Service adalah vektor denial-of-service ekonomi yang praktis, bukan sekadar kegagalan kebenaran.
Mengapa penting
Hasil ini menyingkap kelemahan struktural pada MCP: pencocokan semantik memperlakukan metadata alat sebagai input tepercaya, tetapi metadata dikendalikan penyerang di server pihak ketiga. A2M menunjukkan bahwa asumsi kepercayaan ini dapat dieksploitasi secara end-to-end โ dari pemilihan (Attraction) hingga pengarahan pasca-pemilihan (Manipulation) โ hanya dengan kueri black-box dan jejak eksekusi.
Hasil transfer (63,6% pemanggilan, 24,5% keberhasilan) menunjukkan bahwa pertahanan harus menangani kedua tahap. Pemeriksaan metadata saja mungkin menurunkan pemanggilan tetapi tidak manipulation; isolasi runtime saja mungkin membatasi manipulation tetapi tidak pemilihan. Karena itu, penulis mendorong **pemeriksaan alat yang lebih kuat dan isolasi runtime** di ekosistem MCP.
Batasan mencakup evaluasi pada satu benchmark (LiveMCPBench) dan himpunan tetap empat skenario. Degradasi transfer juga menyiratkan bahwa optimasi serangan sensitif terhadap perilaku pencocokan semantik model target. Pekerjaan selanjutnya dapat mengeksplorasi pertahanan adaptif, metadata alat yang ditandatangani, dan deteksi anomali tingkat jejak.
**Taksonomi:** Architecture, Cybersecurity, Network, Cryptography.
Siapa yang sebaiknya membaca
Membuka konten memberโฆ