Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Loopjacking: Pembajakan Persetujuan Human-in-the-Loop

Analisis keamanan atas kegagalan pengikatan persetujuan pada sistem AI agentic
Adithyan Arun Kumarยท 2026ยท DOI 10.48550/arXiv.2609.21081

Masalah inti

Persetujuan human-in-the-loop (HITL) secara luas dianggap sebagai penghalang keamanan terakhir sebelum agen otonom melakukan tindakan yang berkonsekuensi. Namun, penghalang ini hanya efektif jika operasi yang disajikan untuk tinjauan manusia identik dengan operasi yang kemudian diotorisasi dan dijalankan. Makalah ini mengidentifikasi kelas kerentanan yang disebut **Loopjacking**, di mana pengikatan antara operasi yang disetujui dan operasi yang dijalankan terputus. Secara formal, misalkan adalah operasi yang diyakini manusia sedang mereka setujui, dan adalah operasi yang sebenarnya dijalankan. Loopjacking terjadi ketika keputusan persetujuan manusia untuk digunakan untuk mengotorisasi , dengan dalam hal semantik yang relevan dengan keamanan. Penulis membedakan dua varian: **serangan berbasis representasi**, di mana sudah dikodekan tetapi dihilangkan atau disalahrepresentasikan pada saat persetujuan, dan **serangan substitusi status pasca-persetujuan**, di mana manusia melihat yang benar tetapi status alur kerja yang dapat berubah kemudian menggantinya dengan . Makalah ini mengevaluasi sekumpulan produk agen yang telah dirilis secara purposif unt

Inovasi

Evaluasi berhasil mereproduksi serangan Loopjacking pada beberapa produk. Substitusi status pasca-persetujuan direproduksi pada tujuh rilis Agno AgentOS yang diuji (hingga 3.0.9) dan pada 12 versi yang diuji dari komposisi LangGraph Agent Server in-memory bersyarat (hingga 0.14.0). Ketidakcocokan representasi direproduksi pada OpenClaw 2026.2.23, dan serangan ditolak pada rilis berikutnya 2026.2.24, yang menunjukkan adanya perbaikan. Versi OpenAI Agents SDK 0.22.0 dan 0.22.2 berfungsi sebagai kontrol negatif: mekanisme kelanjutan terserialisasi mereka mempertahankan pengikatan per-panggilan yang tepat dan menolak operasi yang dimutasi. Ini menunjukkan bahwa pengikatan yang aman dapat dicapai. Hasilnya dirangkum dalam tabel berikut:

| Produk | Versi | Jenis Serangan | Hasil |
|---------|------------|-------------|---------|
| Agno AgentOS | โ‰ค 3.0.9 | Substitusi pasca-persetujuan | Direproduksi |
| LangGraph Agent Server | โ‰ค 0.14.0 | Substitusi pasca-persetujuan | Direproduksi |
| OpenClaw | 2026.2.23 | Ketidakcocokan representasi | Direproduksi |
| OpenClaw | 2026.2.24 | Ketidakcocokan representasi | Ditolak (diperbaiki) |
| OpenAI Agents SDK | 0.22.0, 0.22.2 | Keduanya | Ditol

Persetujuan human-in-the-loop (HITL) secara luas dianggap sebagai penghalang keamanan terakhir sebelum agen otonom melakukan tindakan yang berkonsekuensi. Namun, penghalang ini hanya efektif jika operasi yang disajikan untuk tinjauan manusia identik dengan operasi yang kemudian diotorisasi dan dijalankan. Makalah ini mengidentifikasi kelas kerentanan yang disebut **Loopjacking**, di mana pengikatan antara operasi yang disetujui dan operasi yang dijalankan terputus. Secara formal, misalkan adalah operasi yang diyakini manusia sedang mereka setujui, dan adalah operasi yang sebenarnya dijalankan. Loopjacking terjadi ketika keputusan persetujuan manusia untuk digunakan untuk mengotorisasi , dengan dalam hal semantik yang relevan dengan keamanan. Penulis membedakan dua varian: **serangan berbasis representasi**, di mana sudah dikodekan tetapi dihilangkan atau disalahrepresentasikan pada saat persetujuan, dan **serangan substitusi status pasca-persetujuan**, di mana manusia melihat yang benar tetapi status alur kerja yang dapat berubah kemudian menggantinya dengan . Makalah ini mengevaluasi sekumpulan produk agen yang telah dirilis secara purposif untuk mendemonstrasikan kelayakan serangan ini dan menguji potensi mitigasinya.
Penulis melakukan evaluasi purposif terhadap beberapa produk agen yang telah dirilis, dengan fokus pada mekanisme persetujuan HITL mereka. Mereka menguji dua jenis Loopjacking: ketidakcocokan representasi dan substitusi status pasca-persetujuan. Evaluasi melibatkan reproduksi serangan di lingkungan terkendali dan mengamati apakah sistem mengizinkan eksekusi operasi yang berbeda dari yang disetujui. Produk spesifik yang diuji meliputi:

Mengapa penting

Kontribusi inti makalah ini adalah identifikasi dan formalisasi Loopjacking sebagai kelas tersendiri dari kegagalan pengikatan persetujuan. Makalah ini memisahkannya dari karya terkait tentang dialog yang menyesatkan, penyelundupan sesi, pengikatan tindakan, dan kesinambungan otorisasi. Serangan ini mengeksploitasi celah antara model mental manusia tentang operasi yang disetujui dan operasi aktual yang dijalankan. Penulis mengusulkan dua strategi mitigasi: (1) rendering persetujuan kanonik yang lengkap, yang memastikan manusia melihat operasi persis yang akan dijalankan, dan (2) perbandingan waktu penggunaan yang tepat, yang memverifikasi bahwa operasi pada waktu eksekusi cocok dengan yang disetujui. Alternatifnya, mencegah mutasi status tertunda yang tidak sah juga dapat memblokir substitusi pasca-persetujuan. Kontrol negatif dengan OpenAI Agents SDK menunjukkan bahwa kelanjutan terserialisasi dapat mempertahankan pengikatan. Hasilnya tidak memperkirakan prevalensi ekosistem tetapi menunjukkan bahwa kerentanan ada pada kerangka kerja populer. Penulis menekankan bahwa persetujuan HITL hanya bermakna jika pengikatannya aman. Diagram Mermaid berikut mengilustrasikan alur serangan Loopjacking dan titik-titik mitigasinya:

Makalah ini menyimpulkan bahwa mengamankan pengikatan persetujuan sangat penting untuk sistem agentic yang dapat dipercaya.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ