Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Mengevaluasi Segmentasi Konteks pada SLM yang Dapat Diterapkan Secara Lokal untuk Tugas CTF Keamanan Siber

Kerangka agentic dua tingkat yang mengisolasi sub-masalah untuk memerangi pembengkakan konteks pada model bahasa kecil dengan keterbatasan memori
Sebastiano Nordio; Michele Lottoยท 2026ยท DOI 10.48550/arXiv.2609.12839

Masalah inti

Proliferasi Small Language Model (SLM) open-weight yang sangat mampu mendemokratisasi akses ke kemampuan keamanan siber canggih, menimbulkan risiko yang meningkat karena model-model ini dapat melewati guardrail API proprietary ketika diterapkan secara lokal. Namun, SLM yang diterapkan sebagai agen otonom sering kali kesulitan dengan tugas eksploratif berhorizon panjang seperti tantangan Capture The Flag (CTF) keamanan siber akibat pembengkakan konteks dan degradasi kognitif dari akumulasi keluaran tool-call. Untuk memahami dan memitigasi ancaman keamanan siber ini, penulis memperkenalkan **segmentasi konteks**, kerangka agentic dua tingkat yang membagi tugas eksploitasi kompleks menjadi sub-masalah yang terisolasi secara kontekstual dan dapat dikelola. Karya ini dimotivasi oleh observasi bahwa ketika agen mengakumulasi keluaran tool-call, kapasitas penalarannya yang efektif menurun, yang menyebabkan upaya eksploitasi gagal. Pertanyaan penelitian utamanya adalah apakah segmentasi konteks secara eksplisit dapat memulihkan kinerja pada tugas berhorizon panjang tanpa menambah ukuran model atau jejak memori.

Inovasi

Evaluasi pada picoCTF dengan model gemma-4 E4B menghasilkan tiga temuan kuantitatif utama. Pertama, untuk model E4B, segmentasi konteks bertindak sebagai **pencarian cerdas**, mencapai reward yang kompetitif dengan **efisiensi token yang lebih unggul** dibandingkan percobaan ulang brute-force. Kedua, kerangka ini berhasil menyelesaikan **18,52%** tugas yang gagal diselesaikan oleh eksekusi agentic standar. Ketiga, keuntungan efisiensi token disebabkan oleh pengurangan tool call yang redundan dan penghindaran pembengkakan konteks, yang pada agen baseline menyebabkan aksi berulang atau kontradiktif. Penulis melaporkan bahwa strategi segmentasi tidak memerlukan memori tambahan di luar model dasar, sehingga cocok untuk SLM yang dapat diterapkan secara lokal. Peningkatan 18,52% diukur sebagai proporsi tugas di mana agen tersegmentasi berhasil dan agen baseline gagal, relatif terhadap total jumlah tugas yang dicoba. Tidak ada tingkat keberhasilan absolut yang diberikan dalam abstrak, tetapi peningkatan relatifnya signifikan secara statistik dalam eksperimen yang dilaporkan.
Proliferasi Small Language Model (SLM) open-weight yang sangat mampu mendemokratisasi akses ke kemampuan keamanan siber canggih, menimbulkan risiko yang meningkat karena model-model ini dapat melewati guardrail API proprietary ketika diterapkan secara lokal. Namun, SLM yang diterapkan sebagai agen otonom sering kali kesulitan dengan tugas eksploratif berhorizon panjang seperti tantangan Capture The Flag (CTF) keamanan siber akibat pembengkakan konteks dan degradasi kognitif dari akumulasi keluaran tool-call. Untuk memahami dan memitigasi ancaman keamanan siber ini, penulis memperkenalkan **segmentasi konteks**, kerangka agentic dua tingkat yang membagi tugas eksploitasi kompleks menjadi sub-masalah yang terisolasi secara kontekstual dan dapat dikelola. Karya ini dimotivasi oleh observasi bahwa ketika agen mengakumulasi keluaran tool-call, kapasitas penalarannya yang efektif menurun, yang menyebabkan upaya eksploitasi gagal. Pertanyaan penelitian utamanya adalah apakah segmentasi konteks secara eksplisit dapat memulihkan kinerja pada tugas berhorizon panjang tanpa menambah ukuran model atau jejak memori.
Kerangka segmentasi konteks yang diusulkan beroperasi pada dua tingkat. Pada **tingkat luar**, perencana tingkat tinggi menguraikan tantangan CTF secara keseluruhan menjadi urutan sub-tujuan, masing-masing mewakili tujuan eksploitasi atau pengintaian yang mandiri. Pada **tingkat dalam**, agen pekerja mengeksekusi setiap sub-tujuan dalam jendela konteks yang terisolasi, hanya menerima deskripsi tugas dan state minimal yang diperlukan, sehingga mencegah keluaran tool-call yang tidak relevan mencemari proses penalaran. Secara formal, misalkan tugas lengkap adalah dan konteks terakumulasi pada langkah adalah . Eksekusi agentic standar mengondisikan kebijakan pada seluruh riwayat:

Mengapa penting

Hasilnya menunjukkan bahwa segmentasi konteks mengatasi keterbatasan mendasar SLM pada tugas berhorizon panjang: degradasi penalaran akibat akumulasi informasi yang tidak relevan. Dengan mengisolasi sub-masalah, kerangka ini secara efektif mereset memori kerja model, memungkinkannya fokus pada tujuan saat ini. Hal ini analog dengan **chunking** dalam pemecahan masalah manusia, di mana tugas kompleks dipecah menjadi bagian-bagian yang dapat dikelola. Implikasi keamanan sibernya ada dua. Di satu sisi, kerangka ini menurunkan hambatan bagi aktor jahat untuk memanfaatkan SLM yang diterapkan secara lokal untuk eksploitasi, karena meningkatkan tingkat keberhasilan tanpa memerlukan model yang lebih besar atau API cloud. Di sisi lain, ini memberikan cetak biru bagi defender untuk memahami bagaimana serangan semacam itu dapat diotomatisasi, yang berpotensi menginformasikan desain guardrail atau mekanisme deteksi. Penulis mencatat bahwa pendekatan ini bersifat umum dan dapat diterapkan pada tugas agentic berhorizon panjang lainnya di luar CTF. Batasannya meliputi evaluasi pada satu dataset (picoCTF) dan satu keluarga model (gemma-4), yang dapat memengaruhi generalisasi. Pekerjaan selanjutnya dapat mengeksplorasi strategi segmentasi adaptif dan integrasi dengan arsitektur yang diperkaya memori. Kode tersedia di https://github.com/9xeb/context-segmentation.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ