Editorial ilmu komputer
Open AccessOA2026
Tantangan Berikutnya bagi Keamanan Siber Agentic: Tolok Ukur Reverse Engineering yang Realistis dan Bebas Kontaminasi
SRE-Bench mengungkap celah kritis: agen LLM terdepan masih gagal pada reverse engineering biner, hanya menyelesaikan 31,5% instans berskala dunia nyata.
Jeremy Spence; Nicholas Assaderaghi; Jinhao Zhu; Nikil Ravi; Raluca Ada Popa; Guannan Wei; Yangruibo Ding; Zhuo Zhang· 2026· DOI 10.48550/arXiv.2608.11469
Masalah inti
Agen AI berkembang pesat dalam kemampuan keamanan siber ketika kode sumber tersedia untuk dianalisis. Namun, sebagian besar perangkat lunak yang paling konsekuensial bagi keamanan siber—termasuk malware, firmware, dan aplikasi proprietary—hanya tersedia sebagai biner. Menganalisis perangkat lunak semacam itu memerlukan reverse engineering (RE): memulihkan semantik program sebelum analisis dapat dilakukan secara bermakna. Mengevaluasi RE agentic menghadirkan tantangan mendasar: instans tolok ukur harus belum pernah dilihat sebagai kode sumber dalam data pelatihan LLM untuk mencegah model mengambil jalan pintas dengan mengenalinya alih-alih benar-benar menganalisisnya, sekaligus juga harus menyamai skala dan proteksi anti-analisis perangkat lunak nyata. Tolok ukur yang ada tidak memenuhi persyaratan ini secara bersamaan. Untuk mengatasinya, para penulis memperkenalkan SRE-Bench, tolok ukur RE realistis dan bebas kontaminasi pertama. Dibangun sepenuhnya dari nol oleh para ahli RE selama 5.000 jam, SRE-Bench terdiri atas 19 program privat berskala dunia nyata dengan rata-rata 16,9K baris kode. Mereka selanjutnya mengembangkan 44 primitif anti-analisis internal, menghasilkan 262 instans
Inovasi
Evaluasi terhadap lima LLM terdepan mengungkap bahwa reverse engineering masih sebagian besar belum terpecahkan. Model terkuat, GPT-5.6-sol, mencetak 61,4% per instans dan hanya menyelesaikan 31,5% instans secara penuh. Model lain tampil lebih buruk, menunjukkan celah signifikan dalam kemampuan analisis biner. Hasil ini menunjukkan bahwa kemampuan keamanan kode sumber yang kuat belum transfer ke analisis biner. Skor per instans dapat ditafsirkan sebagai ukuran keberhasilan parsial, sedangkan tingkat penyelesaian penuh menunjukkan penyelesaian tugas secara menyeluruh. Distribusi skor antar model menunjukkan bahwa agen saat ini kesulitan dengan kompleksitas dan proteksi anti-analisis yang ada pada biner dunia nyata. Penilaian deterministik tolok ukur ini menjamin evaluasi yang reprodusibel dan objektif. Temuan ini menyoroti bahwa RE agentic merupakan frontier penting bagi keamanan siber, dan SRE-Bench menyediakan testbed yang ketat untuk mengukur kemajuan.
Agen AI berkembang pesat dalam kemampuan keamanan siber ketika kode sumber tersedia untuk dianalisis. Namun, sebagian besar perangkat lunak yang paling konsekuensial bagi keamanan siber—termasuk malware, firmware, dan aplikasi proprietary—hanya tersedia sebagai biner. Menganalisis perangkat lunak semacam itu memerlukan reverse engineering (RE): memulihkan semantik program sebelum analisis dapat dilakukan secara bermakna. Mengevaluasi RE agentic menghadirkan tantangan mendasar: instans tolok ukur harus belum pernah dilihat sebagai kode sumber dalam data pelatihan LLM untuk mencegah model mengambil jalan pintas dengan mengenalinya alih-alih benar-benar menganalisisnya, sekaligus juga harus menyamai skala dan proteksi anti-analisis perangkat lunak nyata. Tolok ukur yang ada tidak memenuhi persyaratan ini secara bersamaan. Untuk mengatasinya, para penulis memperkenalkan SRE-Bench, tolok ukur RE realistis dan bebas kontaminasi pertama. Dibangun sepenuhnya dari nol oleh para ahli RE selama 5.000 jam, SRE-Bench terdiri atas 19 program privat berskala dunia nyata dengan rata-rata 16,9K baris kode. Mereka selanjutnya mengembangkan 44 primitif anti-analisis internal, menghasilkan 262 instans biner dan 1.572 tugas bergradasi secara deterministik. Pertanyaan penelitian utamanya adalah: seberapa baik agen LLM terdepan tampil pada tugas reverse engineering yang realistis dan bebas kontaminasi?
SRE-Bench dibangun dari nol oleh para ahli reverse engineering dengan upaya lebih dari 5.000 jam. Tolok ukur ini mencakup 19 program privat berskala dunia nyata, masing-masing rata-rata 16,9K baris kode. Untuk menyimulasikan proteksi anti-analisis dunia nyata, para penulis mengembangkan 44 primitif anti-analisis internal. Primitif-primitif ini diterapkan untuk menghasilkan 262 instans biner, yang kemudian digunakan untuk membuat 1.572 tugas bergradasi secara deterministik. Tolok ukur ini menjamin evaluasi bebas kontaminasi dengan menggunakan program privat yang tidak ada dalam data pelatihan LLM. Evaluasi mencakup lima LLM terdepan: GPT-5.6-sol, Claude-Opus-5, GPT-5.5, Grok-4.5, dan GLM-5.2. Tugas-tugas dirancang untuk mengukur kemampuan agen memulihkan semantik program dari biner. Tolok ukur ini juga mencakup ablasi terkendali untuk menilai dampak kontrol kontaminasi dan skala realistis. Alur kerja keseluruhannya dapat direpresentasikan sebagai:
Mengapa penting
Analisis mengungkap bahwa agen berperilaku berbeda dari insinyur manusia. Secara spesifik, agen relatif tidak sensitif terhadap optimasi kompilator dan penautan statis, yang merupakan tantangan umum dalam reverse engineering. Ini menunjukkan bahwa agen mungkin mengandalkan pola atau heuristik alih-alih pemahaman semantik yang mendalam. Ablasi terkendali menegaskan bahwa kontrol kontaminasi dan skala realistis sama-sama penting untuk evaluasi yang bermakna. Tanpa kontrol kontaminasi, model mungkin mengenali kode dari data pelatihan dan mengambil jalan pintas. Tanpa skala realistis, tolok ukur mungkin tidak mencerminkan tantangan perangkat lunak dunia nyata. Hasil ini menunjukkan bahwa agen saat ini belum mampu mengotomatiskan tugas reverse engineering secara penuh. Para penulis menekankan bahwa SRE-Bench merupakan langkah krusial untuk mengukur dan memajukan keamanan siber agentic. Pekerjaan mendatang dapat melibatkan pengembangan agen yang lebih canggih yang mampu menangani kompleksitas analisis biner. Desain tolok ukur ini, termasuk penggunaan program privat dan primitif anti-analisis, menetapkan standar baru untuk mengevaluasi kemampuan RE. Temuan ini menegaskan perlunya penelitian berkelanjutan di bidang ini untuk menjembatani celah antara analisis kode sumber dan biner.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten member…