Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

CESBench: Tolok Ukur Model Bahasa Besar pada Keamanan Rekayasa Kriptografi untuk Perangkat IoT

Tolok ukur ahli berisi 380 item mengungkap bahwa LLM unggul dalam recall dan kode, tetapi lemah dalam menjustifikasi putusan keamanan pada rekayasa kriptografi IoT.
Wenquan Zhou; An Wang; Jing Liang; Peien Feng; Jingqi Zhang; Yaoling Ding; Liehuang Zhuยท 2026ยท DOI 10.48550/arXiv.2609.21344

Masalah inti

Perangkat Internet of Things (IoT) menghadapi tantangan keamanan yang kritis: algoritma yang aman saja tidak cukup karena penyerang dengan akses fisik dapat langsung mengeksploitasi cacat implementasi, yang sering kali mustahil ditambal setelah penerapan. Model bahasa besar (LLM) makin banyak digunakan untuk membangun dan menganalisis implementasi semacam itu, namun tolok ukur yang ada untuk kriptografi dan keamanan siber umum tidak mencakup rekayasa kriptografi. Makalah ini memperkenalkan CESBench, tolok ukur berisi 380 item yang ditulis ahli yang mencakup enam sub-domain keamanan rekayasa kriptografi untuk perangkat IoT: side-channel, fault injection, implementasi, penanggulangan, evaluasi, dan integrasi. Tolok ukur ini bertujuan menilai kompetensi LLM pada empat jenis tugas: pilihan ganda (209 item) untuk recall, putusan (67 item) yang menuntut putusan keamanan dan justifikasinya, skenario (63 item) untuk diagnosis rekayasa, dan kode (41 tugas) yang dinilai oleh 572 kasus uji. Penulis memvalidasi CESBench dengan mengevaluasi 11 LLM berbobot terbuka dan proprietary, menggunakan penilaian otomatis untuk pilihan ganda dan kode, serta LLM judge untuk respons putusan dan skenario, ya

Inovasi

Evaluasi 11 LLM pada CESBench mengungkap rentang performa yang lebar. Skor komposit berkisar dari 54,4% hingga 83,6%, menunjukkan variasi signifikan dalam kompetensi keamanan rekayasa kriptografi. Pada jenis tugas individual, model terkuat mencapai performa mendekati plafon pada pilihan ganda (98,6%) dan kode (95,1%), serta 88,4% pada diagnosis skenario. Namun, tugas putusan tetap menantang, dengan skor tertinggi hanya 58,8%. Di seluruh model, 88,5% putusan keamanan benar, tetapi justifikasi atas putusan tersebut hanya memperoleh 53,4% dari marka rubrik. Kesenjangan ini menyoroti bahwa meskipun model sering dapat mengidentifikasi hasil keamanan yang benar, mereka kesulitan memberikan penalaran yang memadai. Hasil ini menunjukkan bahwa tugas pilihan ganda dan kode sebagian besar sudah terpecahkan oleh model teratas, sedangkan menjustifikasi putusan keamanan adalah kompetensi terlemah. Rilis publik tolok ukur berupa prompt dan hasil per item memfasilitasi analisis dan perbaikan lebih lanjut.
Perangkat Internet of Things (IoT) menghadapi tantangan keamanan yang kritis: algoritma yang aman saja tidak cukup karena penyerang dengan akses fisik dapat langsung mengeksploitasi cacat implementasi, yang sering kali mustahil ditambal setelah penerapan. Model bahasa besar (LLM) makin banyak digunakan untuk membangun dan menganalisis implementasi semacam itu, namun tolok ukur yang ada untuk kriptografi dan keamanan siber umum tidak mencakup rekayasa kriptografi. Makalah ini memperkenalkan CESBench, tolok ukur berisi 380 item yang ditulis ahli yang mencakup enam sub-domain keamanan rekayasa kriptografi untuk perangkat IoT: side-channel, fault injection, implementasi, penanggulangan, evaluasi, dan integrasi. Tolok ukur ini bertujuan menilai kompetensi LLM pada empat jenis tugas: pilihan ganda (209 item) untuk recall, putusan (67 item) yang menuntut putusan keamanan dan justifikasinya, skenario (63 item) untuk diagnosis rekayasa, dan kode (41 tugas) yang dinilai oleh 572 kasus uji. Penulis memvalidasi CESBench dengan mengevaluasi 11 LLM berbobot terbuka dan proprietary, menggunakan penilaian otomatis untuk pilihan ganda dan kode, serta LLM judge untuk respons putusan dan skenario, yang diperiksa silang dengan judge kedua dan penilaian ulang manusia. Studi ini mengatasi kesenjangan dalam evaluasi LLM untuk rekayasa kriptografi, menyediakan tolok ukur publik untuk mendorong kemajuan di bidang kritis ini.
CESBench terdiri atas 380 item yang ditulis ahli dan dirancang mencakup keluasan keamanan rekayasa kriptografi untuk perangkat IoT. Item-item tersebut diorganisasi ke dalam enam sub-domain: side-channel, fault injection, implementasi, penanggulangan, evaluasi, dan integrasi. Empat jenis tugas menyasar kompetensi yang berbeda: pilihan ganda (209 item) menguji recall; putusan (67 item) menuntut putusan keamanan dan justifikasinya; skenario (63 item) menuntut diagnosis rekayasa; dan kode (41 tugas) dinilai oleh 572 kasus uji. Untuk memvalidasi tolok ukur, 11 LLM berbobot terbuka dan proprietary menjawab setiap item. Respons pilihan ganda dan kode dinilai secara otomatis, sedangkan respons putusan dan skenario dievaluasi oleh LLM judge. Skor LLM judge diperiksa terhadap judge kedua dari keluarga model lain dan penilaian ulang manusia untuk memastikan reliabilitas. Evaluasi menghasilkan skor komposit berkisar 54,4% hingga 83,6%. Skor tertinggi pada setiap jenis tugas adalah 98,6% untuk pilihan ganda, 95,1% untuk kode, dan 88,4% untuk diagnosis skenario, tetapi hanya 58,8% untuk putusan. Di seluruh model, 88,5% putusan benar, namun justifikasinya hanya memperoleh 53,4% dari marka rubrik. Tolok ukur, prompt, dan hasil per item bersifat publik.

Mengapa penting

Temuan dari CESBench menggarisbawahi kesenjangan kritis dalam kemampuan LLM untuk keamanan rekayasa kriptografi. Meskipun model unggul pada tugas berbasis recall (pilihan ganda) dan pembuatan kode, kemampuan mereka menjustifikasi putusan keamanan tertinggal jauh. Hal ini mengkhawatirkan karena dalam keamanan IoT dunia nyata, memahami mengapa suatu implementasi rentan sama pentingnya dengan mengidentifikasi kerentanan itu sendiri. Akurasi tinggi pada putusan (88,5%) tetapi skor justifikasi rendah (53,4%) menunjukkan bahwa model mungkin mengandalkan pengenalan pola alih-alih penalaran mendalam. Cakupan tolok ukur atas enam sub-domain memastikan penilaian yang komprehensif, tetapi hasilnya menunjukkan bahwa LLM saat ini belum dapat diandalkan untuk analisis keamanan otonom di domain ini. Penulis menekankan perlunya peningkatan kemampuan penalaran dan penjelasan. Ketersediaan publik CESBench, termasuk prompt dan hasil per item, menyediakan fondasi untuk penelitian mendatang. Desain tolok ukur, dengan campuran jenis tugas dan item yang ditulis ahli, menetapkan standar baru untuk mengevaluasi LLM dalam rekayasa kriptografi. Seiring proliferasi perangkat IoT, memastikan keamanannya melalui analisis berbantuan LLM yang kokoh menjadi makin vital.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ