Editorial Ilmu Komputer & AI
Open AccessOA2026
CS-Guard: Uji Tolok Ukur Guardrail LLM untuk Keamanan Generasi Kode
Evaluasi sistematis efektivitas guardrail terhadap generasi kode berbahaya, mengungkap kerentanan kritis pada pertahanan saat ini
Jinyang Li; Mingyu Guo; Hung X. Nguyen· 2026· DOI 10.48550/arXiv.2609.09798
Masalah inti
Large language model (LLM) telah menunjukkan kemampuan luar biasa dalam generasi kode, tetapi kemampuan yang sama dapat dieksploitasi untuk menghasilkan malware dan kode berbahaya lainnya. Meskipun guardrail—mekanisme keamanan yang dirancang untuk mencegah keluaran berbahaya—telah dikembangkan, efektivitasnya secara khusus untuk keamanan generasi kode masih belum jelas. Makalah ini memperkenalkan CS-Guard, tolok ukur pertama untuk mengevaluasi guardrail bagi keamanan generasi kode secara sistematis. Tolok ukur ini menangani dua skenario kritis: generasi text-to-code, di mana pengguna memberikan prompt bahasa alami untuk menghasilkan kode, dan generasi code-to-code, di mana kode yang ada ditransformasi atau dilengkapi. Para penulis mengevaluasi 9 guardrail pada 7 LLM, mengungkap kerentanan signifikan. Studi ini dimotivasi oleh meningkatnya ketergantungan pada LLM dalam pengembangan perangkat lunak dan potensi penyalahgunaannya, menyoroti kebutuhan mendesak akan langkah keamanan yang tangguh.
Inovasi
Evaluasi empiris mengungkap kelemahan yang mengkhawatirkan pada guardrail saat ini. Untuk generasi text-to-code, rata-rata attack success rate (ASR) setelah jailbreak mencapai sekitar 50% untuk banyak guardrail, menunjukkan bahwa separuh prompt berbahaya berhasil melewati mekanisme keamanan. Lebih kritis lagi, serangan skenario fiktif (FSA) yang baru mencapai ASR mendekati 100% pada banyak guardrail, menunjukkan bahwa menyisipkan maksud berbahaya dalam konteks fiktif secara efektif menghindari deteksi. Untuk generasi code-to-code, hasilnya bahkan lebih mengkhawatirkan: pada LLM dasar (tanpa guardrail), rata-rata ASR mendekati 100%, artinya hampir semua permintaan transformasi kode berbahaya berhasil. Bahkan dengan guardrail, ASR tetap tinggi, berkisar dari 14,4% hingga hampir 100% pada berbagai guardrail. Temuan ini menyoroti bahwa guardrail sebagian besar tidak efektif terhadap serangan code-to-code, dan kinerjanya terhadap serangan text-to-code tidak konsisten dan sering kali buruk. Para penulis memberikan rincian berdasarkan jenis serangan, guardrail, dan LLM, menunjukkan bahwa tidak ada satu guardrail pun yang secara konsisten berkinerja baik di semua skenario.
Large language model (LLM) telah menunjukkan kemampuan luar biasa dalam generasi kode, tetapi kemampuan yang sama dapat dieksploitasi untuk menghasilkan malware dan kode berbahaya lainnya. Meskipun guardrail—mekanisme keamanan yang dirancang untuk mencegah keluaran berbahaya—telah dikembangkan, efektivitasnya secara khusus untuk keamanan generasi kode masih belum jelas. Makalah ini memperkenalkan CS-Guard, tolok ukur pertama untuk mengevaluasi guardrail bagi keamanan generasi kode secara sistematis. Tolok ukur ini menangani dua skenario kritis: generasi text-to-code, di mana pengguna memberikan prompt bahasa alami untuk menghasilkan kode, dan generasi code-to-code, di mana kode yang ada ditransformasi atau dilengkapi. Para penulis mengevaluasi 9 guardrail pada 7 LLM, mengungkap kerentanan signifikan. Studi ini dimotivasi oleh meningkatnya ketergantungan pada LLM dalam pengembangan perangkat lunak dan potensi penyalahgunaannya, menyoroti kebutuhan mendesak akan langkah keamanan yang tangguh.
CS-Guard terdiri dari dua komponen utama: tolok ukur text-to-code dan tolok ukur code-to-code. Untuk text-to-code, para penulis menyusun 1000 prompt generasi malware berkualitas tinggi, mencakup beragam maksud berbahaya. Mereka menggunakan 7 serangan jailbreak, termasuk serangan skenario fiktif (FSA) yang baru, yang menyisipkan maksud berbahaya ke dalam skenario pengembangan perangkat lunak fiktif yang sah, sehingga lebih sulit dideteksi oleh guardrail. Untuk code-to-code, mereka menggunakan 331 prompt kode yang mencakup tiga tugas: code infilling, code completion, dan code translation. Evaluasi mencakup 9 guardrail, yang dikategorikan menggunakan taksonomi guardrail modular tiga lapis: penyaringan input, penyaringan output, dan intervensi tingkat model. Taksonomi ini memungkinkan pengembang mendaftarkan guardrail untuk evaluasi. Tolok ukur ini mengukur attack success rate (ASR) sebagai metrik utama, yang didefinisikan sebagai persentase prompt yang menghasilkan generasi kode berbahaya. Pengaturan eksperimen melibatkan kueri setiap LLM dengan dan tanpa guardrail, serta pada berbagai strategi serangan. Para penulis juga merilis tolok ukur dan data untuk memfasilitasi penelitian lebih lanjut.
Mengapa penting
Hasil ini menimbulkan kekhawatiran besar terhadap keandalan dalam pengembangan perangkat lunak dunia nyata, di mana LLM semakin terintegrasi ke dalam alur kerja pengkodean. ASR yang tinggi untuk serangan code-to-code menunjukkan bahwa guardrail dapat memberikan rasa aman yang palsu, karena gagal mencegah generasi kode berbahaya dari input yang tampak tidak berbahaya. Keberhasilan serangan skenario fiktif menunjukkan bahwa guardrail saat ini kurang memiliki pemahaman kontekstual untuk membedakan antara penulisan kreatif yang sah dan maksud berbahaya yang sebenarnya. Para penulis mengaitkan kegagalan ini dengan beberapa faktor: guardrail sering mengandalkan pencocokan pola atau heuristik dangkal yang dapat dilewati dengan parafrase atau pembingkaian kontekstual; pengaturan code-to-code sangat menantang karena kode input mungkin tampak tidak berbahaya sementara outputnya berbahaya; dan taksonomi modular mengungkapkan bahwa sebagian besar guardrail berfokus pada penyaringan input, yang tidak memadai untuk tugas generasi kode. Makalah ini menyimpulkan bahwa ada kebutuhan mendesak akan guardrail yang lebih tangguh dan sadar konteks yang dapat menangani nuansa generasi kode. Perilisan CS-Guard bertujuan mendorong penelitian ke arah ini dengan menyediakan platform evaluasi yang terstandardisasi. Pekerjaan selanjutnya harus mengeksplorasi pertahanan berlapis, deteksi maksud yang lebih baik, dan integrasi teknik verifikasi formal.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten member…