Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2026

Tentang Takhayul Leksikal Large Language Model untuk Pemahaman Kode: Evaluasi Ulang pada Kode Berkualitas Leksikal Rendah

Kerangka penggantian nama yang mempertahankan semantik mengungkap bahwa LLM secara tidak proporsional bergantung pada nama pengenal, bahkan ketika struktur program saja seharusnya cukup.
Xin Shen; San-Zhuo Xi; Yali Du; Ming Li· 2026· DOI 10.48550/arXiv.2609.26388

Masalah inti

Large language model (LLM) kini banyak digunakan untuk tugas terkait kode, termasuk pemahaman kode, peringkasan, dan deteksi bug. Pada kode yang muncul secara alami, nama pengenal bersifat informatif secara statistik: nama sering berkorelasi dengan tujuan fungsi, tipe data, dan alur kendali. Namun, korelasi ini bukan jaminan keandalan. Penulis menanyakan apakah LLM saat ini memberikan bobot yang tidak proporsional pada petunjuk leksikal ketika penggantian nama mempertahankan struktur program. Mereka memperkenalkan **Face/Off**, kerangka penggantian nama pengenal yang mempertahankan semantik, dan mengevaluasi kondisi penamaan progresif pada berbagai model dan tugas pemahaman kode. Hipotesis utamanya adalah bahwa LLM menunjukkan *takhayul leksikal*: mereka mempercayai nama pengenal bahkan ketika nama tersebut menyesatkan, dan kinerjanya menurun ketika nama dihapus atau diobfuskasi. Hal ini penting karena pemahaman kode idealnya berpijak pada semantik program yang formal, bukan pada pola leksikal permukaan yang mungkin tidak ada, menyesatkan, atau bersifat adversarial.

Inovasi

Pada model dan tugas utama yang dievaluasi, penekanan leksikal yang berlebihan bersifat merata. Kinerja umumnya menurun ketika informasi pengenal dihapus atau dibuat menyesatkan. Yang lebih mencolok, keluaran model sering diarahkan pada makna yang disarankan oleh nama yang menyesatkan, bahkan ketika makna tersebut bertentangan dengan struktur program yang sebenarnya. Pola ini bertahan pada intervensi representatif berbasis prompt dan fine-tuning, yang menunjukkan bahwa penekanan leksikal yang berlebihan adalah masalah yang mengakar, bukan artefak permukaan. Kontrol inferensi tipe menegaskan batas: efek penamaan lebih kecil ketika jawaban dapat dipulihkan secara lokal tanpa nama target. Dengan kata lain, ketika model dapat menyimpulkan jawaban yang benar hanya dari petunjuk struktural lokal, model lebih sedikit bergantung pada pengenal. Hasil ini tidak menyiratkan bahwa pengenal tidak berguna; sebaliknya, hasil ini mengungkap kerentanan sistematis dalam cara LLM saat ini menyeimbangkan petunjuk leksikal dengan struktur program.
Large language model (LLM) kini banyak digunakan untuk tugas terkait kode, termasuk pemahaman kode, peringkasan, dan deteksi bug. Pada kode yang muncul secara alami, nama pengenal bersifat informatif secara statistik: nama sering berkorelasi dengan tujuan fungsi, tipe data, dan alur kendali. Namun, korelasi ini bukan jaminan keandalan. Penulis menanyakan apakah LLM saat ini memberikan bobot yang tidak proporsional pada petunjuk leksikal ketika penggantian nama mempertahankan struktur program. Mereka memperkenalkan **Face/Off**, kerangka penggantian nama pengenal yang mempertahankan semantik, dan mengevaluasi kondisi penamaan progresif pada berbagai model dan tugas pemahaman kode. Hipotesis utamanya adalah bahwa LLM menunjukkan *takhayul leksikal*: mereka mempercayai nama pengenal bahkan ketika nama tersebut menyesatkan, dan kinerjanya menurun ketika nama dihapus atau diobfuskasi. Hal ini penting karena pemahaman kode idealnya berpijak pada semantik program yang formal, bukan pada pola leksikal permukaan yang mungkin tidak ada, menyesatkan, atau bersifat adversarial.

Penulis merancang **Face/Off**, kerangka yang secara sistematis mengganti nama pengenal sambil mempertahankan struktur dan semantik program. Kerangka ini mendefinisikan kondisi penamaan progresif, mulai dari nama yang alami dan informatif hingga nama yang diobfuskasi atau sengaja menyesatkan. Untuk program dan fungsi penggantian nama , program hasil transformasi setara secara semantik dengan ; yaitu, untuk semua masukan , perilaku yang dapat diamati memenuhi

. Evaluasi mencakup berbagai LLM dan tugas pemahaman kode, termasuk inferensi tipe, deteksi penyalahgunaan variabel, dan peringkasan program. Penulis juga menguji intervensi representatif berbasis prompt dan fine-tuning untuk melihat apakah penekanan leksikal yang berlebihan dapat dimitigasi. Kontrol inferensi tipe disertakan untuk menyelidiki kondisi batas: ketika jawaban dapat dipulihkan secara lokal tanpa nama target, efek penamaan seharusnya lebih kecil. Desain eksperimen dengan demikian mengisolasi pengaruh leksikal dari penalaran struktural.

Mengapa penting

Temuan ini mendorong evaluasi dan metode pemodelan yang mempertahankan manfaat keteraturan kode alami sekaligus menjaga kesimpulan berpijak pada semantik kode yang akurat dan formal. Penulis berargumen bahwa petunjuk leksikal tidak selalu buruk—petunjuk tersebut informatif secara statistik pada kode alami—tetapi LLM harus belajar menimbangnya secara tepat terhadap bukti struktural. Bertahannya efek ini pada intervensi menunjukkan bahwa tujuan pelatihan dan strategi prompt saat ini mungkin secara tidak sengaja memperkuat jalan pintas leksikal. Arah yang menjanjikan adalah mengembangkan tolok ukur dan sinyal pelatihan yang secara eksplisit memberi imbalan pada penalaran struktural, misalnya dengan memasukkan penggantian nama yang mempertahankan semantik sebagai augmentasi data atau evaluasi adversarial. Kontrol inferensi tipe menawarkan diagnostik yang berguna: tugas yang jawabannya dapat dipulihkan secara lokal lebih tidak rentan, yang menunjukkan bahwa kerentanan terkait dengan kebutuhan akan penalaran global atau non-lokal. Pada akhirnya, makalah ini menyerukan perlakuan yang lebih berprinsip terhadap pengenal pada LLM kode, yang memperlakukannya sebagai petunjuk probabilistik alih-alih label yang otoritatif.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…