Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial ilmu komputer

Open AccessOA2026

Tanda Tangan Token dari Kode: Membandingkan Perilaku Coding di Berbagai Large Language Model

CLIC: Pendekatan Visual Analytics untuk Mencirikan Perilaku Coding LLM melalui Analisis Frekuensi Token
Junpeng Wang; Yuzhong Chen; Menghai Pan; Uday Singh Saini; Yiwei Caiยท 2026ยท DOI 10.48550/arXiv.2609.22097

Masalah inti

Evaluasi large language model (LLM) pada tugas coding selama ini terutama berfokus pada metrik kinerja seperti pass@k. Seiring LLM terus berkembang, banyak model kini memenuhi persyaratan kinerja dasar, sehingga daya pembeda evaluasi berbasis kinerja saja berkurang. Namun satu pertanyaan kunci masih jarang ditelusuri: bagaimana LLM berbeda dalam perilaku coding mereka? Makalah ini menjawab kesenjangan tersebut dengan mengusulkan CLIC (Code Learning for Identification and Comparison), pendekatan visual analytics yang mencirikan perilaku coding LLM melalui analisis frekuensi token. Penulis berargumen bahwa memahami perbedaan perilaku sangat penting untuk tugas seperti pemilihan model dan prompt engineering, terutama ketika metrik kinerja saja tidak dapat membedakan antar model. Karya ini berada dalam konteks proliferasi model yang meningkat dan kebutuhan akan perbandingan yang terperinci di luar skor agregat.

Inovasi

Penulis melakukan studi kasus yang membandingkan 10 LLM pada 22 tugas ML Kaggle. Hasilnya menunjukkan bahwa CLIC dapat secara efektif membedakan LLM berdasarkan tanda tangan frekuensi token. Decision tree mencapai akurasi klasifikasi yang tinggi, menandakan bahwa frekuensi token saja cukup untuk memisahkan kode dari model yang berbeda. Metrik robustness mengungkap bahwa sebagian pasangan LLM tetap dapat dibedakan bahkan setelah banyak token diskriminatif dihapus, sementara pasangan lain dengan cepat menjadi tidak dapat dibedakan. Metrik concentration menunjukkan bahwa untuk sebagian pasangan, beberapa token mendominasi perbedaan, sedangkan untuk pasangan lain, perbedaan tersebar di banyak token. Temuan ini memberikan pandangan yang bernuansa tentang kesamaan dan perbedaan model. Misalnya, model dengan arsitektur atau data pelatihan yang serupa mungkin menunjukkan robustness yang lebih rendah atau concentration yang lebih tinggi, menandakan perbedaan perilaku yang halus. Sistem visual analytics memungkinkan identifikasi token spesifik yang mendorong perbedaan, seperti panggilan API tertentu atau idiom coding, yang dapat menginformasikan strategi prompt engineering.
Evaluasi large language model (LLM) pada tugas coding selama ini terutama berfokus pada metrik kinerja seperti pass@k. Seiring LLM terus berkembang, banyak model kini memenuhi persyaratan kinerja dasar, sehingga daya pembeda evaluasi berbasis kinerja saja berkurang. Namun satu pertanyaan kunci masih jarang ditelusuri: bagaimana LLM berbeda dalam perilaku coding mereka? Makalah ini menjawab kesenjangan tersebut dengan mengusulkan CLIC (Code Learning for Identification and Comparison), pendekatan visual analytics yang mencirikan perilaku coding LLM melalui analisis frekuensi token. Penulis berargumen bahwa memahami perbedaan perilaku sangat penting untuk tugas seperti pemilihan model dan prompt engineering, terutama ketika metrik kinerja saja tidak dapat membedakan antar model. Karya ini berada dalam konteks proliferasi model yang meningkat dan kebutuhan akan perbandingan yang terperinci di luar skor agregat.

CLIC merepresentasikan setiap sampel kode sebagai vektor fitur frekuensi token. Untuk pasangan LLM tertentu, CLIC melatih decision tree yang interpretable untuk memisahkan himpunan kode keduanya. Decision tree tersebut menyediakan model transparan tentang token mana yang paling diskriminatif. Di luar akurasi klasifikasi, penulis mendefinisikan dua metrik baru: robustness dan concentration. Robustness mengukur apakah kedua LLM tetap dapat dibedakan saat token paling diskriminatif mereka dihapus secara progresif. Secara formal, misalkan adalah himpunan token diskriminatif yang diurutkan berdasarkan kepentingan. Robustness dapat dikuantifikasi sebagai area di bawah kurva akurasi klasifikasi saat token dari dihapus satu per satu. Concentration mengukur apakah perbedaan didorong oleh beberapa token dominan atau tersebar di banyak token. Jika adalah kepentingan relatif token , concentration dapat dihitung memakai koefisien Gini atau entropi:

, dengan adalah entropi Shannon. Sistem ini mendukung eksplorasi multi-skala yang digerakkan hipotesis melalui visualisasi interaktif, memungkinkan pengguna menavigasi lanskap perbandingan, mengidentifikasi pasangan yang menarik, dan menelusuri token diskriminatif beserta konteks kodenya. Pipeline analitik diilustrasikan dalam diagram Mermaid berikut:

Mengapa penting

Makalah ini membahas implikasi analisis frekuensi token untuk memahami perilaku coding LLM. Penulis berargumen bahwa metrik kinerja seperti pass@k itu perlu tetapi tidak cukup; tanda tangan perilaku menawarkan wawasan yang saling melengkapi. Metrik robustness dan concentration menyediakan cara untuk mengkuantifikasi sifat perbedaan, yang dapat memandu pemilihan model: jika dua model sangat robust dalam perbedaannya, keduanya mungkin cocok untuk tugas yang berbeda, sedangkan jika keduanya mudah tertukar, keduanya mungkin dapat saling menggantikan. Pendekatan visual analytics ini mendukung eksplorasi yang digerakkan hipotesis, memungkinkan peneliti membentuk dan menguji hipotesis tentang perilaku model. Penulis juga mencatat batasan, seperti ketergantungan pada tokenisasi dan potensi frekuensi token dipengaruhi faktor dangkal seperti pemformatan. Pekerjaan selanjutnya dapat memperluas CLIC ke modalitas lain atau memasukkan analisis semantik. Secara keseluruhan, CLIC merupakan langkah menuju kerangka evaluasi yang lebih komprehensif untuk LLM, dengan menekankan pencirian perilaku di samping kinerja.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ