Editorial ilmu komputer
Tanda Tangan Token dari Kode: Membandingkan Perilaku Coding di Berbagai Large Language Model
Masalah inti
Inovasi
CLIC merepresentasikan setiap sampel kode sebagai vektor fitur frekuensi token. Untuk pasangan LLM tertentu, CLIC melatih decision tree yang interpretable untuk memisahkan himpunan kode keduanya. Decision tree tersebut menyediakan model transparan tentang token mana yang paling diskriminatif. Di luar akurasi klasifikasi, penulis mendefinisikan dua metrik baru: robustness dan concentration. Robustness mengukur apakah kedua LLM tetap dapat dibedakan saat token paling diskriminatif mereka dihapus secara progresif. Secara formal, misalkan adalah himpunan token diskriminatif yang diurutkan berdasarkan kepentingan. Robustness dapat dikuantifikasi sebagai area di bawah kurva akurasi klasifikasi saat token dari dihapus satu per satu. Concentration mengukur apakah perbedaan didorong oleh beberapa token dominan atau tersebar di banyak token. Jika adalah kepentingan relatif token , concentration dapat dihitung memakai koefisien Gini atau entropi:
Mengapa penting
Siapa yang sebaiknya membaca
Membuka konten memberโฆ