Editorial Ilmu Komputer & AI
CodeAssay: Tolok Ukur Multi-Metrik dengan Ground Truth Terverifikasi untuk Generasi Kode LLM
Masalah inti
Large Language Models (LLM) semakin banyak dievaluasi untuk generasi kode menggunakan tolok ukur berbasis tes. Validitas evaluasi semacam itu bergantung pada keandalan referensi dan tesnya, sementara kebenaran berbasis tes hanya menangkap sebagian dari properti yang dapat diamati dari kode yang dihasilkan. Makalah ini memperkenalkan **CodeAssay**, tolok ukur berbasis taksonomi dengan **185 tugas Python** di **sepuluh kategori rekayasa perangkat lunak**. Tolok ukur ini dirancang untuk mengatasi tiga kelemahan yang berulang dalam evaluasi kode LLM: ground truth yang belum diaudit, test suite yang mungkin terlalu lemah atau terlalu terbuka, dan skor kebenaran satu metrik yang mengabaikan properti kode seperti keamanan, kompleksitas, dan pemeliharaan.
CodeAssay menggabungkan **ground truth terverifikasi**, **tes publik untuk generasi dan perbaikan**, **tes tersembunyi untuk penilaian**, **validasi test-suite berbasis mutasi**, dan **ukuran properti kode terpilih**. Pertanyaan penelitian utamanya adalah apakah label kebenaran berbasis tes tetap stabil ketika referensi dan tes diaudit, dan apakah satu metrik kebenaran cukup untuk mencirikan perilaku model. Penulis memotivasi karya ini d
Inovasi
Penilaian ulang output model yang tetap setelah audit mengubah **170 dari 1.890 label kebenaran (9,0%)**. Meskipun kebenaran agregat hampir tidak berubah, **rentang model terbaik ke terburuk yang terukur meningkat dari 11,9 menjadi 23,7 poin persentase**. Ini adalah hasil yang kritis: audit tidak sekadar menaikkan atau menurunkan skor secara seragam; audit mendistribusikan ulang label dengan cara yang membuat perbedaan model lebih terlihat.
Di antara **tujuh LLM proprietary**, kebenaran prompt standar berkisar dari **77,3% hingga 98,9%**. Perbedaan signifikan ditemukan pada **12 dari 21 pasangan model**, yang berarti banyak tetapi tidak semua perbandingan berpasangan dapat dibedakan secara statistik di bawah tolok ukur ini.
Pada **120 tugas yang diselesaikan oleh semua 14 konfigurasi model-prompt**, **tidak ada model yang berkinerja terbaik di semua properti kode terpilih**. Ini secara langsung menantang kesimpulan papan peringkat satu metrik: model yang menang dalam kebenaran mungkin tidak menang dalam keamanan, kompleksitas, atau properti terukur lainnya.
**Prompt yang berfokus pada keamanan** menghasilkan **tidak ada perubahan signifikan dalam kebenaran** dan **tidak ada peng
Mengapa penting
Implikasi utama CodeAssay adalah bahwa **evaluasi yang andal terhadap kode yang dihasilkan LLM memerlukan ground truth tervalidasi, tes terlindungi, dan beberapa ukuran yang ditafsirkan secara eksplisit**. Pergeseran label 9,0% setelah audit menunjukkan bahwa hasil tolok ukur sensitif terhadap kualitas referensi dan tes. Peningkatan rentang terbaik ke terburuk dari 11,9 menjadi 23,7 poin persentase menunjukkan bahwa tolok ukur yang belum diaudit dapat memampatkan perbedaan nyata antar model, yang mengarah pada perbandingan yang diremehkan atau menyesatkan.
Temuan bahwa **tidak ada model yang berkinerja terbaik di semua properti kode terpilih** pada 120 tugas yang umumnya diselesaikan menentang pengurangan evaluasi menjadi satu skor kebenaran. Evaluasi multi-metrik diperlukan karena kebenaran, keamanan, kompleksitas, dan properti lain dapat saling bertukar. Hasil prompt keamanan memperkuat hal ini: prompt yang meningkatkan panjang program dan kompleksitas siklomatik tanpa perolehan keamanan yang konsisten dapat menciptakan kesan perbaikan yang keliru jika hanya kebenaran yang diukur.
Skor mutasi test suite tersembunyi sebesar **74,8%** versus **82,6%** untuk test suite lengkap menunjukkan bahwa tes penilaian yang terlindungi berguna tetapi bukan pengganti lengkap untuk test suite penuh. Perancang tolok ukur karena itu harus melaporkan kekuatan test suite bersama skor model.
Untuk pengembangan perangkat lunak yang diperkuat AI, CodeAssay menyediakan dasar yang dapat direproduksi untuk evaluasi model berbasis bukti. Struktur berbasis taksonominya di sepuluh kategori rekayasa perangkat lunak mendukung analisis cakupan, sementara ground truth terverifikasi dan tes tersembunyinya mengurangi risiko overfitting pada tes publik. Pelajaran yang lebih luas bersifat metodologis: klaim tolok ukur harus disertai jejak audit, metrik kualitas tes, dan pelaporan multi-properti. Tanpa ini, perbandingan antar LLM mungkin signifikan secara statistik namun tidak andal secara praktis.
Pekerjaan selanjutnya dapat memperluas pendekatan ini ke lebih banyak bahasa, kumpulan tugas yang lebih besar, dan ukuran properti kode tambahan, tetapi kontribusi intinya tetap demonstrasi bahwa **validitas evaluasi adalah properti empiris yang harus diukur, bukan diasumsikan**.
Siapa yang sebaiknya membaca
Membuka konten memberโฆ