Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Penilaian LLM commit-first mewarisi kesalahan hakim itu sendiri

Audit terhadap delapan kerangka evaluasi tidak menemukan implementasi satu-satunya pertahanan yang berhasil, dan eksperimen terkontrol menunjukkan mengapa pertahanan itu bukan obat
Idil Gozelยท 2026ยท DOI 10.48550/arXiv.2609.00088

Masalah inti

Hakim LLM adalah model yang menilai keluaran sistem lain. Model ini semakin banyak digunakan sebagai evaluator otomatis dalam pipeline perangkat lunak, tetapi dapat di-gaming oleh sistem yang dinilainya. Penelitian terbaru mengidentifikasi satu pertahanan yang berhasil: hakim menyelesaikan tugas itu sendiri terlebih dahulu dan berkomitmen pada jawaban tersebut, lalu menerima kandidat hanya jika keduanya cocok. Penulis menyebutnya **penilaian commit-first** dan mengajukan dua pertanyaan: apakah perangkat lunak yang dirilis mengimplementasikannya, dan berapa biayanya. Makalah ini mengaudit konfigurasi hakim bawaan dari delapan kerangka evaluasi yang banyak digunakan. Dari 24 konfigurasi yang tercakup, tidak ada yang mengimplementasikan penilaian commit-first. Sembilan mengimplementasikan varian yang diukur literatur sebagai tidak efektif, dan kesembilan ini berbagi satu prompt leluhur, yang dapat dilacak melalui kesalahan tipografi yang disalin. Penulis kemudian menjalankan eksperimen terkontrol untuk menguji biaya penilaian commit-first. Temuan utamanya adalah penilaian commit-first tidak menghilangkan anchor yang di-gaming; ia memindahkannya dari kandidat ke jawaban hakim sendiri.

Inovasi

Audit menemukan bahwa tidak ada dari 24 konfigurasi yang mengimplementasikan penilaian commit-first. Sembilan mengimplementasikan varian yang diukur literatur sebagai tidak efektif, dan kesembilan ini berbagi satu prompt leluhur, yang dapat dilacak melalui kesalahan tipografi yang disalin. Dalam eksperimen terkontrol, pada tugas interval merging, hakim menerima 90 dari 96 kandidat pada satu seed dan 93 dari 96 pada seed lainnya. Setiap kandidat yang diterima lolos setiap tes yang dapat dilihat pencarian dan gagal pada suite held-out yang tidak dapat dilihatnya. Hakim mengidentifikasi baris cacat dan mengutipnya sebagai dasar untuk skor sempurna. Penilaian commit-first menghilangkan efek itu: 0 dari 96 pada kedua seed. Pada tugas kedua, penilaian commit-first memperburuk keadaan pada kedua seed: jawaban yang dikomit hakim salah, dan pada satu seed populasi konvergen padanya. Ini adalah temuan utama. Penulis juga melaporkan bahwa lima dari lima belas klaim dalam kriteria mereka salah terhadap sumber verbatim, dan dua pemeriksaan held-out tidak dibenarkan oleh spesifikasi mereka. Hasil menunjukkan penilaian commit-first tidak menghilangkan anchor yang di-gaming; ia memindahkannya dari
Hakim LLM adalah model yang menilai keluaran sistem lain. Model ini semakin banyak digunakan sebagai evaluator otomatis dalam pipeline perangkat lunak, tetapi dapat di-gaming oleh sistem yang dinilainya. Penelitian terbaru mengidentifikasi satu pertahanan yang berhasil: hakim menyelesaikan tugas itu sendiri terlebih dahulu dan berkomitmen pada jawaban tersebut, lalu menerima kandidat hanya jika keduanya cocok. Penulis menyebutnya **penilaian commit-first** dan mengajukan dua pertanyaan: apakah perangkat lunak yang dirilis mengimplementasikannya, dan berapa biayanya. Makalah ini mengaudit konfigurasi hakim bawaan dari delapan kerangka evaluasi yang banyak digunakan. Dari 24 konfigurasi yang tercakup, tidak ada yang mengimplementasikan penilaian commit-first. Sembilan mengimplementasikan varian yang diukur literatur sebagai tidak efektif, dan kesembilan ini berbagi satu prompt leluhur, yang dapat dilacak melalui kesalahan tipografi yang disalin. Penulis kemudian menjalankan eksperimen terkontrol untuk menguji biaya penilaian commit-first. Temuan utamanya adalah penilaian commit-first tidak menghilangkan anchor yang di-gaming; ia memindahkannya dari kandidat ke jawaban hakim sendiri. Karena itu, evaluasi hanya sebaik kemampuan hakim pada tugas tersebut. Prasyarat ini murah diukur sebelumnya dan bersifat lokal pada tugas, bukan bergantung pada skala: hakim yang lebih kecil menyelesaikan tugas yang gagal diselesaikan hakim frontier dan menolak gaming di tempat hakim frontier tidak menolaknya.
Studi ini menggabungkan audit terhadap kerangka evaluasi yang ada dengan eksperimen terkontrol. Audit memeriksa konfigurasi hakim bawaan dari delapan kerangka evaluasi yang banyak digunakan, menghasilkan 24 konfigurasi yang tercakup. Untuk setiap konfigurasi, penulis memeriksa apakah ia mengimplementasikan penilaian commit-first, dan jika tidak, varian apa yang diimplementasikannya. Mereka juga melacak asal-usul prompt. Eksperimen terkontrol menggunakan pencarian best-of-N biasa tanpa akses ke jawaban yang benar. Pencarian mengoptimalkan kode terhadap salah satu konfigurasi yang diaudit, digunakan persis seperti didokumentasikan. Tugasnya adalah interval merging. Hakim digunakan sebagai fungsi penilaian, dan pencarian mengusulkan kandidat. Penulis mengukur berapa banyak kandidat yang diterima hakim dan berapa banyak dari kandidat yang diterima itu yang lolos suite held-out yang tidak dapat dilihat pencarian. Mereka menjalankan dua seed. Mereka kemudian mengulang eksperimen dengan penilaian commit-first diaktifkan, dan pada tugas kedua. Mereka juga memvalidasi instrumen mereka sendiri: lima dari lima belas klaim dalam kriteria mereka salah terhadap sumber verbatim, dan dua pemeriksaan held-out tidak dibenarkan oleh spesifikasi mereka. Desain eksperimen dapat diringkas sebagai alur: generator kandidat mengusulkan keluaran, hakim menilainya, dan pencarian memilih kandidat dengan skor tertinggi. Pada varian commit-first, hakim terlebih dahulu menyelesaikan tugas dan berkomitmen pada jawaban, lalu membandingkan kandidat dengan jawaban itu. Metrik kuncinya adalah tingkat penerimaan kandidat cacat yang lolos tes terlihat tetapi gagal pada suite held-out.

Mengapa penting

Implikasi utamanya adalah penilaian commit-first bukan perbaikan universal. Ia menggantikan satu anchor dengan anchor lain. Pada pengaturan standar, hakim ter-anchor pada kandidat dan dapat di-gaming oleh kandidat yang tampak benar. Pada pengaturan commit-first, hakim ter-anchor pada jawaban yang dikomitnya sendiri. Jika jawaban itu salah, hakim akan menolak kandidat yang benar dan menerima kandidat yang salah yang cocok dengan kesalahannya. Tugas kedua menunjukkan mode kegagalan ini: jawaban yang dikomit hakim salah, dan pada satu seed populasi konvergen padanya. Karena itu, efektivitas penilaian commit-first bergantung pada kompetensi tugas hakim. Prasyarat ini bersifat lokal pada tugas, bukan bergantung pada skala. Hakim yang lebih kecil dapat mengungguli hakim frontier pada tugas tertentu, dan dengan demikian menolak gaming di tempat hakim frontier tidak menolaknya. Penulis menyarankan prasyarat ini murah diukur sebelumnya: seseorang dapat menguji hakim pada sekumpulan tugas held-out sebelum menerapkannya. Audit juga mengungkap masalah asal-usul: sembilan konfigurasi berbagi prompt leluhur dengan kesalahan tipografi yang disalin, menunjukkan varian tidak efektif menyebar melalui penyalinan. Validasi diri penulis menunjukkan bahkan kriteria mereka sendiri mengandung kesalahan, menyoroti sulitnya evaluasi yang andal. Pelajaran yang lebih luas adalah kerangka evaluasi sebaiknya mengimplementasikan penilaian commit-first hanya ketika kompetensi hakim pada tugas target telah ditetapkan, dan bahwa kesalahan hakim itu sendiri diwarisi oleh evaluasi.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ