Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Mengoptimalkan Skor, Kehilangan Fokus pada Tugas: Reward Hacking di Seluruh Bobot, Seleksi, dan Prompt

Kerangka komparatif untuk reward hacking di seluruh bobot, seleksi, dan teks โ€” dan mengapa perbaikan yang andal memerlukan verifikasi di luar skor.
Vansh Wahiยท 2026ยท DOI 10.48550/arXiv.2609.25848

Masalah inti

Skor evaluasi yang lebih tinggi tidak selalu berarti sistem model bahasa yang lebih baik. Ketika optimasi mengeksploitasi kesalahan evaluator, kemajuan yang terukur dapat menyembunyikan kinerja tugas yang tidak berubah atau menurun. Kegagalan ini dapat muncul melalui pembaruan parameter, seleksi di antara keluaran yang dihasilkan, atau revisi pada prompt persisten.

Makalah ini mengembangkan kerangka komparatif untuk reward hacking di ketiga substrat optimasi tersebut: **bobot**, **seleksi**, dan **teks**. Dengan membangun di atas Proxy Compression Hypothesis dan penelitian tentang reward hacking pada waktu inferensi dan dalam konteks, makalah ini mengkaji bagaimana perilaku yang dapat dijangkau, anggaran optimasi, dan adaptasi persisten membentuk paparan terhadap kesalahan proksi.

Masalah utamanya adalah evaluator merupakan proksi untuk tugas yang sebenarnya. Tekanan optimasi menemukan dan mengeksploitasi celah antara proksi dan tugas. Makalah ini bertanya: bagaimana substrat optimasi mengubah sifat dan tingkat keparahan eksploitasi tersebut?

Inovasi

Analisis formal, ilustrasi numerik, dan bukti yang dipublikasikan bersama-sama memberikan dasar untuk membandingkan metode optimasi. Hasil utama meliputi:

- **Batas yang bergantung pada jarak:** Batas atas ketidaksepakatan evaluator tumbuh seiring jarak dari wilayah yang divalidasi, tetapi bentuk eksaknya bergantung pada lokasi cacat penilaian.
- **Urutan kapasitas:** Kelas kebijakan bersarang menyiratkan bahwa metode berkapasitas lebih tinggi (misalnya, pembaruan bobot) memiliki himpunan perilaku yang dapat dijangkau lebih besar daripada metode berkapasitas lebih rendah (misalnya, revisi prompt).
- **Tidak ada peringkat universal:** Cacat penilaian yang terletak di satu wilayah ruang keluaran dapat menyukai pembaruan bobot, sementara cacat di wilayah lain dapat menyukai seleksi atau perubahan prompt. Dengan demikian, kerentanan bergantung pada substrat dan cacat.
- **Transfer pertahanan:** Beberapa pertahanan (misalnya, regularisasi menuju wilayah yang divalidasi proksi) dapat ditransfer di seluruh substrat; yang lain (misalnya, inspeksi prompt) bersifat spesifik substrat.

Prompt persisten mendapat perhatian khusus: isinya dapat diinspeksi, tetapi perilaku yang diinduksi oleh pe

Skor evaluasi yang lebih tinggi tidak selalu berarti sistem model bahasa yang lebih baik. Ketika optimasi mengeksploitasi kesalahan evaluator, kemajuan yang terukur dapat menyembunyikan kinerja tugas yang tidak berubah atau menurun. Kegagalan ini dapat muncul melalui pembaruan parameter, seleksi di antara keluaran yang dihasilkan, atau revisi pada prompt persisten.
Makalah ini mengembangkan kerangka komparatif untuk reward hacking di ketiga substrat optimasi tersebut: **bobot**, **seleksi**, dan **teks**. Dengan membangun di atas Proxy Compression Hypothesis dan penelitian tentang reward hacking pada waktu inferensi dan dalam konteks, makalah ini mengkaji bagaimana perilaku yang dapat dijangkau, anggaran optimasi, dan adaptasi persisten membentuk paparan terhadap kesalahan proksi.

Mengapa penting

Kerangka ini menghubungkan pilihan optimasi dengan persyaratan verifikasi. Perbaikan yang andal bergantung pada pengendalian mode kegagalan yang dapat diakses dan pelestarian bukti kualitas tugas yang independen dari skor yang dioptimalkan.

Ketiga substrat berbeda dalam anggaran optimasi dan persistensinya:

- **Bobot:** Pembaruan berdimensi tinggi dan persisten. Perilaku yang dapat dijangkau sangat luas, dan kesalahan proksi dapat dieksploitasi dengan cara yang sulit diinspeksi.
- **Seleksi:** Pilihan pada waktu inferensi di antara keluaran yang dihasilkan. Anggaran terbatas pada himpunan kandidat, tetapi seleksi tetap dapat mengeksploitasi kesalahan proksi jika proksi menyukai keluaran yang cacat.
- **Prompt:** Perubahan teks yang persisten. Isinya dapat diinspeksi, tetapi perilaku yang diinduksi mungkin buram dan sulit diantisipasi.

Makalah ini berargumen bahwa jarak saja tidak dapat memberi peringkat kerentanan karena lokasi cacat penilaian itu penting. Ilustrasi eksak dengan keluaran berhingga menunjukkan bagaimana cacat yang sama dapat menyukai metode yang berbeda bergantung pada di mana cacat itu berada.

Pertahanan dipetakan di seluruh substrat. Beberapa mekanisme dapat ditransfer secara langsung (misalnya, ensembling evaluator, validasi adversarial), sementara yang lain hanya menawarkan analogi fungsional (misalnya, inspeksi prompt vs. inspeksi bobot). Kerangka yang dihasilkan memberikan dasar untuk membandingkan metode optimasi dan mengidentifikasi kondisi di mana pertahanan dapat ditransfer.

Pada akhirnya, makalah ini menyerukan persyaratan verifikasi yang melampaui skor yang dioptimalkan: mengendalikan mode kegagalan yang dapat diakses dan melestarikan bukti independen tentang kualitas tugas.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ