Editorial Ilmu Komputer & AI
Open AccessOA2026
Route-Align-Verify untuk Kebenaran Fungsional dalam Generasi Kode
Kerangka kerja tiga tahap yang ringan dan modular yang meningkatkan generasi kode LLM tanpa mengubah arsitektur backbone
Erxue Zhou; Jingxiang Meng; Aofan Liu· 2026· DOI 10.48550/arXiv.2608.03341
Masalah inti
Large language model (LLM) telah meningkatkan generasi kode secara substansial, namun mencapai kebenaran fungsional yang kuat tetap sulit, terutama untuk tugas pemrograman yang heterogen di mana satu strategi prompting dan satu output yang dihasilkan secara langsung sering kali tidak memadai. Para penulis, Erxue Zhou, Jingxiang Meng, dan Aofan Liu, mengatasi kesenjangan ini dengan RAV, kerangka kerja yang ringan dan modular yang meningkatkan generasi kode dengan model backbone tetap melalui tiga tahap yang terkoordinasi: **Route**, **Align**, dan **Verify**. Alih-alih mengubah arsitektur backbone, RAV secara bersama-sama mengoptimalkan bagaimana tugas diprompt, bagaimana model diadaptasi, dan bagaimana output akhir dipilih. Karya ini menargetkan kebenaran fungsional—apakah kode yang dihasilkan benar-benar lulus pengujian—bukan kemiripan permukaan, dan dievaluasi pada benchmark MBPP dalam pengaturan sanitized dan full.
Inovasi
Pipeline RAV lengkap mencapai kinerja terbaik di antara semua konfigurasi yang dievaluasi pada benchmark MBPP. Pipeline ini mencapai **0.8911 pada MBPP Sanitized** dan **0.8520 pada MBPP Full**. Dibandingkan dengan model dasar, hasil ini mewakili peningkatan sebesar **6.35** dan **9.92** poin persentase. Para penulis melaporkan bahwa pipeline lengkap mengungguli semua konfigurasi yang dievaluasi, dan bahwa eksperimen ablasi per komponen menunjukkan routing yang sadar tugas dan adaptasi yang selaras menjadi jauh lebih efektif ketika dikombinasikan dengan verifikasi berbasis eksekusi. Analisis ketahanan dan kontaminasi tambahan mendukung keandalan peningkatan yang diamati. Hasil ini menunjukkan bahwa kebenaran fungsional dalam generasi kode dapat ditingkatkan secara berarti tanpa mengubah arsitektur backbone.
Large language model (LLM) telah meningkatkan generasi kode secara substansial, namun mencapai kebenaran fungsional yang kuat tetap sulit, terutama untuk tugas pemrograman yang heterogen di mana satu strategi prompting dan satu output yang dihasilkan secara langsung sering kali tidak memadai. Para penulis, Erxue Zhou, Jingxiang Meng, dan Aofan Liu, mengatasi kesenjangan ini dengan RAV, kerangka kerja yang ringan dan modular yang meningkatkan generasi kode dengan model backbone tetap melalui tiga tahap yang terkoordinasi: **Route**, **Align**, dan **Verify**. Alih-alih mengubah arsitektur backbone, RAV secara bersama-sama mengoptimalkan bagaimana tugas diprompt, bagaimana model diadaptasi, dan bagaimana output akhir dipilih. Karya ini menargetkan kebenaran fungsional—apakah kode yang dihasilkan benar-benar lulus pengujian—bukan kemiripan permukaan, dan dievaluasi pada benchmark MBPP dalam pengaturan sanitized dan full.
RAV diorganisasikan sebagai pipeline tiga tahap yang diterapkan pada model backbone tetap.
Mengapa penting
Temuan utamanya adalah bahwa kebenaran fungsional dapat ditingkatkan melalui strategi modular pada waktu inferensi dan waktu adaptasi, bukan melalui perubahan arsitektur. Hasil ablasi menunjukkan hubungan yang saling melengkapi di antara ketiga tahap: routing dan penyelarasan saja kurang efektif, tetapi manfaatnya diperkuat oleh verifikasi berbasis eksekusi. Hal ini menunjukkan verifikasi sebagai faktor kunci yang mengubah peningkatan generasi kandidat menjadi peningkatan kebenaran akhir. Analisis ketahanan dan kontaminasi yang dilaporkan lebih lanjut mendukung keandalan perolehan tersebut, yang penting mengingat kekhawatiran tentang kebocoran benchmark dalam evaluasi generasi kode. Batasan tidak dirinci dalam abstrak; evaluasi berpusat pada MBPP dalam pengaturan sanitized dan full, dan kerangka kerja ini digambarkan sebagai ringan dan modular dengan backbone tetap. Secara keseluruhan, RAV menunjukkan bahwa mengoptimalkan secara bersama-sama prompting, adaptasi, dan pemilihan output adalah jalur yang layak untuk kebenaran fungsional yang lebih kuat dalam tugas pemrograman yang heterogen.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten member…