Editorial ilmu komputer
GraphAlignCoder: Menyelaraskan Graf Program dan Bukti untuk Generasi Kode
Masalah inti
Inovasi
GraphAlignCoder secara konsisten mengungguli model dasar, SFT kode saja, dan CodeRL pada semua benchmark. Dibandingkan CodeRL, metode ini meningkatkan jumlah soal terselesaikan dari 38 menjadi 50 pada LiveCodeBench v6 dan dari 16 menjadi 23 pada BigCodeBench Hard, yang setara dengan keuntungan relatif 31,6% dan 43,8%. Pada BigCodeBench Full, metode ini meningkatkan dari 359 menjadi 363 tugas. Angka-angka ini menunjukkan bahwa keuntungan relatif terbesar muncul pada benchmark tersulit, tempat batasan semantik tersembunyi paling mungkin mengalahkan pelatihan yang hanya berbasis umpan balik eksekusi. Arah peningkatan yang konsisten pada tiga benchmark dengan tingkat kesulitan berbeda menunjukkan bahwa keuntungan tersebut bukan artefak dari satu set evaluasi saja. Delta yang dilaporkan dirangkum di bawah ini.
| Benchmark | CodeRL | GraphAlignCoder | Relative Gain |
|---|---|---|---|
| LiveCodeBench v6 | 38 | 50 | 31.6% |
| BigCodeBench Hard | 16 | 23 | 43.8% |
| BigCodeBench Full | 359 | 363 | ~1.1% |
Pola ini konsisten dengan klaim bahwa struktur kebenaran tingkat wilayah memberikan supervisi yang tidak dapat disediakan oleh umpan balik eksekusi biner.
GraphAlignCoder beroperasi dalam dua tahap. Pertama, ia membangun **graf implementasi**
Mengapa penting
Siapa yang sebaiknya membaca
Membuka konten member…