Editorial ilmu komputer
REFINE: Pendekatan LLM Multi-Agen untuk Refactoring Kode Berbasis Bukti
Masalah inti
Large Language Models (LLMs) menawarkan peluang baru untuk refactoring kode otomatis, namun perubahan yang dihasilkan harus mengurangi masalah kualitas yang ditargetkan tanpa menimbulkan masalah baru atau mengubah struktur kode yang relevan terhadap perilaku. Kebutuhan ganda ini—pengurangan smell yang efektif disertai preservasi perilaku—mendefinisikan tantangan utama yang ditangani REFINE (Refactoring with Evidence-aware Flow for Integrated ageNtic Execution).
Para penulis, Muhammad Waseem, Aakash Ahmad, dan Pekka Abrahamsson, memposisikan REFINE sebagai pendekatan multi-agen yang tool-agnostic dan berbasis bukti untuk menghasilkan kandidat refactoring tingkat file Java. Alih-alih mengandalkan satu prompt LLM monolitik, REFINE mengorkestrasi pipeline yang menggabungkan identifikasi smell terpandu analisis statis, perencanaan berbasis smell, transformasi berbasis LLM, analisis ulang otomatis, pemeriksaan preservasi, dan pelaporan terstruktur. Pertanyaan penelitian intinya adalah apakah dekomposisi alur kerja refactoring yang berbasis bukti dan multi-agen dapat mengungguli baseline direct-prompt dalam hal pengurangan code smell, ukuran edit, dan preservasi API publik.
Evaluasi men
Inovasi
REFINE menurunkan code smell terdeteksi sebesar 68,26%, 72,79%, dan 68,49% pada konfigurasi OpenAI GPT-5.5, Google Gemini 3.1 Pro Preview, dan Anthropic Claude Opus 4.8. Pengurangan terkuat diamati pada smell utama, yang menunjukkan bahwa pipeline berbasis bukti paling efektif pada masalah kualitas dengan tingkat keparahan lebih tinggi. Di ketiga konfigurasi, laju pengurangan mengelompok dalam rentang yang relatif sempit sekitar 68–73%, yang menunjukkan bahwa struktur multi-agen memberikan manfaat yang konsisten di berbagai model dasar.
Baseline direct-prompt yang dipasangkan pada 150 file menunjukkan bahwa REFINE mencapai median pengurangan code smell yang lebih tinggi dengan edit yang lebih kecil dan penghapusan metode publik yang lebih sedikit. Perbandingan ini menjadi inti kontribusi makalah: dekomposisi multi-agen berbasis bukti mengungguli pendekatan direct-prompt tidak hanya pada metrik utama pengurangan smell tetapi juga pada ekonomi edit dan preservasi API. Edit yang lebih kecil berarti churn yang lebih sedikit dan beban tinjauan yang lebih rendah, sedangkan penghapusan metode publik yang lebih sedikit berarti risiko yang lebih rendah untuk merusak konsumen hilir.
Namun,
Mengapa penting
Hasil REFINE mendukung kesimpulan yang bernuansa: refactoring LLM multi-agen berbasis bukti dapat secara substansial menurunkan code smell terdeteksi dan dapat mengungguli direct prompting pada median pengurangan smell, ukuran edit, dan preservasi metode publik, tetapi tidak menghilangkan kebutuhan akan verifikasi hilir. Rentang pengurangan smell 68,26%–72,79% di tiga konfigurasi LLM yang berbeda menunjukkan bahwa manfaat pipeline tidak terikat pada satu vendor model, yang memperkuat klaim tool-agnostic. Pengamatan bahwa smell utama paling banyak berkurang menunjukkan pipeline memprioritaskan masalah kualitas berdampak tinggi, konsisten dengan tahap perencanaan berbasis smell.
Tetap adanya risiko residual—perubahan assert/fail-call dan penghapusan metode publik—adalah temuan yang paling konsekuensial bagi praktik. Ini justru jenis perubahan yang dapat mengubah perilaku atau merusak kode dependen, dan deteksinya oleh pemeriksaan preservasi menunjukkan nilai desain berbasis bukti sekaligus mengekspos batasannya. Ketidakkonsistenan perbaikan kualitas yang lebih luas semakin memperingatkan agar tidak memperlakukan pengurangan smell sebagai proksi kualitas keseluruhan. Dalam cahaya ini, REFINE paling tepat dipahami sebagai sistem pembuatan kandidat daripada alat refactoring otonom. Pelaporan terstruktur dan penanda preservasinya dirancang untuk memasok alur kerja human-in-the-loop di mana kompilasi, pengujian, dan analisis dependensi bertindak sebagai gerbang sebelum adopsi. Kandidat taksonomi yang terdaftar untuk karya ini—Architecture, Cybersecurity, Network, dan Cryptography—tidak secara langsung dibahas oleh fokus refactoring Java makalah ini, tetapi temuan risiko preservasi relevan untuk domain apa pun di mana transformasi kode otomatis tidak boleh mengubah struktur yang kritis terhadap keamanan atau perilaku.
Siapa yang sebaiknya membaca
Membuka konten member…