Editorial Ilmu Komputer & AI
Open AccessOA2026
WiseSpec: Agen Berbasis Kebutuhan untuk Generasi Kode
Pendekatan rekayasa kebutuhan untuk meningkatkan generasi kode tingkat repositori berbasis LLM
Zhao Tianยท 2026ยท DOI 10.48550/arXiv.2609.00568
Masalah inti
Generasi kode bertujuan untuk secara otomatis menghasilkan kode sumber dari kebutuhan tugas dan telah menarik perhatian signifikan seiring kemajuan pesat large language models (LLM). Meskipun ada kemajuan luar biasa, LLM sering kesulitan menghasilkan kode yang benar untuk tugas rekayasa perangkat lunak yang kompleks karena deskripsi tugas sering tidak lengkap, ambigu, atau kurang informasi kontekstual yang kritis. Pendekatan yang ada terutama meningkatkan kemampuan agen pengkodean melalui alat, keterampilan, dan alur kerja yang lebih canggih, sementara sebagian besar mengabaikan kualitas kebutuhan tugas itu sendiri. Untuk mengatasi keterbatasan ini, kami mengambil inspirasi dari rekayasa kebutuhan perangkat lunak dan mengusulkan WiseSpec, kerangka kerja agen berbasis kebutuhan baru untuk generasi kode tingkat repositori. WiseSpec secara otomatis membangun kebutuhan terstruktur dan kaya informasi, menilai kualitasnya melalui evaluasi berbasis eksekusi, dan menyempurnakannya secara iteratif untuk memandu generasi kode dengan lebih baik.
Inovasi
Hasil eksperimen menunjukkan bahwa WiseSpec secara konsisten mengungguli semua baseline, mencapai peningkatan rata-rata 13,17% pada %Resolved. Evaluasi dilakukan pada tugas generasi kode tingkat repositori, di mana WiseSpec menunjukkan kinerja unggul di berbagai metrik. Peningkatan ini disebabkan oleh kualitas kebutuhan yang lebih baik, yang mengurangi ambiguitas dan memberikan konteks kritis untuk model generasi kode. Hasil ini menunjukkan bahwa fokus pada kualitas kebutuhan dapat secara signifikan meningkatkan efektivitas agen pengkodean, bahkan tanpa perubahan pada LLM yang mendasari atau alat tambahan.
Generasi kode bertujuan untuk secara otomatis menghasilkan kode sumber dari kebutuhan tugas dan telah menarik perhatian signifikan seiring kemajuan pesat large language models (LLM). Meskipun ada kemajuan luar biasa, LLM sering kesulitan menghasilkan kode yang benar untuk tugas rekayasa perangkat lunak yang kompleks karena deskripsi tugas sering tidak lengkap, ambigu, atau kurang informasi kontekstual yang kritis. Pendekatan yang ada terutama meningkatkan kemampuan agen pengkodean melalui alat, keterampilan, dan alur kerja yang lebih canggih, sementara sebagian besar mengabaikan kualitas kebutuhan tugas itu sendiri. Untuk mengatasi keterbatasan ini, kami mengambil inspirasi dari rekayasa kebutuhan perangkat lunak dan mengusulkan WiseSpec, kerangka kerja agen berbasis kebutuhan baru untuk generasi kode tingkat repositori. WiseSpec secara otomatis membangun kebutuhan terstruktur dan kaya informasi, menilai kualitasnya melalui evaluasi berbasis eksekusi, dan menyempurnakannya secara iteratif untuk memandu generasi kode dengan lebih baik.
WiseSpec beroperasi dalam tiga tahap utama: konstruksi kebutuhan, penilaian kualitas, dan penyempurnaan iteratif. Diberikan deskripsi tugas awal, kerangka kerja ini pertama-tama membangun kebutuhan terstruktur dengan mengekstraksi entitas, aksi, dan batasan kunci, serta memperkayanya dengan informasi kontekstual dari repositori. Kebutuhan ini direpresentasikan dalam format formal yang mencakup prasyarat, pascakondisi, dan invarian. Kualitas kebutuhan yang dibangun kemudian dinilai melalui evaluasi berbasis eksekusi: kode kandidat dihasilkan dari kebutuhan, dieksekusi terhadap kasus uji, dan hasilnya digunakan untuk menghitung skor kualitas kebutuhan. Skor ini memandu loop penyempurnaan iteratif di mana kebutuhan diperbarui untuk menyelesaikan ambiguitas, mengisi informasi yang hilang, dan memperbaiki inkonsistensi. Proses berlanjut hingga kebutuhan dianggap memadai atau jumlah iterasi maksimum tercapai. Kebutuhan akhir kemudian digunakan untuk menghasilkan kode target. Kerangka kerja ini dapat diformalkan sebagai berikut: Misalkan adalah himpunan kebutuhan, adalah kode yang dihasilkan, dan adalah hasil eksekusi. Skor kualitas didefinisikan sebagai tingkat kelulusan pada kasus uji yang diturunkan dari . Langkah penyempurnaan memperbarui menjadi sehingga . Tujuan keseluruhan adalah memaksimalkan dengan batasan komputasi.
Mengapa penting
Keberhasilan WiseSpec menyoroti pentingnya kebutuhan tugas dalam generasi kode. Dengan memperlakukan kebutuhan sebagai artefak kelas satu yang dapat dibangun, dievaluasi, dan disempurnakan, kerangka kerja ini mengatasi hambatan mendasar dalam pendekatan yang ada. Evaluasi berbasis eksekusi memberikan sinyal umpan balik yang secara langsung terkait dengan kebenaran kode yang dihasilkan, memungkinkan perbaikan yang terarah. Proses penyempurnaan iteratif meniru praktik terbaik dari rekayasa kebutuhan perangkat lunak, di mana kebutuhan dielaborasi dan divalidasi sebelum implementasi. Pekerjaan ini menyarankan bahwa agen pengkodean di masa depan harus mengintegrasikan prinsip rekayasa kebutuhan untuk menangani tugas dunia nyata yang kompleks. Batasan meliputi ketergantungan pada kasus uji untuk evaluasi, yang mungkin tidak selalu tersedia atau lengkap. Pekerjaan selanjutnya dapat mengeksplorasi generasi uji otomatis dan penerapan yang lebih luas untuk tugas rekayasa perangkat lunak lainnya.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten memberโฆ