Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2026

Kabar dari Neraka: Bisakah Coding Agent Bertahan dari Kerusakan Tersembunyi dalam Peningkatan Dependensi?

DEPBENCH mengungkap kesenjangan kapabilitas yang tajam: konfigurasi coding agent terbaik hanya menyelesaikan 51,2% tugas peningkatan dependensi dunia nyata yang melibatkan perubahan tersembunyi pada tingkat kode.
Zijian Luo; Runzhi He; Pengfei Gao; Yu Kang; Zeqi Lin; Minghua Ma; Qingwei Lin; Saravan Rajmohan; Yongqiang Tian· 2026· DOI 10.48550/arXiv.2608.30300

Masalah inti

Sistem perangkat lunak modern sangat bergantung pada dependensi pihak ketiga, namun peningkatan dependensi tersebut tetap menjadi aktivitas pemeliharaan yang mahal dan rawan kesalahan. Peningkatan dependensi tidak selalu mempertahankan signature fungsi, sistem tipe, API, atau semantik runtime yang diasumsikan oleh kode yang ada. Akibatnya, pengembang sering kali harus melakukan adaptasi kode sumber untuk mengakomodasi perubahan yang diakibatkan dependensi. Yang krusial, perubahan pada tingkat kode semacam itu sering kali tidak dikomunikasikan secara eksplisit kepada pemelihara proyek, sehingga menimbulkan tantangan signifikan bagi keandalan perangkat lunak. Sementara itu, coding agent telah muncul sebagai bentuk baru alat pengembangan perangkat lunak, yang semakin banyak diadopsi karena kemampuan otomasinya. Makalah ini memperkenalkan DEPBENCH, sebuah benchmark berisi 203 tugas peningkatan dependensi dunia nyata di lima ekosistem paket dan lima komunitas bahasa, yang masing-masing melibatkan perubahan tersembunyi pada tingkat kode yang memerlukan adaptasi kode sumber. Pertanyaan penelitian utamanya adalah: dapatkah coding agent bertahan dari kerusakan tersembunyi dalam peningkatan

Inovasi

Evaluasi coding agent arus utama pada DEPBENCH mengungkap kesenjangan kapabilitas yang tajam. Konfigurasi terbaik yang selesai hanya menyelesaikan 104 dari 203 tugas, setara dengan tingkat keberhasilan 51,2%. Artinya, hampir separuh tugas peningkatan dependensi dunia nyata yang melibatkan perubahan tersembunyi pada tingkat kode tidak diselesaikan oleh konfigurasi agent paling efektif yang diuji. Kinerja bervariasi secara substansial antar harness agent, model, dan ekosistem. Penulis melaporkan "variasi substansial antar harness agent, model, dan ekosistem", yang menunjukkan bahwa tidak ada satu konfigurasi pun yang mendominasi di semua konteks. Hasil ini menyoroti bahwa coding agent saat ini kesulitan dengan adaptasi bernuansa yang diperlukan ketika peningkatan dependensi memunculkan kerusakan tersembunyi. Tingkat keberhasilan 51,2% menegaskan bahwa meskipun agent dapat mengotomatiskan sebagian aspek peningkatan dependensi, agent masih jauh dari andal untuk pemeliharaan perangkat lunak dunia nyata. Keragaman benchmark ini—lima ekosistem paket dan lima komunitas bahasa—memastikan bahwa temuan ini bukan artefak dari satu lingkungan saja, sehingga memperkuat kesimpulan bahwa kesenjang
Sistem perangkat lunak modern sangat bergantung pada dependensi pihak ketiga, namun peningkatan dependensi tersebut tetap menjadi aktivitas pemeliharaan yang mahal dan rawan kesalahan. Peningkatan dependensi tidak selalu mempertahankan signature fungsi, sistem tipe, API, atau semantik runtime yang diasumsikan oleh kode yang ada. Akibatnya, pengembang sering kali harus melakukan adaptasi kode sumber untuk mengakomodasi perubahan yang diakibatkan dependensi. Yang krusial, perubahan pada tingkat kode semacam itu sering kali tidak dikomunikasikan secara eksplisit kepada pemelihara proyek, sehingga menimbulkan tantangan signifikan bagi keandalan perangkat lunak. Sementara itu, coding agent telah muncul sebagai bentuk baru alat pengembangan perangkat lunak, yang semakin banyak diadopsi karena kemampuan otomasinya. Makalah ini memperkenalkan DEPBENCH, sebuah benchmark berisi 203 tugas peningkatan dependensi dunia nyata di lima ekosistem paket dan lima komunitas bahasa, yang masing-masing melibatkan perubahan tersembunyi pada tingkat kode yang memerlukan adaptasi kode sumber. Pertanyaan penelitian utamanya adalah: dapatkah coding agent bertahan dari kerusakan tersembunyi dalam peningkatan dependensi? Penulis mengevaluasi coding agent arus utama pada DEPBENCH untuk mengukur kesenjangan antara kapabilitas agent saat ini dan kebutuhan pemeliharaan perangkat lunak dunia nyata.
Penulis membangun DEPBENCH, sebuah benchmark yang terdiri atas 203 tugas peningkatan dependensi dunia nyata. Tugas-tugas ini mencakup lima ekosistem paket, meliputi lima komunitas bahasa, sehingga menjamin keragaman dalam praktik manajemen dependensi dan semantik bahasa. Setiap tugas melibatkan perubahan tersembunyi pada tingkat kode—perubahan pada signature fungsi, sistem tipe, API, atau semantik runtime—yang tidak dikomunikasikan secara eksplisit kepada pemelihara tetapi memerlukan adaptasi kode sumber agar peningkatan berhasil. Benchmark ini dirancang untuk mencerminkan kompleksitas skenario pemeliharaan dunia nyata. Penulis kemudian mengevaluasi coding agent arus utama pada DEPBENCH, dengan memvariasikan harness agent dan model yang mendasarinya secara sistematis untuk mengukur kinerja. Metrik evaluasinya adalah penyelesaian tugas: apakah agent berhasil mengadaptasi kode sumber untuk mengakomodasi perubahan yang diakibatkan dependensi. Konfigurasi terbaik yang selesai hanya menyelesaikan 104 dari 203 tugas, menghasilkan tingkat keberhasilan 51,2%. Penulis juga menganalisis variasi antar harness agent, model, dan ekosistem untuk mengidentifikasi faktor yang memengaruhi kinerja. Metodologi ini memungkinkan penilaian yang ketat atas kemampuan coding agent dalam menangani kerusakan tersembunyi pada peningkatan dependensi.

Mengapa penting

Temuan dari DEPBENCH membawa implikasi signifikan bagi keandalan perangkat lunak dan adopsi coding agent. Tingkat keberhasilan 51,2% menunjukkan bahwa agent saat ini belum mampu secara andal menangani kerusakan tersembunyi dalam peningkatan dependensi, yang umum terjadi dalam pemeliharaan perangkat lunak modern. Variasi substansial antar harness agent, model, dan ekosistem menunjukkan bahwa kinerja sangat bergantung pada konteks, dan tidak ada solusi universal. Variabilitas ini mungkin berasal dari perbedaan cara agent menafsirkan pesan kesalahan, mengakses dokumentasi, atau bernalar tentang sistem tipe dan API. Sifat tersembunyi dari perubahan pada tingkat kode—yang tidak dikomunikasikan secara eksplisit kepada pemelihara—menimbulkan tantangan khusus bagi agent, yang harus menyimpulkan adaptasi yang diperlukan dari informasi yang tidak lengkap. Penulis menekankan "kesenjangan penting antara kapabilitas agent saat ini dan kebutuhan pemeliharaan perangkat lunak dunia nyata." Kesenjangan ini menyiratkan bahwa pengembang belum dapat sepenuhnya mendelegasikan peningkatan dependensi kepada agent tanpa pengawasan. Pekerjaan selanjutnya dapat berfokus pada peningkatan kemampuan agent untuk mendeteksi dan bernalar tentang kerusakan tersembunyi, mungkin dengan mengintegrasikan analisis statis yang lebih kaya atau umpan balik runtime. Benchmark ini sendiri menyediakan fondasi untuk melacak kemajuan di bidang ini. Secara keseluruhan, DEPBENCH menjadi peringatan penting bagi komunitas rekayasa perangkat lunak, menyoroti kebutuhan akan otomasi yang lebih tangguh dalam manajemen dependensi.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…