Jadwal Sholat

Memuat jadwal sholat…

Editorial ilmu komputer

Open AccessOA2026

Apa yang Membuat Tugas Penyelesaian Isu Perangkat Lunak Sulit bagi Agen?

Kerangka pengukuran mengungkap bahwa kesulitan tugas dapat diprediksi dari properti struktural statis, didorong oleh fragmentasi patch dan skala repositori.
Ebtesam Al-Haque; Brittany Johnson· 2026· DOI 10.48550/arXiv.2608.18280

Masalah inti

Sistem agentic dengan cepat menjenuhkan benchmark, namun skor benchmark tetap sulit ditafsirkan karena kurangnya kontrol dan karakterisasi kesulitan tugas. Saat ini kita masih sedikit memahami apa yang membuat satu tugas penyelesaian isu perangkat lunak lebih sulit daripada yang lain, dan sejauh mana kesulitan dapat diprediksi dari properti tugas yang statis. Makalah ini menjawab kesenjangan tersebut dengan mengusulkan kerangka pengukuran untuk secara sistematis mengukur properti struktural tugas perangkat lunak mana yang berkorespondensi dengan tingkat keberhasilan agen. Penulis melakukan studi empiris berskala besar pada CoderForge-Preview, dataset trajektori agen coding terbuka terbesar hingga saat ini, dengan mengekstraksi fitur dari patch tugas, repositori, dan prompt. Tujuannya adalah memungkinkan estimasi kesulitan statis secara pre-hoc dan meletakkan dasar bagi konstruksi benchmark yang terkontrol kesulitannya.

Inovasi

Kesulitan tugas sebagian besar dapat diprediksi dari fitur statis, mencapai AUC 0,863. Ini menunjukkan bahwa properti struktural saja dapat menjelaskan sebagian besar tingkat keberhasilan agen. Analisis mengidentifikasi fragmentasi patch dan skala repositori sebagai pendorong utama kesulitan. Fitur linguistik prompt terlihat di antara kontributor teratas untuk tugas pada rentang kesulitan menengah, menunjukkan struktur berlapis di mana faktor berbeda mendominasi pada tingkat kesulitan yang berbeda. AUC yang tinggi menunjukkan kelayakan estimasi kesulitan secara pre-hoc tanpa mengeksekusi tugas.

Diagram Mermaid yang mengilustrasikan pipeline ekstraksi fitur dan prediksi:

Sistem agentic dengan cepat menjenuhkan benchmark, namun skor benchmark tetap sulit ditafsirkan karena kurangnya kontrol dan karakterisasi kesulitan tugas. Saat ini kita masih sedikit memahami apa yang membuat satu tugas penyelesaian isu perangkat lunak lebih sulit daripada yang lain, dan sejauh mana kesulitan dapat diprediksi dari properti tugas yang statis. Makalah ini menjawab kesenjangan tersebut dengan mengusulkan kerangka pengukuran untuk secara sistematis mengukur properti struktural tugas perangkat lunak mana yang berkorespondensi dengan tingkat keberhasilan agen. Penulis melakukan studi empiris berskala besar pada CoderForge-Preview, dataset trajektori agen coding terbuka terbesar hingga saat ini, dengan mengekstraksi fitur dari patch tugas, repositori, dan prompt. Tujuannya adalah memungkinkan estimasi kesulitan statis secara pre-hoc dan meletakkan dasar bagi konstruksi benchmark yang terkontrol kesulitannya.
Studi ini menganalisis CoderForge-Preview, sebuah dataset trajektori agen coding. Fitur diekstraksi dari tiga dimensi: patch tugas (misalnya, baris yang diubah, file yang disentuh, fragmentasi), repositori (misalnya, ukuran, kompleksitas, jumlah kontributor), dan prompt (misalnya, properti linguistik seperti keterbacaan, spesifisitas). Kekuatan prediktif setiap fitur terhadap hasil tugas dievaluasi menggunakan metode ensemble, atribusi SHAP, dan analisis effect size. Target hasilnya adalah tingkat keberhasilan agen pada tugas penyelesaian isu. Kerangka ini bertujuan mengukur hubungan antara properti tugas statis dan kinerja agen, sehingga memungkinkan estimasi kesulitan secara pre-hoc.

Mengapa penting

Temuan ini mengungkap bahwa kesulitan tugas penyelesaian isu terkode dalam strukturnya. Fragmentasi patch—bagaimana perubahan tersebar di seluruh file dan hunk—dan skala repositori—ukuran dan kompleksitas—adalah faktor yang paling berpengaruh. Untuk tugas dengan kesulitan menengah, fitur linguistik prompt (misalnya, kejelasan, spesifisitas) menjadi penting, menunjukkan model kesulitan berlapis. Ini menunjukkan bahwa saat tugas menjadi lebih sulit, kepentingan relatif dari kategori fitur yang berbeda bergeser. Kemampuan memprediksi kesulitan dari fitur statis memungkinkan konstruksi benchmark yang terkontrol kesulitannya, sehingga evaluasi agen menjadi lebih dapat ditafsirkan. Hal ini juga mendukung pemilihan tugas secara pre-hoc dan pembelajaran kurikulum. Studi ini meletakkan dasar bagi pemahaman yang lebih mendalam tentang keterbatasan agen dan untuk merancang tugas yang menargetkan kemampuan spesifik.

Diagram konseptual struktur kesulitan berlapis:

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…