Louis Lalonde; Wassim Keddache; Thomas Perron Touchette; Leuson Da Silva; Foutse Khomh
Summary
This study partially replicates the FeedbackEval benchmark on 394 Python repair tasks using GPT-4o and Claude 3.5 Sonnet, confirming that test feedback is the strongest feedback type. An exploratory Java extension on 100 erroneous instance…
Method
Penelitian ini terdiri atas dua bagian utama. Pertama, replikasi parsial studi FeedbackEval asli pada 394 tugas perbaikan menggunakan dua LLM: GPT-4o dan Claude 3.5 Sonnet. Replik…
Results
Dalam replikasi Python, tren kualitatif utama dari studi asli direproduksi: umpan balik tes tetap menjadi jenis umpan balik terkuat, secara signifikan meningkatkan keberhasilan perbaikan dibandingkan…
Nahian Salsabil; Joy Saha; Simantika Bhattacharjee Dristi; Nicholas Phair; Nusrat Jahan Mozumder; Matthew B. Dwyer; Seb…
Summary
This study benchmarks 35 LLM-based software engineering techniques from ICSE 2026 against a single automatically generated prompt on a newer model. It finds that 37–63% of the engineered tools are natively outperformed, with constructive t…
Method
Studi ini melakukan tolok ukur sistematis terhadap 35 makalah teknik berbasis LLM yang diterbitkan di ICSE 2026. Untuk setiap makalah, penulis mengekstrak teknik yang diusulkan da…
Results
Analisis mengungkap bahwa untuk antara 37% dan 63% makalah, model yang lebih baru dengan satu prompt secara native mengalahkan perkakas yang direkayasa secara berat yang diusulkan hanya setahun sebel…
Zhao and Zhao present a runtime-independent architecture that separates a persistent continuity substrate from replaceable execution bindings, demonstrating mechanical continuity across model, harness, and host substitutions. Evidence from…
Method
Arsitektur yang diusulkan bertumpu pada pemisahan formal antara substrat persisten $P_t = (I_t, M_t, B_t)$ dan binding runtime yang dapat diganti. Enam invarian kontinuitas diranc…
Results
Kasus operasional menunjukkan bahwa instans yang sudah mapan mempertahankan identitas, memori tidak kosong, revisi badan, dan ID tugas historisnya lintas substitusi host, model/harness gabungan Codex…
WiseSpec is a novel agent framework that automatically constructs, evaluates, and refines structured requirements to guide code generation, achieving an average improvement of 13.17% in %Resolved over baselines.
Method
WiseSpec beroperasi dalam tiga tahap utama: konstruksi kebutuhan, penilaian kualitas, dan penyempurnaan iteratif. Diberikan deskripsi tugas awal, kerangka kerja ini pertama-tama m…
Results
Hasil eksperimen menunjukkan bahwa WiseSpec secara konsisten mengungguli semua baseline, mencapai peningkatan rata-rata 13,17% pada %Resolved. Evaluasi dilakukan pada tugas generasi kode tingkat repo…
This study introduces Program Executability Prediction (PrEx) to test whether LLMs apply given programming language semantics or rely on pre-training priors. Results show LLMs lean on priors, performing poorly on modified semantics and deg…
Method
Tugas PrEx diformalkan sebagai berikut: diberikan program $P$ dengan sintaks $S$ dan semantik operasional $\mathcal{S}$, model harus memprediksi label $y \in \{0,1\}$ yang menunju…
Results
Temuan mengungkapkan bahwa LLM bersandar pada prior pra-pelatihan daripada secara sistematis menerapkan aturan yang diberikan. Kinerja sangat buruk pada semantik yang dimodifikasi, dan menurun lebih …
Zachary Wadhams; Ann Marie Reinhold; Clemente Izurieta
Summary
This paper proposes an automated process that aggregates Static Application Security Testing (SAST) outputs and integrates them into developers' issue-tracking software, demonstrated with SonarQube in a GitLab environment. Developers repor…
Method
Proses yang diusulkan dirancang agar umum dan otomatis, mengagregasi keluaran dari perkakas SAST dan mengintegrasikannya ke dalam perangkat lunak pelacakan isu. Implementasinya me…
Results
Implementasi dievaluasi di lingkungan pengembangan berbasis GitLab menggunakan SonarQube. Hasilnya menunjukkan bahwa proses berhasil mengintegrasikan keluaran SAST ke dalam sistem pelacakan isu, memb…
In the rural health facilities of Burkina Faso and the bustling urban clinics of The Gambia, a quiet crisis unfolds with every twin delivery. While twins represent only a small fraction of births, they account for a disproportionate share …
Method
Studi ini mengidentifikasi etnisitas ibu dan paritas sebagai faktor risiko utama untuk kelahiran kembar. Di Burkina Faso, kelompok etnis tertentu menunjukkan tingkat kelahiran kem…
Results
Risiko yang dihadapi bayi kembar sangat jelas. Dibandingkan dengan bayi tunggal, bayi kembar memiliki peluang 17,2 kali lebih tinggi untuk berat badan lahir rendah (95% CI: 13,90 hingga 21,30, P<0,00…
In the bustling urban health facilities of The Gambia, a quiet but devastating challenge to newborn survival has been unfolding. Congenital malformations—structural or functional anomalies present at birth—remain a significant contributor …
Method
Di antara 6.750 neonatus yang diperiksa, 140 (2,1%) memiliki setidaknya satu malformasi kongenital. Meskipun prevalensi ini tampak relatif rendah dibandingkan estimasi global, pen…
Results
Studi ini mengidentifikasi riwayat keguguran sebelumnya sebagai faktor risiko signifikan untuk malformasi kongenital. Perempuan yang pernah mengalami keguguran sebelumnya memiliki odds 1,72 kali lebi…
NovaFabric records autonomous AI agent runs into a portable, tamper-evident Run Capsule sealed with DSSE signatures, RFC 3161 timestamps, and Merkle logs, enabling four-mode replay and third-party verification. Evaluation across eight rese…
Method
NovaFabric membangun Run Capsule dengan menginstrumentasi proses agen melalui OpenTelemetry, menangkap span dan event tanpa mengubah logika agen. Skema kapsul terdiri dari lima be…
Results
Evaluasi NovaFabric pada delapan pertanyaan penelitian menghasilkan hasil yang beragam. Replay tiruan berhasil melayani setiap respons model dari kapsul tanpa panggilan model langsung, mencapai 10/10…
This paper presents an embedded Network Intrusion Detection System (NIDS) for DDoS detection in transport networks, developed with Ericsson. It shows that detector choice (Isolation Forest) dominates detection quality, while gRPC transport…
Method
NIDS ini dirancang untuk deteksi DDoS di jaringan transport, memanfaatkan kombinasi baseline statistik dan machine learning. Algoritma Isolation Forest dilatih pada kumpulan fitur…
Results
Evaluasi menunjukkan bahwa kualitas deteksi terutama ditentukan oleh pilihan detektor, bukan arsitektur transport. Isolation Forest secara signifikan meningkatkan recall dan skor F1 dibandingkan base…