Agentic coding READMEs such as CLAUDE.md grow without bound, more than tripling over their lifetime, because deleting an instruction whose rationale is lost risks correctness regressions. The paper names this divergence catastrophic rememb…
Method
Studi ini berjalan dalam tiga tahap empiris. **1. Karakterisasi observasional.** Penulis menganalisis 247.694 masa hidup instruksi di 1.867 repositori, melacak bagaimana berkas pr…
Results
Hasil observasional mengonfirmasi pertumbuhan tak terbatas. Di 247.694 masa hidup instruksi pada 1.867 repositori, prompt agentic lebih dari tiga kali lipat sepanjang masa pakainya, bertambah **+226%…
ACM introduces typed, independently versioned Agentic Configuration Items, immutable revisions and baselines, and a canonical Configuration Graph that normalizes heterogeneous native configurations via semantic projection. Evaluation acros…
Method
Metodologi ACM dibangun di sekitar model rujukan dan implementasi rujukan Python dengan adapter untuk **LangGraph**, **CrewAI**, dan **OpenAI Agents SDK**. Komponen metodologis in…
Results
Untuk konfigurasi yang dievaluasi, ketiga kerangka kerja menghasilkan **representasi ACM yang setara secara tata kelola** dan **hasil tata kelola yang dapat direproduksi** setelah proyeksi. Evaluasi …
Pedro Lopes; Paulo Borba; Paola Accioly; Guilherme Cavalcanti
Summary
MergirafSemi is a language-agnostic semistructured merge tool that uses lightweight Concrete Syntax Trees to guide merging decisions without full structural modeling or language-specific implementations. It reduces spurious conflicts while…
Method
MergirafSemi dirancang sebagai alat merge semistruktur yang agnostic bahasa. Alat ini memakai Concrete Syntax Tree ringan untuk mengidentifikasi batas struktural, seperti body met…
Results
Studi empiris menunjukkan bahwa peningkatan granularitas struktural memperbaiki resolusi konflik otomatis tetapi juga dapat menghasilkan keputusan merge yang lebih agresif, sehingga menambah jumlah k…
Tool architecture—how agent capabilities are organized and exposed to the model—systematically changes coding agent behavior, improving consistency up to 4.7×, broadening repository exploration by over 11%, and cutting steps and tokens by …
Method
Studi ini menggunakan desain eksperimen terkontrol pada perbaikan isu tingkat repositori. Enam arsitektur perkakas dibandingkan, masing-masing dirancang untuk mempertahankan infor…
Results
Eksperimen menunjukkan bahwa, bahkan ketika perkakas menyediakan kapabilitas serupa, arsitektur perkakas mengubah perilaku agen. Tiga temuan utama menonjol: 1. **Konsistensi:** Dibandingkan arsitektu…
GraphAlignCoder aligns an implementation graph of program control and dependence with a formal proof-flow graph extracted from a constrained Lean pipeline. It improves solved counts from 38 to 50 on LiveCodeBench v6 and from 16 to 23 on Bi…
Method
GraphAlignCoder beroperasi dalam dua tahap. Pertama, ia membangun **graf implementasi** $G_{\text{impl}} = (V_{\text{impl}}, E_{\text{impl}})$ dengan simpul merepresentasikan wila…
Results
GraphAlignCoder secara konsisten mengungguli model dasar, SFT kode saja, dan CodeRL pada semua benchmark. Dibandingkan CodeRL, metode ini meningkatkan jumlah soal terselesaikan dari 38 menjadi 50 pad…
Cinara Gomes de Melo Carneiro; Renato de Freitas Bulcão Neto
Summary
This study investigates whether Large Language Models (LLMs) can simplify Requirements Engineering (RE) under the Brazilian General Data Protection Law (LGPD) by automatically generating User Stories and Acceptance Test Scenarios from lega…
Method
Metodologi yang diusulkan terdiri dari pipeline yang mengambil ketentuan hukum LGPD sebagai masukan dan menghasilkan artefak kebutuhan terstruktur sebagai keluaran. Proses dimulai…
Results
Hasil evaluasi menunjukkan kinerja tinggi dari pendekatan berbasis LLM. User Story dan Skenario Uji Penerimaan yang dihasilkan dinilai sebagian besar benar, lengkap, dan jelas oleh para ahli manusia.…
Jeremy Spence; Nicholas Assaderaghi; Jinhao Zhu; Nikil Ravi; Raluca Ada Popa; Guannan Wei; Yangruibo Ding; Zhuo Zhang
Summary
SRE-Bench is the first contamination-free reverse engineering benchmark built from scratch by experts over 5,000 hours, comprising 19 private programs, 262 binary instances, and 1,572 graded tasks. Evaluation of five frontier LLMs shows RE…
Method
SRE-Bench dibangun dari nol oleh para ahli reverse engineering dengan upaya lebih dari 5.000 jam. Tolok ukur ini mencakup 19 program privat berskala dunia nyata, masing-masing rat…
Results
Evaluasi terhadap lima LLM terdepan mengungkap bahwa reverse engineering masih sebagian besar belum terpecahkan. Model terkuat, GPT-5.6-sol, mencetak 61,4% per instans dan hanya menyelesaikan 31,5% i…
Sri Saran Balaji Vellore Rajakumar; James Thompson
Summary
Leader-based consensus datastores face a routing trade-off between load balancing and protocol-role matching. An operation-aware client that pins writes to the leader and spreads reads across healthy followers lowers write P50 by 29% and, …
Method
Penulis mengusulkan klien yang sadar operasi yang menyematkan operasi tulis ke pemimpin dan mendistribusikan operasi baca ke seluruh kumpulan baca pengikut yang sehat. Klien meman…
Results
Dalam kondisi tunak pada klaster etcd 3-node, klien yang sadar operasi menurunkan P50 tulis sebesar 29% dan menaikkan throughput sebesar 9% dibandingkan baseline round-robin. Ketika seorang pengikut …
Alex Deaconu; Anubhav Gupta; Manaal Basha; Nicholas Haydu; Gema Rodríguez-Pérez
Summary
This study operationalizes eight psychology-based influence tactics into reproducible prompt templates and evaluates them across five leading open-weight LLMs using LiveCodeBench and SWE-bench Verified. Results show that certain influence-…
Method
Studi ini mengikuti desain eksperimen terkontrol. Pertama, para penulis mengoperasionalkan delapan taktik pengaruh dari taksonomi Yukl & Falbe menjadi templat prompt yang dapat di…
Results
Hasilnya menunjukkan bahwa pembingkaian prompt tertentu yang dipicu pengaruh, khususnya yang menekankan urgensi, berkaitan dengan penurunan kebenaran dan keamanan. Pada lima LLM berbobot terbuka dan …
CLIC introduces a visual analytics method that uses token-frequency analysis and interpretable decision trees to distinguish LLMs by coding behavior, with new metrics for robustness and concentration. Case studies on 10 LLMs and 22 Kaggle …
Method
CLIC merepresentasikan setiap sampel kode sebagai vektor fitur frekuensi token. Untuk pasangan LLM tertentu, CLIC melatih decision tree yang interpretable untuk memisahkan himpuna…
Results
Penulis melakukan studi kasus yang membandingkan 10 LLM pada 22 tugas ML Kaggle. Hasilnya menunjukkan bahwa CLIC dapat secara efektif membedakan LLM berdasarkan tanda tangan frekuensi token. Decision…