Makalah ini mendokumentasikan komponen arsitektur utama coding agent, tanggung jawab, interaksi, dan alur eksekusinya. Makalah ini memperkenalkan Ark, coding agent open-source minimal, dan ArkBench, benchmark ringan berisi sepuluh tugas pe…
Metode
Studi ini mengikuti desain eksploratif yang bertujuan menghasilkan deskripsi arsitektur coding agent yang sistematis. Penulis terlebih dahulu mengidentifikasi mekanisme arsitektur…
Hasil
Menggunakan gpt-5.4-mini, Ark berhasil menyelesaikan 8 dari 10 tugas di ArkBench dengan konsumsi token yang moderat. Benchmark ini terdiri dari sepuluh tugas pemeliharaan dan evolusi perangkat lunak …
README agentic coding seperti CLAUDE.md tumbuh tanpa batas, lebih dari tiga kali lipat sepanjang masa pakainya, karena menghapus instruksi yang rationale-nya telah hilang berisiko menimbulkan regresi kebenaran. Makalah ini menamai divergen…
Metode
Studi ini berjalan dalam tiga tahap empiris. **1. Karakterisasi observasional.** Penulis menganalisis 247.694 masa hidup instruksi di 1.867 repositori, melacak bagaimana berkas pr…
Hasil
Hasil observasional mengonfirmasi pertumbuhan tak terbatas. Di 247.694 masa hidup instruksi pada 1.867 repositori, prompt agentic lebih dari tiga kali lipat sepanjang masa pakainya, bertambah **+226%…
ACM memperkenalkan Agentic Configuration Item yang bertipe dan berversi independen, revisi dan baseline yang tidak dapat diubah, serta Configuration Graph kanonis yang menormalkan konfigurasi native heterogen melalui proyeksi semantik. Eva…
Metode
Metodologi ACM dibangun di sekitar model rujukan dan implementasi rujukan Python dengan adapter untuk **LangGraph**, **CrewAI**, dan **OpenAI Agents SDK**. Komponen metodologis in…
Hasil
Untuk konfigurasi yang dievaluasi, ketiga kerangka kerja menghasilkan **representasi ACM yang setara secara tata kelola** dan **hasil tata kelola yang dapat direproduksi** setelah proyeksi. Evaluasi …
Pedro Lopes; Paulo Borba; Paola Accioly; Guilherme Cavalcanti
Ringkasan
MergirafSemi adalah alat merge semistruktur yang agnostic bahasa yang memakai Concrete Syntax Tree ringan untuk memandu keputusan merge tanpa pemodelan struktural penuh atau implementasi spesifik bahasa. Alat ini mengurangi konflik palsu s…
Metode
MergirafSemi dirancang sebagai alat merge semistruktur yang agnostic bahasa. Alat ini memakai Concrete Syntax Tree ringan untuk mengidentifikasi batas struktural, seperti body met…
Hasil
Studi empiris menunjukkan bahwa peningkatan granularitas struktural memperbaiki resolusi konflik otomatis tetapi juga dapat menghasilkan keputusan merge yang lebih agresif, sehingga menambah jumlah k…
Arsitektur perkakas—bagaimana kapabilitas agen diorganisasi dan diekspos kepada model—secara sistematis mengubah perilaku agen pengodean, meningkatkan konsistensi hingga 4,7×, memperluas eksplorasi repositori lebih dari 11%, serta memangka…
Metode
Studi ini menggunakan desain eksperimen terkontrol pada perbaikan isu tingkat repositori. Enam arsitektur perkakas dibandingkan, masing-masing dirancang untuk mempertahankan infor…
Hasil
Eksperimen menunjukkan bahwa, bahkan ketika perkakas menyediakan kapabilitas serupa, arsitektur perkakas mengubah perilaku agen. Tiga temuan utama menonjol: 1. **Konsistensi:** Dibandingkan arsitektu…
GraphAlignCoder menyelaraskan graf implementasi dari alur kendali dan dependensi program dengan graf alur bukti formal yang diekstraksi dari pipeline Lean yang dibatasi. Metode ini meningkatkan jumlah soal terselesaikan dari 38 menjadi 50 …
Metode
GraphAlignCoder beroperasi dalam dua tahap. Pertama, ia membangun **graf implementasi** $G_{\text{impl}} = (V_{\text{impl}}, E_{\text{impl}})$ dengan simpul merepresentasikan wila…
Hasil
GraphAlignCoder secara konsisten mengungguli model dasar, SFT kode saja, dan CodeRL pada semua benchmark. Dibandingkan CodeRL, metode ini meningkatkan jumlah soal terselesaikan dari 38 menjadi 50 pad…
Cinara Gomes de Melo Carneiro; Renato de Freitas Bulcão Neto
Ringkasan
Studi ini menyelidiki apakah Large Language Model (LLM) dapat menyederhanakan Rekayasa Kebutuhan (RE) di bawah Lei Geral de Proteção de Dados (LGPD) Brasil dengan secara otomatis menghasilkan User Story dan Skenario Uji Penerimaan dari tek…
Metode
Metodologi yang diusulkan terdiri dari pipeline yang mengambil ketentuan hukum LGPD sebagai masukan dan menghasilkan artefak kebutuhan terstruktur sebagai keluaran. Proses dimulai…
Hasil
Hasil evaluasi menunjukkan kinerja tinggi dari pendekatan berbasis LLM. User Story dan Skenario Uji Penerimaan yang dihasilkan dinilai sebagian besar benar, lengkap, dan jelas oleh para ahli manusia.…
Jeremy Spence; Nicholas Assaderaghi; Jinhao Zhu; Nikil Ravi; Raluca Ada Popa; Guannan Wei; Yangruibo Ding; Zhuo Zhang
Ringkasan
SRE-Bench adalah tolok ukur reverse engineering bebas kontaminasi pertama yang dibangun dari nol oleh para ahli selama 5.000 jam, terdiri atas 19 program privat, 262 instans biner, dan 1.572 tugas bergradasi. Evaluasi terhadap lima LLM ter…
Metode
SRE-Bench dibangun dari nol oleh para ahli reverse engineering dengan upaya lebih dari 5.000 jam. Tolok ukur ini mencakup 19 program privat berskala dunia nyata, masing-masing rat…
Hasil
Evaluasi terhadap lima LLM terdepan mengungkap bahwa reverse engineering masih sebagian besar belum terpecahkan. Model terkuat, GPT-5.6-sol, mencetak 61,4% per instans dan hanya menyelesaikan 31,5% i…
Sri Saran Balaji Vellore Rajakumar; James Thompson
Ringkasan
Datastore konsensus berbasis pemimpin menghadapi trade-off perutean antara penyeimbangan beban dan pencocokan peran protokol. Klien yang sadar operasi yang menyematkan operasi tulis ke pemimpin dan menyebarkan operasi baca ke seluruh pengi…
Metode
Penulis mengusulkan klien yang sadar operasi yang menyematkan operasi tulis ke pemimpin dan mendistribusikan operasi baca ke seluruh kumpulan baca pengikut yang sehat. Klien meman…
Hasil
Dalam kondisi tunak pada klaster etcd 3-node, klien yang sadar operasi menurunkan P50 tulis sebesar 29% dan menaikkan throughput sebesar 9% dibandingkan baseline round-robin. Ketika seorang pengikut …
Alex Deaconu; Anubhav Gupta; Manaal Basha; Nicholas Haydu; Gema Rodríguez-Pérez
Ringkasan
Studi ini mengoperasionalkan delapan taktik pengaruh berbasis psikologi menjadi templat prompt yang dapat direproduksi dan mengevaluasinya pada lima LLM berbobot terbuka terkemuka menggunakan LiveCodeBench dan SWE-bench Verified. Hasilnya …
Metode
Studi ini mengikuti desain eksperimen terkontrol. Pertama, para penulis mengoperasionalkan delapan taktik pengaruh dari taksonomi Yukl & Falbe menjadi templat prompt yang dapat di…
Hasil
Hasilnya menunjukkan bahwa pembingkaian prompt tertentu yang dipicu pengaruh, khususnya yang menekankan urgensi, berkaitan dengan penurunan kebenaran dan keamanan. Pada lima LLM berbobot terbuka dan …