Sofia Vieira Pinto; Álvaro F. Silva; João Pascoal Faria; Alexandra Mendes
Summary
DSpec2Test automatically derives tests from Dafny specifications using DNF equivalence class partitioning and optional Boundary Value Analysis, achieving a 93.9% mutation kill rate versus 82.4% for Dafny's Block mode.
Method
DSpec2Test beroperasi sebagai pembuat tes blackbox: ia mengambil spesifikasi Dafny (prasyarat, pascasyarat, dan invarian) dan mengabaikan badan implementasi. Algoritma inti mempar…
Results
Evaluasi membandingkan DSpec2Test dengan mode Block berbasis implementasi Dafny yang ada pada dataset 131 mutan yang dihasilkan dari program DafnyBench menggunakan MutDafny. Metrik utamanya adalah ti…
ProofPulse is a tool for Dafny that diagnoses specification quality using a three-valued proof coverage model, distinguishing specification intent, auxiliary checks, and irrelevant elements. Evaluated on 252 programs, it provides a high-pr…
Method
ProofPulse memperkenalkan model cakupan pembuktian tiga nilai untuk mengklasifikasikan elemen spesifikasi berdasarkan perannya dalam kewajiban pembuktian. Model ini menganalisis d…
Results
ProofPulse dievaluasi terhadap oracle 252 program dari benchmark dafny-synthesis. Hasilnya menunjukkan bahwa ProofPulse memberikan sinyal presisi tinggi untuk kelemahan spesifikasi, khususnya prasyar…
Suppression of false positives in detection rules accumulates as a one-way ratchet: exclusions are added far more often than withdrawn, persist for years, and are not triaged by consequence. The authors measure this semantically across nin…
Method
Studi ini menganalisis korpus SigmaHQ selama sembilan tahun, mencakup 8.234 revisi. Penekanan dideteksi secara semantik, bukan struktural. Secara formal, misalkan revisi aturan di…
Results
Hasil empirisnya mencolok. Di seluruh korpus, pengecualian ditambahkan 1.642 kali dan ditarik 304 kali, menghasilkan rasio keseluruhan 5,4 banding 1. Pada tingkat aturan individual, rasio naik menjad…
AutoSciRub induces a task-specific executable rubric before research execution, using it to guide experiments, criterion-level verification, and iterative revision. It improves performance across ResearchClawBench and AstaBench E2E Discove…
Method
AutoSciRub beroperasi dalam tiga tahap utama: 1. **Induksi Rubrik**: Kerangka kerja ini menguraikan instruksi yang kurang spesifik menjadi tujuan ilmiah atomik, mendasarkannya pad…
Results
Penulis mengevaluasi AutoSciRub pada dua tolok ukur: **ResearchClawBench** dan **AstaBench E2E Discovery**. - Pada ResearchClawBench, AutoSciRub secara konsisten meningkatkan semua konfigurasi yang d…
Gopi Krishnan Rajbahadur; Amir M. Ebrahimi; Boyuan Chen; Ahmed E. Hassan
Summary
Industrial post-training inherits a deployed checkpoint and must land targeted gains under fixed compute and mixture budgets without regressing the rest. The authors argue the maintained artifact is dataware, and that progress depends on a…
Method
Studi ini adalah studi kasus industri tentang upaya peningkatan pembuatan kode. Unit intervensinya adalah **mixture patch terbatas** yang diterapkan pada checkpoint yang diwarisi,…
Results
Patch yang direkayasa yield menghasilkan keuntungan terukur dan signifikan secara statistik dari satu checkpoint tetap per kondisi, di seluruh 16 evaluasi stokastik setiap benchmark. | Benchmark | Me…
Yisen Xi proposes a four-stage forensic audit protocol that reconstructs launch-time configuration, fingerprints platform catalogs, tests tokenizer identity via a cross-length differential, and corroborates with behavioral probes. Validate…
Method
## Protokol Audit Forensik Empat Tahap ### Tahap 0 — Rekonstruksi Konfigurasi Saat Peluncuran Tahap 0 merekonstruksi konfigurasi saat peluncuran dari **snapshot platform yang diar…
Results
## Konsistensi Deklarasi dan Validasi Prospektif ### Hasil Himpunan Uji (10 Rilis Beridentitas Diketahui) | Hasil | Jumlah | |---|---| | Persis | 7 | | Perbedaan presisi | 2 | | Parsial | 1 | | Berla…
LLM-authored diffs and full-file rewrites are unsafe for unattended GitOps remediation, with tolerant patching silently misapplying 14-20% of edits. A deterministic pipeline that applies LLM-proposed field-change intents via YAML node posi…
Method
Evaluasi membandingkan dua strategi generasi teks yang digerakkan LLM dengan pipeline deterministik yang diusulkan. Pertama, diff terpadu diuji dengan patching ketat dan patching …
Results
Diff terpadu tidak aman untuk otomasi tanpa pengawasan. Di bawah patching ketat, hampir tidak ada yang diterapkan, tetapi ini adalah artefak dari kekakuan. Alat toleran seperti GNU patch menerapkan 9…
Daniel Bund; Julian Erhard; Michael Petter; Michael Schwarz
Summary
This paper extends a static data race detection framework to handle thread barriers and pthread_once, and instantiates it with an abstraction of locksets held by ancestor threads. A suite of litmus tests reveals that state-of-the-art tools…
Method
Penulis membangun di atas kerangka digest, yang melacak abstraksi riwayat eksekusi thread untuk meningkatkan presisi deteksi race. Mereka memperkenalkan dua perluasan utama: 1. **…
Results
Evaluasi berfokus pada dua aspek: (1) kemampuan kerangka digest yang diperluas untuk menangani barrier dan `pthread_once`, dan (2) perbandingan dengan detektor race statis mutakhir yang ada. Penulis …
This digest summarizes an interview with Ciera Jaspan and Collin Green from Google's Developer Intelligence team, exploring how empirical software engineering (ESE) is implemented in industry, including research methods, decision-making, a…
Method
Digest ini didasarkan pada wawancara semi-terstruktur dengan dua praktisi industri. Format wawancara memungkinkan eksplorasi mendalam tentang praktik ESE di Google. Penulis menyun…
Results
Wawancara mengungkap bahwa tim Developer Intelligence Google menerapkan berbagai metode ESE untuk mempelajari produktivitas developer dan proses rekayasa perangkat lunak. Temuan utama meliputi: - **M…
Jessica Diaz; Joaquin Gayoso; Andrea Cimminio; Jorge Perez
Summary
This paper establishes Spec-Driven Development (SDD) as the enabling discipline for Agentic Software Engineering at team scale, introducing a socio-technical model, a dual harness characterization, and five human-agent interaction patterns…
Method
Studi ini melakukan **analisis konseptual** yang terutama bersumber dari gray literature—makalah visi dan peta jalan ASE, laporan praktisi, ceramah, dan perkakas—karena bukti peer…
Results
Makalah ini menyajikan tiga hasil utama: **(i) Model sosio-teknis SDD.** Spesifikasi dinaikkan dari artefak dokumentasi menjadi *kontrak yang dapat dieksekusi* yang mengikat niat manusia pada perilak…