This study reports a practical implementation of Spec-Driven Development (SDD) with AI agents in a third-year undergraduate Software Development Project-Based Learning course. It finds that while AI agents increased implementation throughp…
Method
Para penulis merancang alur kerja empat fase untuk Spec-Driven Development: investigasi, perencanaan, implementasi, dan tinjauan. Pada fase investigasi, mahasiswa mengeksplorasi k…
Results
Analisis mengungkap bahwa pola penggunaan AI bervariasi di seluruh fase pengembangan dan tim. Hal ini menunjukkan bahwa mahasiswa mengadopsi strategi berbeda untuk memanfaatkan agen AI bergantung pad…
Sebastian Watzinger; Christoph Hochrainer; Valentin Wüstholz; Maria Christakis
Summary
Liezz generates ZK DSL programs and injects adversarial witnesses by splicing two valid executions, exposing soundness bugs that valid-execution testing misses. It finds 13 bugs across Circom, Corset, Gnark, and Noir, seven with soundness …
Method
Liezz beroperasi sebagai kerangka pengujian black-box atas toolchain ZK DSL. Pipelinenya memiliki empat tahap utama: pembangkitan program, divergensi terkendali, penyambungan witn…
Results
Liezz diterapkan pada empat toolchain ZK DSL: **Circom, Corset, Gnark, dan Noir**. Evaluasi melaporkan **13 bug**, dengan **tujuh berdampak pada soundness**. Beberapa bug ini hanya dapat dijangkau me…
This paper introduces an LLM-based hardware development framework using two hierarchical intermediate representations—Architectural Sketch and Operational Specification—combined with an end-to-end multi-agent workflow. It achieves a 95.5% …
Method
Metodologi yang diusulkan berpusat pada dua representasi perantara (IR) hierarkis yang menjembatani jarak antara maksud desain tingkat tinggi dan implementasi RTL tingkat rendah. …
Results
Kerangka ini dievaluasi pada tolok ukur Verilog-Eval, sebuah dataset standar untuk menilai pembangkitan RTL berbasis LLM. Pendekatan yang diusulkan mencapai **tingkat pass@5 sebesar 95,5%**, melampau…
A systematic audit of 24 default judge configurations across eight evaluation frameworks finds that none implement commit-first judging, the one defence the literature identifies as effective against gaming. A controlled experiment shows c…
Method
Studi ini menggabungkan audit terhadap kerangka evaluasi yang ada dengan eksperimen terkontrol. Audit memeriksa konfigurasi hakim bawaan dari delapan kerangka evaluasi yang banyak…
Results
Audit menemukan bahwa tidak ada dari 24 konfigurasi yang mengimplementasikan penilaian commit-first. Sembilan mengimplementasikan varian yang diukur literatur sebagai tidak efektif, dan kesembilan in…
Ante Kapetanovic; Tomislav Duricic; Andro Mercep; Emanuel Lacic
Summary
Infobip's AI research team presents a four-phase workflow for operating LLM-based coding agents, where human effort is front-loaded and delegation increases as artifacts mature. Context management is central, addressed through four strateg…
Method
Alur kerja ini disusun ke dalam empat fase, dengan upaya manusia didahulukan dan delegasi meningkat seiring artefak menjadi matang. Pengelolaan konteks ditangani melalui empat str…
Results
Dari pengalaman praktisi, penulis mengamati bahwa kesalahan di hulu pada riset dan perencanaan dapat menumpuk di fase-fase berikutnya, sementara memperbaiki kode yang dihasilkan dapat menimbulkan pem…
sbom-unifier integrates heterogeneous SBOM tool outputs at the field level, identifying components via Package URL and complementing missing values with a deterministic priority-based strategy. Across 90 open-source projects, it raises the…
Method
sbom-unifier beroperasi sebagai pipeline multi-tahap atas sekumpulan SBOM masukan yang heterogen. Tahap intinya adalah: 1. **Identifikasi komponen melalui Package URL (PURL).** Re…
Results
Evaluasi mencakup **90 proyek open-source** dalam **9 bahasa pemrograman**, dan kelengkapan diukur atas **39 field wajib dan opsional SPDX 2.3**. Dua metrik utama dilaporkan: - **Fully covered rate:*…
A four-month longitudinal study with computer science students found that minimal interventions in chat-based LLM interactions produced no detectable harmful effects and trends of increased satisfaction with proactive follow-up suggestions.
Method
Studi ini menggunakan desain longitudinal empat bulan dengan mahasiswa ilmu komputer semester tiga yang terlibat dalam proyek pengembangan Web full-stack. Partisipan ditugaskan ke…
Results
Analisis log interaksi dan survei pengguna tidak menunjukkan perbedaan besar dalam pola interaksi di ketiga kondisi. Ini menunjukkan tidak ada efek berbahaya yang terdeteksi pada hasil yang diukur ke…
Schwarz is an agentic verification harness that makes SMT-backed proof failure local, checkable, and repairable by exposing program-point snapshots, local lemmas, and theory-aware solver policies. It solves 95.2% of 475 agentic verificatio…
Method
Schwarz dirancang sebagai harness agentik yang sadar solver yang menutup loop antara spesifikasi yang dihasilkan LLM dan hasil solver SMT. Klaim metodologis intinya adalah bahwa o…
Results
Schwarz dievaluasi pada 1.475 tugas. Hasilnya dilaporkan dalam dua kelompok utama. Pertama, pada 475 benchmark dari alat verifikasi agentik terkini, Schwarz menyelesaikan **95,2%** tugas. Kelompok in…
Sofia Vieira Pinto; Álvaro F. Silva; João Pascoal Faria; Alexandra Mendes
Summary
DSpec2Test automatically derives tests from Dafny specifications using DNF equivalence class partitioning and optional Boundary Value Analysis, achieving a 93.9% mutation kill rate versus 82.4% for Dafny's Block mode.
Method
DSpec2Test beroperasi sebagai pembuat tes blackbox: ia mengambil spesifikasi Dafny (prasyarat, pascasyarat, dan invarian) dan mengabaikan badan implementasi. Algoritma inti mempar…
Results
Evaluasi membandingkan DSpec2Test dengan mode Block berbasis implementasi Dafny yang ada pada dataset 131 mutan yang dihasilkan dari program DafnyBench menggunakan MutDafny. Metrik utamanya adalah ti…
ProofPulse is a tool for Dafny that diagnoses specification quality using a three-valued proof coverage model, distinguishing specification intent, auxiliary checks, and irrelevant elements. Evaluated on 252 programs, it provides a high-pr…
Method
ProofPulse memperkenalkan model cakupan pembuktian tiga nilai untuk mengklasifikasikan elemen spesifikasi berdasarkan perannya dalam kewajiban pembuktian. Model ini menganalisis d…
Results
ProofPulse dievaluasi terhadap oracle 252 program dari benchmark dafny-synthesis. Hasilnya menunjukkan bahwa ProofPulse memberikan sinyal presisi tinggi untuk kelemahan spesifikasi, khususnya prasyar…