Jeldtoft and Yousef present an auditable, privacy-preserving computational workflow that operationalizes inductive and latent Thematic Analysis using LLM inference constrained to interpretative tasks and deterministic procedural control. E…
Method
Makalah ini menyajikan proof-of-concept untuk alur kerja dua fase yang mengoperasionalkan lima prinsip desain dengan menggabungkan inferensi LLM interpretatif dan kendali prosedur…
Results
Hasil menunjukkan bahwa alur kerja ini menghasilkan keluaran tingkat kode dengan cakupan yang secara luas sebanding dengan anotasi manusia dan justifikasi analitis yang dinilai tinggi. Dalam perbandi…
This paper proposes a base quality model for quantum software that uses McCall's factor-criterion-metric structure as its backbone, broadening classical quality factors and adding quantum-specific extensions only where needed. It defines f…
Method
Metodologinya adalah pendekatan konstruksi model yang terstruktur. Tulang punggung pengorganisasiannya adalah hierarki faktor-kriteria-metrik McCall: faktor kualitas menyatakan tu…
Results
Makalah ini melaporkan konstruksi model kualitas dasar untuk perangkat lunak kuantum. Hasilnya adalah artefak model itu sendiri: (1) himpunan faktor yang terdefinisi, (2) himpunan kriteria kualitas y…
This study reports a practical implementation of Spec-Driven Development (SDD) with AI agents in a third-year undergraduate Software Development Project-Based Learning course. It finds that while AI agents increased implementation throughp…
Method
Para penulis merancang alur kerja empat fase untuk Spec-Driven Development: investigasi, perencanaan, implementasi, dan tinjauan. Pada fase investigasi, mahasiswa mengeksplorasi k…
Results
Analisis mengungkap bahwa pola penggunaan AI bervariasi di seluruh fase pengembangan dan tim. Hal ini menunjukkan bahwa mahasiswa mengadopsi strategi berbeda untuk memanfaatkan agen AI bergantung pad…
Sebastian Watzinger; Christoph Hochrainer; Valentin Wüstholz; Maria Christakis
Summary
Liezz generates ZK DSL programs and injects adversarial witnesses by splicing two valid executions, exposing soundness bugs that valid-execution testing misses. It finds 13 bugs across Circom, Corset, Gnark, and Noir, seven with soundness …
Method
Liezz beroperasi sebagai kerangka pengujian black-box atas toolchain ZK DSL. Pipelinenya memiliki empat tahap utama: pembangkitan program, divergensi terkendali, penyambungan witn…
Results
Liezz diterapkan pada empat toolchain ZK DSL: **Circom, Corset, Gnark, dan Noir**. Evaluasi melaporkan **13 bug**, dengan **tujuh berdampak pada soundness**. Beberapa bug ini hanya dapat dijangkau me…
This paper introduces an LLM-based hardware development framework using two hierarchical intermediate representations—Architectural Sketch and Operational Specification—combined with an end-to-end multi-agent workflow. It achieves a 95.5% …
Method
Metodologi yang diusulkan berpusat pada dua representasi perantara (IR) hierarkis yang menjembatani jarak antara maksud desain tingkat tinggi dan implementasi RTL tingkat rendah. …
Results
Kerangka ini dievaluasi pada tolok ukur Verilog-Eval, sebuah dataset standar untuk menilai pembangkitan RTL berbasis LLM. Pendekatan yang diusulkan mencapai **tingkat pass@5 sebesar 95,5%**, melampau…
A systematic audit of 24 default judge configurations across eight evaluation frameworks finds that none implement commit-first judging, the one defence the literature identifies as effective against gaming. A controlled experiment shows c…
Method
Studi ini menggabungkan audit terhadap kerangka evaluasi yang ada dengan eksperimen terkontrol. Audit memeriksa konfigurasi hakim bawaan dari delapan kerangka evaluasi yang banyak…
Results
Audit menemukan bahwa tidak ada dari 24 konfigurasi yang mengimplementasikan penilaian commit-first. Sembilan mengimplementasikan varian yang diukur literatur sebagai tidak efektif, dan kesembilan in…
Ante Kapetanovic; Tomislav Duricic; Andro Mercep; Emanuel Lacic
Summary
Infobip's AI research team presents a four-phase workflow for operating LLM-based coding agents, where human effort is front-loaded and delegation increases as artifacts mature. Context management is central, addressed through four strateg…
Method
Alur kerja ini disusun ke dalam empat fase, dengan upaya manusia didahulukan dan delegasi meningkat seiring artefak menjadi matang. Pengelolaan konteks ditangani melalui empat str…
Results
Dari pengalaman praktisi, penulis mengamati bahwa kesalahan di hulu pada riset dan perencanaan dapat menumpuk di fase-fase berikutnya, sementara memperbaiki kode yang dihasilkan dapat menimbulkan pem…
sbom-unifier integrates heterogeneous SBOM tool outputs at the field level, identifying components via Package URL and complementing missing values with a deterministic priority-based strategy. Across 90 open-source projects, it raises the…
Method
sbom-unifier beroperasi sebagai pipeline multi-tahap atas sekumpulan SBOM masukan yang heterogen. Tahap intinya adalah: 1. **Identifikasi komponen melalui Package URL (PURL).** Re…
Results
Evaluasi mencakup **90 proyek open-source** dalam **9 bahasa pemrograman**, dan kelengkapan diukur atas **39 field wajib dan opsional SPDX 2.3**. Dua metrik utama dilaporkan: - **Fully covered rate:*…
A four-month longitudinal study with computer science students found that minimal interventions in chat-based LLM interactions produced no detectable harmful effects and trends of increased satisfaction with proactive follow-up suggestions.
Method
Studi ini menggunakan desain longitudinal empat bulan dengan mahasiswa ilmu komputer semester tiga yang terlibat dalam proyek pengembangan Web full-stack. Partisipan ditugaskan ke…
Results
Analisis log interaksi dan survei pengguna tidak menunjukkan perbedaan besar dalam pola interaksi di ketiga kondisi. Ini menunjukkan tidak ada efek berbahaya yang terdeteksi pada hasil yang diukur ke…
Schwarz is an agentic verification harness that makes SMT-backed proof failure local, checkable, and repairable by exposing program-point snapshots, local lemmas, and theory-aware solver policies. It solves 95.2% of 475 agentic verificatio…
Method
Schwarz dirancang sebagai harness agentik yang sadar solver yang menutup loop antara spesifikasi yang dihasilkan LLM dan hasil solver SMT. Klaim metodologis intinya adalah bahwa o…
Results
Schwarz dievaluasi pada 1.475 tugas. Hasilnya dilaporkan dalam dua kelompok utama. Pertama, pada 475 benchmark dari alat verifikasi agentik terkini, Schwarz menyelesaikan **95,2%** tugas. Kelompok in…