Jeldtoft dan Yousef menyajikan alur kerja komputasional yang dapat diaudit dan menjaga privasi yang mengoperasionalkan Analisis Tematik induktif dan laten menggunakan inferensi LLM yang dibatasi pada tugas interpretatif dan kendali prosedu…
Metode
Makalah ini menyajikan proof-of-concept untuk alur kerja dua fase yang mengoperasionalkan lima prinsip desain dengan menggabungkan inferensi LLM interpretatif dan kendali prosedur…
Hasil
Hasil menunjukkan bahwa alur kerja ini menghasilkan keluaran tingkat kode dengan cakupan yang secara luas sebanding dengan anotasi manusia dan justifikasi analitis yang dinilai tinggi. Dalam perbandi…
Makalah ini mengusulkan model kualitas dasar untuk perangkat lunak kuantum yang memakai struktur faktor-kriteria-metrik McCall sebagai tulang punggungnya, memperluas faktor kualitas klasik dan menambahkan ekstensi khusus kuantum hanya bila…
Metode
Metodologinya adalah pendekatan konstruksi model yang terstruktur. Tulang punggung pengorganisasiannya adalah hierarki faktor-kriteria-metrik McCall: faktor kualitas menyatakan tu…
Hasil
Makalah ini melaporkan konstruksi model kualitas dasar untuk perangkat lunak kuantum. Hasilnya adalah artefak model itu sendiri: (1) himpunan faktor yang terdefinisi, (2) himpunan kriteria kualitas y…
Studi ini melaporkan implementasi praktis Spec-Driven Development (SDD) dengan agen AI dalam mata kuliah Software Development Project-Based Learning tahun ketiga sarjana. Studi ini menemukan bahwa meskipun agen AI meningkatkan throughput i…
Metode
Para penulis merancang alur kerja empat fase untuk Spec-Driven Development: investigasi, perencanaan, implementasi, dan tinjauan. Pada fase investigasi, mahasiswa mengeksplorasi k…
Hasil
Analisis mengungkap bahwa pola penggunaan AI bervariasi di seluruh fase pengembangan dan tim. Hal ini menunjukkan bahwa mahasiswa mengadopsi strategi berbeda untuk memanfaatkan agen AI bergantung pad…
Sebastian Watzinger; Christoph Hochrainer; Valentin Wüstholz; Maria Christakis
Ringkasan
Liezz menghasilkan program ZK DSL dan menyuntikkan witness adversarial dengan menyambung dua eksekusi valid, sehingga mengungkap bug soundness yang luput dari pengujian eksekusi valid. Liezz menemukan 13 bug di Circom, Corset, Gnark, dan N…
Metode
Liezz beroperasi sebagai kerangka pengujian black-box atas toolchain ZK DSL. Pipelinenya memiliki empat tahap utama: pembangkitan program, divergensi terkendali, penyambungan witn…
Hasil
Liezz diterapkan pada empat toolchain ZK DSL: **Circom, Corset, Gnark, dan Noir**. Evaluasi melaporkan **13 bug**, dengan **tujuh berdampak pada soundness**. Beberapa bug ini hanya dapat dijangkau me…
Makalah ini memperkenalkan kerangka kerja pengembangan perangkat keras berbasis LLM yang memakai dua representasi perantara hierarkis—Architectural Sketch dan Operational Specification—yang dipadukan dengan alur kerja multi-agen end-to-end…
Metode
Metodologi yang diusulkan berpusat pada dua representasi perantara (IR) hierarkis yang menjembatani jarak antara maksud desain tingkat tinggi dan implementasi RTL tingkat rendah. …
Hasil
Kerangka ini dievaluasi pada tolok ukur Verilog-Eval, sebuah dataset standar untuk menilai pembangkitan RTL berbasis LLM. Pendekatan yang diusulkan mencapai **tingkat pass@5 sebesar 95,5%**, melampau…
Audit sistematis terhadap 24 konfigurasi hakim bawaan di delapan kerangka evaluasi menemukan bahwa tidak ada yang mengimplementasikan penilaian commit-first, satu-satunya pertahanan yang diidentifikasi literatur sebagai efektif melawan gam…
Metode
Studi ini menggabungkan audit terhadap kerangka evaluasi yang ada dengan eksperimen terkontrol. Audit memeriksa konfigurasi hakim bawaan dari delapan kerangka evaluasi yang banyak…
Hasil
Audit menemukan bahwa tidak ada dari 24 konfigurasi yang mengimplementasikan penilaian commit-first. Sembilan mengimplementasikan varian yang diukur literatur sebagai tidak efektif, dan kesembilan in…
Ante Kapetanovic; Tomislav Duricic; Andro Mercep; Emanuel Lacic
Ringkasan
Tim riset AI Infobip menyajikan alur kerja empat fase untuk mengoperasikan agen coding berbasis LLM, di mana upaya manusia didahulukan dan delegasi meningkat seiring artefak menjadi matang. Pengelolaan konteks menjadi inti, ditangani melal…
Metode
Alur kerja ini disusun ke dalam empat fase, dengan upaya manusia didahulukan dan delegasi meningkat seiring artefak menjadi matang. Pengelolaan konteks ditangani melalui empat str…
Hasil
Dari pengalaman praktisi, penulis mengamati bahwa kesalahan di hulu pada riset dan perencanaan dapat menumpuk di fase-fase berikutnya, sementara memperbaiki kode yang dihasilkan dapat menimbulkan pem…
sbom-unifier mengintegrasikan keluaran berbagai tool SBOM yang heterogen pada tingkat field, mengidentifikasi komponen melalui Package URL dan melengkapi nilai yang hilang dengan strategi deterministik berbasis prioritas. Pada 90 proyek op…
Metode
sbom-unifier beroperasi sebagai pipeline multi-tahap atas sekumpulan SBOM masukan yang heterogen. Tahap intinya adalah: 1. **Identifikasi komponen melalui Package URL (PURL).** Re…
Hasil
Evaluasi mencakup **90 proyek open-source** dalam **9 bahasa pemrograman**, dan kelengkapan diukur atas **39 field wajib dan opsional SPDX 2.3**. Dua metrik utama dilaporkan: - **Fully covered rate:*…
Studi longitudinal empat bulan dengan mahasiswa ilmu komputer menemukan bahwa intervensi minimal dalam interaksi LLM berbasis chat tidak menghasilkan efek berbahaya yang terdeteksi dan menunjukkan tren peningkatan kepuasan terhadap saran t…
Metode
Studi ini menggunakan desain longitudinal empat bulan dengan mahasiswa ilmu komputer semester tiga yang terlibat dalam proyek pengembangan Web full-stack. Partisipan ditugaskan ke…
Hasil
Analisis log interaksi dan survei pengguna tidak menunjukkan perbedaan besar dalam pola interaksi di ketiga kondisi. Ini menunjukkan tidak ada efek berbahaya yang terdeteksi pada hasil yang diukur ke…
Schwarz adalah harness verifikasi agentik yang membuat kegagalan bukti berbasis SMT menjadi lokal, dapat diperiksa, dan dapat diperbaiki dengan mengekspos snapshot titik program, lemma lokal, dan kebijakan solver yang sadar teori. Schwarz …
Metode
Schwarz dirancang sebagai harness agentik yang sadar solver yang menutup loop antara spesifikasi yang dihasilkan LLM dan hasil solver SMT. Klaim metodologis intinya adalah bahwa o…
Hasil
Schwarz dievaluasi pada 1.475 tugas. Hasilnya dilaporkan dalam dua kelompok utama. Pertama, pada 475 benchmark dari alat verifikasi agentik terkini, Schwarz menyelesaikan **95,2%** tugas. Kelompok in…