Code-level autonomous research loops (ARLs) can exhibit algorithmic mode collapse, where surface-level edit diversity remains stable but semantic diversity collapses, causing in-loop metric gains to diverge from held-out performance. Diver…
Method
Penulis melakukan diagnosis sistematis atas keruntuhan mode algoritmik pada ARL tingkat kode. Mereka merancang eksperimen pada berbagai pengaturan ketika agen LLM secara iteratif …
Results
Penulis melaporkan bahwa pada berbagai pengaturan eksperimen, keruntuhan mode algoritmik merupakan mode kegagalan yang kokoh. Keragaman suntingan pada tingkat permukaan tetap stabil, tetapi keragaman…
Bridge mines candidate update instances from client dependency update commits at scale, validates them with library-side evidence, and derives API update mappings grounded in real client updates. Applied to WoC V3, it yields 381,661 Java a…
Method
Bridge beroperasi sebagai pipeline yang digerakkan klien dengan tiga tahap utama: menambang kandidat instans pembaruan, memvalidasinya menggunakan bukti dari sisi pustaka, dan men…
Results
Bridge dievaluasi pada dataset ground truth yang dianotasi secara manual dan diterapkan pada WoC V3. Pada ground truth, Bridge mencapai **presisi 91,6%** dan **recall 88,7%** untuk Java, serta **pres…
NAFLD affects over 30% of adults globally and is now recognized as a multisystem disease. This review critically evaluates advances in epidemiology, diagnosis, treatment, and the shift toward MAFLD terminology.
Method
Pencarian literatur komprehensif dilakukan di basis data PubMed, Scopus, dan Web of Science, mencakup studi yang diterbitkan antara [rentang tanggal tidak ditentukan dalam sumber]…
Results
Prevalensi global NAFLD telah meningkat di berbagai populasi, termasuk kelompok pediatrik, lansia, kurus, dan kurang beruntung secara sosial ekonomi. Terminologi MAFLD telah mendapat perhatian karena…
This narrative review synthesizes current evidence on dengue vaccines, highlighting the strengths and limitations of CYD-TDV, TAK-003, and Butantan-DV, and underscores the need for integrated, risk-stratified vaccination strategies in a ch…
Method
Para penulis melakukan tinjauan naratif terhadap PubMed/MEDLINE, Google Scholar, ClinicalTrials.gov, serta sumber kesehatan publik dan regulasi yang relevan. Bukti tentang epidemi…
Results
CYD-TDV adalah vaksin dengue pertama yang berlisensi, tetapi penggunaannya terbatas pada individu dengan infeksi sebelumnya yang terdokumentasi karena penerima seronegatif mungkin mengalami peningkat…
TSExplorer is a cross-platform tool for interactive annotation and exploration of time-series data, enabling users to inspect high-dimensional datasets through multiple complementary 2D visualizations derived from high-dimensional feature …
Method
TSExplorer bekerja dengan memproyeksikan representasi fitur deret waktu berdimensi tinggi ke dalam beberapa visualisasi 2D komplementer. Proyeksi ini memungkinkan pengguna memerik…
Results
Abstrak melaporkan bahwa TSExplorer memungkinkan pengguna memeriksa dataset berdimensi tinggi melalui beberapa visualisasi 2D komplementer yang diturunkan dari representasi fitur berdimensi tinggi. A…
Max Weber; Alina Mailach; Florian Sattler; Sven Apel; Norbert Siegmund
Summary
A survey of 134 software developers finds that energy consumption is explicitly considered in only a minority of projects, with developers instead optimizing proxy properties like execution time and CPU utilization. The study identifies or…
Method
Para penulis melakukan survei daring terhadap 134 pengembang perangkat lunak. Studi ini menggabungkan analisis kuantitatif dengan pengurutan kartu terbuka kualitatif atas jawaban …
Results
Konsumsi energi secara eksplisit dipertimbangkan hanya pada sebagian kecil proyek. Lebih umum, pengembang memengaruhi penggunaan energi secara tidak langsung dengan mengoptimalkan properti proksi sep…
Jiajun Wu; Jian Yang; Yaxin Du; Wei Zhang; Haowen Wang; Junhang Cheng; Yuxuan Zhang; Tuney Zheng; Xianglong Liu; Ming Z…
Summary
WebWorld replaces VLM self-judgment with browser-backed acceptance certificates, letting a planner compile critiques into typed interaction contracts and export only certified transitions for supervised fine-tuning. Under matched training,…
Method
WebWorld beroperasi sebagai loop tertutup antara prior VLM, planner, dan browser-sebagai-world-model. Setiap putaran, VLM mengeluarkan kritik terhadap artefak kandidat saat ini. P…
Results
Dengan pelatihan yang setara, WebWorld-27B meningkatkan Raw-27B sebesar 5,3 poin pada HTMLBench-400 dan 14,9 poin pada MiniAppBench-Val. Sistem yang dihasilkan mencapai tingkat sistem terdepan yang k…
Bin Hong; Zhenchao Zhang; Jiyuan He; Kai Zhang; Zhenya Huang
Summary
This paper introduces Code-driven Agentic Testing (CAT), a paradigm where agents write Playwright code to autonomously explore web applications and uncover bugs. The authors instantiate CAT with CATJudge, an agentic framework, and CATTest,…
Method
Paradigma CAT diinstansiasi melalui dua komponen utama: CATJudge dan CATTest. CATJudge adalah kerangka kerja agentic yang memungkinkan agen menulis kode Playwright untuk berintera…
Results
Penulis mengevaluasi beberapa VLM arus utama pada tolok ukur CATTest menggunakan kerangka kerja CATJudge. Hasilnya menunjukkan bahwa semua model yang dievaluasi berkinerja buruk, dengan tingkat penem…
Jeldtoft and Yousef present an auditable, privacy-preserving computational workflow that operationalizes inductive and latent Thematic Analysis using LLM inference constrained to interpretative tasks and deterministic procedural control. E…
Method
Makalah ini menyajikan proof-of-concept untuk alur kerja dua fase yang mengoperasionalkan lima prinsip desain dengan menggabungkan inferensi LLM interpretatif dan kendali prosedur…
Results
Hasil menunjukkan bahwa alur kerja ini menghasilkan keluaran tingkat kode dengan cakupan yang secara luas sebanding dengan anotasi manusia dan justifikasi analitis yang dinilai tinggi. Dalam perbandi…
This paper proposes a base quality model for quantum software that uses McCall's factor-criterion-metric structure as its backbone, broadening classical quality factors and adding quantum-specific extensions only where needed. It defines f…
Method
Metodologinya adalah pendekatan konstruksi model yang terstruktur. Tulang punggung pengorganisasiannya adalah hierarki faktor-kriteria-metrik McCall: faktor kualitas menyatakan tu…
Results
Makalah ini melaporkan konstruksi model kualitas dasar untuk perangkat lunak kuantum. Hasilnya adalah artefak model itu sendiri: (1) himpunan faktor yang terdefinisi, (2) himpunan kriteria kualitas y…