OpenHealth Lake is a data management prototype platform built on a data lakehouse architecture, data federation, and FAIR principles to address heterogeneous data challenges in bioinformatics and global health. A user study with participan…
Method
Proses perancangan OpenHealth Lake mengikuti pendekatan yang sistematis. Pertama, kebutuhan sistem diidentifikasi dari studi yang telah dipublikasikan sebelumnya dan dilengkapi de…
Results
Studi pengguna menunjukkan bahwa prototipe OpenHealth Lake dapat digunakan dan bermanfaat. Peserta dengan beragam latar belakang teknis mampu berinteraksi dengan platform melalui berbagai antarmuka: …
This paper provides a unified theoretical comparison of recent rotation-based quantizers (EDEN, RabitQ, TurboQuant) and introduces BlockQuant, a block-spherical quantization algorithm that improves reconstruction MSE and expected inner-pro…
Method
Makalah ini pertama-tama menetapkan kerangka teoretis terpadu untuk membandingkan EDEN, RabitQ, dan TurboQuant di bawah kriteria distorsi yang berbeda (MSE, distorsi inner-product…
Results
Makalah ini melaporkan eksperimen pada dataset embedding nyata dan tugas inferensi LLM konteks panjang. Hasilnya menunjukkan keuntungan praktis yang konsisten dengan peningkatan teoretis. Secara spes…
PerfEvolve replaces static documentation with executable skills, enabling LLM-based agents to perform version-consistency verification, workload-specific profiling, and multi-parameter joint optimization for PostgreSQL tuning, outperformin…
Method
PerfEvolve mengoperasionalkan metodologi penyetelan pakar sebagai keterampilan eksekutabel untuk agen berbasis LLM. Pendekatan ini mencakup tiga kemampuan inti: 1. **Verifikasi ko…
Results
PerfEvolve dievaluasi pada PostgreSQL menggunakan benchmark TPC-C dan TPC-H. Hasilnya menunjukkan bahwa PerfEvolve mengungguli baseline penyetelan yang digerakkan dokumentasi mutakhir hingga 35,2%. P…
A two-stage annotation of 10,000 OpenAlex abstracts finds that 12% have integrity issues, primarily insufficient content and misplaced metadata. The authors propose a community portal to improve data quality for computational metascience.
Method
Para penulis menerapkan protokol anotasi dua tahap yang menggabungkan tinjauan pakar manusia dan klasifikasi large language model (LLM). Pertama, sampel acak 10.000 abstrak jurnal…
Results
Analisis mengungkapkan bahwa 12% dari abstrak sampel bermasalah integritas. Mode kegagalan yang paling lazim adalah konten yang tidak memadai dan metadata yang salah tempat. Konten yang tidak memadai…
Philip A. Bernstein recounts the early history of transaction research, explains its enduring relevance, and speculates on its future. This extended version of a SIGMOD-Companion '25 paper reflects on five decades of progress.
Method
Makalah ini memakai metodologi historis dan reflektif, dengan bersandar pada pengalaman Bernstein sendiri dan literatur yang lebih luas. Ini bukan studi eksperimental tradisional,…
Results
Analisis historis mengungkap beberapa temuan kunci. Penelitian transaksi awal, termasuk karya Bernstein sendiri, meletakkan dasar bagi properti ACID dan two-phase locking. Konsep-konsep ini dengan ce…
D-Shap reformulates Shapley-based data valuation as a structured matrix maintenance problem, enabling millisecond task updates and up to three orders of magnitude reduction in player update costs while maintaining competitive valuation qua…
Method
Metodologi inti D-Shap berpusat pada pemeliharaan matriks pemain-demi-tugas $\mathbf{S} \in \mathbb{R}^{n \times m}$, dengan $n$ adalah jumlah pemain pelatihan dan $m$ adalah juml…
Results
Eksperimen pada berbagai model menunjukkan efisiensi dan efektivitas D-Shap. Untuk pembaruan tugas, D-Shap melakukan pembaruan dalam hitungan milidetik, sedangkan komputasi ulang penuh memerlukan wak…
This paper introduces inexistence and anti-existence constraints as duals to existence and non-existence constraints in the (Elementary) Mathematical Data Model. It provides formal definitions, proves constant and linear complexity for man…
Method
Metodologi penelitian mengikuti pendekatan formal. Pertama, penulis memperluas EMDM dengan mendefinisikan constraint inexistence dan anti-existence beserta empat subtipe-nya. Cons…
Results
Makalah ini mendefinisikan secara formal dua tipe constraint baru: inexistence dan anti-existence, masing-masing dengan dua subtipe, sehingga menghasilkan empat subtipe baru. Bersama dengan tiga subt…
Virginia K. Hench; J. Harry Caufield; Sierra A. T. Moxon; Jason M. O'Brien; Stephen W. Edwards
Summary
AOP-Wiki EMOD 3.0 presents data model expansions and a content evaluation framework that leverage agentic AI to improve AOP-Wiki internal quality, evidence structuring, and integration between Adverse Outcome Pathways and New Approach Meth…
Method
Penulis mengembangkan AOP-Wiki EMOD 3.0 sebagai prototipe model bukti yang memperluas model data AOP-Wiki yang ada. Metodologi berpusat pada tiga pilar yang saling terkait: (1) pe…
Results
Hasil utama adalah prototipe AOP-Wiki EMOD 3.0 itu sendiri, yang menunjukkan perluasan model data yang layak dan visi untuk AOP-Wiki yang ditransformasi. Penulis melaporkan bahwa prototipe ini secara…
DivSkill-SQL is a residual skill optimization framework that constructs complementary agentic Text-to-SQL ensembles by iteratively optimizing each new skill on examples the current ensemble fails on, provably targeting marginal contributio…
Method
DivSkill-SQL beroperasi sebagai loop optimasi keterampilan residual yang iteratif. Misalkan ansambel saat ini adalah $\mathcal{E}_t = \{s_1, s_2, \ldots, s_t\}$, dengan setiap $s_…
Results
Pada Spider2-Lite, DivSkill-SQL meningkatkan akurasi terpilih hingga **+11,1 poin pada Snowflake** dan **+8,3 poin pada BigQuery** dibandingkan baseline ansambel terkuat. Peningkatan ini konsisten pa…
This paper empirically evaluates Polars, an Arrow-native DataFrame engine, inside Intel SGX2 enclaves via Gramine on TPC-H SF30 with Azure Blob Storage. It finds that end-to-end overhead remains nearly constant at 1.49–1.56× across dataset…
Method
Pengaturan eksperimen menjalankan Polars di dalam enclave Intel SGX2 menggunakan Gramine, sebuah library OS untuk aplikasi Linux yang tidak dimodifikasi. Beban kerjanya adalah TPC…
Results
Di empat konfigurasi lebar dataset (sekitar 22–73 GB), overhead end-to-end tetap hampir konstan pada 1,49–1,56×. Namun, metrik komposit ini menyembunyikan dua perilaku yang berbeda: overhead khusus k…