Zhongshuai Zhang; Xiaochun Yang; Baihua Zheng; Rui Zhu; Haomin Li; Bin Wang
Ringkasan
Makalah ini memperkenalkan pendekatan berbasis partisi untuk mengidentifikasi interval jumlah maksimal top-$k$ secara berkelanjutan pada data streaming menggunakan jendela geser. Metode ini menjamin bahwa setiap interval jumlah maksimal be…
Metode
Wawasan inti dari pendekatan yang diusulkan adalah skema partisi yang menjamin bahwa setiap interval jumlah maksimal sepenuhnya berada dalam satu partisi, sehingga memungkinkan pe…
Hasil
Eksperimen ekstensif pada dataset nyata dan sintetis menunjukkan bahwa pendekatan yang diusulkan secara signifikan meningkatkan efisiensi. Strategi berbasis partisi mengungguli algoritma yang ada, te…
Hedi Chehaidar; Mihail Stoian; Moritz Stargalla; Andreas Kipf
Ringkasan
OptFSST menggantikan pengodean greedy FSST dengan pengodean pemrograman dinamis yang optimal dan menambahkan penghitungan frekuensi serta heuristik pemangkasan pada konstruksi tabel simbol, meningkatkan faktor kompresi hingga 47,7% (FSST) …
Metode
OptFSST membuat dua kontribusi inti. **1. Pengodean optimal melalui pemrograman dinamis.** Dengan tabel simbol yang tetap, FSST mengodekan setiap string secara greedy, selalu meng…
Hasil
Evaluasi mencakup **92 dataset string dunia nyata**. Angka utamanya adalah: - OptFSST meningkatkan faktor kompresi FSST hingga **47,7%**, dengan **peningkatan rata-rata 7,3%**. - OptFSST12 meningkatk…
Marlena Flüh; Soo-Yon Kim; Carolin Victoria Schneider; Sandra Geisler
Ringkasan
FAIR GraphRAG adalah kerangka kerja yang memakai FAIR Digital Objects sebagai simpul graf dalam sistem retrieval-augmented generation, menggabungkan konstruksi skema yang digerakkan LLM dengan tautan semantik. Diterapkan pada data RNA-sequ…
Metode
FAIR GraphRAG membangun sistem pengambilan berbasis graf di mana setiap simpul adalah FAIR Digital Object (FDO). Sebuah FDO merangkum empat komponen: data inti, metadata, persiste…
Hasil
Kerangka kerja ini diterapkan pada dataset biomedis di gastroenterologi, khususnya data RNA-sequencing. Evaluasi berfokus pada akurasi, cakupan, dan keterjelasan tanya jawab. Hasil menunjukkan bahwa …
AutoSLO adalah kerangka kerja manajemen beban kerja yang sadar SLO latensi untuk cloud data warehouse multi-cluster yang mengoordinasikan penyetelan kebijakan proaktif, autoscaling reaktif, dan perutean kueri daring di tiga skala waktu. Pa…
Metode
AutoSLO menguraikan manajemen beban kerja menjadi tiga komponen yang bekerja pada skala waktu berbeda. **1. Policy Tuner (berkala, proaktif).** Policy Tuner merencanakan tindakan …
Hasil
Para penulis mengevaluasi AutoSLO pada beban kerja Redbench yang realistis. Hasil utamanya adalah AutoSLO berhasil memenuhi SLO latensi dengan tingkat keketatan yang beragam sekaligus menurunkan biay…
Cost-Governed RAG mengintegrasikan indeks vektor yang oblivious terhadap codebook dengan gateway tata kelola LLM multi-tenant untuk membuat biaya embedding, retrieval, dan generation dapat diatribusikan secara bersama per tenant. Pada 100 …
Metode
Arsitektur ini diterapkan pada **Snowpark Container Services** di dalam batas tata kelola platform data cloud. Evaluasi mencakup **100 tenant simulasi** pada korpus **10 juta vekt…
Hasil
Sistem ini mencapai **akurasi atribusi biaya end-to-end 99,96%** pada 100 tenant simulasi. Angka ini mencerminkan akurasi bersama dari atribusi embedding, retrieval, dan generation di bawah distribus…
PCC-SQL mengintegrasikan kebijakan penggunaan kolom ke dalam proses decoding model text-to-SQL, mencapai tingkat kebocoran 0% dan cakupan hingga 88,7% pada Spider-CU sambil menjaga efisiensi token dalam +10% dari direct prompting.
Metode
PCC-SQL memformalkan kebijakan penggunaan kolom atas tiga peran semantik: output, kondisi filter, dan argumen agregasi. Peran-peran ini diselaraskan dengan produksi tata bahasa ya…
Hasil
PCC-SQL dievaluasi pada tiga benchmark dan tiga model open-source. Pada Spider-CU, sistem ini mencapai Leakage Rate 0% dan Coverage hingga 88,7%, sambil tetap berada dalam +10% token dari direct prom…
Studi ini menyajikan sistem pengarsipan sadar siklus hidup untuk layanan transaksi keuangan di Razorpay, mengelola miliaran record pada PostgreSQL Aurora. Studi ini secara analitis mencirikan Celebrity Partition Problem dan memperkenalkan …
Metode
Metodologi berpusat pada dua inovasi. Pertama, Celebrity Partition Problem dicirikan secara analitis. Dalam partisi berbasis status siklus hidup, tabel dipartisi berdasarkan statu…
Hasil
Penerapan produksi menghasilkan peningkatan substansial. Ukuran hot storage berkurang 95%, secara signifikan menurunkan biaya penyimpanan. Biaya infrastruktur database bulanan turun 53%. Latensi pemr…
Daomin Ji; Hui Luo; Zhifeng Bao; Shane Culpepper; Shazia Sadiq
Ringkasan
GRAFT merumuskan ulang pengambilan tabel di data lake sebagai pencocokan graf antara graf intent turunan kueri dan graf data lake heterogen, menggabungkan relevansi semantik, kompatibilitas struktural, dan keragaman bukti dalam satu reward…
Metode
GRAFT memodelkan tugas pengambilan sebagai pencocokan graf intent kueri $G_q = (V_q, E_q)$ terhadap graf data lake heterogen $G_d = (V_d, E_d)$, di mana simpul merepresentasikan t…
Hasil
GRAFT dievaluasi pada Spider dan BIRD yang diadaptasi ke pengaturan data lake tabular. Baseline mencakup penilaian point-wise, greedy-expansion, dan metode pengambilan structure-aware. Pada kedua ben…
Richmond Alake; Cesare Bernardis; Paul Cayet; Luca Engel; Damien Hilloulin; Sungpack Hong; Allen Hosler; Nickolas Kavan…
Ringkasan
Laporan ini menyajikan Oracle Agent Memory, substrat memori native basis data yang dibangun di atas Oracle Database yang memperlakukan memori agen sebagai siklus hidup penuh yang mencakup ingestion, ekstraksi, konsolidasi, pengambilan, per…
Metode
Pekerjaan ini diorganisasi di sekitar tiga pilar metodologis. **1. Memori sebagai siklus hidup.** Memori dimodelkan sebagai proses yang mencakup ingestion, ekstraksi, konsolidasi,…
Hasil
Laporan ini merangkum hasil LongMemEval yang mencapai **akurasi 93,8%**. Dibandingkan baseline riwayat datar, Oracle Agent Memory menggunakan sekitar **10,7x lebih sedikit token**. Baseline eksternal…
Marc Brooker; Marc Bowes; Mike Hershey; Zak van der Merwe; James Morle; Matthys Strydom
Ringkasan
Aurora DSQL adalah basis data SQL serverless yang memisahkan komputasi, penyimpanan, dan koordinasi transaksi untuk memungkinkan penskalaan elastis dari nol hingga jutaan transaksi per detik dengan konsistensi kuat dan ketersediaan multi-r…
Metode
Arsitektur DSQL dibangun di atas tiga komponen utama: query processor, penyimpanan, dan koordinasi transaksi. Query processor berjalan di Firecracker MicroVM dan menjalankan SQL y…
Hasil
Aurora DSQL mencapai penskalaan elastis dari nol hingga jutaan transaksi per detik. Sistem ini menyediakan konsistensi kuat, transaksi ACID, dan ketersediaan berkelanjutan selama kegagalan availabili…