Jadwal Sholat

Memuat jadwal sholat…

Editorial ilmu komputer

Open AccessOA2026

Dari Skema ke Sinyal: Pemodelan Berbasis Retrieval untuk Analitik Data Relasional

RAM: Kerangka kerja berbasis retrieval yang memadukan struktur graf dengan semantik atribut untuk basis data relasional
Lingze Zeng; Shaofeng Cai; Changshuo Liu; Zhongle Xie; Yuncheng Wu; Beng Chin Ooi· 2026· DOI 10.48550/arXiv.2605.14464

Masalah inti

Data relasional yang tersimpan dalam RDBMS menopang berbagai aplikasi di bidang e-commerce, keuangan, dan sosial. Meskipun deep neural network (DNN) unggul pada data tabular satu tabel, memperluasnya ke basis data relasional menjadi sulit karena struktur multi-tabel yang ternormalisasi dan hubungan antar-tabel yang kompleks. Metode yang ada sering kali bergantung secara ketat pada graf yang didefinisikan skema, sehingga mengabaikan sinyal semantik implisit pada atribut tuple dan menghadapi keterbatasan konektivitas yang kaku. Penelitian ini mengusulkan Retrieval-Augmented Modeling (RAM), sebuah kerangka kerja yang menggabungkan struktur graf dengan semantik atribut untuk analitik data relasional. RAM memperlakukan atribut tuple sebagai token dan menggunakan random walk untuk membangun dokumen kontekstual, sehingga teknik information retrieval dapat memperkirakan relevansi semantik antar-tuple. Berdasarkan dokumen tersebut, penulis memperkenalkan dua augmentasi berbasis retrieval: ATRA (relevansi intra-tabel untuk pembelajaran kontrastif) dan ETRA (penautan antar-tabel untuk tuple yang berhubungan secara semantik guna meningkatkan konektivitas graf). Arsitektur model berlapis yang d

Inovasi

Penulis melakukan eksperimen ekstensif pada lima basis data relasional dunia nyata, mencakup beragam tugas prediksi seperti klasifikasi dan regresi. RAM secara konsisten mengungguli baseline yang ada, termasuk metode yang hanya mengandalkan graf yang didefinisikan skema dan metode yang menggunakan DNN satu tabel. Temuan utama meliputi:
- RAM mencapai kinerja state-of-the-art pada kelima basis data, dengan peningkatan signifikan pada metrik seperti akurasi, -score, dan AUC.
- Studi ablasi mengonfirmasi pentingnya augmentasi ATRA dan ETRA; menghilangkan salah satunya menyebabkan penurunan kinerja yang nyata.
- Arsitektur berlapis terbukti efektif, dengan graph aggregation layer memperoleh manfaat dari konektivitas yang diperkaya oleh ETRA.
- RAM menunjukkan ketangguhan terhadap variasi ukuran basis data dan kompleksitas skema, memperlihatkan generalisasinya.

Hasil kuantitatif spesifik tidak disediakan dalam abstrak, tetapi makalah ini mengklaim keunggulan yang konsisten atas baseline pada berbagai tugas prediksi.

Data relasional yang tersimpan dalam RDBMS menopang berbagai aplikasi di bidang e-commerce, keuangan, dan sosial. Meskipun deep neural network (DNN) unggul pada data tabular satu tabel, memperluasnya ke basis data relasional menjadi sulit karena struktur multi-tabel yang ternormalisasi dan hubungan antar-tabel yang kompleks. Metode yang ada sering kali bergantung secara ketat pada graf yang didefinisikan skema, sehingga mengabaikan sinyal semantik implisit pada atribut tuple dan menghadapi keterbatasan konektivitas yang kaku. Penelitian ini mengusulkan Retrieval-Augmented Modeling (RAM), sebuah kerangka kerja yang menggabungkan struktur graf dengan semantik atribut untuk analitik data relasional. RAM memperlakukan atribut tuple sebagai token dan menggunakan random walk untuk membangun dokumen kontekstual, sehingga teknik information retrieval dapat memperkirakan relevansi semantik antar-tuple. Berdasarkan dokumen tersebut, penulis memperkenalkan dua augmentasi berbasis retrieval: ATRA (relevansi intra-tabel untuk pembelajaran kontrastif) dan ETRA (penautan antar-tabel untuk tuple yang berhubungan secara semantik guna meningkatkan konektivitas graf). Arsitektur model berlapis yang dirancang khusus untuk data relasional—terdiri atas lapisan attribute embedding, feature integration, dan graph aggregation—memungkinkan pembelajaran representasi yang ekspresif dan fleksibel. Eksperimen ekstensif pada lima basis data relasional dunia nyata menunjukkan RAM secara konsisten mengungguli baseline pada berbagai tugas prediksi, sehingga menetapkan state-of-the-art untuk analitik data relasional.
RAM beroperasi dalam tiga tahap utama: konstruksi dokumen, augmentasi berbasis retrieval, dan pembelajaran representasi berlapis.

Mengapa penting

RAM mengatasi kesenjangan kritis dalam analitik data relasional dengan melampaui graf yang didefinisikan skema secara kaku. Dengan memperlakukan atribut tuple sebagai token dan memanfaatkan random walk untuk membuat dokumen kontekstual, RAM menangkap sinyal semantik implisit yang sering terabaikan. Augmentasi berbasis retrieval, ATRA dan ETRA, secara efektif menyuntikkan pengetahuan semantik intra-tabel dan antar-tabel, sehingga meningkatkan pembelajaran representasi. Arsitektur berlapis menyediakan kerangka kerja yang fleksibel dan ekspresif yang dapat diadaptasi ke berbagai skema relasional.

Namun, batasan potensial meliputi overhead komputasi dari random walk dan retrieval, terutama untuk basis data besar. Pilihan teknik IR (misalnya BM25) dan hyperparameter seperti dan mungkin memerlukan penyetelan. Penelitian selanjutnya dapat mengeksplorasi metode retrieval yang lebih efisien, perubahan skema dinamis, dan integrasi dengan modalitas lain. Secara keseluruhan, RAM menetapkan state-of-the-art baru untuk analitik data relasional, menjembatani kesenjangan antara pendekatan berbasis graf dan berbasis atribut.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…