Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Melampaui Tabel: Doc2DB-Bench untuk Konstruksi Dokumen-ke-Basis-Data yang Setia Secara Relasional

Sebuah benchmark yang membingkai ulang pemahaman dokumen sebagai konstruksi basis data, dengan 203 instans dokumen panjang, 42 skema, dan 41.935 sel untuk mengevaluasi sistem data berbasis LLM yang setia secara relasional.
Zhuowen Liang; Zhengxuan Zhang; Jiayang Wang; Jiazhuo Chen; Nan Tangยท 2026ยท DOI 10.48550/arXiv.2608.08459

Masalah inti

Sistem AI praktis semakin perlu mengubah dokumen panjang yang heterogen menjadi basis data relasional yang dapat dikueri, bukan spreadsheet yang terisolasi. Di domain seperti keuangan, kesehatan, pendidikan, transportasi, dan operasi perusahaan, alur kerja hilir bergantung pada skema ternormalisasi, identitas entitas, kunci, hubungan antartabel, dan batasan integritas untuk analitik, kepatuhan, audit, dan pengambilan keputusan berbasis SQL. Benchmark Document-to-Table yang ada tidak memadai untuk konteks ini: meratakan bukti ke dalam tabel tunggal dapat menduplikasi entitas, mengaburkan hubungan banyak-ke-banyak, menciptakan catatan yang jarang, dan menghindari pengujian apakah fakta yang diekstraksi membentuk instans basis data yang valid. Hal ini menciptakan kebutuhan mendesak untuk mengevaluasi pemahaman dokumen sebagai konstruksi basis data alih-alih ekstraksi bidang. Penulis memperkenalkan Doc2DB-Bench, sebuah benchmark untuk konstruksi Dokumen-ke-Basis-Data, yang berisi 203 instans dokumen panjang di 42 skema dan tujuh kelompok domain, dengan 117 tabel entitas, 132 tabel hubungan, 7.341 baris, dan 41.935 sel. Dibangun melalui pipeline sintesis DB-to-Doc yang dapat dikendalika

Inovasi

Doc2DB-Bench berisi 203 instans dokumen panjang di 42 skema dan tujuh kelompok domain. Instans basis data mencakup 117 tabel entitas dan 132 tabel hubungan, dengan total 7.341 baris dan 41.935 sel. Statistik ini menyoroti skala dan kompleksitas relasional benchmark. Dokumen yang dihasilkan lulus verifikasi keaslian, terbukti tidak dapat dibedakan dari referensi dunia nyata. Benchmark ini tersedia untuk publik di https://github.com/SetonLiang/Doc2DB-Bench. Taksonomi ekstraksi intra-tabel dan penalaran antar-tabel menyediakan kerangka evaluasi yang terstruktur. Hasilnya menunjukkan bahwa benchmark Document-to-Table yang ada tidak memadai untuk konteks ini, karena meratakan bukti ke dalam tabel tunggal dapat menduplikasi entitas, mengaburkan hubungan banyak-ke-banyak, menciptakan catatan yang jarang, dan menghindari pengujian apakah fakta yang diekstraksi membentuk instans basis data yang valid. Benchmark ini dengan demikian menyediakan testbed untuk sistem data berbasis LLM yang andal, dapat diaudit, dan setia secara relasional.
Sistem AI praktis semakin perlu mengubah dokumen panjang yang heterogen menjadi basis data relasional yang dapat dikueri, bukan spreadsheet yang terisolasi. Di domain seperti keuangan, kesehatan, pendidikan, transportasi, dan operasi perusahaan, alur kerja hilir bergantung pada skema ternormalisasi, identitas entitas, kunci, hubungan antartabel, dan batasan integritas untuk analitik, kepatuhan, audit, dan pengambilan keputusan berbasis SQL. Benchmark Document-to-Table yang ada tidak memadai untuk konteks ini: meratakan bukti ke dalam tabel tunggal dapat menduplikasi entitas, mengaburkan hubungan banyak-ke-banyak, menciptakan catatan yang jarang, dan menghindari pengujian apakah fakta yang diekstraksi membentuk instans basis data yang valid. Hal ini menciptakan kebutuhan mendesak untuk mengevaluasi pemahaman dokumen sebagai konstruksi basis data alih-alih ekstraksi bidang. Penulis memperkenalkan Doc2DB-Bench, sebuah benchmark untuk konstruksi Dokumen-ke-Basis-Data, yang berisi 203 instans dokumen panjang di 42 skema dan tujuh kelompok domain, dengan 117 tabel entitas, 132 tabel hubungan, 7.341 baris, dan 41.935 sel. Dibangun melalui pipeline sintesis DB-to-Doc yang dapat dikendalikan dan diorganisasi oleh taksonomi ekstraksi intra-tabel dan penalaran antar-tabel, dokumen yang dihasilkan menjalani verifikasi keaslian, terbukti tidak dapat dibedakan dari referensi dunia nyata. Doc2DB-Bench dengan demikian menyediakan testbed untuk sistem data berbasis LLM yang andal, dapat diaudit, dan setia secara relasional. Benchmark ini tersedia untuk publik di https://github.com/SetonLiang/Doc2DB-Bench.

Benchmark ini dibangun melalui pipeline sintesis DB-to-Doc yang dapat dikendalikan. Pipeline ini dimulai dengan instans basis data relasional dan menghasilkan dokumen panjang yang heterogen yang mengodekan informasi yang sama dalam bahasa alami. Sintesis diorganisasi oleh taksonomi ekstraksi intra-tabel dan penalaran antar-tabel, memastikan cakupan ekstraksi tingkat bidang lokal dan inferensi relasional global. Dokumen yang dihasilkan menjalani verifikasi keaslian, menunjukkan bahwa dokumen tersebut tidak dapat dibedakan dari referensi dunia nyata. Benchmark ini terdiri dari 203 instans dokumen panjang di 42 skema dan tujuh kelompok domain, menghasilkan 117 tabel entitas, 132 tabel hubungan, 7.341 baris, dan 41.935 sel. Secara formal, misalkan dokumen dihasilkan dari instans basis data

dengan skema
. Tugasnya adalah merekonstruksi instans basis data
sedemikian sehingga
, yaitu
memenuhi semua batasan integritas, kunci, dan hubungan antartabel yang didefinisikan oleh
. Pipeline sintesis dapat direpresentasikan sebagai pemetaan
, dan evaluasi mengukur kesetiaan pemetaan invers
di bawah batasan skema. Taksonomi memisahkan ekstraksi intra-tabel, di mana bidang diekstraksi dalam satu tabel, dari penalaran antar-tabel, di mana hubungan antartabel harus disimpulkan. Desain ini memastikan bahwa benchmark menguji tidak hanya akurasi ekstraksi tetapi juga kesetiaan relasional.

Mengapa penting

Wawasan kunci dari Doc2DB-Bench adalah bahwa pemahaman dokumen harus dievaluasi sebagai konstruksi basis data alih-alih ekstraksi bidang. Pembingkaian ulang ini mengatasi keterbatasan kritis benchmark Document-to-Table: meratakan bukti ke dalam tabel tunggal dapat menduplikasi entitas, mengaburkan hubungan banyak-ke-banyak, menciptakan catatan yang jarang, dan menghindari pengujian apakah fakta yang diekstraksi membentuk instans basis data yang valid. Di domain seperti keuangan, kesehatan, pendidikan, transportasi, dan operasi perusahaan, alur kerja hilir bergantung pada skema ternormalisasi, identitas entitas, kunci, hubungan antartabel, dan batasan integritas untuk analitik, kepatuhan, audit, dan pengambilan keputusan berbasis SQL. Oleh karena itu, mengevaluasi pemahaman dokumen sebagai konstruksi basis data sangat penting untuk sistem data berbasis LLM yang andal, dapat diaudit, dan setia secara relasional. Taksonomi benchmark untuk ekstraksi intra-tabel dan penalaran antar-tabel menyediakan cara berprinsip untuk mengukur kemajuan. Verifikasi keaslian memastikan bahwa dokumen yang dihasilkan realistis, menjadikan benchmark ini testbed yang menantang. Ketersediaan publik benchmark di https://github.com/SetonLiang/Doc2DB-Bench mendukung penelitian yang dapat direproduksi. Diagram Mermaid berikut menggambarkan pipeline sintesis dan evaluasi DB-to-Doc:

Pipeline ini menyoroti masalah invers: dari dokumen ke basis data, dengan evaluasi yang berfokus pada kesetiaan relasional alih-alih ekstraksi bidang yang terisolasi.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ