Editorial Ilmu Komputer & AI
Open AccessOA2026
Rekonstruksi Metadata dari Nilai Semata: Memulihkan Semantik Kolom di Gudang Data Tanpa Dokumentasi
Rosetta: Harness verifikasi yang memakai profiling deterministik untuk menggerbangi semantik kolom hasil LLM, mencapai abstensi terkalibrasi dan cakupan yang meningkat.
Mike Helwig· 2026· DOI 10.48550/arXiv.2608.07946
Masalah inti
Gudang data produksi sering kali tidak memiliki nama kolom atau dokumentasi yang bermakna, sehingga sulit memahami apa yang direpresentasikan data. Tolok ukur text-to-SQL biasanya menyediakan skema dengan nama kolom yang deskriptif, tetapi gudang data dunia nyata memiliki pengenal yang samar dan metadata yang tidak lengkap. Makalah ini membahas tantangan memulihkan semantik kolom—apa makna kolom dan nilainya—langsung dari data itu sendiri. Penulis memperkenalkan Rosetta, sistem yang menggabungkan profiler deterministik dengan model bahasa untuk mengusulkan anotasi semantik. Profiler mengekstrak bukti struktural seperti sidik jari nilai, kecocokan pola dari pustaka 26 pola, dan putusan checksum. Model bahasa kemudian menghasilkan hipotesis semantik yang dikondisikan pada bukti ini, dengan setiap fakta disertai provenans dan skor keyakinan yang dibatasi oleh kelas buktinya. Pendekatan ini dievaluasi terhadap dokumentasi manusia pada 680 kolom berpasangan di sebelas basis data BIRD, dengan pengenal dihancurkan untuk menyimulasikan gudang data tanpa dokumentasi.
Inovasi
Pada 680 kolom berpasangan dari basis data BIRD dengan pengenal dihancurkan, Rosetta mencapai akurasi 0.475 pada 42% kolom yang dikomit, dibandingkan dengan akurasi 0.223 pada 94% untuk model yang sama yang digunakan secara langsung. Perolehan ini terutama disebabkan oleh seleksi: bukti deterministik mengatur apakah sistem berbicara, meningkatkan cakupan sebesar 0.257 (95% CI [0.128, 0.378]). Ketika dibatasi pada 283 kolom tempat kedua lengan membuat prediksi, harness tidak menghasilkan prosa yang lebih baik daripada model saja. Ini menunjukkan bahwa lapisan deterministik bertindak sebagai detektor kompetensi, bukan penguat kompetensi. Pada gudang data klinis i2b2 yang buta, Rosetta dengan benar mendekode 95.5% dari 134 kode ICD-9 dari nilai semata tetapi abstain pada semua 44 kode obat NDC. Di bawah opasitas skema penuh, akurasi eksekusi penerjemah naif turun dari 0.92 menjadi 0.42, sementara gerbang Rosetta menjawab dengan akurasi 86% pada cakupan 59%. Hasil negatif dilaporkan, termasuk bahwa tangga otoritas bukanlah mekanisme di balik peningkatan utama.
Gudang data produksi sering kali tidak memiliki nama kolom atau dokumentasi yang bermakna, sehingga sulit memahami apa yang direpresentasikan data. Tolok ukur text-to-SQL biasanya menyediakan skema dengan nama kolom yang deskriptif, tetapi gudang data dunia nyata memiliki pengenal yang samar dan metadata yang tidak lengkap. Makalah ini membahas tantangan memulihkan semantik kolom—apa makna kolom dan nilainya—langsung dari data itu sendiri. Penulis memperkenalkan Rosetta, sistem yang menggabungkan profiler deterministik dengan model bahasa untuk mengusulkan anotasi semantik. Profiler mengekstrak bukti struktural seperti sidik jari nilai, kecocokan pola dari pustaka 26 pola, dan putusan checksum. Model bahasa kemudian menghasilkan hipotesis semantik yang dikondisikan pada bukti ini, dengan setiap fakta disertai provenans dan skor keyakinan yang dibatasi oleh kelas buktinya. Pendekatan ini dievaluasi terhadap dokumentasi manusia pada 680 kolom berpasangan di sebelas basis data BIRD, dengan pengenal dihancurkan untuk menyimulasikan gudang data tanpa dokumentasi.
Rosetta beroperasi dengan mengintegrasikan model bahasa di dalam harness verifikasi. Profiler deterministik terlebih dahulu menganalisis nilai kolom untuk mengekstrak bukti struktural, termasuk:
Mengapa penting
Temuan ini menunjukkan bahwa bukti deterministik dapat secara efektif menggerbangi prediksi model bahasa, meningkatkan presisi dengan mengorbankan cakupan. Kemampuan sistem untuk abstain ketika bukti kurang sangat penting untuk aplikasi dunia nyata di mana metadata yang salah dapat menyebabkan kesalahan yang mahal. Eksperimen penukaran backbone menunjukkan bahwa meskipun temuan prosa tereproduksi, abstensi yang diminta prompt tidak menular antar model; namun, gerbang komit yang ditegakkan kode memastikan cakupan tanpa bukti tetap 0.000 pada setiap backbone. Ini menunjukkan bahwa batasan eksplisit di tingkat kode diperlukan untuk abstensi yang andal. Evaluasi pada kode klinis menyoroti potensi sistem di domain sensitif, di mana mendekode kode ICD-9 dari nilai semata dapat dilakukan tetapi kode obat NDC memerlukan konteks tambahan. Penulis menekankan bahwa lapisan deterministik adalah detektor kompetensi, bukan penguat, dan bahwa tangga otoritas bukanlah mekanisme di balik hasil utama. Pekerjaan selanjutnya dapat mengeksplorasi perluasan pustaka pola dan mengintegrasikan sumber pengetahuan eksternal untuk meningkatkan cakupan pada sistem kode yang menantang seperti NDC.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten member…