Jadwal Sholat

Memuat jadwal sholat…

Editorial ilmu komputer

Open AccessOA2026

ArticleMiner: Konstruksi Knowledge Graph Berbasis Ontologi dari Publikasi Ilmiah

Kerangka kerja hibrida yang menggabungkan bukti parser, model bahasa, dan modul tugas terbatas yang ditulis manusia untuk ekstraksi fakta ilmiah lintas domain
Md Abrar Jahin; Craig A. Knoblock; Jay Pujara· 2026· DOI 10.48550/arXiv.2609.25607

Masalah inti

Publikasi ilmiah menyematkan sebagian besar konten kuantitatifnya dalam tabel dan berkas suplemen, di mana sebuah angka baru bermakna melalui header, caption, satuan, metode analitik, dan konvensi spesifik bidangnya. Memulihkan baris dan kolom sebuah tabel karena itu tidak setara dengan memulihkan fakta ilmiah yang dilaporkannya. Sebagian besar metode interpretasi tabel semantik mengasumsikan tabel yang bersih sudah tersedia lalu memetakan sel atau kolomnya ke istilah ontologi, sementara sebagian besar sistem ekstraksi tingkat publikasi dirancang untuk satu domain. Karya ini meneliti jalur tengah: proses bersama yang membaca sebuah makalah dan berkas suplemennya, mengumpulkan bukti dari beberapa parser dan sebuah model bahasa, lalu merekonsiliasi bukti tersebut, sementara modul tugas terbatas yang ditulis manusia untuk setiap tugas memasok makna domain. Modul itu mencantumkan nama kanonis yang boleh digunakan graf, bentuk permukaan yang memetakannya, sekumpulan kecil aturan derivasi dan batasan validitas, kunci identitas, serta binding yang dipakai untuk menulis RDF. Modul itu mendefinisikan apa yang boleh dipancarkan sebuah tugas; ia tidak berusaha mendaftar setiap konvensi suatu

Inovasi

ArticleMiner dievaluasi pada 163 makalah di empat domain: kimia penemuan obat, ilmu material, machine learning, dan geokimia mineral. Evaluasi geokimia memperkenalkan tolok ukur baru dengan ground truth yang dikurasi pakar. Dalam perbandingan terhadap baseline few-shot LLM yang sama, estimasi titik mengunggulkan ArticleMiner pada keempat tugas. Untuk dua tolok ukur yang lebih kecil, hasilnya mengandung ketidakpastian, tetapi arah peningkatannya konsisten. Perbandingan geokimia sangat informatif karena mencakup akses ke berkas suplemen, sehingga peningkatan yang diamati tidak dapat diatribusikan semata-mata pada panduan domain. Kerangka kerja ini berhasil merekonsiliasi bukti dari beberapa parser dan sebuah model bahasa, dan modul tugas yang terbatas secara efektif memasok makna domain tanpa berusaha menyebutkan setiap konvensi suatu bidang. Tolok ukur geokimia baru menyediakan sumber daya berharga untuk pekerjaan mendatang tentang ekstraksi fakta ilmiah.
Publikasi ilmiah menyematkan sebagian besar konten kuantitatifnya dalam tabel dan berkas suplemen, di mana sebuah angka baru bermakna melalui header, caption, satuan, metode analitik, dan konvensi spesifik bidangnya. Memulihkan baris dan kolom sebuah tabel karena itu tidak setara dengan memulihkan fakta ilmiah yang dilaporkannya. Sebagian besar metode interpretasi tabel semantik mengasumsikan tabel yang bersih sudah tersedia lalu memetakan sel atau kolomnya ke istilah ontologi, sementara sebagian besar sistem ekstraksi tingkat publikasi dirancang untuk satu domain. Karya ini meneliti jalur tengah: proses bersama yang membaca sebuah makalah dan berkas suplemennya, mengumpulkan bukti dari beberapa parser dan sebuah model bahasa, lalu merekonsiliasi bukti tersebut, sementara modul tugas terbatas yang ditulis manusia untuk setiap tugas memasok makna domain. Modul itu mencantumkan nama kanonis yang boleh digunakan graf, bentuk permukaan yang memetakannya, sekumpulan kecil aturan derivasi dan batasan validitas, kunci identitas, serta binding yang dipakai untuk menulis RDF. Modul itu mendefinisikan apa yang boleh dipancarkan sebuah tugas; ia tidak berusaha mendaftar setiap konvensi suatu bidang. Empat modul semacam itu dibangun (untuk kimia penemuan obat, ilmu material, machine learning, dan geokimia mineral) dalam kerangka kerja ArticleMiner, dan dievaluasi pada 163 makalah, termasuk tolok ukur geokimia baru dengan ground truth yang dikurasi pakar.
ArticleMiner mengikuti pipeline modular yang memisahkan pengumpulan bukti dari interpretasi spesifik domain. Arsitekturnya diilustrasikan di bawah ini:

Mengapa penting

Hasilnya menunjukkan bahwa proses ekstraksi bersama yang dikombinasikan dengan modul tugas ringan yang ditulis manusia dapat secara efektif menjembatani kesenjangan antara interpretasi tabel generik dan ekstraksi publikasi spesifik domain. Sifat terbatas modul-modul itu—mencantumkan nama kanonis, bentuk permukaan, aturan derivasi, batasan validitas, kunci identitas, dan binding RDF—memberikan panduan domain yang memadai sekaligus tetap terpelihara dan dapat diperluas. Peningkatan pada tugas geokimia, yang mencakup berkas suplemen, menunjukkan bahwa keuntungannya tidak semata-mata berasal dari panduan domain tetapi juga dari rekonsiliasi beberapa sumber bukti. Namun, ketidakpastian pada dua tolok ukur yang lebih kecil menyoroti perlunya evaluasi berskala lebih besar. Pekerjaan mendatang dapat memperluas himpunan modul tugas, memasukkan jenis parser tambahan, dan mengeksplorasi pembuatan modul secara otomatis. Kerangka kerja ArticleMiner menawarkan jalur tengah yang menjanjikan untuk membangun knowledge graph dari publikasi ilmiah, menyeimbangkan keumuman proses bersama dengan presisi batasan spesifik domain.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…