Editorial ilmu komputer
Open AccessOA2026
FAIR GraphRAG: Pendekatan Retrieval-Augmented Generation untuk Analisis Data Semantik
Mengintegrasikan FAIR Digital Objects ke dalam pengambilan berbasis graf untuk meningkatkan akurasi, cakupan, dan keterjelasan pada tanya jawab biomedis
Marlena Flüh; Soo-Yon Kim; Carolin Victoria Schneider; Sandra Geisler· 2026· DOI 10.48550/arXiv.2607.11464
Masalah inti
Retrieval-Augmented Generation (RAG) meredam keterbatasan utama Large Language Models (LLMs) saat menjawab pertanyaan spesifik domain dengan mendasarkan generasi pada pengetahuan eksternal. Pendekatan RAG berbasis graf, seperti GraphRAG, lebih lanjut meningkatkan pengambilan dengan menangkap hubungan semantik di dalam knowledge graph (KG). Sejalan dengan itu, prinsip FAIR—Findability, Accessibility, Interoperability, dan Reusability—telah menjadi lazim untuk pengelolaan data ilmiah, khususnya di domain kompleks seperti kedokteran. Namun, pendekatan RAG yang ada belum memiliki FAIRification terstruktur atas sumber daya pengetahuan yang mendasarinya, sehingga membatasi potensi mereka untuk pengambilan informasi yang FAIR di domain tersebut. Untuk mengatasi celah ini, penulis memperkenalkan FAIR GraphRAG, kerangka kerja baru yang mengintegrasikan FAIR Digital Objects (FDO) sebagai unit fundamental sistem pengambilan berbasis graf. Setiap simpul graf merepresentasikan FDO yang memuat data inti, metadata, persistent identifier, dan tautan semantik. Kerangka kerja ini dirancang bersama oleh dokter dan ilmuwan komputer untuk memastikan relevansi teknis dan klinis. Karya ini menunjukkan ke
Inovasi
Kerangka kerja ini diterapkan pada dataset biomedis di gastroenterologi, khususnya data RNA-sequencing. Evaluasi berfokus pada akurasi, cakupan, dan keterjelasan tanya jawab. Hasil menunjukkan bahwa FAIR GraphRAG secara signifikan meningkatkan ketiga metrik tersebut dibandingkan pendekatan RAG baseline, terutama untuk kueri kompleks yang melibatkan metadata dan tautan ontologi. Integrasi FDO memastikan bahwa informasi yang diambil mematuhi prinsip FAIR, meningkatkan kepercayaan dan reusability. Meskipun metrik kuantitatif yang tepat tidak disediakan dalam abstrak, penulis melaporkan peningkatan yang signifikan. Kemampuan sistem menelusuri tautan semantik memungkinkannya menjawab kueri yang memerlukan penggabungan data dan metadata, yang umum di lingkungan klinis dan penelitian. Co-design dengan dokter memastikan bahwa evaluasi mencerminkan pertanyaan yang relevan secara klinis. Peningkatan keterjelasan berasal dari struktur graf, yang menyediakan jalur yang dapat ditelusuri dari kueri ke jawaban melalui subgraf yang diambil. Hal ini krusial di domain medis yang menuntut transparansi. Penerapan pada data RNA-sequencing menunjukkan kelayakan untuk tipe data biomedis yang kompleks, da
Retrieval-Augmented Generation (RAG) meredam keterbatasan utama Large Language Models (LLMs) saat menjawab pertanyaan spesifik domain dengan mendasarkan generasi pada pengetahuan eksternal. Pendekatan RAG berbasis graf, seperti GraphRAG, lebih lanjut meningkatkan pengambilan dengan menangkap hubungan semantik di dalam knowledge graph (KG). Sejalan dengan itu, prinsip FAIR—Findability, Accessibility, Interoperability, dan Reusability—telah menjadi lazim untuk pengelolaan data ilmiah, khususnya di domain kompleks seperti kedokteran. Namun, pendekatan RAG yang ada belum memiliki FAIRification terstruktur atas sumber daya pengetahuan yang mendasarinya, sehingga membatasi potensi mereka untuk pengambilan informasi yang FAIR di domain tersebut. Untuk mengatasi celah ini, penulis memperkenalkan FAIR GraphRAG, kerangka kerja baru yang mengintegrasikan FAIR Digital Objects (FDO) sebagai unit fundamental sistem pengambilan berbasis graf. Setiap simpul graf merepresentasikan FDO yang memuat data inti, metadata, persistent identifier, dan tautan semantik. Kerangka kerja ini dirancang bersama oleh dokter dan ilmuwan komputer untuk memastikan relevansi teknis dan klinis. Karya ini menunjukkan kelayakan dengan menerapkan FAIR GraphRAG pada dataset biomedis di gastroenterologi, khususnya data RNA-sequencing, dan menunjukkan peningkatan akurasi, cakupan, serta keterjelasan tanya jawab, terutama untuk kueri kompleks yang melibatkan metadata dan tautan ontologi.
FAIR GraphRAG membangun sistem pengambilan berbasis graf di mana setiap simpul adalah FAIR Digital Object (FDO). Sebuah FDO merangkum empat komponen: data inti, metadata, persistent identifier (PID), dan tautan semantik. Kerangka kerja ini memanfaatkan LLM untuk mendukung dua proses kunci: (1) konstruksi skema untuk graf, dan (2) ekstraksi otomatis konten dan metadata dari sumber data. Otomasi yang digerakkan LLM ini mengurangi upaya kurasi manual sekaligus menjaga kepatuhan pada prinsip FAIR. Struktur graf memungkinkan pengambilan yang mengikuti hubungan semantik, sehingga sistem dapat menjawab kueri yang memerlukan penelusuran metadata dan tautan ontologi. Proses co-design melibatkan dokter dan ilmuwan komputer, memastikan bahwa skema dan mekanisme pengambilan menjawab kebutuhan klinis nyata. Secara formal, misalkan knowledge graph adalah di mana setiap simpul merepresentasikan FDO dan setiap sisi merepresentasikan tautan semantik antar-FDO. Untuk kueri , proses pengambilan mengidentifikasi subgraf relevan dengan memaksimalkan skor relevansi yang menggabungkan kemiripan semantik dan konektivitas graf. LLM kemudian menghasilkan jawaban yang dikondisikan pada subgraf yang diambil: . FAIRification memastikan bahwa metadata dan PID setiap simpul dapat ditindaklanjuti mesin, mendukung findability dan reusability. Arsitektur keseluruhan diilustrasikan di bawah ini:
Mengapa penting
Karya ini menunjukkan kelayakan menggabungkan praktik data FAIR dengan teknik pengambilan berbasis graf. Dengan menjadikan FDO sebagai unit fundamental, FAIR GraphRAG memastikan bahwa setiap informasi yang diambil dapat ditemukan, diakses, diinteroperasikan, dan digunakan kembali. Ini merupakan penyimpangan dari sistem RAG tradisional yang memperlakukan dokumen sebagai potongan buram. Penggunaan LLM untuk konstruksi skema dan ekstraksi metadata mengotomasi proses yang secara tradisional padat tenaga, meskipun dapat memunculkan bias atau kesalahan yang memerlukan validasi. Co-design dengan dokter menyoroti pentingnya keahlian domain dalam membangun sistem AI yang relevan secara klinis. Peningkatan akurasi, cakupan, dan keterjelasan sangat menonjol untuk kueri kompleks, menunjukkan bahwa struktur graf dan FAIRification adalah pemungkin kunci. Namun, evaluasi terbatas pada satu dataset biomedis; validasi yang lebih luas lintas domain diperlukan. Penulis menyarankan potensi penerapan di pendidikan dan bisnis, di mana prinsip FAIR dan hubungan semantik juga bernilai. Pekerjaan selanjutnya dapat mengeksplorasi skalabilitas, penanganan data dinamis, dan integrasi dengan alat FAIR lainnya. Secara keseluruhan, FAIR GraphRAG merupakan langkah menjanjikan menuju retrieval-augmented generation yang tepercaya, dapat dijelaskan, dan kaya semantik.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten member…