Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

PolicyKG: Pipeline LLM Agentik untuk Menerjemahkan Kebijakan Institusional menjadi Knowledge Graph SHACL

Pipeline LangGraph empat tahap dengan Corpus Adapter YAML mengubah PDF kebijakan menjadi logika deontik dan batasan SHACL, mencapai akurasi klasifikasi 86,9% dan retargeting domain yang dapat ditukar lewat registry.
Ponkrit Kaewsawee; Chaklam Silpasuwanchai; Chutiporn Anutariyaยท 2026ยท DOI 10.48550/arXiv.2608.09028

Masalah inti

Kebijakan institusional masih terkunci dalam bahasa alami, sementara sistem yang memeriksa kepatuhan menuntut batasan yang dapat dibaca mesin. Penjembatanan celah ini masih dilakukan secara manual, menciptakan hambatan bagi pemeriksaan kepatuhan otomatis. PolicyKG mengatasi hal ini dengan menutup siklus: ini adalah pipeline LLM yang membaca PDF kebijakan, mengklasifikasikan setiap kalimat sebagai kewajiban, izin, atau larangan, mengangkat label ke logika deontik orde pertama, dan menghasilkan batasan SHACL. Pipeline ini dirancang agar dapat diarahkan ulang lintas domain melalui Corpus Adapter, sebuah registry kosakata YAML yang mengaitkan predikat LLM ke ontologi target. Penelitian ini mengevaluasi PolicyKG pada korpus Asian Institute of Technology (AIT) Policies and Procedures, yang terdiri atas 1.663 kalimat dan 443 aturan, serta menguji transfer domain ke tolok ukur GDPR dan kontrak sewa.

Inovasi

Pada korpus AIT, PolicyKG mencapai akurasi klasifikasi deontik 86,9% (Cohen's kappa = .709). Tiga anotator secara independen memberi label ulang pada sampel 50 item dan sepakat pada Fleiss' kappa = .844. Kebenaran bentuk SHACL pada subset 69 bentuk menghasilkan = .866. Jalur FOL menangani 79,2% aturan, sisanya menggunakan fallback langsung NL-ke-SHACL. Audit untuk konstruk orde lebih tinggi tidak menemukan apa pun: daftar periksa regex otomatis tidak menandai apa pun, dan pemeriksaan penulis pertama pada 92 kasus fallback FOL mengonfirmasi hal yang sama. Batas atas 95% Clopper-Pearson yang eksak pada tingkat logika orde lebih tinggi yang sebenarnya adalah 0,67%. Menukar registry AIT dengan registry GDPR menaikkan penyelarasan properti eksak dari 1/15 menjadi 11/15 (Fisher's exact p < .001; Cohen's h = 1.53). Pada tolok ukur kontrak sewa LexDeMod (N = 200), Macro turun menjadi .370 karena bahasa Inggris sewa menggunakan "shall be entitled" untuk izin, ketidakcocokan kosakata yang dimaksudkan untuk diperbaiki oleh penukaran registry. Eksekusi berulang menghasilkan keluaran SHACL yang identik secara hash.
Kebijakan institusional masih terkunci dalam bahasa alami, sementara sistem yang memeriksa kepatuhan menuntut batasan yang dapat dibaca mesin. Penjembatanan celah ini masih dilakukan secara manual, menciptakan hambatan bagi pemeriksaan kepatuhan otomatis. PolicyKG mengatasi hal ini dengan menutup siklus: ini adalah pipeline LLM yang membaca PDF kebijakan, mengklasifikasikan setiap kalimat sebagai kewajiban, izin, atau larangan, mengangkat label ke logika deontik orde pertama, dan menghasilkan batasan SHACL. Pipeline ini dirancang agar dapat diarahkan ulang lintas domain melalui Corpus Adapter, sebuah registry kosakata YAML yang mengaitkan predikat LLM ke ontologi target. Penelitian ini mengevaluasi PolicyKG pada korpus Asian Institute of Technology (AIT) Policies and Procedures, yang terdiri atas 1.663 kalimat dan 443 aturan, serta menguji transfer domain ke tolok ukur GDPR dan kontrak sewa.
PolicyKG menjalankan empat tahap pada mesin status LangGraph dengan validator per tahap. Tahapannya adalah: (1) klasifikasi kalimat ke kategori deontik, (2) pengangkatan ke logika deontik orde pertama (FOL), (3) pembangkitan batasan SHACL, dan (4) validasi. Corpus Adapter adalah registry kosakata YAML yang memetakan predikat LLM ke ontologi target, memungkinkan retargeting dengan menukar registry alih-alih melatih ulang model. Jalur FOL menangani 79,2% aturan; aturan sisanya melewati fallback langsung NL-ke-SHACL. Arsitektur pipeline diilustrasikan di bawah ini:

Mengapa penting

Hasil menunjukkan bahwa PolicyKG secara efektif menjembatani celah antara kebijakan bahasa alami dan batasan yang dapat dibaca mesin, dengan akurasi klasifikasi deontik yang tinggi dan pembangkitan SHACL yang andal. Mekanisme penukaran registry pada Corpus Adapter memungkinkan retargeting domain tanpa pelatihan ulang model, terbukti dari peningkatan signifikan dalam penyelarasan properti saat berpindah dari AIT ke GDPR. Namun, penurunan Macro pada tolok ukur LexDeMod menyoroti sensitivitas pipeline terhadap ketidakcocokan kosakata, menegaskan pentingnya penyelarasan registry. Temuan audit bahwa tidak ada konstruk orde lebih tinggi yang terdeteksi pada korpus AIT bersifat spesifik untuk korpus ini dan tidak membuktikan kecukupan FOL untuk kebijakan institusional secara umum. Batas atas eksak 0,67% pada tingkat HOL yang sebenarnya memberikan ukuran kuantitatif atas ketidakpastian. Keluaran yang identik secara hash di seluruh eksekusi berulang menunjukkan perilaku deterministik, yang krusial untuk aplikasi kepatuhan. Penelitian selanjutnya harus memperluas audit ke korpus yang lebih beragam dan mengeksplorasi pembangkitan registry otomatis untuk mengurangi upaya manual dalam adaptasi domain.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ