Editorial ilmu komputer
Open AccessOA2026
Mengurangi Halusinasi pada Large Language Model Melalui Verifikasi Diri Terintegrasi dan Retrieval-Augmented Generation
CoVe-RAG+: Kerangka Kerja Terpadu untuk LLM yang Tepercaya dalam Desain Teknik
Ashly Joseph· 2026· DOI 10.48550/arXiv.2609.26229
Masalah inti
Large Language Model (LLM) semakin banyak digunakan untuk tugas teknik tingkat lanjut seperti dokumentasi Computer-Aided Design (CAD), verifikasi kepatuhan standar, dan pengambilan pengetahuan. Namun, kecenderungannya menghasilkan halusinasi—keluaran yang meyakinkan tetapi tidak berdasar—melemahkan kepercayaan pada aplikasi teknik berisiko tinggi yang menuntut presisi dan kepatuhan regulasi. Makalah ini menjawab kebutuhan kritis akan keluaran LLM yang andal dengan memperkenalkan CoVe-RAG+, kerangka kerja terpadu yang menggabungkan Chain-of-Verification (CoVe) dengan Retrieval-Augmented Generation (RAG). Tujuannya adalah mengurangi halusinasi dengan mendasarkan respons LLM pada sumber eksternal yang otoritatif, termasuk standar teknik, data CAD, dan laporan simulasi, sekaligus menerapkan verifikasi diri berulang untuk memvalidasi klaim utama. Karya ini diposisikan dalam konteks yang lebih luas untuk meningkatkan keandalan LLM bagi proses desain teknik, tempat akurasi faktual tidak bisa ditawar.
Inovasi
Penulis mengevaluasi CoVe-RAG+ pada tiga tugas teknik: dokumentasi model CAD, verifikasi kepatuhan standar, dan penggunaan kembali data desain historis. Hasil eksperimen menunjukkan peningkatan 28% dalam akurasi faktual dibandingkan metodologi baseline CoVe dan RAG. Peningkatan ini diukur menggunakan kombinasi pemeriksaan fakta otomatis terhadap sumber ground-truth dan evaluasi manusia oleh pakar domain. Selain itu, CoVe-RAG+ meningkatkan kepercayaan pengguna dengan menyediakan laporan verifikasi penjelas yang merinci klaim mana yang didukung oleh sumber mana, sehingga menawarkan ketertelusuran penuh. Sistem ini juga mengurangi insiden halusinasi, terutama untuk kueri kompleks yang memerlukan penalaran multi-hop di seluruh standar dan dokumen desain. Makalah ini melaporkan bahwa laporan verifikasi sangat membantu insinyur menilai keandalan keluaran LLM dengan cepat, yang mengarah pada tingkat adopsi lebih tinggi dalam alur kerja desain.
Large Language Model (LLM) semakin banyak digunakan untuk tugas teknik tingkat lanjut seperti dokumentasi Computer-Aided Design (CAD), verifikasi kepatuhan standar, dan pengambilan pengetahuan. Namun, kecenderungannya menghasilkan halusinasi—keluaran yang meyakinkan tetapi tidak berdasar—melemahkan kepercayaan pada aplikasi teknik berisiko tinggi yang menuntut presisi dan kepatuhan regulasi. Makalah ini menjawab kebutuhan kritis akan keluaran LLM yang andal dengan memperkenalkan CoVe-RAG+, kerangka kerja terpadu yang menggabungkan Chain-of-Verification (CoVe) dengan Retrieval-Augmented Generation (RAG). Tujuannya adalah mengurangi halusinasi dengan mendasarkan respons LLM pada sumber eksternal yang otoritatif, termasuk standar teknik, data CAD, dan laporan simulasi, sekaligus menerapkan verifikasi diri berulang untuk memvalidasi klaim utama. Karya ini diposisikan dalam konteks yang lebih luas untuk meningkatkan keandalan LLM bagi proses desain teknik, tempat akurasi faktual tidak bisa ditawar.
CoVe-RAG+ beroperasi melalui pendekatan dua arah: augmentasi pengambilan dan verifikasi diri berulang. Pertama, dengan adanya kueri pengguna, sistem mengambil dokumen relevan dari basis pengetahuan terkurasi yang terdiri atas standar teknik (misalnya ISO, ASME), metadata model CAD, dan laporan simulasi. Bagian yang diambil ini berfungsi sebagai bukti eksternal. Kedua, LLM menghasilkan respons awal, yang kemudian menjalani proses Chain-of-Verification. Proses ini melibatkan penguraian respons menjadi klaim atomik, perumusan pertanyaan verifikasi untuk setiap klaim, dan kueri ulang ke sistem pengambilan untuk mengonfirmasi atau menyangkal setiap klaim. Hasil verifikasi diagregasi untuk menghasilkan jawaban akhir, bersama laporan verifikasi yang menyoroti klaim yang didukung, klaim yang tidak didukung, dan ketertelusuran sumber. Proses ini dapat diformalkan sebagai berikut: misalkan adalah kueri, dokumen yang diambil, dan respons awal. Untuk setiap klaim dalam , pertanyaan verifikasi dihasilkan, dan fungsi pengambilan mengembalikan bukti . Klaim diterima jika mengimplikasikan ; jika tidak, klaim direvisi atau ditolak. Respons akhir dibangun dari klaim yang terverifikasi. Lingkaran berulang ini berlanjut hingga semua klaim terverifikasi atau ditandai. Kerangka kerja ini dirancang agar agnostik terhadap model dan skalabel, serta terintegrasi mulus dengan pipeline LLM yang ada.
Mengapa penting
Temuan ini menunjukkan bahwa mengintegrasikan verifikasi diri dengan augmentasi pengambilan secara signifikan meningkatkan kepercayaan pada LLM dalam konteks teknik. Kenaikan akurasi 28% menegaskan nilai mendasarkan keluaran LLM pada sumber otoritatif dan memvalidasi klaim secara sistematis. Penyediaan laporan verifikasi menjawab sifat 'black-box' LLM dengan membuat proses penalaran transparan dan dapat diaudit, yang krusial bagi industri yang digerakkan kepatuhan. Namun, pendekatan ini memiliki batasan: bergantung pada kualitas dan cakupan korpus pengambilan, dan proses verifikasi berulang dapat menimbulkan latensi. Pekerjaan selanjutnya dapat mengeksplorasi optimalisasi efisiensi pengambilan dan memperluas kerangka kerja ke domain lain seperti keamanan siber dan desain jaringan, tempat risiko halusinasi serupa juga ada. Secara keseluruhan, CoVe-RAG+ merupakan solusi skalabel dan andal untuk menerapkan LLM dalam proses desain teknik berisiko tinggi, membuka jalan bagi adopsi yang lebih luas dalam aplikasi yang kritis terhadap keselamatan.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten member…