Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Pratinjau Awal AI Lokal untuk Tinjauan Sejawat Triplet-Buta Manusia di Bidang Ilmu Kesehatan

Kerangka kerja multi-LLM lima tahap yang mengungkapkan keterlibatan AI sekaligus mempertahankan adjudikasi manusia
Rodrigo Martins Boosยท 2026ยท DOI 10.48550/arXiv.2608.14625

Masalah inti

Tinjauan sejawat akademik berada di bawah tekanan yang semakin berat. NeurIPS 2025 menerima 21.575 kiriman, ICLR 2025 menerima 11.603, dan ICML 2025 menerima 12.107. Volume ini telah melampaui pasokan peninjau yang berkualifikasi, dan large language model (LLM) sudah mengisi celah tersebut, sebagian besar tanpa diungkapkan. Analisis independen terhadap ICLR 2026 menemukan sekitar 21% dari 75.800 tinjauan sejawatnya sepenuhnya dihasilkan AI, dengan lebih dari setengahnya menunjukkan keterlibatan AI (naik dari 15,8% pada 2024). Risiko yang terdokumentasi mencakup kutipan halusinasi dalam makalah yang diterima dan instruksi prompt-injection tersembunyi yang disematkan dalam naskah untuk memanipulasi peninjau AI agar memberikan penilaian yang menguntungkan.

Kerangka kerja yang diusulkan mengatasi masalah ini untuk jurnal ilmu kesehatan dengan memformalkan dan mengungkapkan keterlibatan AI sekaligus mempertahankan peninjau manusia sebagai otoritas pengambilan keputusan akhir. Kerangka ini dirancang triplet-buta: penulis, peninjau, dan sistem AI sama-sama tidak mengetahui identitas satu sama lain. Kerangka kerja ini juga merespons kekhawatiran kerahasiaan di balik larangan NIH/NSF tenta

Inovasi

Kerangka kerja ini dikembangkan untuk jurnal ilmu kesehatan, tetapi tidak ada hasil empiris dari penerapan yang dilaporkan dalam sumber. Temuan kuantitatif utama yang dikutip berasal dari pekerjaan sebelumnya: Shen et al. melakukan benchmark lima LLM open-source pada klasifikasi kuartil 200 naskah dan menemukan akurasi kecocokan persis 35%, yang tidak memadai untuk penggunaan otonom. Hal ini mendukung pilihan desain kerangka kerja untuk mempertahankan adjudikasi manusia yang wajib. Selain itu, sumber mencatat bahwa tinjauan tradisional rata-rata membutuhkan 13 minggu hingga keputusan pertama, dan kerangka kerja yang diusulkan bertujuan mengurangi keterlambatan ini tanpa menggantikan penilaian manusia.
Tinjauan sejawat akademik berada di bawah tekanan yang semakin berat. NeurIPS 2025 menerima 21.575 kiriman, ICLR 2025 menerima 11.603, dan ICML 2025 menerima 12.107. Volume ini telah melampaui pasokan peninjau yang berkualifikasi, dan large language model (LLM) sudah mengisi celah tersebut, sebagian besar tanpa diungkapkan. Analisis independen terhadap ICLR 2026 menemukan sekitar 21% dari 75.800 tinjauan sejawatnya sepenuhnya dihasilkan AI, dengan lebih dari setengahnya menunjukkan keterlibatan AI (naik dari 15,8% pada 2024). Risiko yang terdokumentasi mencakup kutipan halusinasi dalam makalah yang diterima dan instruksi prompt-injection tersembunyi yang disematkan dalam naskah untuk memanipulasi peninjau AI agar memberikan penilaian yang menguntungkan.
Kerangka kerja yang diusulkan mengatasi masalah ini untuk jurnal ilmu kesehatan dengan memformalkan dan mengungkapkan keterlibatan AI sekaligus mempertahankan peninjau manusia sebagai otoritas pengambilan keputusan akhir. Kerangka ini dirancang triplet-buta: penulis, peninjau, dan sistem AI sama-sama tidak mengetahui identitas satu sama lain. Kerangka kerja ini juga merespons kekhawatiran kerahasiaan di balik larangan NIH/NSF tentang pengiriman proposal yang belum diterbitkan ke AI generatif pihak ketiga dengan menjalankan semua peninjau AI pada LLM open-weight yang dihosting secara lokal, menjaga konten naskah tetap berada dalam infrastruktur jurnal.

Mengapa penting

Kerangka kerja yang diusulkan menawarkan alternatif transparan yang diawasi manusia terhadap penggunaan AI yang tidak transparan dan tidak diatur saat ini dalam tinjauan sejawat. Dengan mengungkapkan keterlibatan AI dan mempertahankan peninjau manusia sebagai otoritas pengambilan keputusan akhir, kerangka ini memitigasi risiko seperti kutipan halusinasi dan serangan prompt-injection. Penggunaan LLM open-weight yang dihosting secara lokal mengatasi kekhawatiran kerahasiaan yang menyebabkan larangan NIH/NSF tentang pengiriman proposal yang belum diterbitkan ke AI generatif pihak ketiga. Desain triplet-buta lebih lanjut mengurangi bias. Namun, ketergantungan kerangka kerja pada pratinjau awal AI masih dapat menimbulkan kesalahan, dan akurasi kecocokan persis 35% dari LLM open-source pada klasifikasi kuartil menunjukkan bahwa AI tidak boleh dipercaya untuk keputusan otonom. Loop pengembalian ke penulis pada tahap pemeriksaan dan editor memberikan peluang untuk koreksi. Pekerjaan selanjutnya harus memvalidasi secara empiris dampak kerangka kerja terhadap kualitas tinjauan, waktu hingga keputusan, dan beban peninjau. Potensi kerangka kerja untuk mengurangi keterlambatan rata-rata 13 minggu hingga keputusan pertama menjanjikan tetapi belum terbukti. Secara keseluruhan, desain ini merupakan langkah yang dapat dipertahankan menuju integrasi AI ke dalam tinjauan sejawat secara bertanggung jawab.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ