Editorial Ilmu Komputer & AI
M-PreSS: Pelatihan Awal dan Penyesuaian Halus Siamese BlueBERT untuk Penyaringan Studi dalam Tinjauan Sistematis
Masalah inti
Produksi tinjauan sistematis terhambat pada tahap penyaringan. Satu tinjauan dapat membutuhkan seorang ahli untuk menilai ribuan judul dan abstrak, dan biaya ini berulang setiap kali pencarian diperbarui. Otomatisasi terawasi klasik โ paling kanonik Mesin Vektor Pendukung yang beroperasi pada fitur leksikal โ dapat menyerap sebagian beban kerja ini, tetapi model semacam itu dipelajari per topik dan memiliki generalisasi yang buruk. Sebuah pengklasifikasi yang dilatih untuk satu pertanyaan klinis jarang dapat dialihkan ke pertanyaan berikutnya, sehingga setiap tinjauan baru harus membayar kembali biaya anotasi, dan setiap pembaruan pada tinjauan yang ada berisiko membatalkan model yang telah dibangun untuknya.
Oleh karena itu, penelitian terbaru beralih ke model bahasa komersial besar seperti ChatGPT/GPT-4 sebagai penyaring *zero-shot* atau *few-shot*. M-PreSS (pendekatan Pelatihan Awal Model untuk Penyaringan Studi) berpendapat bahwa pertukaran ini tidak menguntungkan secara khusus untuk sintesis bukti. LLM komersial tidak transparan mengenai data pelatihannya, mereka bergeser antar versi, dan mereka tidak menawarkan jaminan reproduktifitas yang tahan lama โ justru sifat metodolog
Inovasi
Hasil utamanya adalah bahwa penyesuaian halus BlueBERT dengan dataset penyaringan studi dapat digeneralisasi secara berguna di berbagai topik. Di tujuh tinjauan sistematis COVID-19, M-PreSS mencapai **rata-rata *recall* (sensitivitas) sebesar 0,86**, dengan minimum **0,67** dan maksimum **1,00**. **Tingkat positif palsu rata-rata yang sesuai adalah 6,48%**, berkisar dari terendah **1,38%** hingga tertinggi **11,41%**. Dalam alur kerja penyaringan, angka *recall* menentukan apakah alat tersebut dapat diterima sama sekali โ *include* yang terlewat adalah mode kegagalan yang membatalkan tinjauan โ sementara tingkat positif palsu menentukan berapa banyak pekerjaan manusia yang tersisa setelah model menyaring korpus. FPR rata-rata sekitar satu dari lima belas catatan adalah perbedaan antara membaca ekspor basis data lengkap dan membaca daftar pendek.
Dua ablasi mengukur dari mana keuntungan berasal. Pertama, memperkaya definisi topik dengan **kriteria seleksi studi** tinjauan meningkatkan kinerja, diukur sebagai Area di Bawah Kurva Presisi-Recall (PRAUC), sebesar **2,74%**. Ini konsisten dengan pembingkaian Siamese: teks yang lebih kaya dan lebih spesifik di sisi topik pasangan memberi
Mengapa penting
Signifikansi angka-angka ini terletak kurang pada metrik tunggal mana pun daripada pada bentuk *trade-off* yang mereka gambarkan. Perbandingan dengan ChatGPT/GPT-4 bukanlah klaim superioritas universal โ model ini menang pada dua dari tiga topik yang diuji, dan karenanya kalah atau seri pada satu topik. Sebaliknya, argumennya adalah bahwa akurasi penyaringan yang mendekati atau lebih baik dapat dicapai menggunakan model yang silsilah data pelatihannya, bobot, dan perilaku dekodingnya semuanya dapat diperiksa, dan yang dapat dieksekusi ulang untuk mereproduksi keputusan penyaringan secara tepat. Dalam domain di mana log penyaringan itu sendiri adalah bagian dari catatan yang dipublikasikan, reproduktifitas bukanlah fitur kenyamanan.
Kontribusi kedua adalah ekstensibilitas. Karena M-PreSS menilai kesamaan antara definisi topik dan catatan, daripada mengeluarkan label spesifik topik, peneliti mempertahankan kemampuan untuk **terus memperbarui atau memperluas pencarian bukti terkait**. Tinjauan yang hidup dapat menambahkan catatan yang baru diterbitkan atau memperluas definisi topiknya tanpa membuang dan melatih ulang pengklasifikasi khusus. Ablasi yang menunjukkan peningkatan PRAUC sebesar 15,82% dari pelatihan dengan lebih banyak topik tinjauan terkait adalah ekspresi kuantitatif dari maksud desain ini: cakupan pertanyaan klinis tetangga adalah yang membuat *encoder* bersama menjadi penyaring umum daripada filter tujuan tunggal.
Kontribusi ketiga adalah ekonomi sumber daya. Para penulis melaporkan **pengurangan signifikan dalam persyaratan sumber daya komputasi** relatif terhadap LLM komersial besar. Untuk kelompok penelitian yang menjalankan banyak tinjauan secara paralel, atau menjalankannya dalam pengaturan sumber daya rendah, ini mengubah tinjauan mana yang dapat diotomatisasi sama sekali โ inferensi skala *encoder* secara luas terjangkau di mana panggilan API model *frontier* berulang atas ribuan catatan mungkin tidak.
Rentang yang dilaporkan juga menandai batas jujur dari metode ini. *Recall* minimum 0,67 pada topik tersulit, dan tingkat positif palsu maksimum 11,41%, menunjukkan heterogenitas yang berarti di seluruh topik tinjauan. *Recall* pada batas bawah itu tidak akan dapat diterima sebagai filter mandiri dalam tinjauan berisiko tinggi; penerapan yang tepat adalah lapisan prioritas yang keluarannya masih sepenuhnya disaring manusia. Basis bukti di sini adalah tujuh tinjauan COVID-19, korpus penyakit tunggal, dan belum ditetapkan seberapa jauh klaim generalisasi meluas ke domain lain, jenis publikasi lain, atau catatan non-Inggris. Akhirnya, generalisasi diukur pada tingkat topik untuk tinjauan yang diambil dari literatur pandemi yang sama; topik yang benar-benar di luar distribusi tetap menjadi pertanyaan terbuka, dan peningkatan campuran pelatihan 15,82% menunjukkan bahwa jawabannya sangat bergantung pada seberapa banyak materi terkait yang dapat disediakan oleh pelatih sebelumnya.
Siapa yang sebaiknya membaca
Membuka konten memberโฆ