Editorial ilmu komputer
Pengenalan Entitas Bernama Kustom dan Klasifikasi Topik untuk Publikasi Kesehatan Global
Masalah inti
Inovasi
Temuan utama dari eksperimen:
- **Penemuan Tag Semantik**: Cakupan kosakata yang lebih luas tidak selalu menghasilkan asosiasi spesifik domain yang lebih berguna. Evaluasi kualitatif menunjukkan bahwa korpus khusus berukuran sedang mungkin cukup untuk penemuan tag yang bermakna.
- **Pengenalan Entitas Bernama**: Di bawah penilaian yang longgar, transformer RoBERTa mencapai 0,80 micro-, mengungguli model konvolusional (0,65-0,69). Namun, waktu inferensinya (82 detik) lebih dari 13 kali lebih lama daripada model konvolusional (5-6 detik). Pengenal penyakit terintegrasi mencapai 81,33% uji pada NCBI Disease Corpus.
- **Klasifikasi Topik**: Inferensi zero-shot BART-MNLI mencapai akurasi label tunggal 95,2%, jauh lebih tinggi daripada MiniLM few-shot (59%). Untuk klasifikasi multi-label, BART-MNLI mencapai akurasi 88% versus 32% untuk MiniLM di bawah penilaian sebagian manual. Namun, biaya inferensi BART-MNLI yang lebih tinggi membatasi integrasi praktis.
Hasil ini menyoroti trade-off antara akurasi dan efisiensi komputasi.
Mengapa penting
Siapa yang sebaiknya membaca
Membuka konten memberโฆ