Editorial Ilmu Komputer & AI
Menjelajahi Integrasi Large Language Model dalam Diagnosis Histopatologis Penyakit Kulit: Sebuah Studi Komparatif
Masalah inti
Inovasi
ChatGPT-3.5 mencapai kesesuaian lengkap pada 29 kasus (48,4%), kesesuaian sebagian pada 14 kasus (23,3%), dan tidak ada kesesuaian pada 17 kasus (28,3%). Gemini menunjukkan kesesuaian lengkap pada 20 kasus (33%), kesesuaian sebagian pada 9 kasus (15%), dan tidak ada kesesuaian pada 31 kasus (52%). Ahli patologi eksternal memiliki kesesuaian lengkap pada 36 kasus (60%), kesesuaian sebagian pada 17 kasus (28%), dan tidak ada kesesuaian pada 7 kasus (12%). Perbedaan signifikan dalam kesesuaian diagnostik ditemukan antara LLM dan ahli patologi (P < 0,001). Distribusi tingkat kesesuaian dirangkum dalam tabel berikut:
| Evaluator | Complete Agreement | Partial Agreement | No Agreement |
|-----------------|--------------------|-------------------|--------------|
| ChatGPT-3.5 | 29 (48.4%) | 14 (23.3%) | 17 (28.3%) |
| Gemini | 20 (33%) | 9 (15%) | 31 (52%) |
| External Pathologist | 36 (60%) | 17 (28%) | 7 (12%) |
Uji chi-square mengonfirmasi perbedaan signifikan dalam tingkat kesesuaian antara LLM dan ahli patologi manusia, dengan nilai p kurang dari 0,001.
Mengapa penting
Hasil menunjukkan bahwa meskipun ChatGPT-3.5 dan Gemini dapat memberikan diagnosis akurat pada kasus tertentu, kinerja keseluruhannya belum memadai untuk penggunaan yang andal dalam lingkungan klinis nyata. ChatGPT-3.5 mengungguli Gemini, dengan tingkat kesesuaian lengkap lebih tinggi (48,4% vs. 33%) dan tingkat tidak ada kesesuaian lebih rendah (28,3% vs. 52%). Namun, kedua LLM tertinggal dari ahli patologi eksternal, yang mencapai kesesuaian lengkap 60%. Perbedaan signifikan (P < 0,001) menegaskan batasan LLM saat ini dalam akurasi diagnostik. Potensi manfaat LLM mencakup analisis cepat data kompleks dan bantuan dalam diagnosis banding, tetapi bias dan kendala seperti ketergantungan pada deskripsi tekstual tanpa gambar, potensi halusinasi, dan kurangnya konteks klinis harus diatasi. Temuan studi ini sejalan dengan kebutuhan integrasi LLM secara hati-hati sebagai alat pendukung, bukan pengganti keahlian manusia. Penelitian selanjutnya harus mengeksplorasi LLM multimodal yang menyertakan gambar histopatologi serta dataset yang lebih besar dan beragam untuk meningkatkan generalisasi. Persamaan untuk tingkat kesesuaian diagnostik dapat dinyatakan sebagai:
Studi ini menyoroti pentingnya validasi yang ketat sebelum penerapan klinis LLM di bidang patologi.
Siapa yang sebaiknya membaca
Membuka konten member…