Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2024

Metrik evaluasi dan uji statistik untuk machine learning

Digest ini merangkum makalah Scientific Reports yang memperkenalkan metrik evaluasi umum untuk tugas supervised machine learning dan menjelaskan cara memilih serta melakukan uji statistik untuk perbandingan model, dengan contoh dari pencitraan medis.
O. Rainio; J. Teuho; R. Klรฉnยท Scientific Reportsยท 2024ยท DOI 10.1038/s41598-024-56706-x

Masalah inti

Machine learning (ML) telah menjadi pendekatan dominan di banyak bidang ilmiah, namun mengevaluasi dan membandingkan model ML tetap menantang bagi peneliti tanpa latar belakang statistik yang kuat. Makalah ini menjawab kesenjangan tersebut dengan memberikan ikhtisar komprehensif metrik evaluasi untuk tugas supervised ML yang umum: klasifikasi biner, multi-kelas, dan multi-label, regresi, segmentasi citra, deteksi objek, dan temu kembali informasi. Makalah ini juga memberikan panduan dalam memilih uji statistik yang tepat untuk membandingkan model, menentukan jumlah nilai metrik yang diperlukan untuk pengujian yang andal, dan menafsirkan hasil uji. Motivasinya adalah memungkinkan peneliti menilai kinerja model secara rigor dan membuat perbandingan yang terinformasi, khususnya di domain seperti pencitraan medis yang keputusannya dapat berdampak kritis.

Inovasi

Penulis melakukan tinjauan metodologis dan tutorial. Mereka secara sistematis mengategorikan metrik evaluasi berdasarkan jenis tugas, menjelaskan intuisi, formula, dan kasus penggunaan yang tepat untuk masing-masing metrik. Untuk klasifikasi, mereka membahas metrik seperti akurasi, presisi, recall, -score, dan area under the ROC curve (AUC). Untuk regresi, mereka membahas mean squared error (MSE), mean absolute error (MAE), dan koefisien determinasi (). Untuk segmentasi citra, mereka menjelaskan Dice coefficient dan Intersection over Union (IoU). Untuk deteksi objek, mereka menyajikan mean Average Precision (mAP). Untuk temu kembali informasi, mereka menyertakan precision@k dan mean average precision (MAP). Makalah ini kemudian menguraikan prosedur untuk perbandingan model: (1) pilih metrik yang sesuai, (2) peroleh beberapa nilai kinerja melalui cross-validation atau repeated holdout, (3) pilih uji statistik berdasarkan karakteristik data dan tujuan perbandingan, dan (4) tafsirkan hasil uji, termasuk effect size dan interval kepercayaan. Mereka menekankan pentingnya uji berpasangan saat membandingkan model pada pembagian data yang sama, dan membahas alternatif parametrik (misalnya paired t-test) dan non-parametrik (misalnya Wilcoxon signed-rank test). Mereka juga membahas koreksi perbandingan berganda, seperti Bonferroni dan Holm-Bonferroni. Metodologi ini diilustrasikan dengan dua studi kasus: klasifikasi citra X-ray untuk berbagai infeksi paru dan deteksi tumor kanker pada citra positron emission tomography (PET) menggunakan convolutional neural network (CNN).
Pendahuluan
Machine learning (ML) telah menjadi pendekatan dominan di banyak bidang ilmiah, namun mengevaluasi dan membandingkan model ML tetap menantang bagi peneliti tanpa latar belakang statistik yang kuat. Makalah ini menjawab kesenjangan tersebut dengan memberikan ikhtisar komprehensif metrik evaluasi untuk tugas supervised ML yang umum: klasifikasi biner, multi-kelas, dan multi-label, regresi, segmentasi citra, deteksi objek, dan temu kembali informasi. Makalah ini juga memberikan panduan dalam memilih uji statistik yang tepat untuk membandingkan model, menentukan jumlah nilai metrik yang diperlukan untuk pengujian yang andal, dan menafsirkan hasil uji. Motivasinya adalah memungkinkan peneliti menilai kinerja model secara rigor dan membuat perbandingan yang terinformasi, khususnya di domain seperti pencitraan medis yang keputusannya dapat berdampak kritis.

Mengapa penting

Penulis membahas implikasi rekomendasi mereka untuk penelitian dan praktik ML. Mereka menekankan bahwa tidak ada satu metrik yang terbaik secara universal; pilihannya bergantung pada tugas, keseimbangan data, dan biaya kesalahan. Untuk klasifikasi tidak seimbang, mereka merekomendasikan precision-recall AUC daripada ROC AUC. Mereka memperingatkan agar tidak hanya mengandalkan akurasi ketika kelas tidak seimbang. Untuk perbandingan model, mereka menganjurkan uji berpasangan dan beberapa pengulangan cross-validation untuk mengurangi varians dan meningkatkan kekuatan statistik. Mereka mencatat bahwa uji non-parametrik sering lebih tepat untuk ukuran sampel kecil atau distribusi metrik yang tidak normal. Makalah ini juga membahas jebakan umum: mengabaikan perbandingan berganda, salah menafsirkan p-value, dan gagal melaporkan effect size. Mereka menyediakan diagram alur keputusan (lihat diagram Mermaid) untuk memandu peneliti dalam memilih uji yang tepat. Akhirnya, mereka menyoroti pentingnya pelaporan transparan prosedur evaluasi dan hasil statistik untuk memfasilitasi reproduksibilitas. Batasannya meliputi fokus pada tugas supervised dan pengecualian isu spesifik deep learning seperti hyperparameter tuning. Pekerjaan selanjutnya dapat diperluas ke unsupervised dan reinforcement learning.

Siapa yang sebaiknya membaca

Pembaca Research Digest dan praktisi rumpun ini.

Membuka konten memberโ€ฆ