Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2025

Klasifikasi Genom Virus yang Ditingkatkan Menggunakan Model Bahasa Besar

Model Bahasa Besar (LM) DNAGPT, DNABERT, dan GENA yang telah disesuaikan mengungguli model pembelajaran mesin klasik dan pembelajaran mendalam, dengan DNAGPT mencapai akurasi 96% dalam klasifikasi sekuens genom.
Hemalatha Gunasekaran; N. Blessing; Umar Sathic; Mohd Shahid Husainยท Algorithmsยท 2025ยท DOI 10.3390/a18060302

Masalah inti

Klasifikasi sekuens genom telah menjadi landasan virologi modern, didorong oleh frekuensi wabah yang semakin cepat dan munculnya patogen baru. Repositori publik kini menyimpan volume besar sekuens genom yang diambil dari manusia, hewan, tumbuhan, bakteri, dan virus โ€” sebuah korpus yang kaya akan sinyal namun sulit diinterpretasikan, karena genom virus bermutasi terus-menerus dan menghasilkan varian serta strain baru yang mungkin tidak menyerupai referensi yang telah dikarakterisasi sebelumnya.

Pembelajaran mesin telah menjadi perangkat standar untuk masalah ini. Algoritma tradisional seperti Random Forest (RF), K-nearest neighbors (KNN), Decision Tree (DT), dan Naive Bayes (NB) menawarkan interpretasi dan biaya komputasi rendah, sementara arsitektur pembelajaran mendalam โ€” Convolutional Neural Networks (CNNs), Long Short-Term Memory (LSTM) networks, dan Bi-Directional LSTM (BiLSTM) networks โ€” memperluas jangkauan pengklasifikasi ke dependensi kompleks jarak jauh yang tertanam dalam sekuens nukleotida. Setiap keluarga membawa bias induktif yang berbeda: RF mengagregasi pohon keputusan yang tidak berkorelasi, KNN melakukan pencocokan kesamaan berbasis instans, DT mempartisi ruang fi

Inovasi

Di seluruh evaluasi komparatif, model bahasa besar genomik mengungguli baik algoritma pembelajaran mesin tradisional maupun arsitektur pembelajaran mendalam. Hasil utamanya adalah bahwa **DNAGPT mencapai akurasi 96%**, melampaui kinerja model pembelajaran mesin dan pembelajaran mendalam terkini yang diuji dalam studi yang sama. DNABERT dan GENA LM juga disesuaikan dan dievaluasi bersama DNAGPT sebagai bagian dari keluarga model berbasis NLP, sementara RF, KNN, DT, dan NB mewakili baseline algoritmik tradisional dan CNN, LSTM, serta BiLSTM mewakili baseline pembelajaran mendalam.

Urutan hasil mengikuti pola yang dapat dikenali dalam pembelajaran representasi. Algoritma klasik sangat bergantung pada kekuatan diskriminatif dari ruang fitur yang direkayasa โ€” biasanya frekuensi k-mer atau vektor komposisi โ€” dan oleh karena itu jenuh setelah sinyal informatif ditangkap oleh fitur-fitur tersebut. Model sekuens seperti CNN, LSTM, dan BiLSTM mempelajari fitur langsung dari aliran nukleotida dan meningkatkan baseline tradisional, tetapi tetap dibatasi oleh ukuran receptive field konvolusional dalam kasus CNN dan oleh propagasi informasi sekuensial dalam kasus rekuren. Model bahasa genomik y

Klasifikasi sekuens genom telah menjadi landasan virologi modern, didorong oleh frekuensi wabah yang semakin cepat dan munculnya patogen baru. Repositori publik kini menyimpan volume besar sekuens genom yang diambil dari manusia, hewan, tumbuhan, bakteri, dan virus โ€” sebuah korpus yang kaya akan sinyal namun sulit diinterpretasikan, karena genom virus bermutasi terus-menerus dan menghasilkan varian serta strain baru yang mungkin tidak menyerupai referensi yang telah dikarakterisasi sebelumnya.
Pembelajaran mesin telah menjadi perangkat standar untuk masalah ini. Algoritma tradisional seperti Random Forest (RF), K-nearest neighbors (KNN), Decision Tree (DT), dan Naive Bayes (NB) menawarkan interpretasi dan biaya komputasi rendah, sementara arsitektur pembelajaran mendalam โ€” Convolutional Neural Networks (CNNs), Long Short-Term Memory (LSTM) networks, dan Bi-Directional LSTM (BiLSTM) networks โ€” memperluas jangkauan pengklasifikasi ke dependensi kompleks jarak jauh yang tertanam dalam sekuens nukleotida. Setiap keluarga membawa bias induktif yang berbeda: RF mengagregasi pohon keputusan yang tidak berkorelasi, KNN melakukan pencocokan kesamaan berbasis instans, DT mempartisi ruang fitur secara serakah, dan NB menerapkan asumsi independensi probabilistik yang jarang berlaku untuk kemunculan bersama nukleotida.

Mengapa penting

Akurasi 96% yang dicapai oleh DNAGPT paling baik dijelaskan oleh transfer representasi genomik yang telah dilatih sebelumnya ke tugas klasifikasi hilir. Model bahasa genomik terpapar korpora nukleotida besar selama pelatihan awal, sehingga bobot perhatiannya mengkodekan keteraturan statistik โ€” kemunculan bersama motif, struktur mirip kodon, daerah yang dilestarikan, dan bias komposisi โ€” yang seharusnya ditemukan dari awal oleh model supervised dengan data berlabel yang jauh lebih sedikit. Fine-tuning kemudian menyelaraskan representasi umum ini dengan ruang label spesifik dari masalah klasifikasi.

Faktor kedua adalah arsitektural. Self-attention menghitung interaksi berpasangan antara semua posisi token dalam satu lapisan, memberikan model receptive field global. CNN harus menumpuk lapisan untuk memperlebar jendela efektifnya, dan LSTM harus menyebarkan keadaan langkah demi langkah, yang melemahkan dependensi jarak jauh. Untuk sekuens genomik, di mana motif regulasi dan elemen fungsional dapat dipisahkan oleh ribuan nukleotida, pandangan global ini adalah keuntungan struktural daripada peningkatan penyetelan inkremental.

Implikasi praktisnya berkaitan dengan pengawasan dan respons wabah. Pengklasifikasi yang secara andal menetapkan sekuens genomik ke kategori yang benar mendukung pelacakan varian, atribusi sumber, dan prioritas sampel untuk analisis lebih dalam. Meningkatkan akurasi mendekati sembilan puluhan tinggi mengurangi beban penugasan yang salah yang menumpuk ketika klasifikasi diterapkan pada skala repositori, di mana bahkan tingkat kesalahan kecil menghasilkan jumlah absolut sekuens yang salah label yang besar.

Beberapa peringatan mengikuti dari kerangka studi itu sendiri. Klaim ini bersifat komparatif dalam satu protokol eksperimental: 96% DNAGPT diukur terhadap baseline RF, KNN, DT, NB, CNN, LSTM, dan BiLSTM yang dievaluasi di sini, bukan terhadap lanskap metode yang diterbitkan secara menyeluruh. Model bahasa genomik juga lebih berat untuk dilatih dan dilayani daripada pohon keputusan atau pengklasifikasi KNN, sehingga peningkatan akurasi membawa biaya komputasi yang harus dibenarkan oleh konteks penyebaran. Akhirnya, sekuens genomik bermutasi dan membentuk varian baru; model yang disesuaikan pada distribusi strain tertentu menghadapi risiko pergeseran distribusi yang berkelanjutan saat varian baru muncul. Ini mendukung fine-tuning ulang secara berkala dan protokol evaluasi yang menahan sekuens yang secara temporal atau taksonomi jauh, daripada hanya pembagian acak.

Secara arah, hasil ini mendukung perlakuan sekuens nukleotida sebagai bahasa alami dan penggunaan kembali perangkat NLP yang matang โ€” backbone yang telah dilatih sebelumnya, tokenizers, dan fine-tuning yang efisien parameter โ€” sebagai pendekatan kelas satu dalam klasifikasi virologi, melengkapi daripada hanya menggantikan baseline klasik dan pembelajaran mendalam.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ