Editorial Ilmu Komputer & AI
Open AccessOA2025
Sistem Perangkat Lunak Klasifikasi Teks Berbasis Machine Learning dan Recurrent Neural Network
Studi komparatif arsitektur Naive Bayes, SVM, dan LSTM untuk kategorisasi teks otomatis dalam bahasa Inggris dan Ukraina
A. Hlybovets; Andrii Dubovyk; A. Afonin· NaUKMA Research Papers Computer Science· 2025· DOI 10.18523/2617-3808.2025.8.15-27
Masalah inti
Pertumbuhan eksponensial data yang dapat diakses dan kemajuan pesat teknologi informasi membuat pengelolaan analisis data yang efisien semakin krusial. Klasifikasi teks otomatis—menetapkan teks ke kategori yang telah ditentukan—tetap menjadi tantangan utama karena keragaman format, variabilitas struktural, dan kompleksitas semantik bahasa alami. Makalah ini mengatasi tantangan tersebut dengan mengembangkan dan menguji sistem perangkat lunak untuk klasifikasi teks otomatis, termasuk teks yang ditulis dalam bahasa Ukraina. Sistem ini menggunakan tiga model: Naive Bayes, Support Vector Machine (SVM), dan arsitektur Recurrent Neural Network (RNN) berbasis LSTM, serta kombinasinya. Tujuan utamanya adalah menyediakan alat yang cepat, akurat, dan ramah pengguna yang memungkinkan pengguna melatih sistem pada dataset mereka sendiri dan mengonfigurasi parameter untuk hasil yang optimal. Hipotesis yang diuji adalah bahwa model khusus, selain jauh lebih efisien dalam sumber daya, dapat mengungguli large language model (LLM) dalam tugas klasifikasi teks.
Inovasi
Aplikasi grafis yang dikembangkan mencapai akurasi sekitar 92% dalam mengklasifikasikan teks ke dalam empat kategori ("World", "Sports", "Science/Technology", "Business") untuk bahasa Inggris dan Ukraina. Pengujian mengonfirmasi hipotesis bahwa model khusus dapat mengungguli large language model dalam tugas klasifikasi teks sekaligus jauh lebih efisien dalam sumber daya. Sistem ini juga dengan cepat diadaptasi untuk penyaringan spam, di mana model SVM mencapai akurasi sekitar 99% dalam mengidentifikasi pesan spam tipikal dalam hitungan detik. Selain itu, sistem ini menunjukkan kemampuan dalam mendeteksi nada emosional dalam teks, mencapai akurasi 87,75%. Hasil ini menyoroti efektivitas pendekatan gabungan dan potensi model khusus untuk tugas NLP tertentu.
Pertumbuhan eksponensial data yang dapat diakses dan kemajuan pesat teknologi informasi membuat pengelolaan analisis data yang efisien semakin krusial. Klasifikasi teks otomatis—menetapkan teks ke kategori yang telah ditentukan—tetap menjadi tantangan utama karena keragaman format, variabilitas struktural, dan kompleksitas semantik bahasa alami. Makalah ini mengatasi tantangan tersebut dengan mengembangkan dan menguji sistem perangkat lunak untuk klasifikasi teks otomatis, termasuk teks yang ditulis dalam bahasa Ukraina. Sistem ini menggunakan tiga model: Naive Bayes, Support Vector Machine (SVM), dan arsitektur Recurrent Neural Network (RNN) berbasis LSTM, serta kombinasinya. Tujuan utamanya adalah menyediakan alat yang cepat, akurat, dan ramah pengguna yang memungkinkan pengguna melatih sistem pada dataset mereka sendiri dan mengonfigurasi parameter untuk hasil yang optimal. Hipotesis yang diuji adalah bahwa model khusus, selain jauh lebih efisien dalam sumber daya, dapat mengungguli large language model (LLM) dalam tugas klasifikasi teks.
Sistem perangkat lunak ini diimplementasikan dalam Python, memanfaatkan pustaka inti termasuk TensorFlow, scikit-learn, Natural Language Toolkit (nltk), NumPy, dan Pandas. Matplotlib dan Seaborn digunakan untuk visualisasi data. Tugas klasifikasi melibatkan empat kategori: "World", "Sports", "Science/Technology", dan "Business". Untuk pelatihan model, "AG News Classification Dataset" dari Kaggle.com digunakan. Sistem ini mendukung teks dalam bahasa Inggris dan Ukraina. Tiga model utama digunakan: Naive Bayes, SVM, dan RNN berbasis LSTM. Arsitektur LSTM sangat cocok untuk data sekuensial seperti teks, menangkap dependensi jangka panjang. Formulasi matematis sel LSTM mencakup gerbang forget, input, dan output, yang mengatur aliran informasi. Untuk urutan input tertentu , LSTM menghitung hidden state dan cell state sebagai berikut:
Mengapa penting
Temuan ini menunjukkan bahwa meskipun large language model telah menjadi populer, model khusus seperti Naive Bayes, SVM, dan RNN berbasis LSTM tetap sangat kompetitif untuk klasifikasi teks, terutama ketika efisiensi sumber daya menjadi perhatian. Kemampuan sistem untuk menangani teks Ukraina mengatasi kesenjangan dalam alat NLP untuk bahasa yang kurang umum didukung. Akurasi tinggi dalam penyaringan spam (99%) dan deteksi emosi (87,75%) lebih lanjut menunjukkan fleksibilitas pendekatan ini. Arsitektur modular memungkinkan adaptasi yang mudah ke tugas klasifikasi lainnya. Namun, studi ini juga mengakui batasan, seperti ketergantungan pada dataset tertentu (AG News) dan kebutuhan pengujian lebih lanjut pada domain yang beragam. Pekerjaan di masa depan dapat mengeksplorasi integrasi arsitektur jaringan saraf lain dan dataset multibahasa yang lebih besar. Dukungan dari Simons Foundation (SFI-PD-Ukraine-00014577; T.S.) diakui dengan penuh rasa terima kasih.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten member…