Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2026

ELLMW: model visi–bahasa yang ditingkatkan untuk ekstraksi teks yang andal dari naskah yang ditulis tangan

Kerangka hibrida CNN–LSTM dan koreksi pascaproses LLM dengan akurasi 97,8% pada naskah jawaban ujian tulisan tangan
Dr. J. Venkatesh; Brintha Rajakumari Sivaraj· International Journal of Reconfigurable and Embedded Systems (IJRES)· 2026· DOI 10.11591/ijres.v15.i1.pp194-203

Masalah inti

Sistem optical character recognition (OCR) konvensional dapat mendigitalkan teks cetak, tetapi kesulitan menghadapi gaya tulisan tangan yang beragam, masukan yang bising, dan tata letak yang tidak terstruktur, sehingga membatasi efektivitasnya untuk dokumen tulisan tangan di dunia nyata. Penelitian ini menjawab kesenjangan tersebut dengan mengusulkan enhanced large language model whisperer (ELLMW), sebuah kerangka visi–bahasa yang dirancang untuk ekstraksi teks (TE) yang akurat dari naskah yang sepenuhnya ditulis tangan. Domain aplikasi yang disasar adalah naskah jawaban ujian tulisan tangan (HEAS), di mana variasi tulisan, kualitas kertas, dan tata letak membuat digitalisasi otomatis sangat menantang. Penulis memosisikan ELLMW sebagai pipeline lengkap yang tidak hanya mengenali karakter tetapi juga menghasilkan teks terbaca mesin yang sadar konteks dan koheren secara struktural, dengan otomatis mengoreksi kesalahan ejaan, tata bahasa, dan tata letak. Karya ini diterbitkan di International Journal of Reconfigurable and Embedded Systems (IJRES), DOI 10.11591/ijres.v15.i1.pp194-203, dan ditulis oleh Dr. J. Venkatesh dan Brintha Rajakumari Sivaraj.

Inovasi

Evaluasi eksperimental dilakukan pada dataset terkurasi berisi naskah jawaban ujian tulisan tangan (HEAS). ELLMW mencapai akurasi 97,8%, character error rate (CER) 1,04%, dan word error rate (WER) 3,24%. Hasil ini menunjukkan ketangguhan pada gaya tulisan tangan yang beragam, latar belakang yang bising, dan struktur dokumen yang kompleks. Penulis melaporkan bahwa ELLMW mengungguli alat OCR yang banyak digunakan termasuk Tesseract, EasyOCR, Google Cloud Vision (GCV), PaddleOCR, ABBYY FineReader, dan Transym OCR. Metrik yang dilaporkan menunjukkan bahwa kombinasi pengenalan CNN–LSTM dengan koreksi pascaproses berbasis LLM secara substansial menurunkan kesalahan pada tingkat karakter maupun kata dibandingkan baseline OCR konvensional.
Sistem optical character recognition (OCR) konvensional dapat mendigitalkan teks cetak, tetapi kesulitan menghadapi gaya tulisan tangan yang beragam, masukan yang bising, dan tata letak yang tidak terstruktur, sehingga membatasi efektivitasnya untuk dokumen tulisan tangan di dunia nyata. Penelitian ini menjawab kesenjangan tersebut dengan mengusulkan enhanced large language model whisperer (ELLMW), sebuah kerangka visi–bahasa yang dirancang untuk ekstraksi teks (TE) yang akurat dari naskah yang sepenuhnya ditulis tangan. Domain aplikasi yang disasar adalah naskah jawaban ujian tulisan tangan (HEAS), di mana variasi tulisan, kualitas kertas, dan tata letak membuat digitalisasi otomatis sangat menantang. Penulis memosisikan ELLMW sebagai pipeline lengkap yang tidak hanya mengenali karakter tetapi juga menghasilkan teks terbaca mesin yang sadar konteks dan koheren secara struktural, dengan otomatis mengoreksi kesalahan ejaan, tata bahasa, dan tata letak. Karya ini diterbitkan di International Journal of Reconfigurable and Embedded Systems (IJRES), DOI 10.11591/ijres.v15.i1.pp194-203, dan ditulis oleh Dr. J. Venkatesh dan Brintha Rajakumari Sivaraj.
Metodologi ELLMW mengintegrasikan tiga tahap utama: prapemrosesan lanjutan, pengenalan tulisan tangan berbasis deep learning, dan koreksi pascaproses berbasis LLM.

Mengapa penting

Hasil ini menyoroti beberapa kekuatan pendekatan ELLMW. Pertama, tahap prapemrosesan (reduksi derau, binarisasi, dan koreksi kemiringan) secara langsung mengatasi masukan yang bising dan tata letak yang tidak terstruktur yang membatasi OCR konvensional. Kedua, komponen CNN–LSTM menangkap pola spasial dan sekuensial dalam tulisan tangan, yang esensial untuk gaya tulisan yang beragam. Ketiga, tahap koreksi pascaproses berbasis LLM menambahkan kesadaran konteks yang melampaui pengenalan tingkat karakter, memungkinkan koreksi otomatis kesalahan ejaan, tata bahasa, dan tata letak serta menghasilkan keluaran yang koheren secara struktural.

Akurasi 97,8% dan CER 1,04% yang dilaporkan pada HEAS menunjukkan bahwa ELLMW cocok untuk skenario penilaian pendidikan di mana naskah jawaban tulisan tangan harus didigitalkan secara andal. Perbandingan terhadap Tesseract, EasyOCR, GCV, PaddleOCR, ABBYY FineReader, dan Transym OCR memosisikan ELLMW sebagai alternatif yang tangguh untuk ekstraksi teks tulisan tangan. Kemampuan kerangka ini menangani gambar hasil pindai, PDF, dan lembar jawaban dengan format tidak beraturan semakin mendukung penerapan praktisnya. Secara keseluruhan, penelitian ini menunjukkan bahwa pengintegrasian pemodelan visi–bahasa dengan koreksi pascaproses LLM dapat mengatasi keterbatasan OCR tradisional untuk naskah yang ditulis tangan.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…