Editorial Ilmu Komputer & AI
ELLMW: model visi–bahasa yang ditingkatkan untuk ekstraksi teks yang andal dari naskah yang ditulis tangan
Masalah inti
Inovasi
Mengapa penting
Hasil ini menyoroti beberapa kekuatan pendekatan ELLMW. Pertama, tahap prapemrosesan (reduksi derau, binarisasi, dan koreksi kemiringan) secara langsung mengatasi masukan yang bising dan tata letak yang tidak terstruktur yang membatasi OCR konvensional. Kedua, komponen CNN–LSTM menangkap pola spasial dan sekuensial dalam tulisan tangan, yang esensial untuk gaya tulisan yang beragam. Ketiga, tahap koreksi pascaproses berbasis LLM menambahkan kesadaran konteks yang melampaui pengenalan tingkat karakter, memungkinkan koreksi otomatis kesalahan ejaan, tata bahasa, dan tata letak serta menghasilkan keluaran yang koheren secara struktural.
Akurasi 97,8% dan CER 1,04% yang dilaporkan pada HEAS menunjukkan bahwa ELLMW cocok untuk skenario penilaian pendidikan di mana naskah jawaban tulisan tangan harus didigitalkan secara andal. Perbandingan terhadap Tesseract, EasyOCR, GCV, PaddleOCR, ABBYY FineReader, dan Transym OCR memosisikan ELLMW sebagai alternatif yang tangguh untuk ekstraksi teks tulisan tangan. Kemampuan kerangka ini menangani gambar hasil pindai, PDF, dan lembar jawaban dengan format tidak beraturan semakin mendukung penerapan praktisnya. Secara keseluruhan, penelitian ini menunjukkan bahwa pengintegrasian pemodelan visi–bahasa dengan koreksi pascaproses LLM dapat mengatasi keterbatasan OCR tradisional untuk naskah yang ditulis tangan.
Siapa yang sebaiknya membaca
Membuka konten member…