Editorial Ilmu Komputer & AI
Meningkatkan Deteksi Anomali: Pengodean Data Keuangan Non-Semantik dengan Model Bahasa Besar
Masalah inti
Audit keuangan bertumpu pada janji yang tampaknya sederhana: bahwa buku besar mencerminkan apa yang sebenarnya terjadi. Jika janji itu dilanggar melalui entri jurnal yang tidak teratur atau sengaja menipu, maka kepercayaan terhadap seluruh catatan keuangan akan runtuh. Seiring dengan pertumbuhan volume audit yang jauh melampaui kemampuan peninjau manusia, pembelajaran mesin telah beralih dari eksperimen menjadi kebutuhan operasional — algoritma kini diharapkan untuk menandai entri jurnal yang memerlukan pemeriksaan ketat.
Struktur data adalah hambatan utama. Setiap entri jurnal dicirikan oleh jumlah transaksi yang bervariasi, sehingga catatan bukanlah vektor lebar tetap, melainkan objek heterogen dengan panjang variabel:
Heterogenitas dalam dimensi fitur menambah kompleksitas signifikan pada analisis data, dan masalah ini semakin parah karena sebagian besar bidang dalam entri jurnal adalah **atribut kategoris non-semantik** — kode, nomor akun, kunci posting, jenis dokumen — yang tidak memiliki makna linguistik intrinsik. Skema _one-hot_ atau ordinal dapat menyebabkan ledakan dimensi
Inovasi
Eksperimen menunjukkan bahwa LLM memberikan informasi berharga untuk deteksi anomali. Di seluruh konfigurasi yang dievaluasi, alur kerja _embedding_ LLM yang diusulkan **mengungguli _baseline_**, dan dalam pengaturan tertentu mereka melakukannya **dengan selisih yang besar**. Konsistensi hasil tersebut di seluruh keluarga pengklasifikasi yang sengaja heterogen — linear, _ensemble_, berbasis kernel, dan saraf — adalah sinyal terkuat dalam penelitian ini, karena menunjukkan bahwa keuntungan berasal dari representasi daripada dari bias induktif model tunggal mana pun.
Dua temuan yang dilaporkan patut mendapat perhatian khusus. Pertama, _encoder_ tujuan umum yang telah dilatih sebelumnya diterapkan pada data yang tidak pernah secara eksplisit dilatih untuknya: atribut kategoris non-semantik dari catatan keuangan dunia nyata, yang tidak memiliki makna linguistik intrinsik. Bahwa _encoder_ semacam itu masih menghasilkan geometri diskriminatif menunjukkan bahwa keteraturan distribusi yang mereka tangkap dapat ditransfer melampaui bahasa alami ke data administratif yang dikodekan.
Kedua, temuan-temuan tersebut menggarisbawahi efektivitas LLM dalam meningkatkan deteksi anomali dalam entri
Mengapa penting
Klaim interpretatif dari makalah ini adalah bahwa manfaatnya bersifat struktural daripada insidental. Atribut kategoris dalam catatan keuangan bersifat **non-semantik** — mereka adalah kode, bukan kata — namun _encoder_ tidak memerlukan makna semantik untuk menjadi berguna. Ini hanya membutuhkan fungsi _embedding_ untuk memetakan nilai-nilai yang sering muncul bersamaan dan secara fungsional serupa ke titik-titik yang berdekatan, dan tujuan pelatihan _sentence-transformer_ sangat cocok untuk menghasilkan geometri tersebut dari konteks token.
Mekanisme ini dapat dibaca sebagai kernel kesamaan implisit atas nilai-nilai kategoris. Jarak dalam ruang _embedding_ mewakili gagasan kesamaan tingkat atribut yang dipelajari, yang tidak dapat diungkapkan oleh pengodean konvensional:
Melalui kernel ini, bidang kategoris yang jarang memperoleh struktur yang mulus dan dapat ditransfer. Detektor anomali kemudian dapat menggeneralisasi dari entri yang telah dilihatnya ke entri yang dibangun dari kombinasi kategori yang jarang atau belum pernah diamati sebelumnya — situasi yang mendominasi beban kerja audit nyata.
Tiga implikasi berikut. Untuk **praktik audit**, hasilnya menunjukkan bahwa _embedding_ LLM dapat dimasukkan ke dalam alur kerja _supervised_ yang ada tanpa melatih ulang _encoder_ dari awal, menurunkan hambatan adopsi di lingkungan yang diatur di mana transparansi dan reproduktifitas penting. Untuk **metodologi pembelajaran mesin**, ini memvalidasi pola yang muncul: penggunaan kembali representasi model bahasa untuk masalah tabular dan kategoris berkapasitas tinggi, area yang secara historis didominasi oleh pohon _gradient-boosted_. Untuk **keamanan dan tata kelola institusional**, konsekuensi hilirnya adalah lapisan deteksi yang lebih kuat atas integritas buku besar, yang secara langsung relevan dengan deteksi penipuan dan kontrol internal.
Batasan harus dibaca bersama dengan klaim. Desain ini mempertahankan tugas hilir _supervised_, sehingga anomali berlabel masih diperlukan; kualitas _embedding_ dibatasi oleh _encoder_ prapelatihan dan oleh bagaimana atribut kategoris di-_string_-kan; dan interpretasi vektor yang dihasilkan tidak setara dengan fitur eksplisit. Para penulis tetap membingkai **perspektif yang menjanjikan tentang penggunaan _embedding_ SBERT untuk data non-semantik dalam konteks keuangan dan seterusnya** — memperluas strategi pengodean yang sama ke domain lain di mana kode kategoris berkapasitas tinggi, bukan bahasa alami, adalah tipe data yang dominan.
Siapa yang sebaiknya membaca
Membuka konten member…