Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2026

Evaluasi Komparatif Model Embedding Statis untuk Deteksi Anomali Permintaan HTTP

Benchmark Word2Vec, FastText, dan Doc2Vec dalam kerangka deteksi kelas tunggal yang terpadu
Amanda Riverol; Gustavo Betarte; Rodrigo Martínez; Álvaro Pardo· 2026· DOI 10.48550/arXiv.2609.26860

Masalah inti

Aplikasi web menghadapi serangan siber yang semakin meningkat yang memanfaatkan permintaan HTTP untuk melewati mekanisme keamanan. Web Application Firewall (WAF) tradisional mengandalkan pendekatan berbasis aturan, yang sering mengalami tingkat false positive tinggi dan kemampuan adaptasi terbatas. Penelitian terbaru telah mengeksplorasi model machine learning dan word embedding untuk meningkatkan deteksi anomali pada lalu lintas HTTP. Makalah ini menyajikan benchmark untuk model embedding statis—Word2Vec, FastText, dan Doc2Vec—dalam kerangka klasifikasi kelas tunggal yang terpadu. Penulis mengusulkan HEDA (HTTP Embedding-Based Detection Architecture), pipeline deteksi modular yang menggabungkan representasi embedding statis dengan model deteksi anomali kelas tunggal untuk mendeteksi anomali pada tingkat permintaan. Pendekatan ini beroperasi dalam lingkungan unsupervised, di mana model embedding dan detektor dilatih secara eksklusif pada lalu lintas HTTP benign. Metodologi dievaluasi pada tiga dataset dengan karakteristik heterogen, termasuk lalu lintas sintetis dan nyata.

Inovasi

Metodologi yang diusulkan dievaluasi pada tiga dataset dengan karakteristik heterogen, termasuk lalu lintas sintetis dan nyata. Dataset bervariasi dalam ukuran, jenis serangan, dan pola lalu lintas. Kinerja setiap model embedding diukur menggunakan detection rate (true positive rate) dan false positive rate (FPR). Hasil eksperimen menunjukkan bahwa pilihan representasi embedding secara signifikan memengaruhi kinerja deteksi. Embedding berbasis FastText menghasilkan hasil paling konsisten di semua dataset, mencapai tingkat deteksi tinggi sambil menjaga false positive rate tetap terkendali. Misalnya, pada dataset sintetis, FastText mencapai detection rate 98,5% dengan FPR 1,2%, dibandingkan dengan Word2Vec (deteksi 95,3%, FPR 2,1%) dan Doc2Vec (deteksi 93,7%, FPR 2,8%). Pada dataset lalu lintas nyata, FastText mempertahankan kinerja yang kuat, dengan detection rate di atas 96% dan FPR di bawah 2%, sedangkan Word2Vec dan Doc2Vec menunjukkan variabilitas yang lebih besar. Hasil ini menunjukkan bahwa pendekatan character n-gram FastText meningkatkan generalisasi terhadap token yang belum pernah dilihat dan variasi morfologis yang umum dalam permintaan HTTP.
Aplikasi web menghadapi serangan siber yang semakin meningkat yang memanfaatkan permintaan HTTP untuk melewati mekanisme keamanan. Web Application Firewall (WAF) tradisional mengandalkan pendekatan berbasis aturan, yang sering mengalami tingkat false positive tinggi dan kemampuan adaptasi terbatas. Penelitian terbaru telah mengeksplorasi model machine learning dan word embedding untuk meningkatkan deteksi anomali pada lalu lintas HTTP. Makalah ini menyajikan benchmark untuk model embedding statis—Word2Vec, FastText, dan Doc2Vec—dalam kerangka klasifikasi kelas tunggal yang terpadu. Penulis mengusulkan HEDA (HTTP Embedding-Based Detection Architecture), pipeline deteksi modular yang menggabungkan representasi embedding statis dengan model deteksi anomali kelas tunggal untuk mendeteksi anomali pada tingkat permintaan. Pendekatan ini beroperasi dalam lingkungan unsupervised, di mana model embedding dan detektor dilatih secara eksklusif pada lalu lintas HTTP benign. Metodologi dievaluasi pada tiga dataset dengan karakteristik heterogen, termasuk lalu lintas sintetis dan nyata.
Arsitektur HEDA terdiri dari dua tahap utama: pembuatan embedding dan deteksi anomali. Pertama, permintaan HTTP diurai dan ditokenisasi menjadi urutan token (misalnya, method, path, headers, body). Urutan token ini kemudian dimasukkan ke model embedding statis untuk menghasilkan representasi vektor berdimensi tetap. Model embedding yang dipertimbangkan adalah:

Mengapa penting

Temuan ini menyoroti pentingnya pemilihan model embedding dalam deteksi anomali HTTP. Kinerja unggul FastText dapat dikaitkan dengan informasi subword-nya, yang menangkap pola morfologis dan menangani token di luar kosakata secara efektif—fitur kritis untuk permintaan HTTP yang sering mengandung string arbitrer, parameter terenkode, dan payload serangan baru. Word2Vec dan Doc2Vec, meskipun efektif, kesulitan dengan token yang jarang atau belum pernah dilihat, sehingga menyebabkan false positive lebih tinggi atau deteksi yang terlewat. Kerangka kelas tunggal memastikan bahwa sistem dapat dilatih hanya pada lalu lintas benign, mengurangi kebutuhan akan data serangan berlabel. Namun, pilihan detektor juga memengaruhi kinerja; One-Class SVM dan Autoencoder tampil sebanding, sedangkan Isolation Forest menunjukkan detection rate yang sedikit lebih rendah. Penulis mencatat bahwa ambang batas harus disetel dengan hati-hati untuk menyeimbangkan deteksi dan false positive, dan bahwa pendekatan ini dapat diperluas ke protokol lain. Pekerjaan selanjutnya mencakup eksplorasi contextual embedding (misalnya, BERT) dan online learning untuk beradaptasi dengan pola serangan yang terus berkembang. Secara keseluruhan, HEDA menyediakan pipeline modular dan efektif untuk deteksi anomali permintaan HTTP, dengan FastText sebagai model embedding statis yang direkomendasikan.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…