Editorial Ilmu Komputer & AI
Open AccessOA2026
Name2Pkg: Penyaringan Malware Android One-Class Ringan melalui Pemodelan Korespondensi Nama-Paket
Detektor anomali seq2seq tingkat karakter yang menandai aplikasi Android berbahaya hanya menggunakan nama aplikasi dan nama paket, mencapai ROC-AUC 0.982 pada latensi CPU 28.20 ms.
Changyeop Sung; Yeonjae Kang; Jaeho Shin; Huy Kang Kimยท 2026ยท DOI 10.48550/arXiv.2609.24389
Masalah inti
Deteksi malware berbasis deep learning telah menjadi andalan layanan yang kritis terhadap keamanan, namun sebagian besar detektor bergantung pada fitur internal yang diekstraksi dari berkas APK atau pada perilaku runtime. Ekstraksi fitur semacam itu mahal secara komputasi, sehingga membatasi penerapannya dalam pipeline penyaringan tahap awal berskala besar yang harus menyeleksi jutaan aplikasi dengan cepat. Penulis mengamati bahwa aplikasi berbahaya sering kali menunjukkan korespondensi lemah antara nama aplikasi yang tampil ke pengguna dan nama paketnya, suatu ketidaksesuaian yang menawarkan sinyal penyaringan berbiaya rendah tanpa perlu disassembly APK atau instrumentasi dinamis. Name2Pkg disajikan sebagai metode klasifikasi one-class yang ringan dan hanya memanfaatkan dua string: nama aplikasi dan nama paket. Hipotesis utamanya adalah pengembang benign cenderung menjaga kedua pengenal ini selaras secara semantik dan leksikal, sedangkan penulis malware sering kali menggunakan ulang, mengaburkan, atau membuatnya tidak cocok. Dengan merumuskan penyaringan malware sebagai masalah deteksi anomali sekuens, karya ini bertujuan menyediakan sinyal pra-penyaringan yang efisien dan efektif
Inovasi
Evaluasi menggunakan dataset 67,129 aplikasi dunia nyata. Pada data uji yang disisihkan, Name2Pkg mencapai area under the receiver operating characteristic curve (ROC-AUC) 0.982 dan recall malware 0.885 pada tingkat false-positive 0.044. Angka-angka ini menunjukkan bahwa sinyal korespondensi nama-paket saja sudah sangat diskriminatif, meskipun tidak mengandalkan fitur internal APK atau perilaku runtime. Secara operasional, model mempertahankan checkpoint 3.57 MiB dan latensi inferensi CPU 28.20 ms per sampel, mengonfirmasi kesesuaiannya untuk penyaringan tahap awal berskala besar. Kombinasi recall tinggi pada tingkat false-positive rendah sangat relevan untuk pra-penyaringan, yang tujuannya mengarahkan sebagian kandidat yang terkelola ke analisis hilir yang lebih mahal tanpa membanjiri analis dengan alarm palsu. Checkpoint yang ringkas dan inferensi hanya-CPU semakin menurunkan hambatan integrasi ke infrastruktur keamanan yang ada, menghindari biaya penyediaan GPU yang sering menyertai detektor deep learning.
Deteksi malware berbasis deep learning telah menjadi andalan layanan yang kritis terhadap keamanan, namun sebagian besar detektor bergantung pada fitur internal yang diekstraksi dari berkas APK atau pada perilaku runtime. Ekstraksi fitur semacam itu mahal secara komputasi, sehingga membatasi penerapannya dalam pipeline penyaringan tahap awal berskala besar yang harus menyeleksi jutaan aplikasi dengan cepat. Penulis mengamati bahwa aplikasi berbahaya sering kali menunjukkan korespondensi lemah antara nama aplikasi yang tampil ke pengguna dan nama paketnya, suatu ketidaksesuaian yang menawarkan sinyal penyaringan berbiaya rendah tanpa perlu disassembly APK atau instrumentasi dinamis. Name2Pkg disajikan sebagai metode klasifikasi one-class yang ringan dan hanya memanfaatkan dua string: nama aplikasi dan nama paket. Hipotesis utamanya adalah pengembang benign cenderung menjaga kedua pengenal ini selaras secara semantik dan leksikal, sedangkan penulis malware sering kali menggunakan ulang, mengaburkan, atau membuatnya tidak cocok. Dengan merumuskan penyaringan malware sebagai masalah deteksi anomali sekuens, karya ini bertujuan menyediakan sinyal pra-penyaringan yang efisien dan efektif untuk sistem keamanan berskala besar, melengkapi detektor yang lebih berat alih-alih menggantikannya.
Name2Pkg memodelkan likelihood kondisional nama paket dengan syarat nama aplikasi menggunakan model sequence-to-sequence (seq2seq) tingkat karakter. Untuk nama aplikasi dan nama paket , model memperkirakan dan menurunkan skor anomali dari negative log-likelihood yang dinormalisasi panjang:
Mengapa penting
Hasil ini memosisikan Name2Pkg sebagai lapisan pra-penyaringan pelengkap alih-alih pengganti mandiri untuk analisis malware yang komprehensif. Kekuatannya terletak pada pemanfaatan sinyal murah yang tersedia luas: hubungan semantik dan leksikal antara nama tampilan aplikasi dan pengenal paketnya. Karena model hanya dilatih pada data benign, ia menghindari biaya dan ketertinggalan yang terkait dengan pemeliharaan dataset malware berlabel, dan dapat menggeneralisasi ke keluarga malware yang belum pernah terlihat selama mereka menunjukkan korespondensi nama-paket yang anomali. Tingkat false-positive 0.044 menyiratkan bahwa sekitar satu dari dua puluh tiga aplikasi benign akan ditandai, suatu trade-off yang mungkin dapat diterima dalam pipeline bertingkat tetapi perlu dikalibrasi per konteks penerapan. Batasannya meliputi ketergantungan pada asumsi bahwa pengembang benign menjaga konvensi penamaan yang konsisten, potensi penghindaran oleh penulis malware yang sengaja menyelaraskan nama aplikasi dan paket, serta tidak adanya evaluasi multibahasa atau lintas marketplace dalam pengaturan yang dilaporkan. Pekerjaan selanjutnya dapat menggabungkan skor Name2Pkg dengan fitur statis atau metadata yang ringan, menyesuaikan ambang per kategori aplikasi, dan mempelajari strategi penamaan adversarial. Secara keseluruhan, metode ini menawarkan sinyal pra-penyaringan yang efisien dan efektif untuk sistem keamanan berskala besar, dengan keseimbangan yang menguntungkan antara akurasi, ukuran model, dan latensi inferensi.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten memberโฆ