Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2023

Pembelajaran Mesin dalam Keamanan Siber: Teknik dan Tantangan

Sari pilihan atas survei J. Bharadiya tentang deteksi ancaman berbasis data — phishing, deteksi intrusi, dinamika penekanan tombol, kriptografi, dan CAPTCHA — disusun dengan kerangka IMRAD, beserta persoalan terbuka tentang mengamankan si pembelajar itu sendiri
J. Bharadiya· European journal of technology· 2023· DOI 10.47672/ejt.1486

Masalah inti

Makalah ini dibuka dari pengamatan praktis: dalam dunia komputer, sains data merupakan kekuatan di balik perubahan dramatis terkini dalam operasi dan teknologi keamanan siber. Klaim utamanya adalah bahwa kunci untuk membuat sistem keamanan menjadi otomatis dan cerdas terletak pada ekstraksi pola atau wawasan terkait insiden keamanan dari data keamanan siber serta pembangunan model berbasis data yang sesuai. Sains data dicirikan sebagai kajian atas peristiwa nyata melalui penggunaan data — perpaduan berbagai pendekatan ilmiah, teknik pembelajaran mesin, proses, dan sistem.

Secara formal, deteksi keamanan terbimbing dirumuskan sebagai pembelajaran pemetaan dari telemetri yang teramati ke label keamanan:

dengan

adalah vektor fitur yang diekstraksi dari artefak keamanan (header surel, URL, aliran jaringan, sampel waktu penekanan tombol), adalah label acuan (ground truth),
adalah kelas hipotesis yang diinduksi oleh pembelajar yang dipilih, dan adalah fungsi kerugian yang spesifik untuk tugas.

Pembelajaran mesin dinilai sangat

Inovasi

Hasil empiris utama yang dilaporkan bersifat kualitatif tetapi jelas arahnya: model pembelajaran mesin dapat secara efektif mengidentifikasi surel dan situs web phishing dengan akurasi tinggi dan laju positif palsu yang rendah. Pemasangan kedua metrik itulah temuan yang bermakna — akurasi semata dengan mudah digelembungkan oleh ketidakseimbangan kelas dalam telemetri keamanan, yang sebagian besar lalu lintasnya bersifat jinak, sehingga laju positif palsu yang rendah itulah yang membuat akurasi kredibel secara operasional.

Hasil yang lebih luas dari makalah ini bersifat taksonomis: berbagai persoalan keamanan komputer telah ditangani secara efektif oleh beragam teknik pembelajaran mesin. Domain yang disurvei adalah:

| Domain | Fungsi keamanan yang dijalankan oleh si pembelajar |
|---|---|
| Deteksi phishing | Mengklasifikasikan surel dan situs web sebagai phishing atau sah |
| Deteksi intrusi jaringan | Memisahkan lalu lintas bermusuhan dari perilaku jaringan normal |
| Autentikasi dinamika penekanan tombol | Memverifikasi identitas dari irama pengetikan |
| Kriptografi | Tugas kunci, sandi, atau analisis yang dibantu pembelajaran |
| Bukti interaksi manusia | Membedakan pengguna

Makalah ini dibuka dari pengamatan praktis: dalam dunia komputer, sains data merupakan kekuatan di balik perubahan dramatis terkini dalam operasi dan teknologi keamanan siber. Klaim utamanya adalah bahwa kunci untuk membuat sistem keamanan menjadi otomatis dan cerdas terletak pada ekstraksi pola atau wawasan terkait insiden keamanan dari data keamanan siber serta pembangunan model berbasis data yang sesuai. Sains data dicirikan sebagai kajian atas peristiwa nyata melalui penggunaan data — perpaduan berbagai pendekatan ilmiah, teknik pembelajaran mesin, proses, dan sistem.
Secara formal, deteksi keamanan terbimbing dirumuskan sebagai pembelajaran pemetaan dari telemetri yang teramati ke label keamanan:

Mengapa penting

Diskusi ini mengubah hasil phishing menjadi dua rekomendasi rekayasa yang dapat ditindaklanjuti. Pertama, untuk meningkatkan deteksi phishing, dianjurkan memperbarui kumpulan data pelatihan secara berkelanjutan agar mencakup teknik phishing baru. Kedua, dianjurkan menggunakan metode ansambel yang menggabungkan beberapa model pembelajaran mesin demi kinerja yang lebih baik. Jika dibaca bersama, kedua rekomendasi ini menggambarkan sistem yang tidak pernah selesai: kumpulan data harus mengikuti penyerang, dan model harus melindungi diri dari modus kegagalannya sendiri.

Alasan di balik ansambel adalah pengurangan varians. Jika setiap pembelajar dasar memiliki laju galat dan galat-galat tersebut cukup tidak berkorelasi, pengklasifikasi teragregasi dapat mencapai laju galat di bawah laju galat setiap anggotanya. Untuk pembelajar yang independen dengan bobot sama dan pemungutan suara mayoritas, batas klasiknya adalah:

yang menurun tajam terhadap asalkan dan para anggota tidak berkorelasi identik. Dalam keamanan siber, syarat ini rapuh: model yang dilatih pada fitur yang tumpang tindih dan korpus phishing historis yang sama cenderung membuat kesalahan yang sama, sehingga dekorelasi harus direkayasa secara sengaja melalui pandangan fitur yang heterogen (pembelajar hanya header, hanya konten, hanya URL) alih-alih sekadar melalui pengulangan benih acak.

Rekomendasi pembaruan berkelanjutan merupakan pengakuan implisit makalah ini atas pergeseran konsep. Kampanye phishing memutasi pemikat dan infrastrukturnya, sehingga distribusi bersama bergeser seiring waktu dan model dengan distribusi pelatihan yang stasioner menurun kinerjanya secara diam-diam:

Di sinilah kerangka makalah ini sendiri tentang "kemampuan beradaptasi cepat terhadap rintangan baru yang belum diketahui" berubah dari klaim menjadi kewajiban pemeliharaan.

Arus kedua dalam diskusi yang lebih tajam adalah bahwa teknik pembelajaran mesin membawa kekhawatiran keamanan tersendiri. Survei ini secara eksplisit memasukkan "kekhawatiran keamanan pada teknik pembelajaran mesin" sebagai topik, yang membingkai ulang model sebagai aset yang harus dipertahankan, bukan sekadar alat yang mempertahankan. Pembelajar yang mengonsumsi data terpapar masukan pelatihan beracun; pembelajar yang memaparkan batas keputusan terpapar sampel penghindaran yang dirancang khusus; pembelajar yang memaparkan API penilaian terpapar kueri ekstraksi model. Keterlacakan antara distribusi pelatihan dan distribusi penerapan karena itu merupakan kendali keamanan, bukan sekadar kemudahan pemantauan.

Sintesis praktisnya adalah bahwa kualitas deteksi dibatasi oleh kebersihan data. Pengklasifikasi phishing berakurasi tinggi dan berpositif-palsu rendah adalah hasil nyata, tetapi ia hanyalah potret sesaat dari sasaran yang bergerak, dan rekomendasi makalah ini — segarkan kumpulan data, gabungkan model — adalah mekanisme yang membuat potret itu terus diperbarui.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…