Editorial Ilmu Komputer & AI
Model Bahasa Besar untuk Pembuatan Dataset Sintetis Indikator Kompromi Keamanan Siber
Masalah inti
Cyber Threat Intelligence (CTI) bergantung pada dataset berlabel berkualitas tinggi yang memuat Indikator Kompromi (IoC) untuk melatih model prediktif yang tangguh. Abstrak sumber mengidentifikasi kelangkaan 'dataset berkualitas tinggi dan berlabel yang mencakup Indikator Kompromi (IoC)' sebagai hambatan utama, terutama untuk mengklasifikasikan IoC dalam komunikasi daring. Media sosial menjadi lingkungan yang sangat penting karena pengguna berpotensi sangat terpapar ancaman siber. Pembuatan dataset sintetis diusulkan sebagai cara untuk mengisi kesenjangan ini dan mengembangkan sistem CTI yang efektif. Oleh karena itu, studi ini bertujuan melakukan fine-tuning terhadap Large Language Model (LLM) milik OpenAI, GPT-3.5, untuk menghasilkan dataset sintetis yang mereplikasi gaya dataset terkurasi media sosial nyata dan memasukkan IoC terpilih sebagai pengetahuan domain. Secara formal, proses pembuatan dapat dinyatakan sebagai
Inovasi
Abstrak melaporkan bahwa empat model ML dan DL dievaluasi pada dua dataset yang dihasilkan. Pada dataset 4.000 instans, Dense Neural Network (DenseNN) menghasilkan akurasi tertinggi sebesar 77%. Pada dataset 12.000 instans, Logistic Regression (LR) mencapai akurasi tertinggi sebesar 82%. Hasil ini menunjukkan bahwa dataset sintetis dengan ukuran berbeda dapat mendukung evaluasi klasifier, dan model dengan kinerja terbaik dapat berubah seiring skala dataset. Tampilan ringkasnya diberikan di bawah ini:
| Ukuran dataset sintetis | Model terbaik | Akurasi tertinggi |
| --- | --- | --- |
| 4.000 instans | DenseNN | 77% |
| 12.000 instans | LR | 82% |
Abstrak tidak menyebutkan dua model lain yang dievaluasi, sehingga digest ini tidak menyimpulkan identitas atau kinerja keduanya.
Cyber Threat Intelligence (CTI) bergantung pada dataset berlabel berkualitas tinggi yang memuat Indikator Kompromi (IoC) untuk melatih model prediktif yang tangguh. Abstrak sumber mengidentifikasi kelangkaan 'dataset berkualitas tinggi dan berlabel yang mencakup Indikator Kompromi (IoC)' sebagai hambatan utama, terutama untuk mengklasifikasikan IoC dalam komunikasi daring. Media sosial menjadi lingkungan yang sangat penting karena pengguna berpotensi sangat terpapar ancaman siber. Pembuatan dataset sintetis diusulkan sebagai cara untuk mengisi kesenjangan ini dan mengembangkan sistem CTI yang efektif. Oleh karena itu, studi ini bertujuan melakukan fine-tuning terhadap Large Language Model (LLM) milik OpenAI, GPT-3.5, untuk menghasilkan dataset sintetis yang mereplikasi gaya dataset terkurasi media sosial nyata dan memasukkan IoC terpilih sebagai pengetahuan domain. Secara formal, proses pembuatan dapat dinyatakan sebagai
Metodologi ini melakukan fine-tuning terhadap GPT-3.5 milik OpenAI menggunakan dataset media sosial nyata dan pengetahuan domain IoC terkurasi. Fine-tuning dirancang agar LLM meniru gaya dataset terkurasi media sosial nyata sekaligus menyuntikkan IoC terpilih sebagai pengetahuan domain. Studi ini kemudian menghasilkan dua dataset sintetis: satu dengan 4.000 instans dan satu lagi dengan 12.000 instans. Empat model pembelajaran mesin (ML) dan pembelajaran mendalam (DL) dievaluasi pada dataset yang dihasilkan tersebut. Evaluasi berfokus pada kinerja klasifikasi untuk IoC dalam komunikasi daring. Akurasi adalah metrik yang dilaporkan, didefinisikan sebagai
Mengapa penting
Siapa yang sebaiknya membaca
Membuka konten memberโฆ