Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2025

Model Bahasa Besar untuk Pembuatan Dataset Sintetis Indikator Kompromi Keamanan Siber

Fine-Tuning GPT-3.5 dengan Gaya Media Sosial dan Pengetahuan IoC Terkurasi untuk Mengevaluasi Klasifier ML/DL
Ashwaq Almorjan; Mohammed Basheri; Miada Almasreยท Italian National Conference on Sensorsยท 2025ยท DOI 10.3390/s25092825

Masalah inti

Cyber Threat Intelligence (CTI) bergantung pada dataset berlabel berkualitas tinggi yang memuat Indikator Kompromi (IoC) untuk melatih model prediktif yang tangguh. Abstrak sumber mengidentifikasi kelangkaan 'dataset berkualitas tinggi dan berlabel yang mencakup Indikator Kompromi (IoC)' sebagai hambatan utama, terutama untuk mengklasifikasikan IoC dalam komunikasi daring. Media sosial menjadi lingkungan yang sangat penting karena pengguna berpotensi sangat terpapar ancaman siber. Pembuatan dataset sintetis diusulkan sebagai cara untuk mengisi kesenjangan ini dan mengembangkan sistem CTI yang efektif. Oleh karena itu, studi ini bertujuan melakukan fine-tuning terhadap Large Language Model (LLM) milik OpenAI, GPT-3.5, untuk menghasilkan dataset sintetis yang mereplikasi gaya dataset terkurasi media sosial nyata dan memasukkan IoC terpilih sebagai pengetahuan domain. Secara formal, proses pembuatan dapat dinyatakan sebagai

, dengan menyatakan parameter GPT-3.5 yang telah di-fine-tune, adalah dataset terkurasi media sosial nyata, dan adalah pengetahuan domain IoC terkurasi.

Inovasi

Abstrak melaporkan bahwa empat model ML dan DL dievaluasi pada dua dataset yang dihasilkan. Pada dataset 4.000 instans, Dense Neural Network (DenseNN) menghasilkan akurasi tertinggi sebesar 77%. Pada dataset 12.000 instans, Logistic Regression (LR) mencapai akurasi tertinggi sebesar 82%. Hasil ini menunjukkan bahwa dataset sintetis dengan ukuran berbeda dapat mendukung evaluasi klasifier, dan model dengan kinerja terbaik dapat berubah seiring skala dataset. Tampilan ringkasnya diberikan di bawah ini:

| Ukuran dataset sintetis | Model terbaik | Akurasi tertinggi |
| --- | --- | --- |
| 4.000 instans | DenseNN | 77% |
| 12.000 instans | LR | 82% |

Abstrak tidak menyebutkan dua model lain yang dievaluasi, sehingga digest ini tidak menyimpulkan identitas atau kinerja keduanya.

Cyber Threat Intelligence (CTI) bergantung pada dataset berlabel berkualitas tinggi yang memuat Indikator Kompromi (IoC) untuk melatih model prediktif yang tangguh. Abstrak sumber mengidentifikasi kelangkaan 'dataset berkualitas tinggi dan berlabel yang mencakup Indikator Kompromi (IoC)' sebagai hambatan utama, terutama untuk mengklasifikasikan IoC dalam komunikasi daring. Media sosial menjadi lingkungan yang sangat penting karena pengguna berpotensi sangat terpapar ancaman siber. Pembuatan dataset sintetis diusulkan sebagai cara untuk mengisi kesenjangan ini dan mengembangkan sistem CTI yang efektif. Oleh karena itu, studi ini bertujuan melakukan fine-tuning terhadap Large Language Model (LLM) milik OpenAI, GPT-3.5, untuk menghasilkan dataset sintetis yang mereplikasi gaya dataset terkurasi media sosial nyata dan memasukkan IoC terpilih sebagai pengetahuan domain. Secara formal, proses pembuatan dapat dinyatakan sebagai

, dengan menyatakan parameter GPT-3.5 yang telah di-fine-tune, adalah dataset terkurasi media sosial nyata, dan adalah pengetahuan domain IoC terkurasi.

Metodologi ini melakukan fine-tuning terhadap GPT-3.5 milik OpenAI menggunakan dataset media sosial nyata dan pengetahuan domain IoC terkurasi. Fine-tuning dirancang agar LLM meniru gaya dataset terkurasi media sosial nyata sekaligus menyuntikkan IoC terpilih sebagai pengetahuan domain. Studi ini kemudian menghasilkan dua dataset sintetis: satu dengan 4.000 instans dan satu lagi dengan 12.000 instans. Empat model pembelajaran mesin (ML) dan pembelajaran mendalam (DL) dievaluasi pada dataset yang dihasilkan tersebut. Evaluasi berfokus pada kinerja klasifikasi untuk IoC dalam komunikasi daring. Akurasi adalah metrik yang dilaporkan, didefinisikan sebagai

, dengan , , , dan masing-masing menyatakan true positive, true negative, false positive, dan false negative. Alur proses dapat diringkas sebagai berikut:

Mengapa penting

Studi ini menyoroti potensi pengintegrasian LLM yang telah di-fine-tune dengan pengetahuan spesifik domain untuk menciptakan data sintetis berkualitas tinggi. Kontribusi utamanya adalah adopsi fine-tuning untuk sebuah LLM, GPT-3.5, menggunakan dataset media sosial nyata dan pengetahuan domain IoC terkurasi. Hal ini diharapkan dapat meningkatkan proses pembuatan dataset sintetis dan kemudian ekstraksi serta klasifikasi IoC, menawarkan sumber daya yang realistis dan baru untuk aplikasi keamanan siber. Pendekatan ini menjawab hambatan praktis dalam CTI: kurangnya data IoC berlabel yang dapat dibagikan atau dikumpulkan dalam skala besar. Dengan menggunakan dataset terkurasi media sosial nyata sebagai referensi gaya dan IoC terkurasi sebagai pengetahuan domain, data yang dihasilkan bertujuan agar realistis sekaligus relevan dengan tugas. Temuan pada tingkat abstrak juga menunjukkan bahwa ukuran dataset dapat memengaruhi pemilihan model, dengan DenseNN unggul pada set 4.000 instans yang lebih kecil dan LR unggul pada set 12.000 instans yang lebih besar. Namun, ringkasan sumber yang tersedia tidak melaporkan metrik per kelas, analisis kesalahan, atau identitas keempat model yang dievaluasi; hal-hal tersebut penting untuk menilai generalisasi. Karya ini membuka jalur bagi sistem CTI masa depan yang menggabungkan sintesis data berbasis LLM dengan ekstraksi dan klasifikasi IoC di hilir.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ