Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2025

Deteksi Prompt Adversarial pada Model Bahasa Besar: Pendekatan Berbasis Klasifikasi

Sebuah tolok ukur sebelas model dengan fitur ganda yang menunjukkan bahwa kaskade CNN-LSTM melampaui akurasi 97% pada fitur prompt, sementara serangan tingkat kata dan prefiks masih lolos dari deteksi.
Ahmet Emre Ergun; AytuฤŸ Onanยท Comput. Mater. Continuaยท 2025ยท DOI 10.32604/cmc.2025.063826

Masalah inti

Model Bahasa Besar (LLM) telah mengubah interaksi manusia-komputer dengan memperkuat pemahaman dan generasi bahasa alami, namun kefasihan yang sama ini juga menciptakan permukaan serangan. Prompt adversarial โ€” masukan yang sengaja dibuat untuk mengarahkan model menuju keluaran yang tidak diinginkan, tidak aman, atau dimanipulasi โ€” merupakan tantangan besar dan terus berkembang bagi sistem LLM yang diterapkan.

Para penulis membingkai masalah ini sebagai tugas deteksi dan klasifikasi, bukan murni tugas generatif. Alih-alih mencoba memperkuat LLM itu sendiri, mereka bertanya apakah pengklasifikasi yang diawasi dapat menandai masukan berbahaya sebelum atau sesudah inferensi. Dua keluarga sinyal komplementer diusulkan sebagai dasar deteksi:

1. **Fitur prompt** โ€” properti semantik dan sintaksis dari teks masukan itu sendiri.
2. **Fitur respons prompt** โ€” properti dari keluaran LLM yang sesuai, yang mungkin membawa jejak manipulasi.

Teknik Pemrosesan Bahasa Alami (NLP) diposisikan sebagai lapisan pendukung, mengekstraksi representasi semantik dan sintaksis yang menjadi masukan bagi pengklasifikasi selanjutnya. Oleh karena itu, pertanyaan penelitian utamanya adalah (a) keluarga model ma

Inovasi

Di antara sebelas model yang dievaluasi, dua konfigurasi mendominasi papan peringkat, dan yang menarik, keduanya tidak bergantung pada keluarga fitur yang sama.

**Fitur prompt mendukung kaskade deep learning.** Model kaskade CNN-LSTM memberikan kinerja keseluruhan terkuat saat beroperasi pada fitur prompt, mencapai akurasi lebih dari **97% di semua skenario adversarial**. Konsistensi hasil ini di setiap skenario adalah temuan utama: kaskade tidak hanya menang secara rata-rata, tetapi juga melewati ambang batas 97% tanpa pengecualian.

**Fitur respons mendukung SVM.** Support Vector Machine berkinerja terbaik ketika diberi fitur respons prompt, terutama unggul dalam tugas klasifikasi jenis prompt. Hasil ini menunjukkan bahwa keluaran LLM itu sendiri membawa sinyal terstruktur dan terpisah tentang sifat masukan yang diterimanya.

**Kategori serangan tidak sama mudahnya dideteksi.** Hasil klasifikasi mengungkapkan asimetri yang jelas dalam tingkat kesulitan:

- **Sulit dideteksi:** Serangan *Tingkat Kata* dan *Prefiks Adversarial*, diidentifikasi oleh rekal dan skor yang rendah.
- **Lebih mudah dideteksi:** Serangan *Tingkat Kalimat* dan *Penyisipan Adversarial*, yang dapat diatri

Model Bahasa Besar (LLM) telah mengubah interaksi manusia-komputer dengan memperkuat pemahaman dan generasi bahasa alami, namun kefasihan yang sama ini juga menciptakan permukaan serangan. Prompt adversarial โ€” masukan yang sengaja dibuat untuk mengarahkan model menuju keluaran yang tidak diinginkan, tidak aman, atau dimanipulasi โ€” merupakan tantangan besar dan terus berkembang bagi sistem LLM yang diterapkan.
Para penulis membingkai masalah ini sebagai tugas deteksi dan klasifikasi, bukan murni tugas generatif. Alih-alih mencoba memperkuat LLM itu sendiri, mereka bertanya apakah pengklasifikasi yang diawasi dapat menandai masukan berbahaya sebelum atau sesudah inferensi. Dua keluarga sinyal komplementer diusulkan sebagai dasar deteksi:

Mengapa penting

Hasilnya membawa pesan interpretatif yang jelas: **manipulasi yang lebih halus dapat lolos dari mekanisme deteksi**. Perturbasi tingkat kata mendistribusikan efeknya ke seluruh token individual, menyisakan sedikit bukti permukaan yang berdekatan untuk dipegang oleh pengklasifikasi. Prefiks adversarial, yang ditempatkan di awal masukan, juga menyatu dengan kerangka instruksi yang sudah diharapkan oleh model, membuatnya secara statistik tidak dapat dibedakan dari konteks yang sah dalam banyak representasi fitur.

Sebaliknya, serangan tingkat kalimat dan penyisipan adversarial memperkenalkan blok konten asing yang lebih besar dan lebih koheren. Ini menghasilkan anomali semantik dan sintaksis yang lebih kuat, yang ditangkap dengan andal oleh tahap ekstraksi fitur NLP โ€” oleh karena itu rekal dan skor yang relatif tinggi.

Pemisahan keluarga fitur juga sama instruktifnya. Bahwa CNN-LSTM terkuat pada fitur prompt sementara SVM terkuat pada fitur respons menunjukkan bahwa kedua sumber sinyal tidak redundan. Fitur prompt mengkodekan *apa yang ditanyakan*; fitur respons mengkodekan *apa yang dilakukan model sebagai reaksi*. Keberhasilan SVM dalam klasifikasi jenis prompt pada fitur respons menyiratkan bahwa perilaku keluaran adalah sidik jari yang stabil dari niat masukan, bahkan ketika teks masukan itu sendiri dikaburkan.

Ini memotivasi arsitektur pertahanan berlapis di mana kedua cabang berjalan secara bersamaan:

Para penulis menyimpulkan bahwa menggabungkan pendekatan pembelajaran tradisional dan deep learning dengan teknik NLP canggih adalah jalur yang paling layak untuk deteksi prompt adversarial yang andal untuk LLM. Tidak ada satu keluarga model pun yang mencakup spektrum serangan penuh: kaskade menangani sebagian besar deteksi sisi prompt, sementara SVM menyediakan diskriminasi sisi respons komplementer dan granularitas jenis serangan.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ