Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

PIDS-Bench: Mengevaluasi Detektor Prompt-Injection di Bawah Over-Defense, Obfuskasi, dan Pergeseran Distribusi

Benchmark multi-sumbu yang dibekukan mengungkap bahwa agregat menyembunyikan over-defense yang sensitif terhadap provenance pada detektor prompt-injection
Yusuf Khalid Shire; Sang-Chul Kimยท 2026ยท DOI 10.48550/arXiv.2609.15017

Masalah inti

Detektor prompt-injection umumnya dinilai menggunakan agregat pada data uji di dalam distribusi. Praktik ini memberi wawasan terbatas tentang perilaku detektor di bawah pergeseran distribusi, terutama pada sisi benign dari batas keputusan, di mana false positive menimbulkan biaya operasional langsung tetapi jarang diukur. Makalah ini memperkenalkan PIDS-Bench, benchmark multi-sumbu yang dibekukan dan dirancang untuk mengevaluasi secara bersama deteksi serangan dan perilaku false-positive pada input benign pada threshold tetap. Benchmark ini mencakup empat sumbu evaluasi: input di dalam distribusi, prompt hard-benign yang meniru struktur injeksi tanpa maksud jahat, serangan terobfuskasi, serta pergeseran distribusi domain dan struktural. Penulis mengevaluasi tujuh detektor, termasuk baseline yang dipelajari, classifier prompt-injection eksternal, dan pembanding keselamatan luas, bersama referensi batas bawah berbasis aturan. Pertanyaan penelitian utamanya adalah apakah agregat yang tinggi berarti kinerja yang tangguh di seluruh sumbu ini, khususnya terkait false positive pada input benign.

Inovasi

Evaluasi multi-sumbu mengungkap mode kegagalan yang disembunyikan oleh agregat. Detektor yang melampaui pada split held-out masih salah mengklasifikasikan sekitar sepertiga subset benign bersumber eksternal yang diambil dari korpus publik dan dibatasi pada konten berdekatan dengan keamanan. Di seluruh sapuan threshold penuh dan lima seed pelatihan, tidak ada detektor internal yang mencapai titik operasi yang memenuhi dan hard-benign secara bersamaan pada distribusi stres ini. Penguraian berdasarkan provenance mengungkap bahwa augmentasi hard-negative hampir menghilangkan over-defense pada input stres terkurasi tetapi membiarkannya sebagian besar utuh pada prompt bersumber eksternal. Pola ini disebut over-defense yang sensitif terhadap provenance. Asimetri ini bertahan pada kedua arsitektur yang di-fine-tune dan tidak berkurang seiring bertambahnya kumpulan augmentasi, dengan FPR bersumber eksternal tetap jauh di atas target 0.10. Apakah augmentasi yang disesuaikan dengan distribusi bersumber eksternal akan menutup celah ini belum diuji; kalibrasi threshold dan augmentasi bergaya terkurasi saja tidak.
Detektor prompt-injection umumnya dinilai menggunakan agregat pada data uji di dalam distribusi. Praktik ini memberi wawasan terbatas tentang perilaku detektor di bawah pergeseran distribusi, terutama pada sisi benign dari batas keputusan, di mana false positive menimbulkan biaya operasional langsung tetapi jarang diukur. Makalah ini memperkenalkan PIDS-Bench, benchmark multi-sumbu yang dibekukan dan dirancang untuk mengevaluasi secara bersama deteksi serangan dan perilaku false-positive pada input benign pada threshold tetap. Benchmark ini mencakup empat sumbu evaluasi: input di dalam distribusi, prompt hard-benign yang meniru struktur injeksi tanpa maksud jahat, serangan terobfuskasi, serta pergeseran distribusi domain dan struktural. Penulis mengevaluasi tujuh detektor, termasuk baseline yang dipelajari, classifier prompt-injection eksternal, dan pembanding keselamatan luas, bersama referensi batas bawah berbasis aturan. Pertanyaan penelitian utamanya adalah apakah agregat yang tinggi berarti kinerja yang tangguh di seluruh sumbu ini, khususnya terkait false positive pada input benign.
PIDS-Bench adalah benchmark yang dibekukan, artinya data evaluasi dan threshold-nya ditetapkan tetap untuk memungkinkan perbandingan yang dapat direproduksi. Benchmark ini mengevaluasi detektor pada threshold tetap dan juga melakukan sapuan threshold penuh pada lima seed pelatihan. Sumbu evaluasinya adalah:

Mengapa penting

Hasil ini menyoroti celah kritis dalam praktik evaluasi detektor prompt-injection saat ini. agregat pada data di dalam distribusi bisa jadi tinggi secara menyesatkan sementara false positive operasional pada prompt benign yang berdekatan dengan keamanan tetap tidak dapat diterima. Pola over-defense yang sensitif terhadap provenance menunjukkan bahwa detektor mempelajari isyarat superfisial dari hard negative terkurasi yang tidak menggeneralisasi ke prompt benign bersumber eksternal. Hal ini berdampak langsung pada penerapan: di lingkungan yang sensitif terhadap keamanan, tingkat false-positive yang tinggi pada prompt benign dapat mengikis kepercayaan dan menyebabkan kelelahan alert. Penulis mencatat bahwa kalibrasi threshold dan augmentasi bergaya terkurasi saja tidak menyelesaikan masalah ini. Pekerjaan selanjutnya harus mengeksplorasi strategi augmentasi yang disesuaikan dengan distribusi bersumber eksternal, serta tujuan pelatihan yang lebih tangguh yang secara eksplisit menghukum false positive pada input benign di berbagai provenance. Benchmark ini menyediakan fondasi untuk penelitian tersebut dengan menawarkan kerangka evaluasi multi-sumbu yang mengukur deteksi serangan dan perilaku false-positive pada input benign.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ