Editorial Ilmu Komputer & AI
Open AccessOA2026
Origin Is All You Need: Transformer Sadar Provenans untuk Pemisahan Batas Kepercayaan Struktural
Pertahanan sadar provenans yang membuat label sumber dari aplikasi dapat ditindaklanjuti di dalam model, menegakkan batas struktural antara sumber otoritatif dan non-otoritatif.
Yuxuan Zhang; Jeff Huang; Guofei Guยท 2026ยท DOI 10.48550/arXiv.2609.21088
Masalah inti
Indirect prompt injection (IPI) tetap menjadi tantangan keselamatan dan keamanan utama bagi sistem large language model (LLM) karena transformer standar tidak memiliki gagasan arsitektural tentang otoritas sumber. Dokumen hasil retrieval, masukan pengguna, dan instruksi sistem semuanya diproses melalui mekanisme atensi yang sama tanpa pembedaan, memaksa model menyimpulkan hanya dari pilihan kata apa yang harus dipatuhi dan apa yang harus diperlakukan sebagai data. Pencampuran ini menciptakan batas kepercayaan yang rapuh dan dapat dieksploitasi oleh konten adversarial yang tertanam dalam dokumen hasil retrieval atau masukan pengguna. Penulis mengusulkan Transformer Sadar Provenans, pertahanan sadar provenans yang membuat label sumber dari aplikasi dapat ditindaklanjuti di dalam model. Dengan mengekspos provenans sebagai sinyal arsitektural kelas utama, karya ini bertujuan menggeser penyelarasan keselamatan LLM dari pencocokan pola yang rapuh menuju pemisahan kepercayaan yang eksplisit.
Inovasi
Evaluasi menunjukkan bahwa Transformer Sadar Provenans mempertahankan ketahanan yang kokoh terhadap IPI baik in-distribution maupun out-of-distribution sekaligus menjaga utilitas yang sebanding dengan model pretrained dasar. Penulis melaporkan bahwa arsitektur ini berhasil menegakkan batas struktural antara sumber otoritatif dan non-otoritatif, mencegah instruksi yang disuntikkan untuk dipatuhi. Hasil kuantitatif menunjukkan bahwa model mencapai ketahanan tinggi terhadap serangan IPI tanpa degradasi signifikan pada kinerja tugas standar. Pipeline fine-tuning dua tahap secara efektif mengajarkan semantik origin dan perilaku tugas di bawah batasan ring kepada model, memungkinkan model menggeneralisasi ke pola serangan yang belum pernah dilihat.
Indirect prompt injection (IPI) tetap menjadi tantangan keselamatan dan keamanan utama bagi sistem large language model (LLM) karena transformer standar tidak memiliki gagasan arsitektural tentang otoritas sumber. Dokumen hasil retrieval, masukan pengguna, dan instruksi sistem semuanya diproses melalui mekanisme atensi yang sama tanpa pembedaan, memaksa model menyimpulkan hanya dari pilihan kata apa yang harus dipatuhi dan apa yang harus diperlakukan sebagai data. Pencampuran ini menciptakan batas kepercayaan yang rapuh dan dapat dieksploitasi oleh konten adversarial yang tertanam dalam dokumen hasil retrieval atau masukan pengguna. Penulis mengusulkan Transformer Sadar Provenans, pertahanan sadar provenans yang membuat label sumber dari aplikasi dapat ditindaklanjuti di dalam model. Dengan mengekspos provenans sebagai sinyal arsitektural kelas utama, karya ini bertujuan menggeser penyelarasan keselamatan LLM dari pencocokan pola yang rapuh menuju pemisahan kepercayaan yang eksplisit.
Arsitektur yang diusulkan memberikan setiap token masukan sebuah ring ID yang mengodekan asalnya. Model diperkaya dengan tiga komponen utama: origin embedding, bias atensi origin yang dapat dipelajari, dan skala origin yang dapat dipelajari yang mempertahankan provenans di bawah normalisasi. Secara formal, untuk token dengan origin , skor atensi antara query dan key dimodifikasi sebagai:
Mengapa penting
Karya ini menunjukkan bahwa mengekspos provenans sebagai sinyal arsitektural kelas utama dapat menggeser penyelarasan keselamatan LLM dari pencocokan pola yang rapuh menuju pemisahan kepercayaan yang eksplisit. Dengan membuat label sumber dapat ditindaklanjuti di dalam model, arsitektur ini memberikan pertahanan yang lebih kokoh terhadap IPI dibandingkan pendekatan yang hanya mengandalkan penyaringan masukan atau prompt engineering. Bias atensi origin dan skala yang dapat dipelajari memungkinkan model menyesuaikan pengaruh berbagai sumber secara dinamis selama generasi, secara efektif menciptakan batas kepercayaan yang ditegakkan pada tingkat arsitektural. Pendekatan ini komplementer dengan langkah keselamatan yang ada dan dapat diintegrasikan ke dalam model pretrained yang telah dirilis melalui fine-tuning. Penulis menyarankan bahwa pekerjaan selanjutnya dapat mengeksplorasi hierarki provenans yang lebih granular dan memperluas pendekatan ini ke masukan multi-modal. Secara keseluruhan, makalah ini menyajikan arah yang menjanjikan untuk membangun sistem LLM yang lebih aman dan tepercaya.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten memberโฆ