Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

HE-Guardrail: Guardrail Homomorfik terhadap Serangan Jailbreak untuk Inferensi Large Language Model Terenkripsi

Mengevaluasi guardrail keamanan sepenuhnya atas data terenkripsi untuk melindungi inferensi LLM yang menjaga privasi dari klien berbahaya
Byeongseo Min; Yongwoo Lee; Young-Sik Kim; Yongjune Kimยท 2026ยท DOI 10.48550/arXiv.2609.21484

Masalah inti

Homomorphic encryption (HE) telah muncul sebagai pendekatan yang menjanjikan untuk privacy-preserving machine learning (PPML), yang memungkinkan komputasi langsung atas data terenkripsi. Dalam PPML berbasis HE, klien mengirimkan input terenkripsi ke server, yang mengevaluasi model seperti large language model (LLM) tanpa akses ke plaintext yang mendasarinya. Pengaturan ini melindungi kerahasiaan data klien, tetapi penulis mengidentifikasi kerentanan keamanan yang kritis: inferensi HE-LLM rentan terhadap klien berbahaya yang mengirimkan prompt adversarial, seperti serangan jailbreak. Kerahasiaan yang sama yang melindungi klien benign juga mencegah server memeriksa prompt yang masuk atau respons yang dihasilkan, sehingga upaya adversarial sulit dideteksi atau diblokir dan berpotensi membiarkan serangan yang berhasil tetap sepenuhnya tak terlihat oleh server. Untuk mengatasi kerentanan ini, makalah ini mengusulkan HE-Guardrail, kerangka kerja yang mengevaluasi mekanisme guardrail sepenuhnya atas data terenkripsi dan secara homomorfik mengendalikan apakah respons model target dikembalikan ke klien. Karya ini menginstansiasi HE-Guardrail dengan tiga guardrail representatif: Llama Guard,

Inovasi

Penulis mengevaluasi HE-Guardrail dengan tiga guardrail representatif: Llama Guard, JBShield, dan GradSafe. Hasilnya menunjukkan bahwa HE-Guardrail mereproduksi secara dekat keputusan guardrail plaintext yang bersesuaian di ranah terenkripsi. Ini menunjukkan bahwa evaluasi homomorfik atas logika guardrail mempertahankan kinerja deteksi guardrail asli. Makalah ini melaporkan trade-off keamanan-efisiensi-utilitas yang berbeda di antara ketiga instansiasi tersebut. Misalnya, beberapa guardrail mungkin menawarkan jaminan keamanan yang lebih kuat dengan biaya overhead komputasi yang lebih tinggi, sementara yang lain mungkin lebih efisien tetapi sedikit kurang robust. Eksperimen kemungkinan mengukur metrik seperti akurasi deteksi, tingkat false positive/negative, dan latensi komputasi. Hasil numerik yang tepat tidak disediakan dalam abstrak, tetapi temuan kuncinya adalah bahwa guardrail terenkripsi dapat menyamai keputusan guardrail plaintext, sehingga memungkinkan deteksi jailbreak yang efektif tanpa mengorbankan privasi klien.
Homomorphic encryption (HE) telah muncul sebagai pendekatan yang menjanjikan untuk privacy-preserving machine learning (PPML), yang memungkinkan komputasi langsung atas data terenkripsi. Dalam PPML berbasis HE, klien mengirimkan input terenkripsi ke server, yang mengevaluasi model seperti large language model (LLM) tanpa akses ke plaintext yang mendasarinya. Pengaturan ini melindungi kerahasiaan data klien, tetapi penulis mengidentifikasi kerentanan keamanan yang kritis: inferensi HE-LLM rentan terhadap klien berbahaya yang mengirimkan prompt adversarial, seperti serangan jailbreak. Kerahasiaan yang sama yang melindungi klien benign juga mencegah server memeriksa prompt yang masuk atau respons yang dihasilkan, sehingga upaya adversarial sulit dideteksi atau diblokir dan berpotensi membiarkan serangan yang berhasil tetap sepenuhnya tak terlihat oleh server. Untuk mengatasi kerentanan ini, makalah ini mengusulkan HE-Guardrail, kerangka kerja yang mengevaluasi mekanisme guardrail sepenuhnya atas data terenkripsi dan secara homomorfik mengendalikan apakah respons model target dikembalikan ke klien. Karya ini menginstansiasi HE-Guardrail dengan tiga guardrail representatif: Llama Guard, JBShield, dan GradSafe.
HE-Guardrail beroperasi di ranah terenkripsi, di mana server memegang bobot model terenkripsi dan menerima input klien terenkripsi. Kerangka kerja ini mengintegrasikan model guardrail yang mengevaluasi prompt dan/atau respons terenkripsi dan menghasilkan sinyal keputusan terenkripsi. Sinyal ini kemudian digunakan secara homomorfik untuk mengendalikan apakah respons model target dikembalikan ke klien. Secara formal, misalkan menyatakan fungsi enkripsi dan fungsi dekripsi. Server menghitung:

Mengapa penting

Karya ini menyoroti ketegangan fundamental dalam privacy-preserving machine learning: enkripsi yang sama yang melindungi klien benign juga membutakan server terhadap input berbahaya. HE-Guardrail mengatasinya dengan memindahkan evaluasi guardrail ke ranah terenkripsi, sehingga server dapat menegakkan kebijakan keamanan tanpa mendekripsi data pengguna. Trade-off keamanan-efisiensi-utilitas menunjukkan bahwa tidak ada satu guardrail pun yang optimal untuk semua skenario; perancang sistem harus memilih berdasarkan prioritas mereka. Misalnya, Llama Guard mungkin memberikan deteksi yang robust tetapi memerlukan komputasi homomorfik yang signifikan, sementara JBShield atau GradSafe mungkin menawarkan alternatif yang lebih ringan. Kemampuan kerangka kerja ini untuk mengendalikan pelepasan respons secara homomorfik memastikan bahwa bahkan jika upaya jailbreak berhasil menghasilkan respons berbahaya, server dapat memblokir pengirimannya. Ini menambahkan lapisan pertahanan yang tak terlihat oleh klien, karena klien hanya menerima respons yang valid atau sinyal yang diblokir. Pendekatan ini bersifat umum dan dapat diperluas ke guardrail atau mekanisme keamanan lain. Pekerjaan selanjutnya dapat mengeksplorasi optimalisasi evaluasi homomorfik atas guardrail untuk mengurangi latensi dan konsumsi sumber daya, serta mengintegrasikan HE-Guardrail dengan teknik PPML lainnya. Secara keseluruhan, HE-Guardrail merupakan langkah signifikan menuju inferensi LLM yang aman dan privat, yang mengatasi kerentanan kritis dalam sistem PPML berbasis HE yang ada.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ