Editorial Ilmu Komputer & AI
Open AccessOA2026
ExplainGuard: Kerangka Zero Trust untuk Jaminan Integritas Penjelasan Post-Hoc pada Model XAI Blackbox
Arsitektur Zero-Trust untuk Memverifikasi Penjelasan SHAP dan LIME terhadap Serangan Manipulasi
Maraz Mia; Shovan Roy; Mir Mehedi A. Pritom; Maanak Guptaยท 2026ยท DOI 10.48550/arXiv.2608.21803
Masalah inti
Seiring model machine learning (ML) semakin banyak digunakan di lingkungan berisiko tinggi, metode explainable AI (XAI) seperti SHAP dan LIME menjadi penting untuk kepatuhan regulasi dan kepercayaan. Namun, paradigma audit saat ini bergantung pada "chain of trust" implisit yang mengasumsikan auditor pihak ketiga dapat dipercaya. Penelitian terbaru menunjukkan bahwa asumsi ini cacat: auditor adversarial dapat memanipulasi penjelasan XAI melalui serangan manipulasi seperti output shuffling atau scaffolding out-of-distribution (OOD) untuk menyembunyikan bias model sambil mempertahankan akurasi prediksi yang tinggi, dengan tujuan menghasilkan penjelasan yang fairwashed. Makalah ini memperkenalkan ExplainGuard, kerangka pertahanan baru yang memanfaatkan desain Zero-Trust Architecture (ZTA) untuk diintegrasikan dalam rantai pasok penjelasan XAI dan menjamin integritas penjelasan yang dihasilkan. Kerangka ini menggantikan asumsi default yang ambigu "auditor dapat dipercaya" dengan pendekatan "verify-then-trust" yang berkelanjutan.
Inovasi
Makalah ini mengevaluasi ExplainGuard terhadap serangan manipulasi penjelasan mutakhir. Hasilnya menunjukkan bahwa ExplainGuard secara efektif menetralkan serangan tersebut dengan mendeteksi dan menolak penjelasan yang dimanipulasi. Secara spesifik, pemeriksaan integritas aset berhasil mengidentifikasi serangan substitusi model, pemeriksaan validitas semantik menolak penjelasan yang melanggar properti aksiomatik, dan pemeriksaan kesetiaan fitur mendeteksi ketidakstabilan peringkat yang diakibatkan manipulasi. Kerangka ini mempertahankan akurasi prediksi yang tinggi sekaligus menjamin integritas penjelasan, dengan overhead komputasi minimal.
Seiring model machine learning (ML) semakin banyak digunakan di lingkungan berisiko tinggi, metode explainable AI (XAI) seperti SHAP dan LIME menjadi penting untuk kepatuhan regulasi dan kepercayaan. Namun, paradigma audit saat ini bergantung pada "chain of trust" implisit yang mengasumsikan auditor pihak ketiga dapat dipercaya. Penelitian terbaru menunjukkan bahwa asumsi ini cacat: auditor adversarial dapat memanipulasi penjelasan XAI melalui serangan manipulasi seperti output shuffling atau scaffolding out-of-distribution (OOD) untuk menyembunyikan bias model sambil mempertahankan akurasi prediksi yang tinggi, dengan tujuan menghasilkan penjelasan yang fairwashed. Makalah ini memperkenalkan ExplainGuard, kerangka pertahanan baru yang memanfaatkan desain Zero-Trust Architecture (ZTA) untuk diintegrasikan dalam rantai pasok penjelasan XAI dan menjamin integritas penjelasan yang dihasilkan. Kerangka ini menggantikan asumsi default yang ambigu "auditor dapat dipercaya" dengan pendekatan "verify-then-trust" yang berkelanjutan.
ExplainGuard membentuk Policy Decision Point (PDP) yang menegakkan tiga pilar verifikasi yang berbeda sebelum penjelasan apa pun dirilis kepada pengguna:
Mengapa penting
ExplainGuard mengubah proses audit menjadi operasi yang dapat diverifikasi, mengatasi cacat kritis dalam model kepercayaan saat ini. Dengan mengadopsi Zero-Trust Architecture, kerangka ini memastikan bahwa penjelasan terus diverifikasi sebelum dirilis kepada pengguna. Pendekatan ini tidak hanya meningkatkan kepercayaan pada sistem XAI tetapi juga selaras dengan persyaratan regulasi untuk transparansi dan akuntabilitas. Desain modular kerangka ini memungkinkan integrasi ke dalam rantai pasok XAI yang ada, dan ketiga pilarnya memberikan pertahanan menyeluruh terhadap berbagai serangan manipulasi. Pekerjaan selanjutnya dapat mengeksplorasi perluasan ExplainGuard ke metode XAI lain dan mengadaptasinya ke lingkungan dinamis tempat model dan distribusi data berkembang seiring waktu.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten memberโฆ