Jadwal Sholat

Memuat jadwal sholat…

Editorial ilmu komputer

Open AccessOA2026

Mengukur Ketidakadilan Basis Data melalui Kuantifikasi Dependensi di Bawah Privasi Diferensial

Kerangka formal dengan tiga ukuran ketidakadilan yang saling melengkapi dan algoritma yang menjaga privasi untuk menilai bias pada dataset privat
Mariia Vologdin; Yuchao Tao; Amir Gilad· 2026· DOI 10.48550/arXiv.2605.22952

Masalah inti

Privasi diferensial (DP) telah menjadi standar de facto untuk melindungi data sensitif, memberikan jaminan kuat bahwa statistik atau model yang dipublikasikan mengungkapkan informasi terbatas tentang individu mana pun. Namun, derau privasi dan akses data yang terbatas membuat penilaian keadilan dan keandalan dataset privat semakin sulit. Makalah ini menjawab tantangan kuantifikasi ketidakadilan data di bawah DP dengan mengusulkan kerangka formal. Penulis mengidentifikasi tiga desiderata inti untuk ukuran ketidakadilan berdasarkan penelitian sebelumnya: positivitas, monotonisitas, dan komputabilitas DP. Mereka kemudian menginstansiasikan desiderata ini melalui tiga ukuran yang saling melengkapi: (1) ukuran berbasis mutual information dengan proksi total variation distance yang cocok untuk DP, (2) ukuran berbasis perbaikan data yang diaproksimasi melalui reduksi ke weighted MaxSAT, dan (3) ukuran kontribusi tuple top- yang mengisolasi rekaman paling berpengaruh dalam pelanggaran keadilan. Makalah ini merancang algoritma yang menjaga privasi dan menganalisis sensitivitas, akurasi, serta efisiensinya. Eksperimen ekstensif pada berbagai dataset dunia nyata menunjukkan bahwa ukuran ya

Inovasi

Eksperimen ekstensif pada berbagai dataset dunia nyata menunjukkan efektivitas ukuran yang diusulkan. Penulis mengevaluasi ketiga ukuran di bawah anggaran privasi yang bervariasi dan membandingkannya dengan padanan non-privatnya. Temuan utama meliputi:

- Ukuran berbasis mutual information dengan proksi total variation distance dengan setia mengaproksimasi mutual information non-privat, dengan galat rendah bahkan pada tingkat privasi sedang (misalnya, ).
- Ukuran berbasis perbaikan data, yang diaproksimasi melalui weighted MaxSAT, secara efektif mengidentifikasi jumlah minimum modifikasi tuple yang diperlukan untuk menghilangkan ketidakadilan, dan algoritma yang menjaga privasi mempertahankan akurasi tinggi.
- Ukuran kontribusi tuple top- berhasil mengisolasi rekaman paling berpengaruh, memberikan wawasan yang dapat ditindaklanjuti untuk manajemen data.

Hasil kuantitatif menunjukkan bahwa seiring meningkat (yaitu, privasi melemah), ukuran-ukuran tersebut konvergen ke nilai non-privatnya. Misalnya, pada dataset Adult, ukuran berbasis MI mencapai galat relatif kurang dari 5% pada , dan ukuran top- dengan benar mengidentifikasi

Privasi diferensial (DP) telah menjadi standar de facto untuk melindungi data sensitif, memberikan jaminan kuat bahwa statistik atau model yang dipublikasikan mengungkapkan informasi terbatas tentang individu mana pun. Namun, derau privasi dan akses data yang terbatas membuat penilaian keadilan dan keandalan dataset privat semakin sulit. Makalah ini menjawab tantangan kuantifikasi ketidakadilan data di bawah DP dengan mengusulkan kerangka formal. Penulis mengidentifikasi tiga desiderata inti untuk ukuran ketidakadilan berdasarkan penelitian sebelumnya: positivitas, monotonisitas, dan komputabilitas DP. Mereka kemudian menginstansiasikan desiderata ini melalui tiga ukuran yang saling melengkapi: (1) ukuran berbasis mutual information dengan proksi total variation distance yang cocok untuk DP, (2) ukuran berbasis perbaikan data yang diaproksimasi melalui reduksi ke weighted MaxSAT, dan (3) ukuran kontribusi tuple top- yang mengisolasi rekaman paling berpengaruh dalam pelanggaran keadilan. Makalah ini merancang algoritma yang menjaga privasi dan menganalisis sensitivitas, akurasi, serta efisiensinya. Eksperimen ekstensif pada berbagai dataset dunia nyata menunjukkan bahwa ukuran yang diusulkan dengan setia mengaproksimasi padanan non-privatnya, secara efektif mengukur bias di bawah batasan privasi, dan memberikan wawasan untuk manajemen data.
Penulis mengusulkan kerangka formal untuk mengukur ketidakadilan data di bawah privasi diferensial. Mereka mulai dengan mengidentifikasi tiga desiderata inti untuk ukuran ketidakadilan: positivitas (ukuran harus non-negatif), monotonisitas (ukuran harus meningkat seiring ketidakadilan), dan komputabilitas DP (ukuran harus dapat dihitung di bawah DP). Untuk memenuhi desiderata ini, mereka memperkenalkan tiga ukuran yang saling melengkapi.

Mengapa penting

Makalah ini memberikan analisis komprehensif tentang kerangka yang diusulkan, membahas kekuatan dan batasannya. Ketiga ukuran tersebut saling melengkapi: ukuran berbasis MI menawarkan kuantifikasi dependensi secara global, ukuran perbaikan data memberikan pendekatan preskriptif untuk mencapai keadilan, dan ukuran kontribusi top- memungkinkan intervensi yang tertarget. Penulis menunjukkan bahwa ukuran-ukuran ini memenuhi tiga desiderata: positivitas, monotonisitas, dan komputabilitas DP.

Algoritma yang menjaga privasi dianalisis dalam hal sensitivitas, akurasi, dan efisiensi. Sensitivitas setiap ukuran dibatasi, dan derau yang ditambahkan untuk memastikan DP dikalibrasi sesuai. Akurasi dievaluasi melalui batas galat teoretis dan eksperimen empiris. Efisiensi ditangani dengan mengoptimalkan algoritma, misalnya, menggunakan pemecah MaxSAT yang efisien dan teknik pengambilan sampel untuk top-.

Pembahasan juga menyoroti trade-off antara privasi dan penilaian keadilan: privasi yang lebih kuat ( lebih kecil) menghasilkan ukuran yang lebih berderau, tetapi metode yang diusulkan tetap memberikan wawasan yang berguna. Penulis menyarankan bahwa kerangka ini dapat diperluas ke gagasan keadilan dan tipe data lain. Mereka juga membahas potensi aplikasi dalam manajemen data, seperti memandu pengumpulan dan pembersihan data untuk mengurangi ketidakadilan.

Secara keseluruhan, makalah ini memberikan kontribusi signifikan pada bidang penilaian keadilan yang menjaga privasi, menyediakan landasan teoretis dan algoritma praktis. Eksperimen memvalidasi efektivitas pendekatan ini, dan wawasan yang ditawarkan dapat menginformasikan desain sistem data yang adil dan privat.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…