Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Audit Inferensi Keanggotaan Berbasis Subkelompok pada Teks Sintetis Berprivasi Diferensial

Audit MIA yang menyasar subkelompok mengungkap bahwa rilis teks sintetis DP memusatkan kebocoran residual pada subkelompok rentan, dan bahwa risiko tingkat rekaman adalah properti dari mekanisme rilis, bukan rekaman semata.
Yidan Sun; Viktor Schlegel; Srinivasan Nandakumar; Siew Kei Lam; Anil Anthony Bharathยท 2026ยท DOI 10.48550/arXiv.2609.09848

Masalah inti

Rilis data sintetis semakin banyak diusulkan sebagai sarana berbagi replika data yang realistis sebagai pengganti dataset privat yang sensitif. Bahkan ketika kebocoran privasi kasus terburuk dari rilis semacam itu dibatasi melalui privasi diferensial (DP), risiko residual tetap ada dalam praktik. Audit serangan inferensi keanggotaan (MIA) dilakukan untuk mengukur risiko ini secara empiris.

Namun, metode yang ada hanya mengukur risiko kasus rata-rata untuk rekaman yang ditarik secara acak, yang dapat menyembunyikan risiko terhadap subkelompok rentan. Untuk menyoroti masalah ini, penulis mendefinisikan permainan inferensi keanggotaan yang menyasar subkelompok di mana kumpulan target adalah parameter eksplisit. Pembingkaian ulang ini menggeser pertanyaan audit dari *apakah rilis ini bocor secara rata-rata?* menjadi *subkelompok mana yang mengalami kebocoran dari rilis ini, dan seberapa besar?*

Karya ini diposisikan pada persimpangan antara audit privasi, generasi teks sintetis, dan keadilan subkelompok dalam pembelajaran mesin. Klaim utamanya adalah bahwa jaminan DP agregat dan audit kasus rata-rata dapat hidup berdampingan dengan kebocoran yang terkonsentrasi dan spesifik subkelomp

Inovasi

Audit menunjukkan bahwa rilis sintetis membocorkan keanggotaan subkelompok dan bahwa serangan sebelumnya secara sistematis meremehkan kebocoran ini. Inilah temuan empiris utama: audit MIA kasus rata-rata bukan sekadar tidak presisi, melainkan bias ke arah yang meremehkan risiko terhadap subkelompok rentan.

DP efektif pada tingkat agregat: DP secara substansial mengurangi kebocoran rata-rata pada setiap anggaran yang diuji. Ini mengonfirmasi bahwa DP memberikan perlindungan yang berarti dalam pengertian agregat.

Namun, tiga pengamatan meredam gambaran ini:

1. **Konsentrasi kebocoran residual.** Di bawah DP, sepersepuluh rekaman membawa sekitar **40%** dari kebocoran yang tersisa. Kebocoran tidak tersebar merata di seluruh rilis; kebocoran terkonsentrasi pada sebagian kecil rekaman.
2. **Perlindungan yang tidak merata.** Dalam jaminan kasus terburuknya, derau menghilangkan lebih banyak kebocoran terukur dari rekaman acak dibandingkan dari rekaman berisiko tinggi. Audit kumpulan gabungan yang menilai kedua jenis rekaman terhadap negatif bersama mengonfirmasi hal ini pada tingkat rekaman.
3. **Ketergantungan risiko pada rilis.** *Rekaman mana* yang bocor terbukti merupakan properti

Rilis data sintetis semakin banyak diusulkan sebagai sarana berbagi replika data yang realistis sebagai pengganti dataset privat yang sensitif. Bahkan ketika kebocoran privasi kasus terburuk dari rilis semacam itu dibatasi melalui privasi diferensial (DP), risiko residual tetap ada dalam praktik. Audit serangan inferensi keanggotaan (MIA) dilakukan untuk mengukur risiko ini secara empiris.
Namun, metode yang ada hanya mengukur risiko kasus rata-rata untuk rekaman yang ditarik secara acak, yang dapat menyembunyikan risiko terhadap subkelompok rentan. Untuk menyoroti masalah ini, penulis mendefinisikan permainan inferensi keanggotaan yang menyasar subkelompok di mana kumpulan target adalah parameter eksplisit. Pembingkaian ulang ini menggeser pertanyaan audit dari *apakah rilis ini bocor secara rata-rata?* menjadi *subkelompok mana yang mengalami kebocoran dari rilis ini, dan seberapa besar?*

Mengapa penting

Audit MIA kasus rata-rata yang ada secara sistematis meremehkan kebocoran keanggotaan ke subkelompok rentan pada rilis teks sintetis DP. ยท Di bawah DP, kebocoran residual terkonsentrasi: sekitar 10% rekaman membawa sekitar 40% dari kebocoran yang tersisa. ยท Perlindungan DP tidak merata dalam praktik: derau menghilangkan lebih banyak kebocoran terukur dari rekaman acak dibandingkan dari rekaman berisiko tinggi, dikonfirmasi oleh audit kumpulan gabungan pada tingkat rekaman. ยท Rekaman mana yang bocor merupakan properti dari mekanisme rilis, bukan rekaman semata, sehingga risiko tingkat rekaman tidak dapat dinilai secara independen dari rilis. ยท Audit mencakup 32 proksi, tiga skenario pengetahuan penyerang, empat dataset, tiga generator (fine-tuning DP-SGD, prompting berbasis API, pengarah aktivasi), dan lima anggaran privasi.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ