Editorial Ilmu Komputer & AI
Bukti Watermark AI Gagal Memenuhi Kesiapan Forensik: Evaluasi Empiris
Masalah inti
Pemerintah semakin banyak mewajibkan konten yang dihasilkan LLM membawa watermark. EU AI Act menyerukan penandaan yang "cukup andal dan kuat." California SB 942 mensyaratkan pengungkapan yang "permanen atau sangat sulit dihapus." Kedua mandat bertumpu pada asumsi yang belum teruji: bahwa deteksi watermark menghasilkan bukti yang cukup andal untuk pengadilan. Makalah ini menguji asumsi tersebut secara langsung.
Para penulis, Saifur Rahman Tamim dan Amir Labib Khan, mengevaluasi tiga metode watermarking LLM yang representatif -- KGW, Unigram, dan implementasi MarkLLM dari SynthID-Text -- terhadap kriteria kelayakan Daubert dan proses forensik digital NIST SP 800-86. Untuk menyusun evaluasi ini, mereka mengusulkan kerangka Forensic Readiness Score (FRS) dengan 12 kriteria, tiga gerbang wajib, dan sistem penilaian 60 poin. Vektor serangan adalah parafrase yang mempertahankan makna, dipilih karena realistis secara hukum dan sulit ditolak sebagai perusakan bukti.
Pertanyaan utamanya adalah apakah deteksi watermark dapat berfungsi sebagai bukti yang sah secara forensik. Temuan makalah ini menimbulkan kekhawatiran pembuktian yang serius, menunjukkan bahwa konfigurasi watermarking saat in
Inovasi
Dari 846 proses parafrase yang valid di 15 prompt beragam per metode, setiap teks KGW dan Unigram yang awalnya terdeteksi kehilangan watermarknya setelah parafrase -- penghapusan kondisional 100%. SynthID hanya sedikit lebih baik pada 98,3%.
Bahkan sebelum serangan apa pun, tingkat false-negative sudah tinggi: 70% untuk KGW, 83% untuk Unigram, dan 80% untuk SynthID. Konfigurasi SynthID juga menandai 5,4% kontrol tulisan manusia yang diparafrase sebagai dihasilkan AI dan menunjukkan tingkat paradoks 18,6%, dengan 80% dari output berwatermark murninya sendiri masuk ke deadband ketidakpastian.
Tidak ada dari ketiga metode yang memenuhi lebih dari dua dari lima faktor Daubert. Sistem penilaian berbasis poin FRS, meskipun bekerja sesuai rancangan, tidak dapat sepenuhnya menangkap ketidakbergunaan forensik. Konfigurasi ini, sebagaimana diuji, tidak memenuhi standar pembuktian yang dibutuhkan pengadilan.
Hasil kuantitatif utama dapat diringkas sebagai:
- Penghapusan kondisional setelah parafrase: KGW = 100%, Unigram = 100%, SynthID = 98,3%.
- Tingkat false-negative pra-serangan: KGW = 70%, Unigram = 83%, SynthID = 80%.
- False-positive SynthID pada kontrol manusia: 5,4%.
- Tingkat par
Mengapa penting
Hasil ini secara langsung menantang asumsi yang mendasari EU AI Act dan California SB 942: bahwa deteksi watermark menghasilkan bukti yang cukup andal untuk pengadilan. Penghapusan kondisional yang hampir total di bawah parafrase yang mempertahankan makna menunjukkan bahwa watermark rapuh terhadap transformasi yang realistis secara hukum. Karena parafrase tidak mengubah makna, sulit untuk mencirikannya sebagai perusakan bukti, namun secara efektif menghapus watermark.
Tingkat false-negative pra-serangan yang tinggi semakin melemahkan keandalan. Jika suatu metode gagal mendeteksi watermarknya sendiri bahkan sebelum serangan, nilai pembuktiannya terbatas. False-positive SynthID pada kontrol tulisan manusia (5,4%) dan tingkat paradoksnya (18,6%) menimbulkan kekhawatiran tambahan tentang spesifisitas dan kalibrasi. Fakta bahwa 80% dari output berwatermark murni SynthID jatuh ke deadband ketidakpastian menunjukkan bahwa metode ini sering tidak dapat membuat penentuan yang yakin bahkan dalam kondisi ideal.
Analisis Daubert memperkuat temuan ini: tidak ada dari ketiga metode yang memenuhi lebih dari dua dari lima faktor. Kerangka FRS, meskipun fungsional, tidak dapat sepenuhnya mengekspresikan ketidakbergunaan forensik, menyoroti kebutuhan akan desain kerangka di masa depan yang menangkap kegagalan kategoris. Secara keseluruhan, konfigurasi yang diuji tidak memenuhi standar pembuktian yang dibutuhkan pengadilan.
Alur evaluasi forensik yang disederhanakan dapat direpresentasikan sebagai:
Tidak ada persamaan yang disajikan dalam sumber; sistem penilaian FRS dijelaskan sebagai skala 60 poin dengan 12 kriteria dan tiga gerbang wajib.
Siapa yang sebaiknya membaca
Membuka konten memberโฆ