Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2026

Menempa Tree-Ring: Mereproduksi dan Menginstrumentasi Pemalsuan Watermark Semantik Kotak Hitam

Reproduksi perangkat keras terbatas dari serangan Reprompt pada Stable Diffusion XL, dengan instrumentasi detektor dan prediksi yang difalsifikasi
Saifur Rahman Tamim; Md Taslimul Hasan Toufique; A. M. Tayeful Islam· 2026· DOI 10.48550/arXiv.2609.12909

Masalah inti

Skema watermark semantik seperti Tree-Ring menyematkan pola yang dapat dideteksi pada latent noise awal model difusi, memungkinkan detektor memverifikasi asal-usul gambar tanpa akses ke kunci generasi. Penelitian terbaru oleh Müller et al. menunjukkan bahwa watermark ini tidak hanya dapat dihapus tetapi juga dapat dipalsukan: penyerang yang tidak pernah mengamati kunci watermark tetap dapat menghasilkan gambar yang diterima oleh detektor asli. Digest ini melaporkan reproduksi serangan pemalsuan Reprompt terhadap Tree-Ring pada Stable Diffusion XL (SDXL), yang dilakukan di bawah batasan perangkat keras yang jauh lebih ketat daripada studi asli. Penelitian asli menggunakan GPU NVIDIA A40; reproduksi ini dijalankan pada GPU dual T4 tingkat gratis dengan 14.6 GB memori yang dapat digunakan per perangkat. Selain reproduksi, studi ini menginstrumentasi detektor yang dirilis untuk memulihkan statistik uji yang dibuang dan mengevaluasi dua skor alami yang diturunkan darinya. Pertanyaan utamanya adalah apakah serangan tersebut direproduksi di bawah memori yang berkurang, apakah sinyal internal detektor dapat dibuat lebih informatif, dan apakah prediksi tingkat sumber tentang perilaku detekt

Inovasi

Serangan tersebut direproduksi. Selama enam uji coba dari tiga lengan, detektor asli menerima gambar asli 6/6 kali, gambar bersih 0/6 kali, dan gambar palsu 5/6 kali. Waktu eksekusi per serangan adalah 325–332 detik. Statistik detektor yang dipulihkan cocok persis dengan detektor yang dirilis, mengonfirmasi bahwa inversi tersebut akurat. Dua skor yang dibangun dari statistik yang dipulihkan memisahkan lengan palsu dari null bersih pada AUC 0.861 dan 0.972 pada delapan belas observasi yang sama. Probe terkontrol mengonfirmasi bahwa tambalan presisi setengah tidak mengubah statistik detektor, menyingkirkan artefak yang disebabkan presisi. Prediksi yang dibuat dari membaca sumber detektor—bahwa properti tertentu dari statistik akan berlaku—dibantah oleh pengukuran. Diagram Mermaid berikut merangkum alur eksperimen dan instrumentasi detektor:
Skema watermark semantik seperti Tree-Ring menyematkan pola yang dapat dideteksi pada latent noise awal model difusi, memungkinkan detektor memverifikasi asal-usul gambar tanpa akses ke kunci generasi. Penelitian terbaru oleh Müller et al. menunjukkan bahwa watermark ini tidak hanya dapat dihapus tetapi juga dapat dipalsukan: penyerang yang tidak pernah mengamati kunci watermark tetap dapat menghasilkan gambar yang diterima oleh detektor asli. Digest ini melaporkan reproduksi serangan pemalsuan Reprompt terhadap Tree-Ring pada Stable Diffusion XL (SDXL), yang dilakukan di bawah batasan perangkat keras yang jauh lebih ketat daripada studi asli. Penelitian asli menggunakan GPU NVIDIA A40; reproduksi ini dijalankan pada GPU dual T4 tingkat gratis dengan 14.6 GB memori yang dapat digunakan per perangkat. Selain reproduksi, studi ini menginstrumentasi detektor yang dirilis untuk memulihkan statistik uji yang dibuang dan mengevaluasi dua skor alami yang diturunkan darinya. Pertanyaan utamanya adalah apakah serangan tersebut direproduksi di bawah memori yang berkurang, apakah sinyal internal detektor dapat dibuat lebih informatif, dan apakah prediksi tingkat sumber tentang perilaku detektor bertahan terhadap pengukuran.

Reproduksi mengikuti kode yang dirilis oleh Müller et al. untuk serangan pemalsuan Reprompt terhadap Tree-Ring pada SDXL. Desain eksperimen terdiri dari tiga lengan: gambar asli yang dihasilkan dengan kunci watermark, gambar bersih yang dihasilkan tanpa watermark apa pun, dan gambar palsu yang dihasilkan oleh serangan tanpa akses kunci. Enam uji coba dijalankan di ketiga lengan, menghasilkan delapan belas observasi. Serangan dijalankan pada GPU dual T4 dengan 14.6 GB memori yang dapat digunakan per perangkat, memerlukan eksekusi presisi setengah (FP16). Karena pipeline SDXL melakukan panggilan autoencoder langsung yang tidak kompatibel dengan presisi setengah, pipeline ditambal untuk mengarahkan panggilan tersebut melalui jalur yang aman untuk presisi setengah. Probe terkontrol memverifikasi bahwa jalur yang ditambal tidak mengubah statistik detektor. Detektor yang dirilis menghitung statistik chi-kuadrat non-sentral tetapi hanya mengembalikan fungsi distribusi kumulatif (CDF) nya. Statistik yang dibuang dipulihkan dengan membalik hubungan CDF. Secara formal, jika detektor mengembalikan

, di mana adalah CDF chi-kuadrat non-sentral dengan derajat kebebasan dan non-sentralitas , statistik yang dipulihkan adalah
. Dua skor alami kemudian dibangun dari statistik yang dipulihkan: satu berdasarkan nilai mentahnya dan satu berdasarkan varian yang dinormalisasi. Kinerja deteksi diringkas oleh area di bawah kurva karakteristik operasi penerima (AUC) atas delapan belas observasi. Waktu eksekusi serangan diukur per uji coba. Semua artefak pengukuran, notebook, dan fork yang dipin dirilis bersama makalah.

Mengapa penting

Reproduksi mengonfirmasi bahwa serangan pemalsuan Reprompt terhadap Tree-Ring tahan terhadap pengurangan substansial memori per GPU: studi asli menggunakan GPU A40, sedangkan pekerjaan ini menggunakan GPU T4 dengan 14.6 GB memori yang dapat digunakan per perangkat. Tingkat keberhasilan pemalsuan 5/6 konsisten dengan efektivitas serangan yang dilaporkan, dan tingkat penerimaan bersih 0/6 mengonfirmasi bahwa detektor tidak secara sepele menerima gambar tanpa watermark. Waktu eksekusi 325–332 detik per serangan praktis bagi penyerang dengan sumber daya sederhana. Hasil instrumentasi mungkin yang paling konsekuensial: detektor yang dirilis membuang statistik yang, ketika dipulihkan, menghasilkan skor dengan AUC hingga 0.972. Ini menunjukkan bahwa output detektor saat ini—hanya CDF—kurang memanfaatkan informasi yang tersedia. Dua skor tersebut memisahkan gambar palsu dari gambar bersih pada delapan belas observasi yang sama, menunjukkan bahwa modifikasi sederhana pada pelaporan detektor dapat meningkatkan diskriminasi forensik. Prediksi yang difalsifikasi dari pembacaan sumber menggarisbawahi nilai pengukuran: analisis statis kode detektor dapat menyarankan properti yang tidak berlaku saat eksekusi. Tambalan presisi setengah divalidasi sebagai tidak mengganggu, yang penting karena perangkat keras terbatas adalah norma bagi banyak peneliti. Rilis notebook, fork yang dipin, dan artefak pengukuran mendukung reproduktifitas. Pekerjaan selanjutnya dapat mengeksplorasi apakah statistik yang dipulihkan dapat digeneralisasi ke skema watermark semantik lainnya, apakah skor tersebut tetap diskriminatif di bawah serangan adaptif, dan apakah detektor dapat diperkuat dengan memasukkan statistik yang dipulihkan ke dalam aturan keputusannya.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…