Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

MarkSec: Evaluasi Serangan Adversarial terhadap Watermark LLM yang Sadar Kapabilitas

Kerangka kerja terpadu mengungkap bahwa peringkat serangan berubah ketika kualitas teks ditegakkan, menantang evaluasi terisolasi atas stealing, scrubbing, dan spoofing.
Kairong Li; Zhikun Zhang; Xiao Ren; Yunjun Gaoยท 2026ยท DOI 10.48550/arXiv.2609.16681

Masalah inti

Watermarking large language model (LLM) menyematkan sinyal yang dapat dideteksi ke dalam teks yang dihasilkan untuk melacak provenans. Namun, penyerang dapat melancarkan tiga kelas serangan: **stealing** (memulihkan informasi watermark), **scrubbing** (menghapus sinyal watermark), dan **spoofing** (memalsukan teks yang diterima sebagai berwatermark). Penelitian sebelumnya mempelajari serangan-serangan ini secara terisolasi, mengaburkan keterkaitannya dan membuat perbandingan tidak dapat diandalkan karena kalibrasi detektor, definisi metrik, dan protokol pelaporan yang tidak konsisten. Selain itu, mengevaluasi keberhasilan serangan dan kualitas teks secara terpisah gagal mengidentifikasi serangan yang sekaligus efektif dan mempertahankan kualitas. Makalah ini memperkenalkan **MarkSec**, kerangka kerja umum yang menyatukan analisis stealing, scrubbing, dan spoofing di bawah protokol pelaporan bersama. MarkSec juga mengusulkan **metrik keberhasilan serangan yang dibatasi kualitas** yang menilai secara bersama efektivitas dan kualitas teks. Penulis mengevaluasi keluarga watermark, serangan, LLM, dan dataset yang representatif, menghasilkan tiga temuan kunci: (1) serangan yang tampak te

Inovasi

Eksperimen di seluruh keluarga watermark, serangan, LLM, dan dataset yang representatif menghasilkan tiga temuan utama. **Pertama**, serangan yang tampak terkuat hanya berdasarkan penghapusan watermark dapat tertinggal di belakang penulisan ulang umum ketika keberhasilan juga mensyaratkan kualitas teks yang dapat diterima. Ini menunjukkan bahwa metrik keberhasilan serangan konvensional melebih-lebihkan ancaman praktis dari beberapa serangan. **Kedua**, penulisan ulang umum tetap menjadi baseline yang kuat di seluruh keluarga watermark, sementara keunggulannya atas scrubber lain bervariasi menurut keluarga. Misalnya, pada beberapa keluarga watermark, penulisan ulang umum mencapai keberhasilan yang dibatasi kualitas lebih tinggi daripada scrubber khusus, sedangkan pada keluarga lain kesenjangannya menyempit. **Ketiga**, dalam studi kasus satu keluarga watermark, scrubber berbasis stealing sering kali berkinerja lebih rendah daripada baseline general-scrubbing terbaik ketika kualitas teks disyaratkan. Ini menunjukkan bahwa mencuri informasi watermark tidak serta-merta berarti scrubbing yang lebih baik di bawah batasan kualitas. Hasilnya konsisten di berbagai LLM dan dataset, menegaska
Watermarking large language model (LLM) menyematkan sinyal yang dapat dideteksi ke dalam teks yang dihasilkan untuk melacak provenans. Namun, penyerang dapat melancarkan tiga kelas serangan: **stealing** (memulihkan informasi watermark), **scrubbing** (menghapus sinyal watermark), dan **spoofing** (memalsukan teks yang diterima sebagai berwatermark). Penelitian sebelumnya mempelajari serangan-serangan ini secara terisolasi, mengaburkan keterkaitannya dan membuat perbandingan tidak dapat diandalkan karena kalibrasi detektor, definisi metrik, dan protokol pelaporan yang tidak konsisten. Selain itu, mengevaluasi keberhasilan serangan dan kualitas teks secara terpisah gagal mengidentifikasi serangan yang sekaligus efektif dan mempertahankan kualitas. Makalah ini memperkenalkan **MarkSec**, kerangka kerja umum yang menyatukan analisis stealing, scrubbing, dan spoofing di bawah protokol pelaporan bersama. MarkSec juga mengusulkan **metrik keberhasilan serangan yang dibatasi kualitas** yang menilai secara bersama efektivitas dan kualitas teks. Penulis mengevaluasi keluarga watermark, serangan, LLM, dan dataset yang representatif, menghasilkan tiga temuan kunci: (1) serangan yang tampak terkuat hanya berdasarkan penghapusan watermark dapat tertinggal di belakang penulisan ulang umum ketika kualitas teks disyaratkan; (2) penulisan ulang umum tetap menjadi baseline yang kuat di seluruh keluarga watermark, meskipun keunggulannya atas scrubber lain bervariasi; dan (3) dalam studi kasus, scrubber berbasis stealing sering kali berkinerja lebih rendah daripada baseline general-scrubbing terbaik ketika kualitas teks ditegakkan. Hasil ini menyoroti bahwa pemenang serangan yang tampak bergantung pada batasan kualitas teks, keumuman serangan, dan asumsi kapabilitas.
MarkSec menyediakan kerangka kerja terpadu untuk mengevaluasi serangan stealing, scrubbing, dan spoofing terhadap watermark LLM. Kerangka kerja ini menstandardisasi kalibrasi detektor, definisi metrik, dan protokol pelaporan untuk memungkinkan perbandingan yang adil. Inti dari MarkSec adalah **metrik keberhasilan serangan yang dibatasi kualitas** yang mengukur secara bersama efektivitas serangan dan kualitas teks. Secara formal, misalkan menyatakan serangan, skema watermarking, dan detektor. Tingkat keberhasilan serangan didefinisikan sebagai:

Mengapa penting

Kerangka kerja MarkSec mengungkap keterbatasan kritis dalam evaluasi sebelumnya yang memperlakukan keberhasilan serangan dan kualitas teks secara terpisah. Dengan memperkenalkan metrik yang dibatasi kualitas, penulis menunjukkan bahwa pemenang serangan yang tampak bergantung pada batasan kualitas teks, keumuman serangan, dan asumsi kapabilitas. **Batasan kualitas teks**: Ketika kualitas ditegakkan, serangan yang secara agresif menghapus watermark sering kali menurunkan kualitas teks, mengurangi kegunaan praktisnya. **Keumuman serangan**: Metode penulisan ulang umum, yang tidak disesuaikan untuk keluarga watermark tertentu, tetap kompetitif atau lebih unggul di seluruh keluarga, menunjukkan bahwa serangan khusus mungkin overfit terhadap watermark tertentu. **Asumsi kapabilitas**: Scrubber berbasis stealing mengasumsikan penyerang dapat memulihkan informasi watermark; namun, bahkan dengan kapabilitas ini, mereka tidak secara konsisten mengungguli baseline general-scrubbing yang lebih sederhana ketika kualitas menjadi pertimbangan. Wawasan ini menyiratkan bahwa penelitian watermarking dan serangan di masa depan harus mengadopsi protokol evaluasi terpadu yang sadar kualitas. Kerangka kerja MarkSec menyediakan fondasi untuk standardisasi tersebut, memungkinkan perbandingan yang adil dan mengungkap trade-off antara efektivitas dan kualitas. Batasan meliputi cakupan keluarga watermark dan serangan yang diuji, serta pilihan metrik kualitas, yang dapat memengaruhi peringkat. Meskipun demikian, temuan ini menyoroti perlunya mempertimbangkan kualitas teks sebagai batasan kelas satu dalam evaluasi adversarial.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ