Editorial ilmu komputer
WoE Wrote It? Watermarking Mixture-of-Experts LLMs for Black-Box Text Provenance
Masalah inti
Watermark Large Language Model (LLM) adalah mekanisme utama untuk provenans teks: mekanisme ini memungkinkan pemilik model mengidentifikasi konten yang dihasilkan mesin dan mengatribusikannya ke model ber-watermark tertentu. Namun, pendekatan watermark LLM saat ini sebagian besar bergantung pada **metode sampler saat inferensi** dan memusatkan analisisnya pada **model dense**. Hal ini menciptakan titik buta struktural. Metode saat inferensi hanya efektif ketika teks dihasilkan secara eksplisit melalui API terkendali milik pemilik model; metode ini gagal dalam **skenario pasca-kompromi**. Penyerang yang mencuri atau membocorkan bobot model memperoleh kendali penuh atas inferensi dan cukup menjalankan sampler tanpa modifikasi, melewati watermark dan mencegah atribusi pasca-pencurian.
Para penulis (Jona te Lintelo, Lichao Wu, Stjepan Picek) karena itu merumuskan ulang masalahnya: provenans seharusnya tidak berada dalam pembungkus inferensi yang dapat ditegakkan, melainkan dalam parameter model itu sendiri. Mereka memperkenalkan **Watermarking of Experts (WoE)**, metode provenans teks black-box yang memanfaatkan sifat struktural unik dari model **Mixture-of-Experts (MoE)** sparse. WoE
Inovasi
Di antara delapan model MoE yang dievaluasi, WoE berhasil mendeteksi watermark dari teks yang dicurigai dengan **rata-rata true positive rate 90,1% pada false positive rate 1%**, mencapai **hingga 94,9%** pada konfigurasi terkuat. Ini menempatkan detektor jauh di atas titik operasi FPR 1% yang dibutuhkan sistem provenans praktis, sekaligus tetap merupakan prosedur black-box yang hanya memerlukan teks yang dicurigai.
Yang krusial, watermark tidak hanya terdeteksi pada kasus benign. WoE tetap terdeteksi di bawah tiga tekanan adversarial:
- **Supervised fine-tuning adversarial** โ mengadaptasi model curian pada data penyerang tidak menghapus bias kosakata tingkat expert.
- **Ekstraksi model** โ model dense sekunder yang didistilasi dari arsitektur MoE curian mempertahankan sinyal yang dapat dideteksi.
- **Parafrase pada tingkat output** โ menulis ulang teks yang dihasilkan tidak sepenuhnya menghapus tanda statistik.
Pada saat yang sama, para penulis melaporkan bahwa WoE **sebagian besar mempertahankan utilitas umum model**, artinya jaminan provenans tidak diperoleh dengan mengorbankan model dasar yang menurun. Hasilnya adalah kurva trade-off yang menguntungkan bagi defender: atribu
Mengapa penting
Kontribusi utama WoE adalah pergeseran pada *di mana* watermark berada. Sampler saat inferensi mengasumsikan defender mengendalikan jalur generasi; WoE mengasumsikan defender sudah kehilangan kendali itu dan harus mengandalkan parameter itu sendiri. Dengan membiaskan kosakata expert, sinyal terjerat dengan spesialisasi yang dipelajari model, sehingga menghapusnya bukan sekadar menukar sampler.
Ini menghasilkan **trade-off yang disengaja bagi aktor jahat**: melemahkan sinyal atribusi memerlukan adaptasi model tambahan atau operasi penulisan ulang teks, atau mengorbankan utilitas output yang dihasilkan. Dengan kata lain, penyerang harus membayar dalam komputasi, kompleksitas pipeline, atau kualitas output โ tidak ada jalan pintas gratis.
Pendekatan ini juga memperluas provenans ke **model dense sekunder yang didistilasi dari arsitektur curian**, skenario yang sama sekali tidak dapat ditangani watermark saat inferensi, karena model hasil distilasi tidak pernah menyentuh API pemilik. Rata-rata TPR 90,1% pada FPR 1% yang dilaporkan, dengan puncak 94,9%, menunjukkan sinyal cukup kuat untuk atribusi praktis sementara pemeliharaan utilitas menjaga MoE ber-watermark tetap dapat digunakan sebagai model serbaguna.
Batasan mengikuti desainnya: WoE spesifik untuk arsitektur MoE sparse dan bergantung pada persistensi struktur routing expert melalui adaptasi dan distilasi. Taksonomi karya ini berada di persimpangan **Arsitektur**, **Keamanan Siber**, **Jaringan**, dan **Kriptografi** โ arsitektur karena memanfaatkan routing MoE, keamanan siber karena menangani pencurian model dan atribusi pasca-kompromi, dan kriptografi karena berfungsi sebagai primitif provenans dan atribusi untuk teks yang dihasilkan.
Siapa yang sebaiknya membaca
Membuka konten memberโฆ