Bukan Pelindung yang Sama: Intervensi Protektif yang Bergantung pada Deployment di LLM
Eunna Lee; Soomyoung Lee; Jungpyo Nam; Heonjin Ha; Jamin Jung; Kyunam Choi; Sunjun Hwang; Yeonghun Kim; Seok-Jae Lim
- Ringkasan
- Pada empat model frontier yang diuji dengan vignette distress yang dipadankan, perilaku protektif menyusut pada antarmuka suara dan hilang sepenuhnya pada akses API mentah, bahkan ketika panjang respons dijaga konstan.
- Metode
- Metodologinya adalah perbandingan input yang dipadankan dan terkontrol. Satu vignette distress dijaga konstan di semua kondisi; hanya permukaan deployment yang bervariasi. Tiga pe…
- Hasil
- Tiga temuan menonjol. Pertama, **respons antarmuka suara jauh lebih pendek daripada respons antarmuka teks untuk tiga dari empat model**. Kompresi ini sistematis, bukan insidental. Kedua, **perilaku …