Jadwal Sholat

Memuat jadwal sholat…

Editorial ilmu komputer

Open AccessOA2026

Bukan Pelindung yang Sama: Intervensi Protektif yang Bergantung pada Deployment di LLM

Bagaimana permukaan permintaan—suara, teks, atau API mentah—membentuk ulang apakah model frontier melakukan intervensi untuk melindungi pengguna yang mengalami distress
Eunna Lee; Soomyoung Lee; Jungpyo Nam; Heonjin Ha; Jamin Jung; Kyunam Choi; Sunjun Hwang; Yeonghun Kim; Seok-Jae Lim· 2026· DOI 10.48550/arXiv.2608.29136

Masalah inti

Makalah ini dibuka dengan pertanyaan yang tampak sederhana: apakah model melindungi pengguna dengan cara yang sama ketika pengguna itu *berbicara* alih-alih *mengetik*? Intervensi protektif di sini berarti kecenderungan model untuk mengenali distress dan bertindak atasnya—paling konkret, dengan mengeluarkan direktif perawatan medis yang eksplisit. Penulis memotivasi pertanyaan ini dengan mencatat bahwa permukaan deployment biasanya diperlakukan sebagai saluran netral, sekadar lapisan transportasi untuk model yang sama. Jika perilaku protektif invarian terhadap lapisan itu, maka evaluasi keselamatan yang dilakukan melalui satu antarmuka seharusnya dapat digeneralisasi ke semua antarmuka lain. Studi ini menguji asumsi tersebut secara langsung.

Desainnya menggunakan satu vignette distress: cedera fisik dengan tingkat keparahan yang tidak disebutkan setelah konflik interpersonal. Konten yang sama disajikan kepada empat model frontier dalam tiga kondisi deployment yang dipadankan—suara, teks, dan API mentah—dengan per sel. Setiap respons dikodekan sepanjang lima indikator protektif biner, termasuk apakah model mengeluarkan direktif perawatan medis yang eksplisit. Hipotesis uta

Inovasi

Tiga temuan menonjol.

Pertama, **respons antarmuka suara jauh lebih pendek daripada respons antarmuka teks untuk tiga dari empat model**. Kompresi ini sistematis, bukan insidental.

Kedua, **perilaku protektif menyusut seiring kompresi tersebut**. Direktif medis berada di plafon pada kondisi API maupun teks—artinya hampir setiap respons memuatnya—tetapi menurun pada kondisi suara untuk setiap model yang diuji. Arahnya konsisten di seluruh rangkaian model.

Ketiga, dan yang paling penting, **penyusutan itu tidak dapat direduksi menjadi panjang**. Dua disosiasi menetapkan hal ini:

- Satu model menghasilkan respons suara dan teks dengan panjang sebanding namun tetap menurunkan direktif medis.
- Model lain turun di bawah plafon antara kondisi API dan suaranya, yang panjang responsnya hampir identik.

Pada akses API mentah, polanya menjadi kategoris alih-alih parsial: **tidak ada model yang menanyakan keselamatan pengguna bahkan sekali pun**. Ini adalah pergeseran kualitatif, bukan penurunan marginal. Kondisi API, meskipun merupakan permukaan yang paling langsung dan paling sedikit termediasi, menghasilkan perilaku protektif paling rendah dari ketiganya.

| Kondisi | Direktif Medis |

Makalah ini dibuka dengan pertanyaan yang tampak sederhana: apakah model melindungi pengguna dengan cara yang sama ketika pengguna itu *berbicara* alih-alih *mengetik*? Intervensi protektif di sini berarti kecenderungan model untuk mengenali distress dan bertindak atasnya—paling konkret, dengan mengeluarkan direktif perawatan medis yang eksplisit. Penulis memotivasi pertanyaan ini dengan mencatat bahwa permukaan deployment biasanya diperlakukan sebagai saluran netral, sekadar lapisan transportasi untuk model yang sama. Jika perilaku protektif invarian terhadap lapisan itu, maka evaluasi keselamatan yang dilakukan melalui satu antarmuka seharusnya dapat digeneralisasi ke semua antarmuka lain. Studi ini menguji asumsi tersebut secara langsung.
Desainnya menggunakan satu vignette distress: cedera fisik dengan tingkat keparahan yang tidak disebutkan setelah konflik interpersonal. Konten yang sama disajikan kepada empat model frontier dalam tiga kondisi deployment yang dipadankan—suara, teks, dan API mentah—dengan per sel. Setiap respons dikodekan sepanjang lima indikator protektif biner, termasuk apakah model mengeluarkan direktif perawatan medis yang eksplisit. Hipotesis utamanya adalah bahwa intervensi protektif sensitif terhadap permukaan tempat permintaan datang, dan bahwa sensitivitas ini bukan sekadar artefak dari keluaran yang lebih pendek.

Mengapa penting

Hasilnya mendukung klaim inti makalah: intervensi protektif sensitif terhadap permukaan tempat permintaan datang. Sensitivitas ini dapat dideteksi menggunakan skema pengodean protektif yang sederhana—lima indikator biner cukup untuk memunculkannya—dan tidak dijelaskan oleh panjang giliran semata.

Disosiasi yang dikontrol panjang adalah inti analitiknya. Jika efeknya murni artefak verbositas, model dengan panjang suara dan teks yang sebanding seharusnya menunjukkan tingkat direktif yang sebanding. Ternyata tidak. Ini menyiratkan bahwa sesuatu pada permukaan suara itu sendiri—bukan sekadar keringkasan yang dipicunya—menekan perilaku protektif. Penulis membingkainya sebagai properti model yang bergantung pada deployment, bukan properti distress pengguna.

Hasil API mentah menajamkan poin ini. Pada akses API, tidak ada model yang menanyakan keselamatan pengguna bahkan sekali pun. Jika perilaku keselamatan adalah properti model yang stabil, ini seharusnya tidak terjadi. Absennya yang kategoris menunjukkan bahwa intervensi protektif sebagian dibentuk oleh konteks interaksi, dan bahwa menghilangkan perancah percakapan turut menghilangkan perilaku tersebut.

Implikasi praktisnya adalah evaluasi keselamatan yang dilakukan melalui satu antarmuka mungkin tidak dapat digeneralisasi. Model yang tersertifikasi protektif pada kondisi teks atau API dapat berperilaku berbeda ketika pengguna berbicara. Kontribusi makalah ini bersifat metodologis sekaligus empiris: skema pengodean ringan yang membuat variasi yang bergantung pada deployment menjadi terlihat, dan desain yang dikontrol panjang yang menyingkirkan perancu paling jelas.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…