Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

ALTSTEER: Pengarahan Keamanan Selektif untuk Melampaui Penolakan Kaku menuju Alternatif Konstruktif

Kerangka kerja waktu inferensi yang menggabungkan intervensi selektif dengan pengalihan konstruktif berjangkar penolakan
Hoejoon Kwon; Byeonggeuk Lim; Kahyeon Kim; YoungBin Kimยท 2026ยท DOI 10.48550/arXiv.2608.30197

Masalah inti

Penyelarasan keamanan sangat penting untuk menerapkan large language model (LLM), yang menuntut sistem untuk mencegah kepatuhan berbahaya sekaligus mempertahankan kegunaan pada permintaan baik. Pengarahan aktivasi menawarkan pendekatan waktu inferensi tanpa pelatihan untuk kontrol keamanan, tetapi pengarahan keamanan yang efektif memerlukan penanganan dua pertanyaan yang saling terkait: **kapan harus melakukan intervensi** dan **bagaimana generasi harus dibentuk setelah intervensi**. Metode pengarahan keamanan yang ada masih terbatas pada kedua dimensi tersebut: mekanisme pemicunya dapat tidak stabil lintas domain, dan pengarahan yang berorientasi penolakan sering menghasilkan penolakan kaku alih-alih panduan aman yang konstruktif. Untuk mengatasi keterbatasan ini, penulis mengusulkan ALTSTEER, kerangka kerja waktu inferensi yang menggabungkan intervensi selektif dengan pengalihan konstruktif berjangkar penolakan dalam satu lintasan inferensi. Karya ini menyasar celah praktis: melampaui penolakan kaku menuju alternatif konstruktif sambil mempertahankan utilitas baik.

Inovasi

Evaluasi pada Llama-3.1 dan Qwen2.5 menunjukkan bahwa ALTSTEER mempertahankan utilitas baik sekaligus meningkatkan perilaku penyelesaian aman yang konstruktif, terutama pada model yang cenderung menghasilkan penolakan singkat untuk permintaan berbahaya. Penulis melaporkan bahwa ALTSTEER mencapai keseimbangan yang lebih baik antara keamanan dan kegunaan dibandingkan metode pengarahan baseline. Secara khusus, pada model yang rentan terhadap penolakan singkat, ALTSTEER meningkatkan tingkat penyelesaian aman yang konstruktif tanpa menurunkan kinerja secara signifikan pada tugas-tugas baik. Abstrak tidak menyediakan nilai numerik spesifik, tetapi hasil kualitatif menunjukkan peningkatan yang konsisten pada model-model yang dievaluasi.
Penyelarasan keamanan sangat penting untuk menerapkan large language model (LLM), yang menuntut sistem untuk mencegah kepatuhan berbahaya sekaligus mempertahankan kegunaan pada permintaan baik. Pengarahan aktivasi menawarkan pendekatan waktu inferensi tanpa pelatihan untuk kontrol keamanan, tetapi pengarahan keamanan yang efektif memerlukan penanganan dua pertanyaan yang saling terkait: **kapan harus melakukan intervensi** dan **bagaimana generasi harus dibentuk setelah intervensi**. Metode pengarahan keamanan yang ada masih terbatas pada kedua dimensi tersebut: mekanisme pemicunya dapat tidak stabil lintas domain, dan pengarahan yang berorientasi penolakan sering menghasilkan penolakan kaku alih-alih panduan aman yang konstruktif. Untuk mengatasi keterbatasan ini, penulis mengusulkan ALTSTEER, kerangka kerja waktu inferensi yang menggabungkan intervensi selektif dengan pengalihan konstruktif berjangkar penolakan dalam satu lintasan inferensi. Karya ini menyasar celah praktis: melampaui penolakan kaku menuju alternatif konstruktif sambil mempertahankan utilitas baik.
ALTSTEER beroperasi sepenuhnya pada waktu inferensi tanpa pelatihan tambahan. Kerangka ini terdiri dari dua komponen utama:

Mengapa penting

Makalah ini membahas dua keterbatasan kritis dari pengarahan keamanan yang ada: pemicu yang tidak stabil dan pengarahan berorientasi penolakan. Dengan menggunakan sinyal internal yang relevan dengan penolakan, ALTSTEER bertujuan menyediakan pemicu yang lebih andal yang dapat digeneralisasi lintas domain. Pendekatan pengarahan bertahap melampaui penolakan biner untuk menghasilkan alternatif konstruktif, yang penting untuk aplikasi di mana pengguna membutuhkan respons aman namun berguna. Sifat waktu inferensi ALTSTEER membuatnya menarik untuk penerapan tanpa pelatihan ulang. Namun, ketergantungan pada sinyal internal menimbulkan pertanyaan tentang ketahanan dan potensi manipulasi adversarial. Penelitian selanjutnya dapat mengeksplorasi ambang batas adaptif dan interaksi multi-giliran. Secara keseluruhan, ALTSTEER merupakan langkah menuju penyelarasan keamanan yang lebih bernuansa yang menyeimbangkan penolakan dengan panduan konstruktif.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ