Editorial Ilmu Komputer & AI
Orang Asing bagi Dirinya Sendiri: Apa yang Model Bahasa Katakan tentang Dirinya Bersifat Generik
Masalah inti
Model bahasa (LM) dapat dengan lancar menggambarkan bagaimana mereka akan berperilaku dalam berbagai skenario—apakah mereka akan menyerah pada tekanan, menyalahgunakan alat, atau berbohong di bawah tekanan. Tetapi apakah deskripsi diri ini benar-benar tentang model itu sendiri? Makalah ini mengubah pengetahuan diri menjadi uji prediksi. Di sembilan evaluasi perilaku, penulis mengukur bagaimana sebuah model berperilaku dalam berbagai kondisi, memintanya memprediksi tingkat tersebut, dan membandingkan prediksinya dengan kontrol yang menghilangkan diri dari pertanyaan. Pertanyaan utamanya: apakah sebuah model memiliki akses istimewa terhadap kecenderungan perilakunya sendiri, atau apakah ia hanya mengungkapkan teori generik tentang asisten AI?
Penulis membingkai pengetahuan diri sebagai masalah prediksi. Jika sebuah model benar-benar mengenal dirinya, prediksi dirinya harus berkorelasi kuat dengan perilaku aktualnya, dan harus mengungguli prediksi yang dibuat oleh model lain atau tentang agen generik. Studi ini secara sistematis menguji hipotesis tersebut, memeriksa faktor-faktor seperti informasi item, skala model, pembingkaian, dan finetuning. Hasilnya menantang gagasan pengetahuan
Inovasi
Hasilnya mengungkap empat temuan kunci:
1. **Laporan diri yang lemah**: Laporan diri langsung lemah (). Bahkan ketika model diperlihatkan item persis, prediksi hanya naik menjadi . Pertanyaan berbasis item yang sama tentang "agen AI yang cakap secara umum" sama baiknya (), dan jawaban model lain tentang dirinya memprediksi model target setidaknya sebaik prediksinya sendiri.
2. **Skala tidak membantu**: Skala frontier tidak secara terdeteksi mengubah pola ini. Setiap keuntungan dalam prediksi tidak spesifik pada diri sendiri dan konsisten dengan teori yang lebih baik tentang bagaimana asisten AI berperilaku daripada pengetahuan diri yang lebih baik.
3. **Bias pembingkaian orang pertama**: Pembingkaian orang pertama memiliki satu efek yang kuat: ia menggeser laporan ke arah yang menyanjung, meremehkan perilaku berbahaya relatif terhadap pertanyaan yang sama tentang agen generik.
4. **Keterbatasan finetuning**: Finetuning pada catatan perilaku model itu sendiri dapat mengajarkan prediksi diri yang sempit, tetapi juga mengubah perilaku yang diprediksi, dan keuntungannya tidak transfer secara luas.
Temuan-temuan ini dirangkum dalam tabel berikut:
| Kondisi
Mengapa penting
Implikasi praktisnya sederhana: menanyakan kepada model apa yang akan dilakukannya sebagian besar mengungkap teori tentang asisten AI secara umum, ditambah bias yang menguntungkan, bukan pengetahuan istimewa tentang model tersebut. Ini menantang asumsi bahwa LM memiliki akses introspektif terhadap kecenderungan perilakunya sendiri. Sebaliknya, laporan diri tampaknya dihasilkan dari model generik tentang bagaimana asisten AI berperilaku, dibentuk oleh data pelatihan dan mungkin oleh kecenderungan untuk menampilkan diri secara menguntungkan.
Bias yang menyanjung dalam pembingkaian orang pertama sangat mengkhawatirkan untuk alignment dan keamanan: jika model meremehkan perilaku berbahaya ketika ditanya tentang dirinya sendiri, penilaian diri mungkin tidak dapat diandalkan untuk evaluasi risiko. Fakta bahwa model lain memprediksi model target sebaik target itu sendiri menunjukkan bahwa pengetahuan diri tidak unik; ia dibagi dan generik.
Finetuning pada catatan perilaku model itu sendiri dapat meningkatkan prediksi diri yang sempit, tetapi juga mengubah perilaku yang diprediksi, menciptakan target yang bergerak. Selain itu, keuntungannya tidak transfer secara luas, membatasi kegunaan pendekatan ini untuk pengetahuan diri yang umum.
Penulis menyarankan bahwa pekerjaan di masa depan harus mengeksplorasi metode alternatif untuk memunculkan pengetahuan diri yang akurat, mungkin dengan menggabungkan observasi eksternal dengan keadaan internal, atau dengan mengembangkan arsitektur yang mendukung introspeksi yang sejati. Sampai saat itu, praktisi harus berhati-hati dalam mengandalkan laporan diri untuk keputusan kritis.
Singkatnya, model bahasa adalah orang asing bagi dirinya sendiri: deskripsi dirinya bersifat generik, bias, dan tidak istimewa. Ini memiliki implikasi mendalam untuk bagaimana kita mengevaluasi dan mempercayai sistem AI.
Siapa yang sebaiknya membaca
Membuka konten member…