Editorial Ilmu Komputer & AI
Open AccessOA2026
Melampaui Benar dan Salah: Mengevaluasi Penalaran Sosial Tingkat Kedua pada Model Bahasa Besar
Dataset dan kerangka kerja multi-perspektif mengungkap bahwa LLM terlalu banyak memprediksi hukuman dan tidak selaras dengan penilaian metanorma manusia seiring bertambahnya jarak sosial.
Sunny Rai; Jinyi Kuang; Reyhan Jamalova; Annie Lou; Cristina Bicchieri; Niyati Malhotra; Victor Hugo Orozco-Olvera; Ana Maria Munoz-Boudet; Lyle H Ungar; Sharath C Guntuku· 2026· DOI 10.48550/arXiv.2609.05437
Masalah inti
Upaya penyelarasan AI sebelumnya terutama berfokus pada norma sosial tingkat pertama—mengajarkan model apa yang dapat diterima atau tidak dapat diterima secara sosial (misalnya, 'jangan mencuri'). Namun, kecerdasan sosial tidak hanya bergantung pada pengenalan norma, tetapi juga pada antisipasi siapa yang akan menegakkannya dan bagaimana (misalnya, rasa malu publik atau bahkan hukuman penjara). Ekspektasi tingkat kedua ini, yang dikenal sebagai metanorma, mengatur bagaimana orang merespons ketika aturan sosial dilanggar. Makalah ini memperkenalkan kerangka kerja baru untuk mengevaluasi penalaran metanorma pada Model Bahasa Besar (LLM) di sepanjang dua dimensi: penilaian emosional dan respons perilaku. Kerangka ini mengusulkan tugas klasifikasi baru: memprediksi regulasi diri pada pelanggar dan regulasi orang lain pada pengamat. Para penulis merilis dataset multi-perspektif, NormReact, yang terdiri dari 450 skenario pelanggaran norma, yang dianotasi secara manual untuk emosi dan respons perilaku berdasarkan jenis kelamin pelanggar norma dan kedekatan sosial pengamat. Studi ini bertujuan untuk menilai apakah LLM dapat secara akurat memodelkan regulasi sosial bernuansa yang menjadi ci
Inovasi
Pada enam LLM, model-model tersebut secara konsisten terlalu banyak memprediksi sanksi negatif di mana manusia akan mengharapkan tidak ada tindakan. Hal ini menunjukkan gambaran dunia sosial yang lebih keras oleh LLM. Selain itu, keselarasan dengan penilaian manusia memburuk seiring meningkatnya jarak sosial. Hasilnya menunjukkan bahwa LLM kesulitan menangkap toleransi, pengekangan, dan kalibrasi relasional yang menjadi ciri penegakan norma yang sebenarnya. Prediksi hukuman yang berlebihan bersifat sistematis di seluruh model. Studi ini juga menemukan bahwa prediksi LLM menyimpang dari anotasi manusia, terutama dalam skenario yang melibatkan jarak sosial yang lebih besar antara pelanggar dan pengamat. Temuan ini menunjukkan bahwa LLM saat ini mungkin tidak cukup memodelkan regulasi sosial bernuansa yang ada dalam interaksi dunia nyata. Hasilnya menyoroti kesenjangan antara keluaran LLM dan penalaran metanorma manusia, dengan implikasi potensial untuk sistem AI di domain yang sensitif terhadap norma.
Upaya penyelarasan AI sebelumnya terutama berfokus pada norma sosial tingkat pertama—mengajarkan model apa yang dapat diterima atau tidak dapat diterima secara sosial (misalnya, 'jangan mencuri'). Namun, kecerdasan sosial tidak hanya bergantung pada pengenalan norma, tetapi juga pada antisipasi siapa yang akan menegakkannya dan bagaimana (misalnya, rasa malu publik atau bahkan hukuman penjara). Ekspektasi tingkat kedua ini, yang dikenal sebagai metanorma, mengatur bagaimana orang merespons ketika aturan sosial dilanggar. Makalah ini memperkenalkan kerangka kerja baru untuk mengevaluasi penalaran metanorma pada Model Bahasa Besar (LLM) di sepanjang dua dimensi: penilaian emosional dan respons perilaku. Kerangka ini mengusulkan tugas klasifikasi baru: memprediksi regulasi diri pada pelanggar dan regulasi orang lain pada pengamat. Para penulis merilis dataset multi-perspektif, NormReact, yang terdiri dari 450 skenario pelanggaran norma, yang dianotasi secara manual untuk emosi dan respons perilaku berdasarkan jenis kelamin pelanggar norma dan kedekatan sosial pengamat. Studi ini bertujuan untuk menilai apakah LLM dapat secara akurat memodelkan regulasi sosial bernuansa yang menjadi ciri masyarakat manusia.
Para penulis mengembangkan kerangka kerja untuk mengevaluasi penalaran metanorma pada LLM dengan berfokus pada dua dimensi utama: penilaian emosional dan respons perilaku. Mereka merumuskan dua tugas klasifikasi: (1) memprediksi regulasi diri pada pelanggar (misalnya, rasa bersalah, rasa malu) dan (2) memprediksi regulasi orang lain pada pengamat (misalnya, hukuman, toleransi). Untuk mendukung hal ini, mereka membuat NormReact, sebuah dataset yang terdiri dari 450 skenario pelanggaran norma. Setiap skenario dianotasi secara manual untuk emosi dan respons perilaku, dengan variasi berdasarkan jenis kelamin pelanggar norma dan kedekatan sosial pengamat. Dataset ini bersifat multi-perspektif, menangkap sudut pandang pelanggar dan pengamat. Enam LLM dievaluasi pada tugas-tugas ini. Metrik evaluasi kemungkinan mencakup akurasi dan keselarasan dengan penilaian manusia. Kerangka kerja ini memungkinkan analisis sistematis tentang bagaimana LLM bernalar tentang norma sosial tingkat kedua. Metodologi ini menekankan pentingnya jarak sosial dan jenis kelamin dalam membentuk ekspektasi metanorma. Dataset dan tugas dirancang agar dapat direproduksi dan diperluas untuk penelitian di masa depan.
Mengapa penting
Temuan ini menunjukkan bahwa sistem AI di domain yang sensitif terhadap norma—dari mediasi konflik hingga simulasi kebijakan—berisiko menghasilkan gambaran regulasi sosial yang terdistorsi: gambaran yang terlalu banyak merepresentasikan hukuman dan kurang merepresentasikan toleransi, pengekangan, dan kalibrasi relasional yang menjadi ciri penegakan norma yang sebenarnya di dunia nyata. Distorsi ini dapat menyebabkan intervensi atau kebijakan yang salah arah jika LLM digunakan untuk mensimulasikan dinamika sosial. Para penulis berpendapat bahwa penalaran sosial tingkat kedua sangat penting untuk kecerdasan sosial dan bahwa upaya penyelarasan saat ini tidak memadai. Studi ini menyerukan lebih banyak penelitian tentang penalaran metanorma dan pengembangan dataset seperti NormReact untuk menjadi tolok ukur LLM. Batasannya meliputi ukuran dataset dan model spesifik yang diuji. Pekerjaan di masa depan dapat diperluas ke skenario dan model yang lebih beragam. Implikasinya mencakup setiap aplikasi di mana LLM berinteraksi dengan atau memodelkan perilaku sosial manusia, yang menekankan perlunya evaluasi yang cermat dan mitigasi bias dalam penalaran norma sosial.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten member…