Editorial Ilmu Komputer & AI
Open AccessOA2026
CompanionSim: Data sintetis untuk mengevaluasi antropomorfisme dalam hubungan manusia-AI
Kerangka simulasi yang menghasilkan 2.240 percakapan manusia-chatbot multi-giliran mengungkap bahwa perilaku persahabatan menurunkan kesukaan, kemiripan dengan manusia, dan kepercayaan pada chatbot AI.
Jacy Reese Anthis; Mark Díaz; Renee Shelby· 2026· DOI 10.48550/arXiv.2609.00250
Masalah inti
Integrasi cepat sistem AI ke dalam kehidupan sehari-hari telah menggeser perannya dari sekadar alat produktivitas menjadi pendamping sosial. Ketika orang semakin sering berinteraksi dengan chatbot untuk dukungan emosional, validasi, dan persahabatan, peneliti ingin memahami konsekuensi dari perilaku antropomorfik tersebut. Namun, kelangkaan dan ketidakandalan data interaksi manusia-AI di dunia nyata menghambat studi yang sistematis. Untuk mengatasi kesenjangan ini, Anthis, Díaz, dan Shelby memperkenalkan CompanionSim, kerangka simulasi yang dirancang untuk menghasilkan dialog manusia-chatbot multi-giliran sintetis yang mencerminkan interaksi dunia nyata. Kerangka ini bertujuan memperbesar skala data nyata yang sedikit dengan menyimulasikan percakapan di berbagai perilaku chatbot dan kasus penggunaan, sehingga memungkinkan eksperimen terkontrol tentang persepsi pendamping AI. Penulis berpendapat bahwa data sintetis dapat melengkapi data dunia nyata untuk mempercepat penelitian tentang dampak diferensial pendamping AI dan untuk menetapkan evaluasi tolok ukur bagi chatbot AI.
Inovasi
Bertentangan dengan ekspektasi, perilaku persahabatan tidak meningkatkan persepsi positif terhadap chatbot AI. Sebaliknya, pada kedua studi, perilaku tersebut menurunkan kesukaan, kemiripan dengan manusia, dan kepercayaan. Pada Studi 1, partisipan menilai chatbot yang menunjukkan perilaku persahabatan lebih rendah pada ketiga dimensi dibandingkan chatbot tanpa perilaku tersebut. Studi 2 mereplikasi temuan ini di empat negara, menunjukkan pola yang konsisten. Ukuran efek bervariasi menurut subkelompok demografis: perempuan dan partisipan yang lebih tua mempersepsikan chatbot persahabatan sebagai jauh lebih tidak disukai, kurang mirip manusia, dan kurang dapat dipercaya. Misalnya, perbedaan skor kesukaan antara kondisi persahabatan dan non-persahabatan lebih menonjol pada perempuan daripada laki-laki, dan pada orang dewasa yang lebih tua daripada yang lebih muda. Hasil ini menunjukkan bahwa perilaku antropomorfik dapat menjadi bumerang, berpotensi karena ekspektasi yang meningkat atau kesan artifisial. Temuan ini menantang asumsi bahwa meniru persahabatan ala manusia secara universal meningkatkan pengalaman pengguna.
Integrasi cepat sistem AI ke dalam kehidupan sehari-hari telah menggeser perannya dari sekadar alat produktivitas menjadi pendamping sosial. Ketika orang semakin sering berinteraksi dengan chatbot untuk dukungan emosional, validasi, dan persahabatan, peneliti ingin memahami konsekuensi dari perilaku antropomorfik tersebut. Namun, kelangkaan dan ketidakandalan data interaksi manusia-AI di dunia nyata menghambat studi yang sistematis. Untuk mengatasi kesenjangan ini, Anthis, Díaz, dan Shelby memperkenalkan CompanionSim, kerangka simulasi yang dirancang untuk menghasilkan dialog manusia-chatbot multi-giliran sintetis yang mencerminkan interaksi dunia nyata. Kerangka ini bertujuan memperbesar skala data nyata yang sedikit dengan menyimulasikan percakapan di berbagai perilaku chatbot dan kasus penggunaan, sehingga memungkinkan eksperimen terkontrol tentang persepsi pendamping AI. Penulis berpendapat bahwa data sintetis dapat melengkapi data dunia nyata untuk mempercepat penelitian tentang dampak diferensial pendamping AI dan untuk menetapkan evaluasi tolok ukur bagi chatbot AI.
CompanionSim mencakup 2.240 percakapan manusia-chatbot yang disimulasikan, mewakili 16 perilaku chatbot yang berbeda di tujuh kasus penggunaan. Perilaku tersebut meliputi validasi, empati, dan respons berorientasi persahabatan lain yang membangkitkan kepercayaan dan keterikatan dalam interaksi manusia-manusia. Kerangka simulasi ini menghasilkan dialog multi-giliran yang meniru alur percakapan alami, sehingga peneliti dapat memanipulasi perilaku tertentu dan mengamati efeknya. Untuk memvalidasi data sintetis, partisipan manusia menganotasi percakapan yang disimulasikan dan percakapan dunia nyata dalam dua eksperimen. Studi 1 menggunakan sampel representatif Amerika Serikat (), sedangkan Studi 2 diperluas ke Amerika Serikat, Inggris, India, dan Nigeria (). Partisipan menilai percakapan pada dimensi seperti kesukaan, kemiripan dengan manusia, dan kepercayaan. Desain eksperimen memungkinkan perbandingan antara perilaku persahabatan dan perilaku netral atau non-persahabatan, serta analisis lintas budaya. Arsitektur kerangka ini dapat direpresentasikan sebagai berikut:
Mengapa penting
Efek negatif yang tidak terduga dari perilaku persahabatan menimbulkan pertanyaan penting tentang desain pendamping AI. Salah satu interpretasi adalah bahwa pengguna dapat mempersepsikan validasi atau empati yang berlebihan sebagai manipulatif atau tidak tulus, sehingga menurunkan kepercayaan. Alternatifnya, sifat simulasi dari percakapan mungkin memperkuat skeptisisme, meskipun penyertaan percakapan dunia nyata dalam proses anotasi mengurangi kekhawatiran ini. Perbedaan demografis menyoroti perlunya pendekatan yang disesuaikan secara kultural dan individual terhadap pendamping AI. Perempuan dan orang dewasa yang lebih tua mungkin memiliki ekspektasi atau sensitivitas berbeda terkait hubungan dengan AI, mungkin karena tingkat paparan atau norma sosial yang berbeda. Penulis mendorong peneliti untuk memanfaatkan data dunia nyata dan data sintetis untuk mempelajari dampak diferensial ini dan untuk mengembangkan evaluasi tolok ukur bagi chatbot AI. CompanionSim menyediakan alat yang skalabel untuk investigasi semacam itu, tetapi pekerjaan selanjutnya harus mengatasi batasan simulasi, seperti potensi kurangnya kedalaman emosional dan risiko melanggengkan bias yang ada dalam data pelatihan. Pada akhirnya, studi ini menegaskan bahwa merancang pendamping AI memerlukan pertimbangan cermat terhadap persepsi pengguna dan potensi konsekuensi yang tidak diinginkan.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten member…