AI Baca Ekspresi Wajah via Webcam: Terobosan Tallinn University, tapi Etika Jadi Sorotan
Baca dalam 60 detik
- Proyek doktoral Tallinn University mengembangkan sistem AI yang menganalisis ekspresi wajah melalui webcam dan menghasilkan respons animasi wajah digital secara real-time.
- Pendekatan berbasis gerakan otot wajah individual dinilai lebih stabil dibanding label emosi umum, namun tiga mesin analisis ekspresi saling bertentangan dalam memprediksi emosi.
- Regulasi EU AI Act melarang inferensi emosi di tempat kerja dan sekolah, sementara riset ini menyoroti bias demografis yang belum sepenuhnya teratasi.

Sebuah proyek doktoral di Tallinn University, Estonia, memperkenalkan sistem kecerdasan buatan yang mampu membaca ekspresi wajah manusia melalui webcam standar dan meresponsnya dengan animasi wajah digital. Sistem bernama Enactive Facial Expression Pipeline (EFEP) ini dikembangkan oleh Abdallah Hussein Sham dan dirancang untuk menjembatani analisis ekspresi wajah dengan generasi respons agen AI, bukan sekadar memberi label emosi pada satu gambar.
Pendekatan ini menandai pergeseran penting dalam riset interaksi manusia-komputer. Alih-alih mengklasifikasikan wajah ke dalam kategori sempit seperti "senang" atau "sedih", EFEP memperlakukan ekspresi sebagai pertukaran yang berlangsung dalam konteks sosial tertentu. Sistem ini memecah proses menjadi tiga tahap modular: menganalisis input wajah, memperkirakan reaksi yang sesuai, lalu menghasilkan gerakan wajah pada karakter digital.
Dalam eksperimennya, peneliti menemukan bahwa pelacakan gerakan otot wajah individual—menggunakan action units dari Facial Action Coding System—memberikan kontrol yang lebih halus dan stabil dibanding label emosi umum. Peneliti memanfaatkan antarmuka OpenFace dan Unreal Engine 4 untuk memprogram karakter agar meniru ekspresi, kemudian melatih model untuk menghasilkan reaksi berdasarkan urutan ekspresi sebelumnya.
Meski menjanjikan, riset ini mengungkap persoalan mendasar. Ketika tiga mesin analisis ekspresi yang berbeda diminta menilai rekaman partisipan, ketiganya tidak menghasilkan prediksi emosi yang seragam. Temuan ini menggarisbawahi bahwa perilaku wajah yang terlihat tidak serta-merta dapat diterjemahkan menjadi label emosi yang pasti. Software yang berbeda pun bisa mengklasifikasikan materi yang sama secara berbeda.
"Menambahkan variasi pada data pelatihan dapat mengurangi bias, tetapi tidak menjamin menghilangkannya sepenuhnya," demikian temuan studi pendukung yang menganalisis beberapa metode pengenalan ekspresi, termasuk Deep Emotion, Self-Cure Network, ResNet50, InceptionV3, dan DenseNet121.
Isu bias demografis menjadi salah satu fokus utama. Model yang dilatih hanya dengan gambar dari kelompok demografis terbatas menunjukkan perbedaan akurasi saat diterapkan pada kelompok lain. Peneliti menemukan bahwa peningkatan performa keseluruhan justru dapat memperbesar bias jika data pelatihan tetap tidak seimbang. Karena itu, mereka mendorong inklusi kelompok yang sebelumnya terabaikan dalam data pelatihan.
Dalam konteks Indonesia, perkembangan ini relevan dengan maraknya adopsi AI di sektor layanan publik dan swasta. Beberapa perusahaan teknologi dalam negeri mulai mengembangkan sistem analisis wajah untuk verifikasi identitas, pemantauan pengguna, hingga riset pengalaman pengguna. Namun, tanpa regulasi yang jelas dan data pelatihan yang representatif, risiko bias terhadap keragaman etnis dan budaya di Indonesia bisa menjadi masalah serius. Otoritas perlindungan data dan pembuat kebijakan perlu mencermati bagaimana teknologi inferensi emosi digunakan, terutama di ruang publik dan tempat kerja.
EFEP sendiri menyasar aplikasi media interaktif, kreatif, dan riset pengalaman pengguna—bukan diagnosis medis atau penilaian karyawan. Peneliti menegaskan bahwa sistem ini tidak dimaksudkan untuk menilai kondisi psikologis seseorang. Batasan ini penting mengingat EU AI Act secara eksplisit melarang penggunaan AI untuk menyimpulkan emosi di lingkungan kerja dan pendidikan, kecuali untuk alasan medis atau keselamatan.
Ke depan, peneliti mengusulkan penambahan modalitas suara dan bahasa tubuh untuk memperkaya interaksi. Namun, integrasi tersebut memerlukan evaluasi lebih lanjut dan uji coba yang lebih luas. Pertanyaannya, akankah teknologi semacam ini benar-benar memahami manusia, atau hanya menciptakan ilusi pemahaman yang meyakinkan?



