Editorial Ilmu Komputer & AI
Open AccessOA2024
Skor nilai keputusan: Keluarga metrik baru untuk AI-ML yang etis
Kerangka kerja baru untuk mengukur keselarasan etis dalam sistem pengambilan keputusan AI
Gabriella Waters; William Mapp; Phillip Honenberger· AI and Ethics· 2024· DOI 10.1007/s43681-024-00504-8
Masalah inti
Penelitian dalam AI etis telah membuat kemajuan signifikan dalam mengekspresikan nilai-nilai etis seperti keadilan, transparansi, dan privasi secara kuantitatif. Namun, metrik yang ada sering kali kurang memiliki granularitas untuk membedakan jenis keputusan yang relevan secara etis dan untuk memfasilitasi perbandingan lintas sistem pengambilan keputusan yang berbeda. Makalah ini mengatasi kesenjangan tersebut dengan mengusulkan keluarga metrik baru yang disebut **skor nilai keputusan (decisional value scores/DVS)**. DVS diberikan kepada suatu sistem berdasarkan apakah keputusan yang dibuatnya memenuhi atau gagal memenuhi standar etika tertentu, baik secara individual, total, maupun sebagai rasio atau rata-rata atas keputusan yang dibuat. Penulis berargumen bahwa DVS menawarkan kapasitas diskriminasi yang lebih besar antara keputusan yang relevan secara etis dan memungkinkan perbandingan etis lintas modalitas—manusia, mesin, atau sistem gabungan manusia–mesin. Makalah ini mengklarifikasi ambiguitas dalam konsep 'keputusan' itu sendiri, termasuk cara mengindividualisasi keputusan yang dibuat oleh suatu sistem, dan membahas peran 'keputusan' dalam pendekatan AI dan machine learning u
Inovasi
Penulis mendemonstrasikan penerapan DVS melalui dua studi kasus. Pada studi kasus pertama, mereka mengevaluasi beberapa large language model (LLM) untuk transparansi. Keputusan diindividualisasi sebagai respons terhadap prompt yang dirancang untuk memunculkan penjelasan. Standar transparansi mensyaratkan bahwa output model menyertakan alasan yang jelas untuk jawabannya. Hasil menunjukkan bahwa DVS dapat membedakan antar model: misalnya, Model A mencapai skor rasio
, sedangkan Model B memperoleh
, yang menunjukkan perbedaan signifikan dalam transparansi. Skor total lebih lanjut mengungkapkan bahwa Model A memenuhi standar pada 150 dari 200 keputusan, sedangkan Model B hanya memenuhinya pada 90 dari 200. Pada studi kasus kedua, penulis mengevaluasi alat penilaian risiko kriminal, khususnya algoritma COMPAS, untuk utilitas, pelanggaran hak, keadilan, dan transparansi. Menggunakan DVS, mereka menghitung:
- **Utilitas**: (berdasarkan akurasi prediktif)
- **Pelanggaran hak**: (proporsi keputusan yang melanggar hak)
- **Keadilan**: (proporsi
Penelitian dalam AI etis telah membuat kemajuan signifikan dalam mengekspresikan nilai-nilai etis seperti keadilan, transparansi, dan privasi secara kuantitatif. Namun, metrik yang ada sering kali kurang memiliki granularitas untuk membedakan jenis keputusan yang relevan secara etis dan untuk memfasilitasi perbandingan lintas sistem pengambilan keputusan yang berbeda. Makalah ini mengatasi kesenjangan tersebut dengan mengusulkan keluarga metrik baru yang disebut **skor nilai keputusan (decisional value scores/DVS)**. DVS diberikan kepada suatu sistem berdasarkan apakah keputusan yang dibuatnya memenuhi atau gagal memenuhi standar etika tertentu, baik secara individual, total, maupun sebagai rasio atau rata-rata atas keputusan yang dibuat. Penulis berargumen bahwa DVS menawarkan kapasitas diskriminasi yang lebih besar antara keputusan yang relevan secara etis dan memungkinkan perbandingan etis lintas modalitas—manusia, mesin, atau sistem gabungan manusia–mesin. Makalah ini mengklarifikasi ambiguitas dalam konsep 'keputusan' itu sendiri, termasuk cara mengindividualisasi keputusan yang dibuat oleh suatu sistem, dan membahas peran 'keputusan' dalam pendekatan AI dan machine learning umum seperti decision tree, neural network, SVM, dan classifier tanpa pengawasan. Penulis kemudian mendefinisikan DVS untuk beberapa nilai etis, dengan pembahasan diperluas mengenai transparansi, dan menerapkan metrik tersebut pada dua studi kasus: evaluasi LLM untuk transparansi dan evaluasi alat penilaian risiko kriminal untuk utilitas, pelanggaran hak, keadilan, dan transparansi.
Penulis mengembangkan kerangka DVS dengan terlebih dahulu mengatasi ambiguitas konseptual seputar 'keputusan' dalam sistem AI. Mereka mengusulkan metode untuk mengindividualisasi keputusan berdasarkan output sistem dan konteks di mana sistem beroperasi. Untuk nilai etis tertentu, keputusan dievaluasi terhadap standar , menghasilkan skor biner , di mana 1 menunjukkan keputusan memenuhi standar dan 0 sebaliknya. Dari skor individual ini, metrik agregat dapat dihitung:
Mengapa penting
Penulis membahas kelebihan dan batasan DVS. Kelebihan utama meliputi: (1) **Kapasitas diskriminasi**: DVS dapat membedakan keputusan yang relevan secara etis yang mungkin digabungkan oleh metrik lain; (2) **Komparabilitas**: DVS memungkinkan perbandingan etis lintas sistem dan modalitas yang berbeda, seperti pengambilan keputusan manusia vs. mesin; (3) **Fleksibilitas**: DVS dapat didefinisikan untuk nilai etis apa pun dengan standar yang jelas. Namun, tantangan tetap ada. Individualisasi keputusan tidaklah trivial dan bergantung pada konteks; misalnya, dalam neural network, satu forward pass dapat dianggap sebagai satu keputusan, tetapi dalam decision tree, setiap jalur dapat menjadi keputusan. Penulis mengusulkan taksonomi metode individualisasi keputusan, termasuk berbasis output, berbasis proses, dan berbasis hasil. Batasan lain adalah sifat biner dari standar: banyak nilai etis bersifat bertingkat daripada biner, dan DVS saat ini memerlukan ambang batas. Pekerjaan selanjutnya dapat memperluas DVS ke standar fuzzy atau probabilistik. Makalah ini juga mencatat bahwa DVS bukan pengganti analisis etis kualitatif melainkan pelengkap. Penulis menyimpulkan dengan menyarankan bahwa DVS dapat diintegrasikan ke dalam pipeline pengembangan AI untuk pemantauan etis berkelanjutan dan dapat memfasilitasi kepatuhan regulasi dengan menyediakan bukti terukur atas kinerja etis. Mereka menyerukan penelitian lebih lanjut tentang penetapan standar dan penerapan lintas budaya DVS.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten member…