Editorial Ilmu Komputer & AI
Open AccessOA2026
Sebuah Metode untuk Mempelajari Sistem Nilai pada AI Generatif
Mengadaptasi pembelajaran nilai berbasis landasan untuk menyelaraskan model generatif dengan nilai manusia yang multidimensi
Andrés Holgado-Sánchez; Holger Billhardt; Sascha Ossowski· 2026· DOI 10.48550/arXiv.2607.16903
Masalah inti
Sistem AI yang sadar nilai memerlukan representasi komputasional eksplisit atas nilai manusia, yang disebut *landasan*, dan agregasinya menjadi *sistem nilai* untuk menyelaraskan keputusan dengan harapan manusia. Namun, representasi semacam itu sulit diperoleh secara langsung. Pembelajaran nilai mengatasi hal ini dengan menyimpulkannya dari perilaku manusia yang teramati. Para penulis mengidentifikasi celah kritis: metode pembelajaran nilai berbasis landasan yang ada pada AI generatif hanya mereplikasi preferensi manusia tanpa menyadari struktur multidimensi dari penyelarasan nilai, atau tidak memiliki metode elisitasi sistem nilai yang berprinsip. Untuk menjembatani celah ini, mereka mengadaptasi metode pembelajaran sistem nilai yang sebelumnya telah tervalidasi ke konteks AI generatif, dengan memanfaatkan data preferensi pasangan prompt-respons. Pendekatan ini secara simultan mempelajari: (i) implementasi landasan untuk sekumpulan nilai melalui model reward multiobjektif, dan (ii) representasi sistem nilai sebagai skalarisasi linear berbobot dari model landasan tersebut. Inovasi utamanya adalah mekanisme prioritisasi dinamis yang memastikan sistem nilai yang dipelajari bertumpu p
Inovasi
Para penulis mengevaluasi metode mereka pada dataset preferensi prompt-respons, membandingkannya dengan baseline dan pendekatan kontemporer. Hasilnya menunjukkan kinerja kompetitif dengan trade-off minimal terhadap baseline. Secara spesifik, sistem nilai yang dipelajari mencapai akurasi penyelarasan preferensi yang sebanding sekaligus memberikan keterjelasan yang lebih baik. Mekanisme prioritisasi dinamis terbukti krusial untuk mempertahankan representasi nilai yang koheren, karena ablasi tanpa mekanisme tersebut menyebabkan kinerja yang menurun pada penyelarasan nilai multidimensi. Metode ini berhasil mempelajari model landasan dan bobot sistem nilai secara simultan, menunjukkan bahwa optimisasi dua tingkat konvergen ke solusi yang bermakna. Metrik kuantitatif mencakup akurasi preferensi dan skor koherensi nilai, meskipun angka pastinya tidak disediakan dalam abstrak. Keterjelasan yang lebih baik berasal dari vektor nilai dan bobot yang eksplisit, yang memungkinkan inspeksi bagaimana setiap nilai berkontribusi terhadap keputusan akhir.
Sistem AI yang sadar nilai memerlukan representasi komputasional eksplisit atas nilai manusia, yang disebut *landasan*, dan agregasinya menjadi *sistem nilai* untuk menyelaraskan keputusan dengan harapan manusia. Namun, representasi semacam itu sulit diperoleh secara langsung. Pembelajaran nilai mengatasi hal ini dengan menyimpulkannya dari perilaku manusia yang teramati. Para penulis mengidentifikasi celah kritis: metode pembelajaran nilai berbasis landasan yang ada pada AI generatif hanya mereplikasi preferensi manusia tanpa menyadari struktur multidimensi dari penyelarasan nilai, atau tidak memiliki metode elisitasi sistem nilai yang berprinsip. Untuk menjembatani celah ini, mereka mengadaptasi metode pembelajaran sistem nilai yang sebelumnya telah tervalidasi ke konteks AI generatif, dengan memanfaatkan data preferensi pasangan prompt-respons. Pendekatan ini secara simultan mempelajari: (i) implementasi landasan untuk sekumpulan nilai melalui model reward multiobjektif, dan (ii) representasi sistem nilai sebagai skalarisasi linear berbobot dari model landasan tersebut. Inovasi utamanya adalah mekanisme prioritisasi dinamis yang memastikan sistem nilai yang dipelajari bertumpu pada representasi nilai yang koheren.
Metode yang diusulkan beroperasi pada data preferensi pasangan prompt-respons, di mana setiap pasangan menunjukkan preferensi manusia antara dua respons terhadap prompt yang sama. Proses pembelajaran secara bersama mengoptimalkan dua komponen:
Mengapa penting
Karya ini mengatasi keterbatasan mendasar dalam penyelarasan AI generatif saat ini: kurangnya metode pembelajaran nilai berbasis landasan yang menghormati sifat multidimensi dari nilai manusia. Dengan mengadaptasi metode pembelajaran sistem nilai yang sebelumnya telah tervalidasi, para penulis menyediakan pendekatan berprinsip untuk menyimpulkan landasan nilai dan agregasinya dari data preferensi. Prioritisasi dinamis pada pembelajaran landasan memastikan sistem nilai yang dipelajari didasarkan pada representasi nilai yang koheren, menghindari jebakan hanya mereplikasi preferensi tanpa memahami struktur nilai yang mendasarinya. Keterjelasan yang lebih baik merupakan keunggulan signifikan, karena memungkinkan pemangku kepentingan memahami nilai mana yang mendorong keputusan model dan bagaimana bobotnya. Namun, metode ini bergantung pada data preferensi pasangan, yang mungkin bising atau berbias. Pekerjaan selanjutnya dapat mengeksplorasi penggabungan umpan balik yang lebih kaya atau memperluas ke konteks multi-agen. Secara keseluruhan, kontribusi ini memajukan tujuan sistem AI yang sadar nilai yang selaras dengan nilai manusia secara transparan dan terstruktur.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten member…