Jadwal Sholat

Memuat jadwal sholat…

Editorial Ilmu Komputer & AI

Open AccessOA2026

Objektif Mana yang Perlu Dial? Memprediksi Konflik Objektif dan Menutup Trade-off dalam Penyelarasan Pluralistik yang Dapat Dikendalikan

Studi tentang prediksi konflik objektif dan cakupan trade-off dalam optimasi preferensi multi-objektif
David Tsoi; Esra Dönmez· 2026· DOI 10.48550/arXiv.2609.26929

Masalah inti

Penyelarasan pluralistik mengakui bahwa orang memiliki nilai yang beragam dan kadang bertentangan, sehingga mustahil bagi satu model yang selaras untuk memuaskan semua orang. Model yang dapat dikendalikan, yang dapat menyeimbangkan objektif yang bersaing secara berbeda, karena itu menjadi penting. Multi-Objective Direct Preference Optimization (MODPO) mengatasi hal ini dengan menggunakan bobot objektif untuk merentang kontinum trade-off. Makalah ini mempelajari dua pertanyaan kunci: (1) Kapan satu model dapat meningkatkan dua objektif secara bersamaan? (2) Bagaimana banyak trade-off dapat dicakup tanpa melatih model terpisah untuk masing-masing? Penulis menganalisis tujuh pasangan objektif dari dataset HelpSteer dan UltraFeedback, memeriksa data beranotasi manusia maupun beranotasi AI. Mereka menemukan bahwa dua pengukuran pra-pelatihan memprediksi apakah objektif selaras atau bertentangan untuk data beranotasi manusia, tetapi tidak untuk data beranotasi AI, di mana panjang respons dan repetisi mengacaukan skor reward-model. Untuk cakupan trade-off yang lebih luas, mereka mengeksplorasi pemilihan model terlatih terdekat dan penggabungan parameter model, dan menemukan bahwa keduanya

Inovasi

Pada tujuh pasangan objektif, penulis menemukan bahwa dua pengukuran pra-pelatihan—korelasi data preferensi dan kesesuaian reward model—memprediksi apakah objektif selaras atau bertentangan untuk data beranotasi manusia. Secara spesifik, ketika pengukuran ini menunjukkan penyelarasan, satu model dapat meningkatkan kedua objektif secara bersamaan; ketika menunjukkan konflik, trade-off diperlukan. Namun, untuk data beranotasi AI, pengukuran ini gagal memprediksi konflik karena faktor pengacau: panjang respons dan repetisi menggelembungkan skor reward-model, yang mengarah pada korelasi semu. Untuk cakupan trade-off, pemilihan model terlatih terdekat dan penggabungan parameter model keduanya lebih baik daripada satu model, tetapi tidak ada yang secara konsisten menyamai pelatihan langsung pada bobot target. Kesenjangan performa bervariasi menurut pasangan objektif dan bobot, dengan penggabungan kadang mengungguli pemilihan model terdekat dan sebaliknya. Penulis juga mencatat bahwa pelatihan langsung tetap menjadi metode paling andal untuk mencapai trade-off optimal, meskipun mahal secara komputasi.
Penyelarasan pluralistik mengakui bahwa orang memiliki nilai yang beragam dan kadang bertentangan, sehingga mustahil bagi satu model yang selaras untuk memuaskan semua orang. Model yang dapat dikendalikan, yang dapat menyeimbangkan objektif yang bersaing secara berbeda, karena itu menjadi penting. Multi-Objective Direct Preference Optimization (MODPO) mengatasi hal ini dengan menggunakan bobot objektif untuk merentang kontinum trade-off. Makalah ini mempelajari dua pertanyaan kunci: (1) Kapan satu model dapat meningkatkan dua objektif secara bersamaan? (2) Bagaimana banyak trade-off dapat dicakup tanpa melatih model terpisah untuk masing-masing? Penulis menganalisis tujuh pasangan objektif dari dataset HelpSteer dan UltraFeedback, memeriksa data beranotasi manusia maupun beranotasi AI. Mereka menemukan bahwa dua pengukuran pra-pelatihan memprediksi apakah objektif selaras atau bertentangan untuk data beranotasi manusia, tetapi tidak untuk data beranotasi AI, di mana panjang respons dan repetisi mengacaukan skor reward-model. Untuk cakupan trade-off yang lebih luas, mereka mengeksplorasi pemilihan model terlatih terdekat dan penggabungan parameter model, dan menemukan bahwa keduanya membantu tetapi tidak ada yang secara konsisten menyamai pelatihan langsung. Temuan ini memberikan panduan praktis untuk membangun model yang dapat dikendalikan yang melayani beragam preferensi.
Penulis menggunakan Multi-Objective Direct Preference Optimization (MODPO), yang memperluas Direct Preference Optimization (DPO) ke banyak objektif dengan memperkenalkan vektor bobot objektif. Loss MODPO untuk satu objektif diberikan oleh:

Mengapa penting

Temuan ini memiliki implikasi penting bagi penyelarasan pluralistik. Pertama, dua pengukuran pra-pelatihan dapat memandu praktisi dalam memutuskan apakah akan berinvestasi dalam pelatihan multi-objektif atau mengharapkan trade-off yang melekat. Untuk data beranotasi manusia, pengukuran ini adalah prediktor yang andal, tetapi untuk data beranotasi AI, pengukuran ini dikacaukan oleh panjang dan repetisi, yang menunjukkan bahwa reward model untuk data AI mungkin perlu dihilangkan biasnya. Kedua, strategi cakupan trade-off—pemilihan model terdekat dan penggabungan parameter—menawarkan alternatif praktis untuk melatih banyak model, tetapi performanya yang tidak konsisten berarti pelatihan langsung mungkin masih diperlukan untuk aplikasi kritis. Penulis menyarankan bahwa pekerjaan selanjutnya dapat mengeksplorasi teknik penggabungan yang lebih baik atau pemilihan bobot adaptif. Secara keseluruhan, pekerjaan ini memberikan fondasi untuk membangun model yang dapat dikendalikan yang dapat melayani beragam preferensi tanpa pelatihan yang menyeluruh.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten member…