Editorial ilmu komputer
Post-Training Berbasis Grounding dengan Contoh Sulit untuk Mengurangi Halusinasi pada Model Bahasa Besar Multimodal
Masalah inti
Halusinasi pada model vision-language (VLM) masih menjadi tantangan mendasar: generasi autoregresif dapat menghasilkan respons yang masuk akal secara linguistik namun tidak konsisten secara fisik atau tidak ter-grounding secara visual. Penulis mengaitkan hal ini dengan maksimalisasi likelihood di bawah pemodelan probabilistik bersama, di mana model lebih menyukai kelanjutan yang fasih bahkan ketika bukti visual lemah. Secara formal, diberikan gambar dan prompt teks , sebuah VLM menghasilkan respons dengan memaksimalkan probabilitas kondisional
Inovasi
Halusinasi pada model vision-language (VLM) masih menjadi tantangan mendasar: generasi autoregresif dapat menghasilkan respons yang masuk akal secara linguistik namun tidak konsisten secara fisik atau tidak ter-grounding secara visual. Penulis mengaitkan hal ini dengan maksimalisasi likelihood di bawah pemodelan probabilistik bersama, di mana model lebih menyukai kelanjutan yang fasih bahkan ketika bukti visual lemah. Secara formal, diberikan gambar dan prompt teks , sebuah VLM menghasilkan respons dengan memaksimalkan probabilitas kondisional
Mengapa penting
Siapa yang sebaiknya membaca
Membuka konten memberโฆ