Editorial Ilmu Komputer & AI
Open AccessOA2026
BAS-OPD: Self-Distillation On-Policy Selektif Sadar Anggaran untuk Persepsi Multimodal Berbutir Halus
Supervisi guru selektif di bawah anggaran kueri terbatas untuk persepsi multimodal berbutir halus
Zihan Chen; Hengguang Zhou; Yuan Kang; Yiming Zhang; Wenhui Fang; Zenghui Ding; Yining Sun; Cho-Jui Hsieh· 2026· DOI 10.48550/arXiv.2609.25891
Masalah inti
Model bahasa besar multimodal (MLLM) sering kesulitan dengan persepsi visual berbutir halus saat memproses gambar lengkap, karena bukti penting mungkin hanya muncul di wilayah lokal. Self-distillation on-policy (OPD) memungkinkan transfer pengetahuan visual istimewa dari tampilan informatif ke kebijakan gambar penuh, tetapi mengueri guru untuk setiap rollout menimbulkan biaya supervisi yang besar. Hal ini menciptakan ketegangan antara manfaat supervisi tampilan istimewa dan biaya komputasi kueri guru. Makalah ini mengusulkan BAS-OPD, kerangka OPD selektif sadar anggaran yang mengalokasikan supervisi guru di bawah anggaran kueri terbatas. Alih-alih mengueri semua rollout, BAS-OPD memilih sampel informatif sambil mempertahankan generasi siswa seluruh batch. Penulis mengeksplorasi strategi pemilihan acak, berbasis ketidakpastian, dan berbasis utilitas terpelajar. Selektor terpelajar memperkirakan nilai kueri dari statistik rollout yang dilepas dan sinyal utilitas daring yang berasal dari kesepakatan siswa–guru dan keyakinan guru tanpa forward pass siswa tambahan. BAS-OPD hanya mengubah alokasi supervisi saat pelatihan dan mempertahankan inferensi gambar penuh sekali jalan. Eksperimen
Inovasi
Penulis mengevaluasi BAS-OPD pada tolok ukur persepsi multimodal berbutir halus. Meskipun abstrak tidak memberikan angka spesifik, abstrak menyatakan bahwa BAS-OPD mencapai kinerja kuat sekaligus mengurangi biaya supervisi guru secara substansial. Eksperimen membandingkan tiga strategi pemilihan (acak, berbasis ketidakpastian, berbasis utilitas terpelajar) di bawah anggaran kueri yang bervariasi. Hasilnya menunjukkan bahwa OPD selektif di bawah anggaran yang terbatas efektif, dan bahwa pemilihan berbasis utilitas terpelajar kemungkinan mengungguli baseline dengan memfokuskan supervisi guru pada rollout yang paling informatif. Makalah ini menyoroti bahwa BAS-OPD mempertahankan inferensi gambar penuh sekali jalan, yang berarti pada waktu pengujian, model tidak memerlukan beberapa tampilan atau komputasi tambahan. Hal ini krusial untuk penerapan praktis. Pengurangan biaya supervisi guru bersifat substansial, karena hanya sebagian kecil rollout yang dikueri. Tingkat anggaran dan metrik kinerja yang tepat dirinci dalam makalah lengkap, tetapi abstrak mengonfirmasi bahwa pendekatan ini menghasilkan kinerja kuat di seluruh tolok ukur.
Model bahasa besar multimodal (MLLM) sering kesulitan dengan persepsi visual berbutir halus saat memproses gambar lengkap, karena bukti penting mungkin hanya muncul di wilayah lokal. Self-distillation on-policy (OPD) memungkinkan transfer pengetahuan visual istimewa dari tampilan informatif ke kebijakan gambar penuh, tetapi mengueri guru untuk setiap rollout menimbulkan biaya supervisi yang besar. Hal ini menciptakan ketegangan antara manfaat supervisi tampilan istimewa dan biaya komputasi kueri guru. Makalah ini mengusulkan BAS-OPD, kerangka OPD selektif sadar anggaran yang mengalokasikan supervisi guru di bawah anggaran kueri terbatas. Alih-alih mengueri semua rollout, BAS-OPD memilih sampel informatif sambil mempertahankan generasi siswa seluruh batch. Penulis mengeksplorasi strategi pemilihan acak, berbasis ketidakpastian, dan berbasis utilitas terpelajar. Selektor terpelajar memperkirakan nilai kueri dari statistik rollout yang dilepas dan sinyal utilitas daring yang berasal dari kesepakatan siswa–guru dan keyakinan guru tanpa forward pass siswa tambahan. BAS-OPD hanya mengubah alokasi supervisi saat pelatihan dan mempertahankan inferensi gambar penuh sekali jalan. Eksperimen pada tolok ukur persepsi multimodal berbutir halus menunjukkan bahwa BAS-OPD mencapai kinerja kuat sekaligus mengurangi biaya supervisi guru secara substansial, menyoroti efektivitas OPD selektif di bawah anggaran yang terbatas.
BAS-OPD beroperasi dengan memisahkan generasi siswa dari supervisi guru. Model siswa menghasilkan rollout untuk seluruh batch, tetapi hanya subset rollout terpilih yang dikueri ke guru untuk supervisi. Alokasi selektif ini diatur oleh kendala anggaran: jumlah kueri guru dibatasi pada sebagian kecil dari seluruh batch. Kerangka ini mempertimbangkan tiga strategi pemilihan:
Mengapa penting
Wawasan kunci dari BAS-OPD adalah bahwa tidak semua rollout sama-sama informatif untuk distillation. Dengan mengueri guru secara selektif, metode ini mengurangi biaya komputasi sekaligus mempertahankan atau meningkatkan kinerja. Pemilihan berbasis utilitas terpelajar sangat menjanjikan karena beradaptasi dengan keadaan siswa saat ini dan keandalan guru. Penggunaan statistik rollout yang dilepas dan sinyal utilitas daring menghindari forward pass tambahan, sehingga overhead pemilihan minimal. Kerangka ini bersifat umum dan dapat diterapkan pada pengaturan distillation on-policy lainnya. Namun, efektivitas selektor terpelajar bergantung pada kualitas sinyal utilitas, dan mungkin ada trade-off antara anggaran dan perolehan kinerja. Pekerjaan selanjutnya dapat mengeksplorasi strategi pemilihan yang lebih canggih, penganggaran adaptif, dan perluasan ke modalitas lain. Kontribusi makalah ini terletak pada memformalkan masalah OPD selektif sadar anggaran dan memberikan solusi praktis yang mempertahankan inferensi sekali jalan. Hal ini sejalan dengan kebutuhan yang berkembang akan model multimodal efisien yang dapat menangani persepsi berbutir halus tanpa overhead komputasi yang berlebihan.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten member…