Editorial ilmu komputer
Open AccessOA2026
AgentVidBench: Tolok Ukur Tanya Jawab Video Multi-Hop untuk Mengevaluasi Agen MLLM
Tolok ukur untuk penalaran spasial, temporal, dan kausal dalam pemahaman video agentic
Seoyeon An; Hyeonseo Jang; Minsu Kim; Chanho Lee; Younghan Park; Kangwook Leeยท 2026ยท DOI 10.48550/arXiv.2609.21386
Masalah inti
Pemahaman video yang komprehensif sangat penting untuk memajukan kecerdasan artifisial menuju dinamika rumit dunia fisik. Kemajuan terbaru dalam Multimodal Large Language Models (MLLM) telah menunjukkan kemampuan luar biasa dalam pemahaman video, namun tolok ukur yang ada masih terbatas pada kueri tingkat adegan sederhana atau ringkasan global yang hanya memerlukan inferensi satu langkah. Pemahaman video di dunia nyata melibatkan tugas-tugas yang lebih menantang yang memerlukan penalaran multimodal multi-hop, dan terdapat kekosongan kritis akan tolok ukur video yang mampu mengevaluasi kemampuan agentic ini secara rigoris. Untuk menjembatani kesenjangan ini, penulis memperkenalkan AgentVidBench, tolok ukur tanya jawab video multi-hop yang berfokus pada evaluasi kemampuan penalaran spasial, temporal, dan kausal agen MLLM. Selain pasangan tanya jawab standar, AgentVidBench menyediakan jejak solusi langkah demi langkah untuk mendukung evaluasi trajektori yang menilai apakah agen secara eksplisit memperoleh bukti yang diperlukan untuk membenarkan jawaban mereka.
Inovasi
Eksperimen dengan 12 MLLM proprietary dan open-source menunjukkan bahwa performa single-turn tetap terbatas pada AgentVidBench. Ini mengindikasikan bahwa model saat ini kesulitan dengan penalaran multimodal multi-hop ketika diminta menjawab dalam satu langkah inferensi. Sebaliknya, mengintegrasikan model-model ini ke dalam alur kerja agentic state-of-the-art umumnya meningkatkan performa baik dalam hal akurasi maupun skor trajektori. Penulis juga menyajikan strategi agentic yang sederhana namun efektif yang berfungsi sebagai baseline kompetitif pada AgentVidBench. Temuan ini menetapkan tolok ukur sebagai testbed holistik untuk penelitian masa depan tentang pemahaman video agentic. Hasilnya menyoroti kesenjangan antara kemampuan MLLM single-turn dan tuntutan penalaran video multi-hop, sekaligus menunjukkan bahwa dekomposisi agentic dan akuisisi bukti dapat menutup sebagian kesenjangan tersebut.
Pemahaman video yang komprehensif sangat penting untuk memajukan kecerdasan artifisial menuju dinamika rumit dunia fisik. Kemajuan terbaru dalam Multimodal Large Language Models (MLLM) telah menunjukkan kemampuan luar biasa dalam pemahaman video, namun tolok ukur yang ada masih terbatas pada kueri tingkat adegan sederhana atau ringkasan global yang hanya memerlukan inferensi satu langkah. Pemahaman video di dunia nyata melibatkan tugas-tugas yang lebih menantang yang memerlukan penalaran multimodal multi-hop, dan terdapat kekosongan kritis akan tolok ukur video yang mampu mengevaluasi kemampuan agentic ini secara rigoris. Untuk menjembatani kesenjangan ini, penulis memperkenalkan AgentVidBench, tolok ukur tanya jawab video multi-hop yang berfokus pada evaluasi kemampuan penalaran spasial, temporal, dan kausal agen MLLM. Selain pasangan tanya jawab standar, AgentVidBench menyediakan jejak solusi langkah demi langkah untuk mendukung evaluasi trajektori yang menilai apakah agen secara eksplisit memperoleh bukti yang diperlukan untuk membenarkan jawaban mereka.
AgentVidBench dibangun sebagai tolok ukur tanya jawab video multi-hop yang menyasar penalaran spasial, temporal, dan kausal. Tolok ukur ini mencakup tidak hanya pasangan tanya jawab tetapi juga jejak solusi langkah demi langkah, yang memungkinkan evaluasi trajektori. Desain ini memungkinkan penilaian apakah agen secara eksplisit memperoleh bukti yang diperlukan untuk membenarkan jawabannya, bukan sekadar menghasilkan respons akhir yang benar. Protokol evaluasi membandingkan performa MLLM single-turn dengan alur kerja agentic. Penulis bereksperimen dengan 12 MLLM proprietary dan open-source. Mereka juga menyajikan strategi agentic yang sederhana namun efektif yang berfungsi sebagai baseline kompetitif. Tolok ukur dan dataset dirilis secara publik.
Mengapa penting
Kontribusi utama AgentVidBench adalah pergeserannya dari akurasi jawaban akhir ke evaluasi trajektori. Dengan mensyaratkan jejak solusi langkah demi langkah, tolok ukur ini menilai apakah agen secara eksplisit memperoleh bukti yang diperlukan untuk membenarkan jawaban mereka. Hal ini penting karena jawaban yang benar dapat muncul dari jalan pintas yang keliru, sementara jawaban yang salah mungkin masih mencerminkan penalaran yang sehat. Tolok ukur ini karena itu memberikan ukuran yang lebih holistik tentang pemahaman video agentic. Penulis memposisikan AgentVidBench sebagai testbed untuk penelitian masa depan, dan rilis publik kode dan dataset mendukung reproduktibilitas dan perluasan. Batasan mencakup cakupan 12 MLLM yang dievaluasi saat ini dan ketergantungan pada pertanyaan multi-hop yang dikurasi; pekerjaan masa depan dapat memperluas cakupan model, jenis penalaran, dan granularitas bukti. Secara keseluruhan, AgentVidBench mengatasi kekosongan kritis akan tolok ukur video yang mampu mengevaluasi kemampuan agentic secara rigoris dalam penalaran spasial, temporal, dan kausal.
Siapa yang sebaiknya membaca
Praktisi dan peneliti ilmu komputer
Membuka konten memberโฆ