Jadwal Sholat

Memuat jadwal sholatโ€ฆ

Editorial Ilmu Komputer & AI

Open AccessOA2026

Video-HopChain: Pertanyaan Multi-Hop dan Eksplorasi Berbasis Gerbang Keyakinan untuk Model Penalaran Video

Dataset video multi-hop berisi 22.550 pertanyaan dan strategi rollout berbasis gerbang keyakinan yang meningkatkan Qwen3-VL-8B pada delapan benchmark video
Trung Nguyen Quang; Yuhao Dong; Shuo Sun; Shuai Liu; Shulin Tian; Kim-Hui Yap; Ziwei Liuยท 2026ยท DOI 10.48550/arXiv.2609.25773

Masalah inti

HopChain menunjukkan pada citra diam bahwa sintesis data multi-hop meningkatkan penalaran vision-language: penalaran chain-of-thought yang panjang memunculkan kesalahan yang menumpuk antar langkah, sementara sebagian besar data yang dipakai untuk reinforcement learning with verifiable rewards (RLVR) jarang menuntut rantai bukti visual, sehingga kelemahan ini kemungkinan tetap tidak terungkap. Penulis mengamati masalah yang sama pada video, tempat kerangka ini belum dieksplorasi.

Makalah ini karena itu memperkenalkan **Video-HopChain**, dataset berisi **22.550 pertanyaan video multi-hop atas 13.378 video**, bersama benchmark held-out berisi **1.000 pertanyaan**. Setiap pertanyaan merangkai **tiga sampai enam pertanyaan ya/tidak** tentang momen dalam satu video, dan setiap sub-pertanyaan menghasilkan salah satu dari dua bilangan bulat bergantung jawabannya. Jawaban akhir adalah jumlah bilangan bulat tersebut, sehingga kecocokan persis pada jumlah itu menyediakan reward yang dapat diverifikasi yang dibutuhkan RLVR.

Pertanyaan penelitian intinya adalah: (1) apakah sintesis data video multi-hop meningkatkan model penalaran video di bawah RLVR, dan (2) dapatkah batasan gradient-collaps

Inovasi

Evaluasi melaporkan rata-rata atas **delapan benchmark pemahaman dan penalaran video**.

| Tahap | Data pelatihan | Skor rata-rata |
|---|---|---|
| Base | โ€” | 55,4 |
| Tahap 1 | Dataset video standar (GRPO) | 55,4 โ†’ baseline |
| Tahap 2 | Video-HopChain (GRPO) | **57,9** |
| Tahap 2 + CGE | Video-HopChain (GRPO + CGE) | **59,3** |

Temuan utama:

- Tahap kedua pada Video-HopChain menaikkan rata-rata dari **55,4 menjadi 57,9** dan meningkatkan **setiap** dari delapan benchmark.
- Penambahan **Confidence-Gated Exploration** menaikkan rata-rata lebih jauh ke **59,3**, memulihkan grup yang oleh GRPO standar dibiarkan tanpa gradien pada anggaran komputasi yang sama.
- Dataset ini mencakup **22.550 pertanyaan** atas **13.378 video**, dengan benchmark held-out berisi **1.000 pertanyaan**.
- Setiap pertanyaan merangkai **3โ€“6** sub-pertanyaan ya/tidak, menghasilkan reward jumlah bilangan bulat yang dapat diverifikasi.

HopChain menunjukkan pada citra diam bahwa sintesis data multi-hop meningkatkan penalaran vision-language: penalaran chain-of-thought yang panjang memunculkan kesalahan yang menumpuk antar langkah, sementara sebagian besar data yang dipakai untuk reinforcement learning with verifiable rewards (RLVR) jarang menuntut rantai bukti visual, sehingga kelemahan ini kemungkinan tetap tidak terungkap. Penulis mengamati masalah yang sama pada video, tempat kerangka ini belum dieksplorasi.
Makalah ini karena itu memperkenalkan **Video-HopChain**, dataset berisi **22.550 pertanyaan video multi-hop atas 13.378 video**, bersama benchmark held-out berisi **1.000 pertanyaan**. Setiap pertanyaan merangkai **tiga sampai enam pertanyaan ya/tidak** tentang momen dalam satu video, dan setiap sub-pertanyaan menghasilkan salah satu dari dua bilangan bulat bergantung jawabannya. Jawaban akhir adalah jumlah bilangan bulat tersebut, sehingga kecocokan persis pada jumlah itu menyediakan reward yang dapat diverifikasi yang dibutuhkan RLVR.

Mengapa penting

Hasil ini mendukung hipotesis bahwa sintesis data multi-hop bertransfer dari citra ke video. Karena setiap pertanyaan menuntut rantai bukti visual, kesalahan menumpuk antar sub-pertanyaan, memunculkan kelemahan yang disembunyikan data RLVR single-hop. Reward kecocokan persis pada jumlah bilangan bulat itu sederhana, otomatis, dan dapat diverifikasi, sehingga dataset ini langsung kompatibel dengan pipeline RLVR.

Kontribusi CGE menangani batasan struktural GRPO, bukan batasan data. Ketika seluruh 8 rollout berbagi hasil yang sama, advantage grup runtuh menjadi nol dan tidak ada gradien yang mengalir. Dengan memask token paling yakin milik policy di dalam rentang penalaran untuk paruh kedua rollout, CGE menyuntikkan keragaman terkendali sekaligus mengecualikan posisi yang dimask dari loss, sehingga seluruh 8 rollout tetap berkontribusi pada advantage. Ini memulihkan grup sulit dan mudah tanpa menambah anggaran rollout.

Batasan dan pertanyaan terbuka mencakup ketergantungan pada sub-pertanyaan ya/tidak (yang membatasi ruang jawaban), biaya menghasilkan anotasi berantai untuk 13.378 video, dan apakah keuntungannya bertransfer ke model penalaran video yang lebih besar atau ke video QA terbuka. Penulis merilis dataset, checkpoint, serta kode pembangkitan data dan pelatihan untuk mendukung replikasi dan perluasan.

Siapa yang sebaiknya membaca

Praktisi dan peneliti ilmu komputer

Membuka konten memberโ€ฆ