Video-in-the-Loop: Span-Grounded Long Video QA with Interleaved Reasoning
Proposes Video-in-the-Loop (ViTL), a two-stage long-video QA framework combining localization and span-aware answering, achieving up to 8.6% improvement with 50% less input.
Chendong Wang, Donglin Bai, Yifan Yang et al.