VideoAgent: Long-form Video Understanding with Large Language Model as Agent
VideoAgent uses a large language model as an agent for multi-round retrieval, achieving 54.1% zero-shot accuracy with only 8.4 frames on average.
Xiaohan Wang, Yuhui Zhang, Orr Zohar et al.