Minimal Clips, Maximum Salience: Long Video Summarization via Key Moment Extraction
Proposes lightweight clip selection combined with large language models to extract key moments, achieving near-reference summary quality with less than 6% video content.
Galann Pennec, Zhengyuan Liu, Nicholas Asher et al.