Mitigating Modality and Language-Style Gaps for Zero-Shot Video Moment Retrieval

TL;DR

Self-SiMS以视频自相似性生成片段,在QVHighlights测试集[email protected]达42.2%。

cs.CV 🔴 高级 2026-07-21 21 次浏览
Jihyun Lee Cheol-Ho Cho Woojin Jun Woojin Jeong Jae-Pil Heo
零样本视频检索 视频时刻定位 自相似性 多模态大模型 跨模态鸿沟

核心发现

方法论

Self-SiMS首先用帧特征与MLLM生成的字幕特征构造时间自相似矩阵,再通过对比核检测边界、生成候选片段;随后结合查询—字幕相似度与片段内部一致性评分,最后以LLaMA-3.2-11B-Vision-Instruct进行查询感知的Yes/No重排序。

关键结果

研究意义

论文指出,零样本检索的瓶颈不只是视觉语言模型能力不足,还包括文本与视觉表征之间的模态鸿沟,以及人工查询与自动字幕之间的语言风格鸿沟。Self-SiMS把候选边界生成从查询依赖转为视频内部结构建模,降低了无标注场景中的不稳定性,为无需时序标注的检索系统提供了更可靠的工程路径。

技术贡献

核心技术包括双源时间自相似矩阵、对比核边界检测、基于视频变化程度的动态阈值、多峰查询—字幕评分、自匹配片段评分和MLLM重排序。矩阵定义为M=1/2(M^f+M^c),片段总分为S_n=(1-α)S^Q_n+αS^S_n,最终分数为S*= (1-β)S+βS^R。默认α=0.1、β=0.5。

新颖性

作者声称这是首个在训练免零样本视频时刻检索中,直接利用时间自相似性生成候选片段并进行片段评分的方法。相较于CLIP式查询—帧相似度和Moment-GPT式查询—字幕相似度,Self-SiMS先利用查询无关的内部结构定位边界,再用查询进行筛选。

局限性

  • 自相似性主要反映视觉或描述上的内部一致性,若目标事件跨越明显场景切换,或多个事件外观高度相似,边界可能被错误切分。
  • 系统仍依赖MLLM字幕、查询—字幕特征和最终视觉问答;LLaMA-3.2-11B-Vision-Instruct的推理成本较高,且性能可能受模型偏差影响。
  • 论文给出的正文实验未展示完整消融表,因此各模块的独立贡献仍需更多可复现实验证。

未来方向

未来可研究更高效的MLLM与帧采样策略,学习帧自相似和字幕自相似的自适应融合权重,并处理长视频、跨语言查询和多事件查询。进一步方向包括以少量弱标注校准动态阈值、建立更系统的误差分析,以及评估不同视觉语言模型对Self-SiMS的迁移性。

AI 总览摘要

从“帮我找出视频中两个人在家得宝查看工具的片段”到监控、教育和媒体检索,视频时刻检索要求系统不仅理解语义,还要准确指出时间边界。传统方法依赖大量人工标注;零样本方法虽借助CLIP、BLIP或MLLM摆脱训练数据,却常把查询与帧或自动字幕直接比较。前者受到模态鸿沟影响,信号低而平;后者受到语言风格鸿沟影响,字幕关注点不断变化,导致候选片段不稳定。

论文提出Self-SiMS。它分别用帧特征和MLLM字幕特征建立时间自相似矩阵M^f、M^c,并取M=1/2(M^f+M^c)。对角线附近的对比核奖励边界两侧内部相似、惩罚跨边界相似,从而发现事件变化位置;动态阈值再生成不重叠候选片段。候选评分结合片段内top-3查询—字幕相似度与关键帧到其他帧的平均自相似度,前五名随后交给LLaMA-3.2-11B-Vision-Instruct进行Yes/No查询感知重排序。

结果显示,QVHighlights测试集[email protected]达到42.2、[email protected]达到59.2,超过Moment-GPT的37.7和55.1;平均mAP为38.3,对比35.0。在Charades-STA上mIoU达到41.9,对比Moment-GPT的36.5。研究的意义在于把“哪里可能是一个完整事件”与“它是否符合查询”分开处理,减少跨模态匹配噪声。不过,自相似性可能误切分跨场景事件,MLLM重排序也带来算力和模型偏差问题。

深度分析

研究背景

VMR从ActivityNet、QVHighlights等带时间标注的数据集发展而来,使用Moment-DETR、UMT等监督模型取得较强效果,但标注成本高。零样本研究转向CLIP、BLIP-2、Moment-GPT和MLLM。现有方法已能进行语义匹配,却普遍依赖查询—帧或查询—字幕相似度,精确边界仍不稳定。

核心问题

给定无标注视频V={v_i}和文本查询Q,系统需预测相关时间区间。视觉特征与文本特征直接比较会产生低而平坦的信号;自动字幕虽改善模态匹配,却可能分别描述物体、动作或子事件,与人工查询语言风格不一致。结果是边界提议和片段排序同时受到噪声影响。

核心创新

第一,Self-SiMS用视频内部关系而非查询关系生成候选边界。第二,将帧和字幕两种自相似性融合,以兼顾视觉连续性与语义连续性。第三,以top-k查询—字幕分数缓解均值受噪声污染的问题,再加入Self-Matching Span Score约束片段内部一致性。第四,用MLLM直接回答查询—帧是否相关,完成最终重排序。

方法详解

  • �� 特征:对帧特征F^f和字幕特征F^c做L2归一化,计算M^f=Fhat^f(Fhat^f)^T、M^c=Fhat^c(Fhat^c)^T,并融合为M。
  • �� 边界:对每个对角位置提取局部patch P_i,与四象限正负权重的对比核K逐元素相乘,得到b_i=P_i⊙K。
  • �� 提议:依据视频上下文变化设置动态阈值,选取局部极大边界并加入首尾帧,生成候选E_n。
  • �� 评分:QMS取片段内top-3查询—字幕分数均值;SMS取最高查询分关键帧与片段所有帧的M相似度均值;S=(1-α)SQ+αSS。
  • �� 重排:前5个片段采样10至30帧,用MLLM得到Yes概率,取top-3均值并与S按β=0.5融合。

实验设计

评测覆盖QVHighlights、Charades-STA、ActivityNet-Captions和TVR。帧率分别为0.5、1、1、1 fps,使用LLaMA-3.2-11B-Vision-Instruct生成字幕并重排。QVHighlights报告[email protected][email protected][email protected]和平均mAP;其余数据集报告[email protected]/0.5/0.7及mIoU。比较对象包括Moment-DETR、TFVTG和Moment-GPT。

结果分析

QVHighlights测试集上,Self-SiMS为59.7/42.2/59.2/38.3,Moment-GPT为58.3/37.7/55.1/35.0,四项均领先。验证集上四项为61.0、43.2、60.5、39.3。Charades-STA的[email protected][email protected][email protected]和mIoU为62.7、39.7、21.0、41.9;ActivityNet-Captions为49.9、28.2、13.8、34.7。方法在不同数据域展现较好的泛化性。

应用场景

可用于新闻、体育、教学视频和用户生成内容的自然语言检索,例如查找某个动作、人物互动或产品演示。部署前需具备视频抽帧、MLLM字幕生成和视觉问答能力。由于无需训练时序标注,媒体归档和企业内部视频搜索可快速试用,但实时应用仍需压缩MLLM调用。

局限与展望

方法假设事件内部具有一定时间连续性,因此快速剪辑、跨镜头事件和外观重复场景可能造成错误边界。双矩阵计算及MLLM字幕、重排序都会增加显存、延迟和成本。动态阈值虽减少人工调参,但论文正文未给出完整消融结果,无法充分判断每个模块的边际贡献。未来应探索轻量模型、自适应融合、多语言查询和长视频分层检索。

通俗解读 非专业人士也能看懂

把系统想成一位整理超长录像的档案管理员。传统管理员先逐秒阅读观众的问题,再判断每一画面像不像答案:有时画面明明相关,却因为“照片语言”和“文字语言”不同而被忽略;有时自动写出的说明换了重点,也会让判断忽左忽右。

Self-SiMS先不看问题,而是观察录像自身的节奏。它会发现连续的一段画面通常彼此相似,场景、动作或人物突然改变时,前后两边的相似程度会下降,于是把这些地方当作可能的分界线。这样做像先按录像内容自然分段,而不是被问题牵着走。

分段后,管理员再回头检查问题:每段中挑最像答案的几幅画面,同时确认整段画面是否保持同一件事。最后让一个能同时看图和读问题的助手直接回答“相关吗?”。在QVHighlights上,这种流程把严格边界指标[email protected]提高到42.2,优于Moment-GPT的37.7。它仍可能把跨场景的同一事件切开,也需要较强计算资源。

简单解释 像给14岁少年讲一样

想象你在一段很长的游戏直播里找“主播第一次打败Boss”的片段。最笨的方法是把这句话和每一帧画面逐一比较,但文字和画面不是同一种语言,系统可能看不出真正相关的地方。另一种方法让AI给每帧写说明,可AI一会儿写“挥剑”,一会儿写“站在门口”,说明重点变化后,评分就会抖来抖去。

Self-SiMS的聪明之处是先观察视频自己的变化。连续战斗画面通常很像,进入新房间或战斗结束时会突然不同。系统就在这些变化处画分界线,先把长视频切成许多比较完整的小段,再去检查哪一段最符合问题。

它会挑每段里最可能相关的几帧,也会检查这些帧和整段是否属于同一件事。然后再让一个更会“看图回答问题”的AI判断:“这一帧和问题有关吗?”最后综合所有答案。就像先按章节整理视频,再找关键词,而不是在整本书里乱翻。

实验中,QVHighlights的严格[email protected]达到42.2,超过Moment-GPT的37.7;Charades-STA的平均交并比达到41.9。可是,如果一个事件跨越多个场景,系统可能误以为它们是两件事;而且大模型反复判断也比较费时间。

术语表

Zero-Shot Video Moment Retrieval(零样本视频时刻检索)

无需使用带时间片段标注的数据训练模型,根据自然语言查询直接定位视频中的相关区间。

论文研究的任务设定。

Temporal Self-Similarity Matrix(时间自相似矩阵)

矩阵元素表示不同时间帧或字幕特征之间的相似程度。对角线附近的结构可揭示视频内部事件变化。

用于边界检测和片段一致性评分。

Modality Gap(模态鸿沟)

视觉与语言表征形式、分布和信息重点不同造成的匹配误差。

解释查询—帧相似度低而平坦的原因。

Language-Style Gap(语言风格鸿沟)

人工查询与MLLM自动字幕在表达方式、关注对象和描述粒度上的差异。

解释查询—字幕分数噪声的来源。

Inner-to-Outer Ratio(内外比,IOR)

比较真实片段内部相似度与外部区域相似度的比值。数值高于1通常意味着内部区分性更强。

论文用它分析不同相似度信号的判别能力。

Query-Aware MLLM Re-ranking(查询感知多模态大模型重排序)

让MLLM直接结合查询和代表性视频帧进行相关性判断,而不是只比较独立向量。

用于前五个候选片段的最终排序。

开放问题 这项研究留下的未解疑问

  • 1 自相似性如何处理跨镜头但语义连续的事件仍不清楚;需要显式建模人物、物体和动作的长期关系。
  • 2 论文正文缺少完整消融数据,尚难精确区分双矩阵、动态阈值、SMS与MLLM重排的独立贡献。
  • 3 不同MLLM、语言和视频领域之间的迁移稳定性仍待验证,尤其是低资源语言和超长视频。

应用场景

近期应用

媒体档案自然语言搜索

新闻机构可抽帧并生成字幕,用Self-SiMS先切分节目,再按“记者采访某专家”等查询返回时间区间。无需重新训练标注模型,适合已有视频库的离线索引。

教育与企业视频定位

在线课程或培训平台可检索“演示实验步骤”“讲解安全规范”等片段。部署需要字幕生成模型、视频特征编码器和有限的MLLM重排序预算。

远期愿景

通用视频知识入口

若结合轻量化模型、多语言查询和长视频分层索引,用户可像搜索网页一样搜索个人录像、会议和公共视频。主要障碍是隐私、计算成本、跨场景事件建模与可靠性评估。

原文摘要

Zero-shot video moment retrieval aims to overcome the limitations of traditional approaches that require large-scale datasets annotated with text and its relevant temporal spans. Despite advances in pre-trained vision-language models and multimodal large language models, existing ZMR methods still heavily depend on query-to-video content similarity, making them vulnerable to modality and language-style gaps. These gaps lead to unreliable span proposals and unstable moment retrieval results. To address this issue, we propose Self-Similarity-based Moment Proposal and Scoring that instead exploits intrinsic relationships within videos, enabling robust span generation and scoring. By deriving self-similarity only from the video content, we circumvent the noisy and mismatched patterns of query-frame or query-caption similarities, thereby mitigating both modality and language-style gaps. Furthermore, we introduce a query-aware MLLM-based reasoning stage to further sharpen alignment between text and video. Extensive experiments demonstrate that Self-SiMS achieves state-of-the-art performance across ZMR benchmarks.

cs.CV