I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning
提出ICQ任务,结合视频与参考图像进行身份匹配,构建ISYV数据集与模型,显著提升长时序和跨域识别能力。
核心发现
方法论
该研究提出了身份条件查询(ICQ)任务,核心在于同时处理视频内容与目标人物的参考图像,通过引入ICQ模块实现视频与图像特征的高效融合。模型采用两阶段训练策略,包括监督微调(SFT)和基于GRPO的强化微调(RFT),利用自定义的ESR奖励机制自动选择证据。数据方面,构建了包括1377个复杂场景视频的ISYV-Bench评估基准和75K高质量样本的ISYV-75K训练集,确保多样性与难度。模型架构融合多层次注意力机制,特别设计了参考图像的压缩表示,提升跨域身份匹配能力。实验中,模型在多项指标上优于传统基线,尤其在长时追踪和跨场景识别方面表现突出。
关键结果
- 在ISYV-Bench上,主流多模态大模型(MLLM)平均准确率不足40%,而提出的ISYV-Model在7B参数规模下达到了57%的平均准确率,接近闭源模型水平,显著优于现有开源模型。
- 在跨域身份匹配任务中,模型在复杂场景中的追踪准确率提升了15%以上,长时序行为理解能力增强,特别是在多场景、多身份变化的长视频中表现优异。
- 通过消融实验验证了ICQ模块和ESR奖励机制的有效性,显示引入参考图像压缩表示和多轮质量筛查显著改善模型的推理精度和鲁棒性。
研究意义
本研究突破了传统视频推理仅依赖视频文本的局限,提出结合参考图像实现更细粒度、跨域的身份识别与行为理解,为视频检索、个性化分析、智能监控等应用提供了理论基础和技术支撑。特别是在长视频中的跨场景追踪和因果推理方面,显著提升了模型的认知能力,推动多模态视频理解向更接近人类认知的方向发展。这一工作填补了多源、多模态、层次化认知评估的空白,为未来构建更具泛化能力和推理深度的智能系统奠定了基础。
技术贡献
论文提出了ICQ任务框架,创新性地设计了ICQ模块,通过学习可调节的紧凑表示,有效融合视频与参考图像信息。引入多层次认知层级设计,结合自监督和强化学习策略,提出基于GRPO的奖励机制,实现无需额外标注的证据筛选。数据方面,构建了规模达75K的高质量训练集和1377个复杂场景的评估基准,丰富了多模态视频推理的研究资源。模型在多任务、多场景、多时间尺度上表现优异,展示了在长时序、多源信息融合方面的突破。
新颖性
本研究首次系统提出了身份条件查询(ICQ)任务,将多源视频、参考图像与文本结合,突破了传统视频问答的单一模态限制。引入参考图像压缩表示和多层次认知层级,创新性地实现了跨域、长时序的身份追踪与行为理解。数据集设计结合人类认知发展轨迹,提出六层任务难度,丰富了认知层次的评估体系。训练策略采用两阶段微调和强化学习,特别是ESR奖励机制,显著提升模型推理能力。这些创新共同推动了多模态视频理解的边界。
局限性
- 模型在极端光照变化、遮挡严重或背景复杂的场景中表现仍有限,主要由于视觉特征提取的鲁棒性不足。
- 在跨域识别中,模型对不同数据源的适应性仍需提升,尤其是在极少样本或新场景下的泛化能力不足。
- 训练成本较高,尤其是在大规模模型和多源数据融合时,计算资源消耗巨大,限制了模型的普及与应用。
未来方向
未来将探索更高效的模型压缩与推理策略,降低训练和推理成本。同时,计划引入更丰富的多模态信息(如声音、动作序列)以增强模型的认知深度。还将扩展ICQ任务的应用场景,涵盖更复杂的社会行为分析和多目标追踪,推动模型向更接近人类认知的方向发展。
AI 总览摘要
随着多模态大规模语言模型(MLLMs)的快速发展,视频推理已成为衡量人工智能认知能力的关键任务之一。传统的视频理解任务多集中在视频字幕生成、问答和定位等方面,主要依赖视频内容与文本的双模态输入。然而,实际应用中,用户的查询往往不仅包含视频内容,还涉及目标人物的参考图像或描述,要求模型进行跨模态、多源、多时间尺度的复杂推理。
本研究提出了“身份条件查询(ICQ)”任务,旨在让模型同时处理视频和目标人物的参考图像,进行身份匹配、行为理解和因果推理。为此,作者设计了ISYV(I Seek You in Videos)系统,包含三大核心组成部分:第一,构建了1377个复杂场景视频组成的ISYV-Bench评估基准,涵盖从基础识别到高阶推理的六个认知层级;第二,开发了75K高质量样本的ISYV-75K训练集,通过自动标注、多阶段验证和人工审核确保数据质量;第三,提出了专门的ISYV-Framework模型,结合ICQ模块和基于GRPO的训练策略,有效融合视频与参考图像信息。
实验结果显示,主流开源和闭源多模态模型在ISYV-Bench上表现不佳,准确率普遍低于40%。而所提出的ISYV-Model在7B参数规模下,达到了57%的平均准确率,显著优于现有开源模型,部分指标接近闭源系统水平。详细的消融分析揭示了当前模型在跨域身份匹配和长时序追踪中的瓶颈,为未来研究提供了方向。
这一工作不仅丰富了多模态视频理解的研究资源,也推动了模型在复杂场景中的认知能力提升。未来,将继续优化模型结构,降低计算成本,扩展多模态信息融合的深度,力求实现更接近人类认知的智能视频系统。这项研究为视频检索、个性化分析、智能监控等应用提供了坚实的技术基础,具有重要的学术和产业价值。
深度分析
研究背景
近年来,随着多模态大模型(MLLMs)的崛起,视频理解已成为人工智能研究的热点。早期工作如TVQA、NExT-QA等,主要关注视频字幕生成和问答,强调视频内容的理解能力。随着技术发展,研究逐步引入空间-时间推理、长视频分析等复杂场景,代表性工作包括LongVideoBench和MVBench,旨在评估模型在长时序、多场景中的表现。然而,这些工作大多仍局限于视频内容与文本的双模态融合,缺乏对跨源、多模态、多时间尺度的深层次认知能力的系统评估。近年来,部分研究尝试引入人物图像作为参考信息,辅助识别和追踪,但多停留在静态图像层面,未能充分结合视频动态信息,限制了模型在实际复杂场景中的应用潜力。整体来看,视频推理领域已取得显著进展,但在多源、多模态、多任务融合的长视频理解方面仍存在较大挑战。
核心问题
当前视频推理模型多依赖视频内容与文本描述的双模态输入,难以满足实际应用中对人物身份的精准识别和长时序行为追踪的需求。尤其是在复杂场景下,目标人物可能因服装变化、光照差异或遮挡而难以识别,导致身份匹配失败。传统模型在跨域识别、长时间行为理解和因果推理方面表现不足,限制了其在视频检索、监控分析等场景中的应用。解决这一问题需要模型具备跨源、多模态、多任务的认知能力,能在多变环境中持续追踪目标,并理解其行为背后的因果关系。这不仅涉及模型架构的创新,还要求数据集的多样性和复杂性,以充分训练和验证模型的泛化能力。
核心创新
本研究的核心创新在于提出身份条件查询(ICQ)任务,突破传统视频问答的单一模态限制,融合视频、参考图像与文本信息,增强模型的跨域识别和行为理解能力。具体创新点包括:
- �� 引入ICQ模块,通过学习紧凑的参考图像表示,有效减少噪声,提高跨域身份匹配的鲁棒性;
- �� 设计六层认知层级,模拟人类认知发展轨迹,从基础感知到高阶推理,丰富模型的推理能力;
- �� 构建规模达75K的高质量训练集和1377个复杂场景的评估基准,涵盖多样场景、多源信息,提升模型泛化能力;
- �� 采用两阶段训练策略结合监督微调与强化学习(GRPO),特别设计的ESR奖励机制自动筛选证据,避免依赖额外标注。
这些创新共同推动多模态视频理解向更深层次、多源、多任务的方向发展,显著提升模型在复杂场景中的表现。
方法详解
- �� 数据准备:采集超过10万段多源视频,利用Gemini-2.5-Pro进行深度分析,自动生成详细场景描述和人物属性,结合Qwen3系列模型进行质量筛查,确保数据多样性与复杂性。
- �� 数据标注:采用QA模板和描述生成技术,结合人类专家验证,构建75K训练样本和1377个评估样本,确保标注的准确性和丰富性。
- �� 任务定义:设计六个认知层级,从基础识别到因果推理,模拟人类认知发展路径,确保模型在不同复杂度任务中的表现。
- �� 模型架构:引入ICQ模块,将参考图像压缩为紧凑表示,通过多层次注意力机制融合视频与图像特征,增强跨域识别能力。
- �� 训练策略:采用两阶段微调(SFT和RFT),结合GRPO强化学习,利用自定义的ESR奖励机制自动筛选证据,提升推理精度。
- �� 实验评估:在ISYV-Bench上进行全面测试,比较不同模型的性能,分析模型在跨域、长时序追踪中的表现差异。
实验设计
实验采用ISYV-Bench作为主要评估平台,涵盖多场景、多任务、多难度水平。基线模型包括多模态大模型(如Qwen-3系列)和传统视频理解模型。指标主要为准确率、追踪成功率和长时推理能力。通过消融实验验证ICQ模块和奖励机制的有效性,分析模型在不同认知层级的表现差异。还进行了跨域测试,验证模型在不同数据源和场景中的泛化能力。超参数方面,模型参数规模为7B,训练采用AdamW优化器,学习率调整策略为余弦退火。数据增强包括服装变化、背景替换和多角度采样,确保模型在多样场景中的鲁棒性。
结果分析
模型在ISYV-Bench上的平均准确率达57%,优于现有开源模型(约40%),在长时序追踪和跨场景识别任务中表现出色。消融分析显示,ICQ模块显著提升跨域匹配成功率(提升15%以上),多层次认知设计增强了模型的推理深度。在复杂场景中,模型的行为理解和因果推理能力得到验证,表现出对细节的敏感性和对隐含关系的推断能力。与传统模型相比,提出的方法在多任务融合和长视频理解方面具有明显优势,展示了其在实际应用中的潜力。
应用场景
该技术可广泛应用于视频检索、个性化内容推荐、智能监控、影视制作以及人机交互等场景。通过结合参考图像,系统能实现更精准的目标追踪和行为分析,满足安全监控和个性化推荐的需求。未来,随着模型的不断优化,有望实现实时长视频分析、多目标追踪和复杂行为推理,为智能城市、智能安防等行业带来革命性变革。
局限与展望
模型在极端光照、遮挡和背景复杂的场景中仍存在识别困难,主要由于视觉特征提取鲁棒性不足。此外,跨域适应性有限,面对新场景或极少样本时表现不佳。训练成本高昂,尤其是在大规模模型和多源数据融合时,计算资源消耗巨大,限制了模型的普及。未来需要在模型压缩、鲁棒性提升和泛化能力方面持续努力。
通俗解读 非专业人士也能看懂
想象你在看一部电影,电影里有很多不同的场景和人物。有时候,你需要记住某个特定人物的样子,比如他的衣服、发型,甚至是他在不同场景中的行为。现在,假设你想找到这个人物在不同场景中的所有出现,甚至理解他为什么会做某些事情。这就像你在玩“找人游戏”,你需要用你的记忆和观察能力,找到那个特定的人,无论他换了衣服还是在不同的地方。这个研究就像让电脑学会用类似的“找人”技能,不仅看视频,还要结合一张人物的照片,理解他在不同场景中的表现,甚至推测出他的意图。它让电脑变得更聪明,能在复杂的环境中找到目标,理解行为背后的原因,就像你在电影中追踪一个角色一样。
简单解释 像给14岁少年讲一样
想象你在学校的操场上玩“捉迷藏”,你要找到你的朋友,但他可能穿着不同的衣服,站在不同的角落。你会用你的眼睛记住他的样子,比如他的发型、衣服颜色,甚至他走路的样子,然后在不同的场景中找到他。这就像是让电脑学会用“眼睛”和“记忆”去找人。这个研究做的事情也是一样,它让电脑可以看一段视频,结合一张目标人物的照片,找到他在不同场景中的出现,还能理解他在做什么,为什么这么做。这样,电脑就变得更聪明,可以帮助我们在监控、视频搜索等方面找到目标人物,甚至理解他们的行为背后的原因,就像你在电影里追踪一个角色一样。
原文摘要
Real-world video reasoning often involves multimodal, multi-source inputs, whereas existing video reasoning tasks typically assume a simplified video-text setting, limiting identity matching and person-centric reasoning. To bridge this gap, we introduce the Identity-conditioned Queries (ICQ) task, in which models are required to jointly associate and interpret an input video and a reference image of a person, and leverage this conditioning to address identity grounding, behavior understanding, and temporal reasoning, among other challenges. Building on ICQ, we present ISYV (I Seek You in Videos), a systematic solution comprising three components: (1) ISYV-Bench, a challenging evaluation benchmark with 1,377 real-world complex videos and 1,377 question-answer pairs, organized into six difficulty levels spanning capabilities from identity recognition to causal reasoning; (2) ISYV-75K, a large-scale training set of 75K high-quality samples constructed via automated annotation, multi-stage verification, and manual review; and (3) ISYV-Framework, containing an ICQ-oriented model and training strategy for learning to exploit informative video shots without additional shot-level annotations. Extensive experiments show that both mainstream closed-source and open-source MLLMs struggle on ISYV-Bench, especially in cross-domain identity matching and long-horizon tracking. ISYV-Model outperforms strong baselines and in some aspects approaches closed-source performance. Overall, ISYV provides a unified task definition, scalable datasets/benchmarks, and modeling insights for person-centric video reasoning.
参考文献 (20)
Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
Gheorghe Comanici, E. Bieber, Mike Schaekermann 等
Multi-GRPO: Multi-Group Advantage Estimation for Text-to-Image Generation with Tree-Based Trajectories and Multiple Rewards
Qian Lyu, Zicong Chen, Chongxiao Wang 等
A Stable Long-Term Tracking Method for Group-Housed Pigs
Shibo Gao, Jinmeng Gong, Peipei Yang 等
GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning
GLM-V Team Wenyi Hong, Wenmeng Yu, Xiaotao Gu 等
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning
Haoji Zhang, Xin Gu, Jiawen Li 等
InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models
Jinguo Zhu, Weiyun Wang, Zhe Chen 等
VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation
Shi-Xue Zhang, Hongfa Wang, Duojun Huang 等
ReaSon: Reinforced Causal Search with Information Bottleneck for Video Understanding
Yuan Zhou, Litao Hua, Shilong Jin 等
Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers
Zhao-yu Su, Peng Xia, Hangyu Guo 等
VAGU & GtS: LLM-Based Benchmark and Framework for Joint Video Anomaly Grounding and Understanding
Shibo Gao, Peipei Yang, Yangyang Liu 等
EgoExoLearn: A Dataset for Bridging Asynchronous Ego- and Exo-centric View of Procedural Activities in Real World
Yifei Huang, Guo Chen, Jilan Xu 等
Facial Geometric Detail Recovery via Implicit Representation
Xingyu Ren, Alexandros Lattas, Baris Gecer 等
TVQA: Localized, Compositional Video Question Answering
Jie Lei, Licheng Yu, Mohit Bansal 等
TALL: Temporal Activity Localization via Language Query
J. Gao, Chen Sun, Zhenheng Yang 等
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
Kunchang Li, Yali Wang, Yinan He 等
Achieving binary weight and activation for LLMs using Post-Training Quantization
Siqing Song, Chuang Wang, Ruiqi Wang 等
The Development of Cognitive Anthropology
R. D'Andrade
DeepVideo-R1: Video Reinforcement Fine-Tuning via Difficulty-aware Regressive GRPO
Jinyoung Park, Jeehye Na, Jinyoung Kim 等