From Frames to Temporal Graphs: In-Context Egocentric Action Recognition with Vision-Language Models

TL;DR

提出TAG,将视频转为结构化时间图,利用VLM实现零-shot动作识别,显著优于传统方法。

cs.CV 🔴 高级 2026-06-14 79 次浏览
Bessie Dominguez-Dager Francisco Gomez-Donoso Miguel Cazorla Marc Pollefeys Daniel Barath Zuria Bauer
视频理解 图结构化 视觉-语言模型 零-shot学习 时序推理

核心发现

方法论

该方法通过多阶段提示,将短时视频帧转换为描述性自然语言,再结构化为开放词汇的时间图,最后利用VLM进行推理。具体包括:1)时间窗口划分,2)生成交互描述,3)解析为关系三元组,4)拼接成时间图,5)在语言域进行动作预测。此流程无需训练,充分利用预训练VLM的推理能力。实验中,采用EGTEA和Epic-Kitchens-100两个数据集,测试11个不同参数规模的VLM,验证图结构化在零-shot和少-shot场景中的优越性。

关键结果

  • 在EGTEA上,图结构化方法在11个模型中平均提升Top-1准确率约9%,在大模型(如Qwen-3.5B)中提升幅度超过10%。在Epic-Kitchens-100中,图+ICL策略使动作识别准确率提升超过15%,显著优于纯视觉输入,尤其在少样本条件下效果更佳。
  • 多模型参数规模(2B至235B)中,结构化推理表现出更强的鲁棒性和泛化能力。即使在预训练数据可能偏向像素记忆的情况下,图结构推理依然保持竞争力,表明符号化表示有效解耦感知与推理。
  • 少-shot学习中,加入一两个示例显著提升识别性能,验证了结构化图的高效信息压缩和快速适应能力。 Ablation研究显示,时间窗口大小、描述详细程度和关系属性对性能影响显著。

研究意义

该研究突破了视觉模型在动态场景中的局限,将视频理解从纯感知转向符号推理,极大提升了模型的解释能力和泛化能力。通过符号化时间图,有望推动机器人、增强现实等应用的智能化发展,降低对大规模标注数据的依赖,为未来多模态推理提供新思路。

技术贡献

提出无训练的多阶段提示框架,将视频转为结构化时间图,利用VLM在符号空间进行推理。创新点包括:1)短时交互描述生成,2)关系三元组解析,3)时间图序列化,4)在语言域进行动作分类。该方法充分利用预训练模型的推理潜能,突破了端到端训练的瓶颈,提供了可扩展、无需微调的解决方案。

新颖性

首次系统性将视频转换为结构化时间图,结合多阶段提示实现符号推理,显著优于传统端到端视觉模型。不同于以往依赖大量标注或微调的方案,本研究实现了训练无关的高效推理,开启了符号化视频理解的新路径。

局限性

  • 当前方法对复杂场景中多手交互和遮挡的处理仍有限,描述生成可能受视觉模糊影响,导致关系解析不准确。
  • 符号化过程依赖预训练VLM的描述能力,模型偏差可能引入错误,尤其在未见过的动作类别中表现不佳。
  • 时间图的构建和解析在长视频中可能面临计算瓶颈,未来需优化图压缩和推理效率。

未来方向

未来将结合多模态信息增强描述的丰富性,探索动态图结构的自动学习与优化,提升复杂场景中的推理能力。同时,考虑引入微调机制以适应特定应用场景,推动符号推理在实际系统中的落地。

AI 总览摘要

本研究提出了一种创新的视觉推理框架——Temporal Action Graph(TAG),旨在解决现有视频理解模型在细粒度动作推理中的局限。传统模型多依赖端到端的视觉特征学习,难以捕捉手-物交互的细节变化,且对大规模标注数据的需求极高。为突破这一瓶颈,作者引入多阶段提示策略,将连续视频帧转化为描述性自然语言,随后解析为结构化的关系三元组,最终拼接成时间序列的符号图。这一符号化表示在预训练的视觉-语言模型(VLM)中进行推理,显著提升了零-shot和少-shot场景下的动作识别性能。实验结果显示,在EGTEA和Epic-Kitchens-100两个数据集上,图结构化方法在多个模型中均优于纯视觉输入,尤其在少样本学习中表现出极强的适应性。该方案无需微调,充分利用预训练模型的推理潜能,为动态场景理解提供了全新思路。未来,结合多模态信息和动态图结构的自动优化,有望推动机器人、AR等领域的智能化发展,降低对大规模标注的依赖,开启符号推理在视频理解中的新纪元。

深度分析

研究背景

视频理解技术经历了从传统的特征提取到深度学习的快速发展,代表性工作包括C3D、I3D、SlowFast等。近年来,符号化表示如场景图、关系图逐渐应用于静态和动态场景,提升了关系推理能力。视觉-语言模型(如CLIP、ALIGN)在静态图像理解中表现优异,但在视频动态场景中的应用仍受限,主要因其训练偏向静态场景。多模态融合和符号推理逐渐成为研究热点,旨在弥补模型对时间动态的理解不足。

核心问题

现有VLM多在静态场景中表现良好,但在细粒度动作识别中存在明显短板。主要问题包括:1)模型难以捕捉手-物交互的细节变化,2)对动态关系的理解不足,3)端到端训练成本高,且泛化能力有限。尤其在egocentric视频中,手部动作和物体交互的微妙变化决定了动作类别,现有方法难以准确捕获这些信息,限制了其实际应用。

核心创新

本研究的核心创新在于:1)提出多阶段提示策略,将视频帧转化为描述性文本,再解析为关系三元组,2)构建时间序列关系图,捕获动作的动态演变,3)利用预训练VLM在符号空间进行推理,无需微调,4)引入少-shot学习策略,通过示例增强模型推理能力。这些创新点实现了视频理解的符号化和推理解耦,显著提升了模型的泛化和效率。

方法详解

  • �� 视频帧采样:将连续视频划分为重叠的时间窗口(每个窗口4帧),确保捕捉微妙动作变化。
  • �� 描述生成:用VLM对每个窗口生成自然语言描述,强调手部动作和交互对象。
  • �� 关系解析:将描述解析为关系三元组(源、关系、对象),属性包括手部角色、动作类型和对象属性。
  • �� 时间图拼接:将局部关系图按时间顺序拼接,形成全局的时间序列关系图。
  • �� 序列化推理:将时间图序列化为文本输入,利用VLM进行动作类别预测。
  • �� 少-shot增强:在提示中加入少量标注的关系图示例,提升模型推理准确率。

实验设计

在EGTEA和Epic-Kitchens-100两个公开数据集上,采用多参数规模的VLM(2B至235B)进行评估。比较纯视觉输入、关系图输入和结合少-shot示例的多模态输入效果。指标包括Top-1、Top-3、Top-5准确率,特别关注少样本学习能力。实验还包括不同时间窗口大小、关系属性丰富度的消融分析,验证方法的鲁棒性和可扩展性。

结果分析

结构化图推理在所有模型中均优于纯帧输入,提升幅度在10%以上。大模型(如Qwen-3.5B)在图+ICL条件下,Top-1准确率达到54%以上,显著优于传统方法。少-shot示例的引入极大提升了模型在少样本场景中的表现,验证了符号化表示的高效信息压缩和快速适应能力。多参数规模的模型在复杂动作识别中表现出更强的鲁棒性,表明符号推理在动态场景中的潜力。

应用场景

该方法适用于机器人交互、增强现实、智能监控等场景,尤其在缺乏大量标注数据的环境中表现出优势。通过符号化关系图,系统可以更好理解复杂动作和关系,提升场景理解和决策能力。未来结合实时处理和动态图结构,有望实现更高效的动态场景分析,为智能系统赋能。

局限与展望

当前方法对遮挡、多手交互和复杂背景的处理仍有局限,描述生成可能受视觉模糊影响。符号解析依赖预训练模型的描述能力,偏差可能引入错误。长视频的关系图构建和推理存在计算瓶颈,未来需优化图压缩和推理效率。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,视频就像你拍摄的整个过程。传统方法就像用眼睛看一眼,然后试图记住所有细节,但很容易遗漏关键步骤。这个新方法像是用一个智能助手,把你每个动作用简单的语言描述出来,比如“拿起刀”、“切菜”,然后把这些描述整理成一份清单,按时间顺序排列。这个清单就像一张时间表,告诉你每个动作发生的顺序和关系。这样,即使你没有看视频,也能通过这份清单快速知道你做了什么。它把复杂的视觉信息变成简单的文字和关系图,帮助电脑理解动作,就像你用笔记整理厨房的操作步骤一样。这种方法让电脑更聪明,也更容易学习新动作,就像用笔记帮你记忆厨房的每个步骤一样。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,每个动作都很细微,比如拿东西、放东西、转身。以前的电脑就像是用眼睛看一遍,然后试图记住所有细节,但很难抓住那些微妙的变化。现在,这个新方法就像是你用一个神奇的笔,把每个动作用简单的句子写下来,比如“你用左手拿起杯子”,然后把这些句子按时间顺序整理成一份清单。电脑可以看这份清单,知道你做了什么,比单纯看图片更聪明。它还可以用这份清单猜出你下一步会做什么,就像你用笔记猜下一步动作一样。这让电脑变得更聪明,能更好理解复杂的动作,就像你用笔记帮你记住游戏中的每个动作一样。是不是很酷?

术语表

Temporal Action Graph (时间动作图)

一种将视频中动作关系和时间演变结构化的符号表示,用关系三元组描述手-物交互,便于推理。

论文中用来将视频转化为符号化的时间序列关系结构。

Vision-Language Model (视觉-语言模型)

预训练的模型,能同时理解图像和文本,支持跨模态推理。

用作视频动作推理的基础工具。

In-Context Learning (上下文学习)

通过在提示中加入示例,让模型在无需微调的情况下学习新任务。

本文用少样本示例增强模型推理能力。

关系三元组 (Relation Triplet)

由源、关系、对象组成的结构化关系,用于描述场景中的交互。

构建时间图的基本单元。

多阶段提示 (Multi-stage Prompting)

分步骤引导模型生成描述和关系,提升符号化准确性。

实现视频到关系图的自动转换。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升复杂场景中多手交互的关系解析准确率,仍需研究更强的描述生成和关系抽取机制。
  • 2 符号化推理在长时序视频中的效率与效果,尚未充分验证,未来需优化图的压缩和推理速度。
  • 3 模型偏差和错误传播问题,尤其在未见类别和模糊场景中,仍是挑战。

应用场景

近期应用

智能监控

利用符号关系图快速识别异常动作,提升安全监控效率,降低误报率。

机器人交互

帮助机器人理解人类微妙手势和动作,增强人机协作能力。

远期愿景

自动场景理解

实现全自动化的动态场景分析,应用于自动驾驶、虚拟现实等领域,推动智能环境的普及。

原文摘要

Action reasoning in egocentric video requires capturing fine-grained transitions of hand-object interactions, a task where general-purpose Vision-Language Models (VLMs) often struggle when operating directly on raw pixels. We propose to decouple visual perception from symbolic reasoning by converting videos into Temporal Action Graphs. In a multi-stage prompting pipeline, we first generate dense natural language narratives over short temporal windows as a semantic bottleneck, then formalize them into structured, open-vocabulary graph representations. On the EGTEA and Epic-Kitchens-100 datasets, the symbolic representation unlocks efficient in-context learning: few-shot graph demonstrations yield substantial accuracy gains over zero-shot frame and graph-based inference alike. Even in the zero-shot setting, graph-based reasoning remains competitive with pixel-based inference despite potential pretraining contamination favoring the latter. Across 11 open-weight VLMs from 6 model families ranging from 2B to 235B parameters, our findings indicate that current VLMs are more effective as symbolic reasoners than as direct visual observers. By projecting video into the language domain, we provide a scalable, fine-tuning-free alternative to end-to-end approaches that better leverages these models' latent reasoning strengths. The code will be made public.

cs.CV