BARISTA: A Multi-Task Egocentric Benchmark for Compositional Visual Understanding

TL;DR

BARISTA利用密集标注场景图实现多任务场景理解,涵盖185个真实咖啡制作视频。

cs.CV 🔴 高级 2026-05-12 63 次浏览
Patrick Knab Orgest Xhelili Inis Buzi Drago Andres Guggiana Nilo Mohd Saquib Khan Lorenz Kolb Manuel Scherzer Kerem Yildirir Christian Bartelt Philipp Johannes Schubert
场景理解 视频分析 多任务学习 egocentric数据集 程序推理

核心发现

方法论

该研究构建了一个基于每帧场景图的密集标注体系,结合半自动化标注流程,包括交互检测、稀疏关键帧标注、密集掩码传播、身份一致性修正及关系与活动标注。利用深度学习模型(如SAM 2/3)辅助掩码传播,确保标注的时间一致性与高质量。场景图链接对象、关系、属性和活动信息,支持多任务评估。通过零样本任务设计,评估了多种视觉-语言模型(如Gemini、Qwen、GPT)在对象定位、交互识别、关系提取、活动识别和时序问答中的表现。

关键结果

  • 在对象定位任务中,Qwen 3.5-27B模型达到mAP@50 0.680,明显优于其他模型,显示出强大的空间理解能力;而在关系提取任务中,模型表现差异显著,说明空间关系理解仍是瓶颈;多任务评估揭示模型在空间定位与时序推理上的能力互补,未出现单一优势模型。
  • 实验表明,模型在不同任务中的表现存在明显差异,空间定位任务对模型的空间感知能力要求更高,关系推理则依赖于丰富的场景图信息。模型的性能在不同准备流程和对象类别间波动较大,验证了BARISTA作为复杂场景理解基准的挑战性。
  • 通过消融实验,验证了场景图密集标注对提升模型多任务能力的重要性,特别是在零样本条件下,场景图的结构信息显著改善模型的推理能力。

研究意义

该研究填补了场景理解多任务评估的空白,提供了一个高质量、结构化的 egocentric 视频数据集,支持空间、关系、活动等多层次理解。其多任务设计帮助诊断模型在程序推理中的具体缺陷,为未来智能体在复杂环境中的自主理解提供基础。该数据集的密集场景图结构推动了视觉-语言模型在实际应用中的泛化能力,具有重要的学术和工业价值。

技术贡献

创新点在于提出基于场景图的密集标注体系,结合半自动化流程实现大规模高质量标注,支持多任务评估。引入零样本任务设计,利用场景图作为统一的知识基础,有效连接空间感知、关系推理和程序理解。模型评估方面,系统比较了多种VLM(如Gemini、Qwen、GPT)在空间定位、关系识别、活动理解中的表现,揭示模型能力的互补性和局限性。

新颖性

首次在 egocentric 视频中实现全流程密集场景图标注,覆盖对象、关系、属性、活动和程序步骤,支持多任务零样本评估。区别于以往只关注单一任务或稀疏标注的工作,BARISTA提供了结构化、可追溯的场景理解基础,推动了多任务、多层次场景理解研究的发展。

局限性

  • 标注依赖深度模型辅助,可能在遮挡或快速运动场景中出现误差,影响标注质量;
  • 目前仅覆盖咖啡制作这一特定领域,泛化到其他复杂场景仍需扩展;
  • 模型在关系推理和时序理解方面仍存在较大差距,未来需引入更强的时序建模机制。

未来方向

未来将扩展场景类别,提升标注自动化水平,结合多模态信息增强场景理解能力。同时,探索引入强化学习和自监督机制,改善模型在复杂程序推理中的表现,推动智能体在真实世界中的自主理解和操作能力。

AI 总览摘要

在人工智能的场景理解领域, egocentric视频因其丰富的空间和动作信息而成为研究焦点。然而,现有数据集多偏重单一任务或稀疏标注,难以全面评估模型在复杂场景中的多层次理解能力。为此,BARISTA提出了一套基于密集场景图的多任务评估体系,涵盖185个真实咖啡制作视频,提供超过3.6百万的实例掩码、关系和属性标注,支持对象检测、关系识别、活动理解及程序推理等任务。其核心创新在于采用半自动化流程,结合深度模型(如SAM 2/3)实现高质量、多层次的场景图标注,确保标注的时间一致性和空间准确性。通过构建统一的零样本任务评估框架,研究者可以系统分析模型在空间定位、关系推理和时序理解中的能力差异。实验结果显示,当前主流视觉-语言模型(如Gemini、Qwen、GPT)在不同任务中表现差异显著,空间定位任务尤为具有挑战性。该工作不仅推动了多任务、多层次场景理解的研究,也为未来智能体在复杂环境中的自主认知提供了坚实基础。尽管如此,模型在关系推理和程序推断方面仍存在不足,未来需要引入更强的时序建模和多模态融合技术。BARISTA的发布,为学术界提供了一个具有挑战性和可扩展性的评估平台,助力推动视觉理解技术迈向更高水平。

深度分析

研究背景

场景理解一直是计算机视觉的重要研究方向,早期多关注静态对象检测和分类,随着深度学习的发展,关系推理和动作识别逐渐成为焦点。代表性工作包括Object Detection(如Faster R-CNN)、关系推理(如Scene Graph Generation)以及视频理解(如EPIC-KITCHENS、Ego4D)。然而,这些工作多局限于单一任务或稀疏标注,难以实现多层次的场景理解。近年来,egocentric视频因其第一人称视角,提供了丰富的空间和动作信息,成为研究热点。尽管如此,缺乏密集、结构化的标注限制了模型在复杂程序推理中的表现。现有数据集如VISOR、Ego4D提供部分空间或动作信息,但未能覆盖完整的场景关系和程序步骤。BARISTA的出现,旨在填补这一空白,通过密集标注场景图,支持多任务评估,推动场景理解向更高层次发展。

核心问题

当前场景理解模型在空间定位、关系推理和程序推断方面表现有限,尤其是在egocentric视频中。缺乏结构化、密集的场景图标注,使得模型难以进行多层次推理,导致在复杂任务中表现不佳。现有数据集多偏重单一任务,缺少统一的评估平台,难以诊断模型的具体缺陷。如何构建一个既能覆盖对象、关系、属性,又能支持程序推理的高质量数据集,成为亟待解决的问题。解决这一问题,有助于提升模型的泛化能力和推理深度,推动智能体在真实环境中的自主理解。

核心创新

本研究创新点在于提出基于场景图的密集标注体系,结合半自动化流程,实现大规模高质量标注。具体创新包括:1)构建每帧场景图,链接对象、关系、属性和活动信息;2)利用深度模型(SAM 2/3)辅助掩码传播,确保标注时间一致性;3)引入零样本多任务评估框架,支持对象定位、关系识别、活动理解和程序推理。通过密集标注,模型能在不同任务间共享结构信息,提升推理能力。这一体系区别于传统稀疏标注方法,为多任务、多层次场景理解提供了坚实基础。

方法详解

  • �� 交互检测与关键帧选择:利用CaRe-Ego模型检测交互,提取交互段,选择中心帧作为标注点。• 稀疏关键帧标注:在选定关键帧上,人工标注对象掩码和类别,利用SAM 2提供的掩码建议。• 密集掩码传播:用SAM 2/3模型将稀疏掩码在时间上传播到中间帧,确保连续性。• 识别与身份修正:人工审核传播掩码,修正遮挡或误差,合并跨段对象身份。• 关系与活动标注:在代表帧上标注空间关系、手-物交互和程序步骤,形成完整场景图。• 任务定义:基于场景图,设计空间定位、关系识别、活动理解和时序问答任务,支持零样本评估。

实验设计

采用185个咖啡制作视频,标注总时长4.4小时,生成469K实例掩码、2.48M关系、2424个活动段。模型评估包括多种VLM(Gemini、Qwen、GPT),在对象检测、关系提取、活动识别和时序问答中进行零样本测试。指标包括mAP、F1、G-Eval等。通过不同模型规模和类型的比较,分析模型在空间定位与关系推理上的差异,验证场景图结构对提升多任务性能的作用。实验还包括消融分析,验证场景图密集标注的有效性。

结果分析

模型在对象定位任务中,Qwen 3.5-27B达到mAP@50 0.680,优于其他模型。关系提取任务中,模型表现差异明显,表明关系理解仍是瓶颈。空间定位任务对模型空间感知要求高,关系推理依赖丰富的场景图信息。多任务评估揭示模型在不同任务中的能力互补,未出现单一优势模型。消融实验显示,场景图密集标注显著改善模型推理能力,尤其在零样本条件下效果更明显。

应用场景

该数据集和评估框架可应用于机器人自主操作、智能监控、虚拟助手等场景,提升模型在复杂环境中的空间感知和程序推理能力。未来,结合多模态信息和强化学习,有望实现更智能的自主系统,推动人机交互和自动化水平提升。

局限与展望

当前标注依赖深度模型辅助,可能在遮挡或快速运动场景中出现误差;仅覆盖咖啡制作场景,泛化到其他复杂任务仍需扩展;模型在关系推理和程序推断方面仍存在不足,未来需引入更强的时序建模和多模态融合技术。

通俗解读 非专业人士也能看懂

想象你在厨房里准备咖啡。每次你拿起咖啡豆、放入研磨机、按下按钮,整个过程都可以被看作一场复杂的舞蹈。研究人员就像是用一台超级相机,把每个动作、每个物体的位置、它们之间的关系都拍下来,画成一张详细的地图。这个地图不仅告诉你谁在做什么,还能告诉你这些动作是怎么连接在一起的,比如先倒咖啡粉,再压紧,然后放入机器。通过这样的详细地图,电脑可以学会像人一样理解整个咖啡制作的流程,甚至在没有提前告诉它的情况下,自己判断下一步该做什么。这就像是教会机器人看懂厨房的每个细节,让它变得更聪明、更会自己做事。

简单解释 像给14岁少年讲一样

嘿,你知道吗?想象你在厨房里做咖啡。你会用手拿咖啡豆、放到研磨机里,然后按按钮,最后倒出香喷喷的咖啡。现在,科学家们也在试图让电脑学会像你一样理解这个过程。他们用一种特别的方法,把每个动作、每个物体的位置都画成一张超级详细的地图,就像你画的流程图一样。这张地图告诉电脑:谁在做什么,谁和谁有关系,动作是怎么连接的。这样,电脑就能学会看懂整个咖啡制作的步骤,甚至帮你提醒下一步该做什么。就像让机器人变得更聪明,能自己理解厨房里的事情一样。是不是很酷?

原文摘要

Scene understanding is central to general physical intelligence, and video is a primary modality for capturing both state and temporal dynamics of a scene. Yet understanding physical processes remains difficult, as models must combine object localization, hand-object interactions, relational parsing, temporal reasoning, and step-level procedural inference. Existing benchmarks usually evaluate these capabilities separately, limiting diagnosis of why models fail on procedural tasks. We introduce BARISTA, a densely annotated egocentric dataset and benchmark of 185 real-world coffee-preparation videos covering fully automatic, portafilter-based, and capsule-based workflows. BARISTA provides verified per-frame scene graphs linking persistent object identities to masks, tracks, boxes, attributes, typed relations, hand-object interactions, activities, and process steps. From these graphs, we derive zero-shot language-based tasks spanning phrase grounding, hand-object interaction recognition, referring, activity recognition, relation extraction, and temporal visual question answering. Experiments reveal strong variation across task families and no consistently dominant model family, positioning BARISTA as a challenging diagnostic benchmark for procedural video understanding. Code and dataset available at https://huggingface.co/datasets/ramblr/BARISTA.

cs.CV