OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs

TL;DR

提出OmniAssistBench,基于逆向工程构建多轮交互视频数据集,评估Omni-LLMs的多模态交互能力。

cs.CV 🟡 进阶级 2026-08-22 73 次浏览
Xianyun Sun Chaoyou Fu Zhengye Zhang Feiyang Duan Qingyuan Cao Yonghui Niu Sihang Yuan Ge Zhang Caifeng Shan
多模态大模型 交互评估 数据集构建 视频理解 人机交互

核心发现

方法论

该研究通过逆向工程现有互联网视频,推导用户目标和路径先验,设计多轮交互场景。构建包括基础和高级两个层级的任务,涵盖社交、时间、指示等多模态理解能力。数据由专家手工标注,模拟连续交互,确保路径唯一性,避免路径偏差。采用视频编辑和语音合成嵌入用户提问,模拟真实交互环境。评估使用Gemini-3-Pro和Qwen3-Omni-Instruct模型,采用多维评分指标,反映模型在视觉提示、长时记忆和延迟反应等方面的不足。

关键结果

  • Gemini-3-Pro模型得分66.4(满分100),Qwen3-Omni-Instruct得分51.2,显示当前模型在多模态交互中的表现仍有较大提升空间。
  • 模型在视觉提示(如手势)理解、长时上下文保持和延迟响应方面表现不足,特别是在多轮复杂场景中容易遗忘用户目标。
  • 实验验证了路径先验引导策略的有效性,但模型仍难以应对未预设路径的多样化交互,显示出模型在真实场景中的局限性。

研究意义

该研究填补了多模态大模型在连续交互场景中的评估空白,为未来开发更可靠的智能助手提供了基准。通过逆向工程构建高质量数据集,有助于推动模型在复杂、多轮、多模态任务中的理解与响应能力提升,具有重要的学术和工业价值。

技术贡献

提出基于逆向工程的视频内容推导路径先验的交互数据构建方法,设计了两层次任务体系,结合专家标注与视频编辑,创新性地模拟连续交互场景。引入多维评分指标,系统评估模型在视觉理解、上下文保持和延迟反应等方面的能力,为多模态交互模型的研究提供了新思路。

新颖性

首次系统性利用逆向工程从互联网视频中构建多轮交互数据集,结合路径先验确保路径一致性,突破了传统静态数据集无法模拟动态交互的限制,推动了多模态交互模型的评估体系创新。

局限性

  • 数据构建依赖专家手工标注,耗时长,难以规模化推广。
  • 模型在视觉提示和长时记忆方面仍表现不足,难以应对复杂场景。
  • 未充分覆盖所有潜在交互路径,未来需引入多样化路径训练。

未来方向

未来将结合自动化标注技术,扩展多路径交互场景;优化模型在视觉提示和长时记忆中的表现;探索多模态融合与推理机制,提升模型的交互鲁棒性和适应性。

AI 总览摘要

随着多模态大模型(Omni-LLMs)的快速发展,其在实时视频交互中的潜力逐渐显现。传统视频理解任务多关注静态内容分析,难以满足动态、多轮交互的需求。本文提出了OmniAssistBench,一个基于逆向工程的多轮交互视频数据集,旨在评估模型在复杂场景中的表现。通过从互联网视频中推导用户目标和路径先验,结合专家手工标注和视频编辑,构建了涵盖基础感知和高级交互能力的任务体系。

该方法确保路径唯一性,有效模拟连续交互过程,避免路径偏差带来的评估偏差。评估结果显示,最先进模型Gemini-3-Pro得分66.4(满分100),而开源模型Qwen3-Omni-Instruct得分51.2,揭示当前模型在视觉提示理解、上下文保持和延迟反应方面的不足。研究发现,模型在多轮复杂场景中易遗忘用户目标,缺乏长时记忆和适时响应能力。

该工作不仅为多模态交互模型提供了标准化评估平台,也为未来模型的优化提供了明确方向。未来将结合自动化数据生成技术,丰富交互路径,提升模型在真实场景中的适应性和鲁棒性。整体来看,OmniAssistBench推动了多模态大模型在连续交互中的研究,为智能助手的实际应用奠定基础。

深度分析

研究背景

多模态大模型(Omni-LLMs)近年来取得显著进展,代表性工作包括GPT-4、PaLM-E等,主要聚焦静态内容理解。随着应用场景向实时交互扩展,模型需融合视觉、语音和文本信息,支持多轮动态交互。传统视频理解多为被动分析,难以模拟交互中的因果关系。现有评估多依赖静态问答,缺乏连续性和动态性,限制模型在实际场景中的表现。构建高质量、多轮交互数据集成为关键瓶颈,亟需创新方法以模拟真实交互流程。

核心问题

现有评估体系无法反映模型在连续、多模态、多轮交互中的能力,尤其在视觉提示理解、上下文记忆和延迟响应方面表现不足。静态数据集无法动态调整输入,难以覆盖所有交互路径,导致模型在实际应用中表现不佳。此外,缺乏标准化的评估框架限制了模型性能的客观比较。这些问题阻碍了多模态大模型的进一步发展,亟需构建能模拟真实交互场景的评估平台。

核心创新

提出基于逆向工程的视频内容推导路径先验,确保交互路径唯一性,避免偏差。设计两层任务体系,基础任务涵盖感知能力,高级任务聚焦复杂目标导向交互。结合专家手工标注与视频编辑,模拟连续、多轮交互,提升数据真实性。引入多维评分指标,系统评估模型在视觉提示、上下文保持和延迟反应的能力,突破传统静态评估的局限。创新在于路径先验的引入和多层次任务设计,为多模态交互模型提供了全新评估思路。

方法详解

  • �� 逆向工程:筛选互联网视频,推导用户目标和路径先验。• 任务设计:分为基础感知和高级交互两层,涵盖社交、时间、指示等能力。• 数据标注:专家手工设计问答对,确保路径唯一性。• 视频编辑:嵌入语音提问和视觉提示,模拟连续交互。• 评分体系:结合语义相似度和关键点匹配,客观评价模型表现。• 模型评估:使用Gemini-3-Pro和Qwen3-Omni-Instruct,分析视觉提示理解、上下文记忆和延迟反应能力。

实验设计

采用300个多轮交互视频,涵盖7大任务和16子任务,配合专家标注的问答对。模型在不同任务中表现差异明显,Gemini-3-Pro得分66.4,Qwen3-Omni-Instruct得分51.2。通过消融实验验证路径先验的有效性,分析模型在视觉提示(如手势)和长时记忆中的不足。多轮复杂场景中,模型易遗忘用户目标,响应不及时,验证了评估体系的有效性和模型的改进空间。

结果分析

模型在视觉提示理解方面表现不足,尤其在手势识别上准确率低于70%。长时记忆保持能力有限,模型在多轮交互中遗忘早期目标。延迟响应方面,模型常提前或过早回答,影响交互自然性。整体评分显示,当前模型仍难以满足复杂场景的需求,未来需在多模态融合和记忆机制上突破。

应用场景

该评估平台可用于开发更智能、更可靠的实时视频助手,广泛应用于智能家居、辅助驾驶、远程教育等场景。模型需具备多模态理解、连续记忆和延迟响应能力,才能满足实际需求。未来,结合自动化数据生成,将推动模型在复杂、多变环境中的应用落地。

局限与展望

数据构建依赖专家手工,耗时长,难以快速扩展。模型在视觉提示和长时记忆方面仍表现不足,难以应对多样化场景。未来需引入自动化标注和多路径训练,提升模型鲁棒性和适应性。

通俗解读 非专业人士也能看懂

想象你在一家厨房里做饭。每次你需要准备食材、按照步骤操作,还要记住之前做过的事情。传统方法就像只看菜谱,告诉你每一步,但不能根据你手边的食材变化调整。现在的智能助手就像一个聪明的厨师,不仅知道菜谱,还能根据你厨房里的情况实时指导你。这个研究就是在教电脑怎么像厨师一样,边看视频边帮你做饭,确保每一步都正确,记住你之前做过的事情,还能等你准备好再回答问题。它用一种特殊的方法,把很多厨房视频拆开,模拟你和厨师的对话,帮你学会做各种菜肴。

简单解释 像给14岁少年讲一样

想象你在学校参加一个科学实验,你需要跟老师和同学们一起完成一系列步骤。每次你问问题,老师会根据你的问题和之前的实验情况给你答案,但如果你没有记住之前的内容,可能会搞错。这个研究就像在教电脑如何在实验中帮你记住每个步骤,理解你说的话,还能等你准备好再回答。它用一种特别的方法,把很多实验视频拆成一段段,让电脑学会像人一样跟你互动。虽然现在还不完美,但未来它会变得更聪明,能帮你做更复杂的事情,就像一个真正的助手一样。

原文摘要

Recent omni-modal large language models (Omni-LLMs) show great potential as real-time video assistants, which continuously perceive environments and guide users to achieve specific goals. Unlike traditional passive video understanding, interactive assistants should actively combine visual states, user goals, and prior knowledge to provide effective help. Evaluating this is rather challenging, as the model's unpredictable response dynamically changes the user's subsequent actions, which static offline datasets cannot accommodate. To address this bottleneck, we introduce OmniAssistBench. To solve the issue of diverging interaction paths where the same user goal can be achieved through various methods, we provide models with predefined priors derived from the source video, requiring them to guide users along the exact same routes. Since real interaction videos are rare, we construct the dataset by reverse-engineering existing Internet videos. We deduce logical user goals and segment the videos into multi-turn clips to simulate continuous interactions. This rigorous pipeline required over 1000 expert person-hours to build the dataset. Results show that the proprietary Gemini-3-Pro reaches 66.4 out of the max point of 100, while the open-source Qwen3-Omni-Instruct achieves 51.2. Although current models generally understand user inputs, they frequently provide incorrect or incomplete answers. Specifically, they struggle with visual prompts (e.g., hand gestures), fail to maintain historical context during multi-turn interactions, and fail to delay response until the target event. Results indicate substantial room for improvement before models can become reliable assistants.

cs.CV