MOSS-VL Technical Report

TL;DR

MOSS-VL是一款支持实时交互的开源视觉-语言模型,采用门控交叉注意力实现感知与生成同步,参数11.3B。

cs.CV 🔴 高级 2026-08-15 42 次浏览
Pengyu Wang Chenkun Tan Shaojun Zhou Qirui Zhou Yanxin Chen Xingyang He Huazheng Zeng Jijun Cheng Chenghao Wang Xiaomeng Qian Pengfei Wang Zhan Huang Shanqing Gao Wei Huang Longjun Cao Wu Ran Jie Liu Changtai Zhu Hongkai Wang Yixian Tian Chenghao Liu Zhen Ye Xinghao Wang Botian Jiang Guoguo Feng Zhaoye Fei Ruixiao Li Mingshu Chen Yang Gao Qinyuan Cheng Shimin Li Xipeng Qiu
视觉-语言模型 实时交互 多模态学习 门控交叉注意力 时间感知

核心发现

方法论

该模型采用基于门控交叉注意力机制的架构,视觉编码器为27层Transformer,初始化自Qwen3-VL,文本解码器为48层,结合XRoPE三轴位置编码。训练策略包括四阶段预训练(视觉-语言对齐、大规模多模态预训练、高质量微调、长序列训练)及两阶段微调(标准指令微调与实时交互微调)。模型通过合成的实时交互语料 supervision,学习何时发言、保持沉默或修正回复。模型在离线和流媒体场景均表现优异,参数11.3B,视觉token未进入解码序列,提升时间-首词比(TFF)优势。

关键结果

  • 离线,MOSS-VL-Instruct在时间推理视频集(Minerva、TOMATO、VideoMME-Logical)表现优异,领先多数开源模型。
  • 在四个流媒体基准测试中,MOSS-VL-Realtime在三项中取得最高平均分(66.0),在OmniMMI Proactive Alerting中超越最佳基线37.5分。
  • 随着视觉上下文增加,模型在时间-首词优势由2.8倍提升至5.1倍,显示出对视觉信息的高效利用。

研究意义

该研究突破了实时交互场景下视觉-语言模型的能力瓶颈,实现感知与生成的同步,推动智能助手、交互机器人等应用的发展。其创新架构和训练策略为未来多模态实时系统提供了技术基础,有望改善人机交互的自然性和响应速度。

技术贡献

提出门控交叉注意力机制,有效隔离视觉信息进入解码序列,结合XRoPE实现多轴位置编码,显著提升模型的感知-生成同步能力。训练中引入合成交互语料,优化响应时序控制,整体架构支持多模态长序列处理与实时推理。模型参数规模达11.3B,视觉token未进入解码序列,优化推理效率。

新颖性

首次在视觉-语言模型中引入门控交叉注意力机制,结合多轴位置编码实现感知与生成的同步。模型在实时交互场景中表现出优异的主动响应能力,突破了传统离线或延迟响应的限制,展现出强大的实时感知与生成能力。

局限性

  • 模型在极端场景下的响应准确性仍受限,尤其在复杂动态场景中可能出现误判。
  • 高参数规模带来较大计算成本,实时推理对硬件要求较高。
  • 合成交互语料虽丰富,但在真实场景中的泛化能力仍需验证。

未来方向

未来将探索更高效的模型架构以降低计算成本,增强模型对复杂场景的理解能力。同时,计划引入强化学习优化响应策略,提升自主交互的自然度与准确性,推动多模态实时系统的广泛应用。

AI 总览摘要

随着人工智能技术的不断发展,支持实时交互的多模态视觉-语言模型成为研究热点。传统模型多在离线场景中表现优异,但在实时交互中存在响应延迟和感知不足的问题。为此,OpenMOSS团队提出了MOSS-VL系列模型,特别是支持感知与生成同步的L5能力。该模型采用门控交叉注意力机制,确保视觉信息在生成过程中持续感知,结合XRoPE多轴位置编码,显著提升多模态信息的时序理解能力。

模型架构由27层视觉编码器和48层语言解码器组成,参数总数达11.3B。训练策略包括四阶段预训练(对齐、多模态预训练、高质量微调、长序列训练)及两阶段微调(指令微调与实时交互微调),通过合成的交互语料 supervision,学习何时发言、何时保持沉默、何时修正回复。模型在离线和流媒体场景中均表现出色,尤其在主动响应和时间敏感任务中优于现有开源模型。

在四个流媒体基准测试中,MOSS-VL-Realtime在三项中获得最高平均分,超越了传统模型的响应速度和主动性。参数规模虽大,但视觉token未进入解码序列,提升了推理效率。未来,模型将继续优化计算效率,增强复杂场景理解能力,推动多模态智能助手的广泛应用。这一突破为实现更自然、更高效的人机交互提供了坚实基础。

深度分析

研究背景

多模态视觉-语言模型经历了从离线理解到实时交互的演变。早期模型如VisualBERT、LXMERT主要关注静态图像理解,随后VideoBERT、VideoLLaMA引入视频理解能力。现有模型多在离线场景中表现优异,但缺乏同步感知与生成能力,限制了在动态交互中的应用。近年来,流媒体模型如ALBEF、Florence尝试实现连续输入,但仍未解决感知与生成的同步问题。随着智能助手、交互机器人需求增长,实时感知能力成为研究重点。

核心问题

核心挑战在于如何在生成过程中持续感知视觉信息,实现响应的及时性和准确性。传统模型在生成时会“盲”着视觉输入,导致响应滞后或信息遗漏。实现感知与生成的同步,要求模型在保持高效推理的同时,能动态感知场景变化。这不仅涉及模型架构创新,还需训练策略优化,尤其是在复杂、多变的场景中保持鲁棒性。

核心创新

本研究提出门控交叉注意力机制,有效隔离视觉信息,确保视觉感知在生成过程中持续进行。结合XRoPE多轴位置编码,模型能准确捕捉多模态信息的时间关系。训练中引入合成交互语料,模拟实时场景,学习何时发言、何时沉默、何时修正回复。这一架构突破了传统模型的限制,实现了感知与生成的同步,显著提升主动响应能力。

方法详解

  • �� 视觉编码器:27层Transformer,处理高分辨率图像/视频,提取多层特征。• 文本解码器:48层,结合自注意力和门控交叉注意力,确保视觉信息不进入解码序列。• 门控交叉注意力:在每四层中引入,利用tanh门控机制隔离视觉信息。• XRoPE位置编码:在跨注意力中引入三轴(时间、行、列)位置编码,明确多模态时间关系。• 训练策略:四阶段预训练(对齐、多模态预训练、高质量微调、长序列训练),以及指令微调和实时交互微调。• 合成交互语料:模拟实时场景,学习响应时序,包括沉默、发言、修正。• 视觉-文本同步:通过绝对时间戳和缓存机制,实现视觉信息的持续感知。

实验设计

模型在离线场景中通过多种时间推理视频集(Minerva、TOMATO、VideoMME-Logical)验证,优于对比模型。在流媒体基准测试中,模型在四项中三项获得最高平均分(66.0),在主动响应任务中表现优异。参数效率方面,视觉token未进入解码序列,推理速度提升显著。 Ablation研究显示门控机制和XRoPE位置编码对性能提升关键。模型在不同视觉上下文长度下表现稳定,验证其强大感知能力。

结果分析

模型在离线任务中表现优异,领先多个开源模型。在流媒体任务中,平均得分达66.0,明显优于基线37.5。在视觉上下文增加时,时间-首词优势由2.8倍提升至5.1倍,显示出极高的感知效率。参数规模虽大,但推理延迟控制良好,验证了架构设计的有效性。这些结果表明模型在主动响应和时间敏感任务中具有巨大潜力。

应用场景

该模型可广泛应用于智能助手、交互机器人、视频监控等场景,支持实时场景理解和主动响应。只需配备标准GPU硬件,即可实现高效推理。未来还可结合强化学习优化响应策略,提升交互自然度,推动多模态交互系统的商业化落地。

局限与展望

模型在极端复杂场景中的表现仍有限,尤其在快速变化或遮挡严重的环境中可能出现误判。高参数规模带来较大硬件成本,实时推理对硬件要求较高。此外,合成语料虽丰富,但在真实场景中的泛化能力仍需验证,未来需引入更多真实数据进行微调。

通俗解读 非专业人士也能看懂

想象你在一个厨房里做饭。厨师(模型)需要同时看着食材(视觉信息)和听着指令(语言),在烹饪过程中不断调整。传统厨师只看完所有食材后才开始做菜(离线模型),而你希望厨师能一边看食材一边做饭,随时根据变化调整(实时交互)。MOSS-VL就像这样一个厨师,能同时“看”和“说”,不断感知厨房的变化,及时回应不同的需求。这种能力让机器人或智能助手能更自然、更灵活地与人互动,像个真正懂事的厨师一样。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的拼图游戏,你需要不停地看着拼图块(视觉信息),同时告诉朋友你拼到哪了(语言输出)。普通的机器人只能看完全部拼图后再说话(离线模型),但你希望它能一边看一边说,甚至在拼图还在变的时候就开始描述。MOSS-VL就像这样一个聪明的伙伴,它能在拼图过程中不断观察,随时调整自己的描述,变得更聪明、更贴心。它用一种特别的“门控”方法,确保每次说话都基于最新的拼图状态,就像你在游戏中不断观察和调整一样。这让它在和人交流时变得更自然、更及时。

原文摘要

We present MOSS-VL, an open vision-language model family that treats real-time interaction -- perceiving while it speaks -- as a first-class capability. It is co-designed across the stack: the language decoder attends to vision only through gated cross-attention, so the model can naturally see incoming frames while generating; a synthesized interaction corpus supervises when to speak, when to stay silent, and when to revise; and a staged curriculum concentrates all real-time-specific training in one light final stage over a strong offline foundation. Offline, MOSS-VL-Instruct is competitive at comparable scale and leads temporal-reasoning video sets. Across four streaming benchmarks, MOSS-VL-Realtime posts the best average on three (second on the fourth) among open-source streaming models, sweeping the three subsets that squarely test proactive behavior -- 66.0 vs. 37.5 for the best baseline on OmniMMI Proactive Alerting. With 11.3B parameters but visual tokens outside the decoded sequence, MOSS-VL widens its time-to-first-token advantage over same-backbone Qwen3-VL-8B from 2.8x to 5.1x as visual context grows. We release all five checkpoints, the training curriculum, and the real-time inference code at https://github.com/OpenMOSS/MOSS-VL.

cs.CV