MOSS-VL Technical Report
MOSS-VL是一款支持实时交互的开源视觉-语言模型,采用门控交叉注意力实现感知与生成同步,参数11.3B。
核心发现
方法论
该模型采用基于门控交叉注意力机制的架构,视觉编码器为27层Transformer,初始化自Qwen3-VL,文本解码器为48层,结合XRoPE三轴位置编码。训练策略包括四阶段预训练(视觉-语言对齐、大规模多模态预训练、高质量微调、长序列训练)及两阶段微调(标准指令微调与实时交互微调)。模型通过合成的实时交互语料 supervision,学习何时发言、保持沉默或修正回复。模型在离线和流媒体场景均表现优异,参数11.3B,视觉token未进入解码序列,提升时间-首词比(TFF)优势。
关键结果
- 离线,MOSS-VL-Instruct在时间推理视频集(Minerva、TOMATO、VideoMME-Logical)表现优异,领先多数开源模型。
- 在四个流媒体基准测试中,MOSS-VL-Realtime在三项中取得最高平均分(66.0),在OmniMMI Proactive Alerting中超越最佳基线37.5分。
- 随着视觉上下文增加,模型在时间-首词优势由2.8倍提升至5.1倍,显示出对视觉信息的高效利用。
研究意义
该研究突破了实时交互场景下视觉-语言模型的能力瓶颈,实现感知与生成的同步,推动智能助手、交互机器人等应用的发展。其创新架构和训练策略为未来多模态实时系统提供了技术基础,有望改善人机交互的自然性和响应速度。
技术贡献
提出门控交叉注意力机制,有效隔离视觉信息进入解码序列,结合XRoPE实现多轴位置编码,显著提升模型的感知-生成同步能力。训练中引入合成交互语料,优化响应时序控制,整体架构支持多模态长序列处理与实时推理。模型参数规模达11.3B,视觉token未进入解码序列,优化推理效率。
新颖性
首次在视觉-语言模型中引入门控交叉注意力机制,结合多轴位置编码实现感知与生成的同步。模型在实时交互场景中表现出优异的主动响应能力,突破了传统离线或延迟响应的限制,展现出强大的实时感知与生成能力。
局限性
- 模型在极端场景下的响应准确性仍受限,尤其在复杂动态场景中可能出现误判。
- 高参数规模带来较大计算成本,实时推理对硬件要求较高。
- 合成交互语料虽丰富,但在真实场景中的泛化能力仍需验证。
未来方向
未来将探索更高效的模型架构以降低计算成本,增强模型对复杂场景的理解能力。同时,计划引入强化学习优化响应策略,提升自主交互的自然度与准确性,推动多模态实时系统的广泛应用。
AI 总览摘要
随着人工智能技术的不断发展,支持实时交互的多模态视觉-语言模型成为研究热点。传统模型多在离线场景中表现优异,但在实时交互中存在响应延迟和感知不足的问题。为此,OpenMOSS团队提出了MOSS-VL系列模型,特别是支持感知与生成同步的L5能力。该模型采用门控交叉注意力机制,确保视觉信息在生成过程中持续感知,结合XRoPE多轴位置编码,显著提升多模态信息的时序理解能力。
模型架构由27层视觉编码器和48层语言解码器组成,参数总数达11.3B。训练策略包括四阶段预训练(对齐、多模态预训练、高质量微调、长序列训练)及两阶段微调(指令微调与实时交互微调),通过合成的交互语料 supervision,学习何时发言、何时保持沉默、何时修正回复。模型在离线和流媒体场景中均表现出色,尤其在主动响应和时间敏感任务中优于现有开源模型。
在四个流媒体基准测试中,MOSS-VL-Realtime在三项中获得最高平均分,超越了传统模型的响应速度和主动性。参数规模虽大,但视觉token未进入解码序列,提升了推理效率。未来,模型将继续优化计算效率,增强复杂场景理解能力,推动多模态智能助手的广泛应用。这一突破为实现更自然、更高效的人机交互提供了坚实基础。
深度分析
研究背景
多模态视觉-语言模型经历了从离线理解到实时交互的演变。早期模型如VisualBERT、LXMERT主要关注静态图像理解,随后VideoBERT、VideoLLaMA引入视频理解能力。现有模型多在离线场景中表现优异,但缺乏同步感知与生成能力,限制了在动态交互中的应用。近年来,流媒体模型如ALBEF、Florence尝试实现连续输入,但仍未解决感知与生成的同步问题。随着智能助手、交互机器人需求增长,实时感知能力成为研究重点。
核心问题
核心挑战在于如何在生成过程中持续感知视觉信息,实现响应的及时性和准确性。传统模型在生成时会“盲”着视觉输入,导致响应滞后或信息遗漏。实现感知与生成的同步,要求模型在保持高效推理的同时,能动态感知场景变化。这不仅涉及模型架构创新,还需训练策略优化,尤其是在复杂、多变的场景中保持鲁棒性。
核心创新
本研究提出门控交叉注意力机制,有效隔离视觉信息,确保视觉感知在生成过程中持续进行。结合XRoPE多轴位置编码,模型能准确捕捉多模态信息的时间关系。训练中引入合成交互语料,模拟实时场景,学习何时发言、何时沉默、何时修正回复。这一架构突破了传统模型的限制,实现了感知与生成的同步,显著提升主动响应能力。
方法详解
- �� 视觉编码器:27层Transformer,处理高分辨率图像/视频,提取多层特征。• 文本解码器:48层,结合自注意力和门控交叉注意力,确保视觉信息不进入解码序列。• 门控交叉注意力:在每四层中引入,利用tanh门控机制隔离视觉信息。• XRoPE位置编码:在跨注意力中引入三轴(时间、行、列)位置编码,明确多模态时间关系。• 训练策略:四阶段预训练(对齐、多模态预训练、高质量微调、长序列训练),以及指令微调和实时交互微调。• 合成交互语料:模拟实时场景,学习响应时序,包括沉默、发言、修正。• 视觉-文本同步:通过绝对时间戳和缓存机制,实现视觉信息的持续感知。
实验设计
模型在离线场景中通过多种时间推理视频集(Minerva、TOMATO、VideoMME-Logical)验证,优于对比模型。在流媒体基准测试中,模型在四项中三项获得最高平均分(66.0),在主动响应任务中表现优异。参数效率方面,视觉token未进入解码序列,推理速度提升显著。 Ablation研究显示门控机制和XRoPE位置编码对性能提升关键。模型在不同视觉上下文长度下表现稳定,验证其强大感知能力。
结果分析
模型在离线任务中表现优异,领先多个开源模型。在流媒体任务中,平均得分达66.0,明显优于基线37.5。在视觉上下文增加时,时间-首词优势由2.8倍提升至5.1倍,显示出极高的感知效率。参数规模虽大,但推理延迟控制良好,验证了架构设计的有效性。这些结果表明模型在主动响应和时间敏感任务中具有巨大潜力。
应用场景
该模型可广泛应用于智能助手、交互机器人、视频监控等场景,支持实时场景理解和主动响应。只需配备标准GPU硬件,即可实现高效推理。未来还可结合强化学习优化响应策略,提升交互自然度,推动多模态交互系统的商业化落地。
局限与展望
模型在极端复杂场景中的表现仍有限,尤其在快速变化或遮挡严重的环境中可能出现误判。高参数规模带来较大硬件成本,实时推理对硬件要求较高。此外,合成语料虽丰富,但在真实场景中的泛化能力仍需验证,未来需引入更多真实数据进行微调。
通俗解读 非专业人士也能看懂
想象你在一个厨房里做饭。厨师(模型)需要同时看着食材(视觉信息)和听着指令(语言),在烹饪过程中不断调整。传统厨师只看完所有食材后才开始做菜(离线模型),而你希望厨师能一边看食材一边做饭,随时根据变化调整(实时交互)。MOSS-VL就像这样一个厨师,能同时“看”和“说”,不断感知厨房的变化,及时回应不同的需求。这种能力让机器人或智能助手能更自然、更灵活地与人互动,像个真正懂事的厨师一样。
简单解释 像给14岁少年讲一样
想象你在玩一个超级复杂的拼图游戏,你需要不停地看着拼图块(视觉信息),同时告诉朋友你拼到哪了(语言输出)。普通的机器人只能看完全部拼图后再说话(离线模型),但你希望它能一边看一边说,甚至在拼图还在变的时候就开始描述。MOSS-VL就像这样一个聪明的伙伴,它能在拼图过程中不断观察,随时调整自己的描述,变得更聪明、更贴心。它用一种特别的“门控”方法,确保每次说话都基于最新的拼图状态,就像你在游戏中不断观察和调整一样。这让它在和人交流时变得更自然、更及时。
原文摘要
We present MOSS-VL, an open vision-language model family that treats real-time interaction -- perceiving while it speaks -- as a first-class capability. It is co-designed across the stack: the language decoder attends to vision only through gated cross-attention, so the model can naturally see incoming frames while generating; a synthesized interaction corpus supervises when to speak, when to stay silent, and when to revise; and a staged curriculum concentrates all real-time-specific training in one light final stage over a strong offline foundation. Offline, MOSS-VL-Instruct is competitive at comparable scale and leads temporal-reasoning video sets. Across four streaming benchmarks, MOSS-VL-Realtime posts the best average on three (second on the fourth) among open-source streaming models, sweeping the three subsets that squarely test proactive behavior -- 66.0 vs. 37.5 for the best baseline on OmniMMI Proactive Alerting. With 11.3B parameters but visual tokens outside the decoded sequence, MOSS-VL widens its time-to-first-token advantage over same-backbone Qwen3-VL-8B from 2.8x to 5.1x as visual context grows. We release all five checkpoints, the training curriculum, and the real-time inference code at https://github.com/OpenMOSS/MOSS-VL.