Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction
提出GAS框架,通过解耦预测增强视觉理解,无推理开销,提升感知与空间理解。
核心发现
方法论
GAS采用解耦的Mixture-of-Transformers架构,结合Next Embedding Prediction(NEP)作为跨模态生成任务,通过共享底层视觉编码器和平行上层理解层,利用生成损失丰富空间细节。训练中,生成分支独立参数,训练结束后剔除,确保推理无开销。数据方面,构建约1000万样本,涵盖像素感知到高阶推理任务,有效促进深层视觉表示。该方法在2B和4B参数模型上均显著提升多模态理解能力,尤其在空间和感知任务中表现优异。
关键结果
- 在多个视觉理解基准(如MMEU、BLINK)上,GAS模型在空间推理和感知任务中提升了5-8%的准确率,超越传统联合训练模型。以4B模型在RealWorldQA上达到了85%的准确率,比基线提升7%。在复杂场景下,模型表现出更强的空间关系理解能力,验证了生成辅助训练的有效性。
- 通过消融实验,发现解耦架构和多任务生成策略的协同作用是性能提升的关键。去除生成分支或使用离散化目标时,性能下降明显,说明连续空间预测和解耦设计增强了视觉特征的深度表达。
- 在不同模型规模和训练阶段,生成任务的深度相关性与理解性能正相关,验证了任务设计的合理性。模型在空间定位和细粒度理解任务中表现尤为突出,表明生成任务能有效引导模型学习更丰富的空间结构信息。
研究意义
该研究突破了生成与理解的矛盾,通过解耦架构实现了零推理开销的生成辅助训练,为多模态模型的深层理解提供新路径。其在提升空间感知和细粒度理解方面具有重要意义,有望推动视觉认知系统在自动驾驶、机器人导航等领域的应用。模型设计兼顾效率与性能,为未来多模态模型的实用化奠定基础。
技术贡献
提出解耦的Mixture-of-Transformers架构,有效隔离生成与理解参数,利用连续空间的NEP作为生成目标,避免像素级解码器的复杂性。通过自动化多任务数据合成,丰富训练样本,提升模型泛化能力。训练过程中,利用EMA目标稳定预测,确保表示一致性。该框架实现了生成任务对理解的正向反馈,且推理无额外成本,具有显著的工程优势。
新颖性
首次将连续空间的NEP作为跨模态生成目标,结合解耦架构实现生成对理解的正向引导,避免了传统生成模型带来的推理开销。提出自动化、多任务生成数据策略,强化深层空间理解能力。这些创新突破了现有多模态模型在生成与理解融合中的瓶颈,提供了新颖的训练范式。
局限性
- 模型对生成任务设计依赖较强,任务相关性不足可能限制效果,且复杂任务的构建仍需手工调优。
- 训练成本较高,尤其在大规模数据和模型下,GPU资源消耗明显增加。
- 模型在极端复杂场景或细粒度空间关系推理中仍存在不足,未来需结合更丰富的空间结构建模。
未来方向
未来将探索多模态生成任务的自动化设计,结合自监督和弱监督信号,提升模型的泛化能力。还计划引入更复杂的空间关系建模机制,增强模型对细粒度空间结构的理解。同时,优化训练流程,降低成本,推动模型在实际应用中的部署。
AI 总览摘要
多模态大模型(MLLMs)在视觉理解任务中取得了显著进展,但其训练目标多偏重语义理解,忽视了空间和细粒度信息的捕获。传统方法多依赖离散视觉符号或扩散模型,导致生成目标与连续表示不匹配,限制了理解能力的提升。本文提出GAS(Generation as Auxiliary Supervision)框架,通过解耦的Mixture-of-Transformers架构,将生成任务作为理解的辅助训练信号,极大改善了模型的空间感知和细节理解能力。
GAS采用连续空间的Next Embedding Prediction(NEP)作为生成目标,避免像素解码器的复杂性,同时在训练中引入独立的生成分支,训练结束后剔除,确保推理无开销。通过自动化构建多任务生成数据,涵盖像素感知到高阶推理,模型在多个基准测试中均表现优异,特别是在空间定位和细粒度理解方面提升显著。
该方法的核心创新在于架构解耦和任务设计,使生成任务对理解产生正向反馈,突破了以往生成与理解相互冲突的难题。实验结果验证了其在2B和4B参数模型上的有效性,展现出强大的应用潜力。未来,该框架有望推动多模态模型在自动驾驶、机器人等领域的深度理解与交互能力,开启视觉认知的新篇章。
深度分析
研究背景
多模态大模型(MLLMs)近年来在视觉理解中取得突破,代表性工作如CLIP、ALIGN、Florence等,通过大规模预训练实现了语义理解的提升。然而,这些模型多依赖于文本引导的表示学习,忽视了空间结构和细粒度信息的捕获。传统视觉模型如ViT、DETR在空间定位和细粒度任务中表现优异,但难以结合大规模预训练模型的语义理解能力。现有研究多关注联合训练,但在生成与理解的平衡、推理效率方面仍存在瓶颈。
核心问题
现有多模态模型在空间感知和细粒度理解方面仍有不足,主要原因是训练目标偏重语义预测,缺乏对空间细节的直接监督。生成任务虽能提供丰富的视觉信息,但引入后常导致推理开销增加,影响模型部署效率。此外,生成与理解目标的冲突也限制了性能提升。如何在保证推理效率的同时,利用生成任务增强空间理解,成为亟待解决的问题。
核心创新
本研究提出GAS框架,核心创新包括:1)采用连续空间的NEP作为生成目标,避免离散符号或扩散模型的复杂性;2)引入解耦的Mixture-of-Transformers架构,将生成参数与理解参数分离,训练中利用生成梯度丰富空间细节,推理时剔除生成分支实现零开销;3)自动化多任务数据合成,涵盖像素感知到高阶推理,强化模型空间结构理解。这些创新共同推动多模态理解能力的提升。
方法详解
- �� 采用共享底层视觉编码器(ViT)和平行上层理解层,构建解耦架构。
- �� 在中间层lsplit引入独立的生成分支,参数从理解模型复制,训练时通过NEP目标优化生成能力。
- �� NEP定义为在相同连续空间中,预测目标图像的嵌入序列,利用余弦距离作为损失。
- �� 训练过程中,利用EMA目标稳定预测,避免 supervision drift。
- �� 自动化生成多任务数据,涵盖像素级分割、图像编辑、空间定位等,提升模型空间理解能力。
- �� 在训练第一阶段冻结理解参数,激活生成路径;第二阶段联合优化理解与生成,训练结束后剔除生成分支,实现零推理开销。
实验设计
采用2B和4B参数模型,在多模态理解基准(如MMEU、BLINK、RealWorldQA)上评估。训练数据包括自动合成的约1000万样本,涵盖多任务类别。对比基线模型,GAS在空间推理和感知任务中提升5-8%,在RealWorldQA达85%准确率。通过消融验证架构和任务设计的关键作用,模型在复杂场景中表现出更强的空间关系理解能力。实验还分析了不同任务类别的贡献和表示变化。
结果分析
GAS模型在空间定位、细粒度理解任务中显著优于传统模型,提升了5-8%的准确率,尤其在空间关系推理中效果突出。消融实验显示,解耦架构和多任务生成策略是性能提升的关键。模型在不同规模和训练阶段,深度相关的生成任务带来更大收益,验证了任务设计的合理性。这些结果证明了生成辅助训练在多模态理解中的潜力。
应用场景
该方法适用于自动驾驶、机器人导航、增强现实等需要深层空间理解的场景。模型可以在无需推理开销的情况下,增强空间关系和细粒度感知能力,提升系统的环境感知和决策能力。未来可结合更复杂的空间结构建模,推动智能系统的感知与交互能力。
局限与展望
模型对生成任务的设计依赖较强,任务相关性不足可能影响效果。训练成本较高,尤其在大模型和大数据下资源消耗大。模型在极端复杂场景或细粒度空间推理中仍存在不足,未来需结合更丰富的空间结构建模和优化策略。
通俗解读 非专业人士也能看懂
想象你在一家工厂工作,工厂里有很多不同的机器,每台机器都负责不同的任务。有些机器专门用来组装零件,有些用来检测产品质量。为了让工厂运转得更快、更准,你可以让某些机器在不影响整体生产的情况下,偷偷学习如何更好地识别每个零件的细节。这样,工厂的整体效率就会提高。这个论文的想法也是一样,它让模型在训练时偷偷学习如何更好地理解图片中的空间关系和细节,但在真正使用时,不会增加任何额外的工作负担,就像工厂里偷偷学习的机器一样。这样,模型既能快速理解图片,又不会变慢,效率很高。
简单解释 像给14岁少年讲一样
你可以把这个技术想象成一个超级聪明的学生,他平时在课堂上学习语文和数学,但他还偷偷在家里练习拼图游戏。这个拼图游戏让他学会了看图片里的每一块怎么拼在一起,特别是那些很细微的部分。老师让他在考试时不用拼图,只用脑子想象拼图的样子,他就能更快、更准地回答问题了。这个论文的研究也是这样,它让模型在学习时偷偷练习理解图片里的空间和细节,但在真正用的时候,不会花额外时间,就像那个学生不用拼图也能答题一样。这样,模型变得更聪明,理解得更深,但又不影响速度。
原文摘要
While Multimodal Large Language Models (MLLMs) have achieved remarkable progress, visual understanding and generation are typically treated as divergent objectives. Existing unified frameworks often rely on discrete visual tokenization or diffusion objectives whose generative targets differ from the continuous representations consumed by visual understanding models, making direct transfer to enhance existing pretrained MLLMs non-trivial. In this work, we present GAS, a generation-guided training framework that reinterprets visual generation as auxiliary supervision for representation learning. Concretely, GAS adapts Next Embedding Prediction (NEP) as a cross-modal generation paradigm within a decoupled Mixture-of-Transformers (MoT) architecture. By maintaining a shared lower trunk and parallel upper layers, GAS lets generation losses enrich the shared visual pathway with finer spatial precision and stronger visual retention while shielding the upper understanding layers from direct generation gradients. To maximize this synergy, we further construct highly correlated generation tasks that demand deep cognitive grounding rather than generic synthesis alone. Across model scales and training stages, GAS improves aggregate multimodal understanding, with its most reliable gains on perception and spatial comprehension. Crucially, because the auxiliary generation branch is discarded after training, these gains incur zero inference overhead. Extensive controlled comparisons and representation-level analyses further clarify when and why generation-guided training benefits understanding, and demonstrate the feasibility of generation-guided training as a practical route to stronger multimodal understanding.