MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models

TL;DR

提出MOSAIC自动搜索异构架构,结合线性、稀疏和低秩机制,显著提升视觉-语言模型效率。

cs.CV 🔴 高级 2026-07-10 41 次浏览
Yuncheng Yang Feiyang Ye Shixian Luo Yinna Zhu Lianlei Shan Wangcai Zhao Kuo Zhang Yan Chen Yong Wu Yan Xie
视觉-语言模型 神经架构搜索 异构Transformer 硬件感知优化 多目标优化

核心发现

方法论

MOSAIC通过定义包含多种机制(线性、稀疏、低秩等)的统一搜索空间,采用多目标混合整数规划(MIP)优化模型结构。在搜索过程中,结合块级局部蒸馏初始化候选模块,利用多能力评分评估模块性能,并通过多目标优化在硬件延迟约束下找到最优配置。参数恢复采用两阶段策略:全局离策略蒸馏稳定内部表征,随后双教师在策略蒸馏中结合235B大模型和原始4B模型,确保性能和稳定性。

关键结果

  • 在多个视觉-语言任务中,MOSAIC-4B模型性能与原始4B模型持平,训练成本降低至不到2%。
  • 推理速度显著提升,预填充速度达1.76倍,解码速度达2.54倍,达成高效推理。
  • 在Qwen3-VL-4B-Instruct基础上,模型实现了性能匹配与推理加速的双重突破,有效平衡了模型复杂度与硬件适配性。

研究意义

该研究突破了异构Transformer架构设计的自动化瓶颈,显著提升多模态模型在硬件上的部署效率。通过多目标优化框架,解决了手工设计的静态混合模式难以适应不同硬件平台的问题,为大规模多模态模型的普及提供了技术支撑。这不仅推动了视觉-语言理解的研究前沿,也为边缘设备上的高效推理奠定基础,具有深远的行业影响。

技术贡献

首次提出基于多目标混合整数规划的自动异构架构搜索方法,集成多种高效机制(线性、稀疏、低秩)于统一空间。引入块级局部蒸馏与两阶段参数恢复策略,有效缓解结构变换带来的性能损失。模型在保持性能的同时,极大提升了推理效率,降低训练成本,展示了硬件感知模型优化的潜力。

新颖性

本研究首次将多目标优化框架应用于视觉-语言模型的异构架构自动搜索,突破了手工静态设计的限制。区别于传统NAS只关注模型大小或单一性能指标,MOSAIC同时优化多项指标,兼顾硬件延迟和模型能力,具有创新性。

局限性

  • 当前方法依赖于预定义的机制池,可能限制探索空间的多样性。
  • 模型结构调整仍需一定的搜索时间,尽管低于端到端训练成本。
  • 对极端硬件平台的适应性尚需进一步验证。

未来方向

未来将扩展机制池,加入更多高效算子,提升搜索多样性。探索端到端联合训练与搜索的结合,减少参数恢复阶段的依赖。推动模型在边缘设备和特定硬件平台上的实时部署,增强实际应用能力。

AI 总览摘要

随着多模态应用的快速发展,视觉-语言模型(VLMs)在自动驾驶、智能助手等场景中扮演着核心角色。传统的同质Transformer架构虽然性能优异,但在长序列处理和硬件部署方面面临巨大挑战,主要因自注意力机制的二次复杂度限制。近年来,研究者开始探索异构结构,将线性、稀疏和低秩机制融入模型中,以提升效率和推理速度,但多为手工设计,缺乏自动化优化手段。

本论文提出MOSAIC,一种基于多目标混合整数规划的自动架构搜索方法,旨在将同质模型转化为硬件感知的异构架构。通过定义包含多种机制的统一搜索空间,结合块级局部蒸馏初始化候选模块,利用多能力评分评估性能,并在硬件延迟约束下优化结构配置。引入两阶段参数恢复策略,有效缓解结构变换带来的性能损失。

在Qwen3-VL-4B-Instruct基础上,MOSAIC-4B模型实现了性能与原模型持平,同时推理速度提升至1.76倍预填充和2.54倍解码速度,训练成本降低至不到2%。这一创新不仅提升了多模态模型的硬件适应性,也为未来自动化架构优化提供了新思路。尽管如此,模型仍需在更极端硬件环境中验证其适应性,未来将扩展机制池,结合端到端训练,推动模型在边缘设备上的高效部署。

深度分析

研究背景

多模态模型的发展经历了从纯文本到融合视觉信息的演变,Transformer架构成为主流。早期如BERT、GPT在自然语言处理中的成功,促使视觉-语言模型(VLMs)采用类似架构,代表有LXMERT、ViLT、UNITER。随着模型规模扩大,性能不断提升,但自注意力机制的二次复杂度成为瓶颈,限制模型在长序列和边缘硬件上的应用。为解决这一问题,研究者提出线性注意力(如Linear Transformers、Performer)、稀疏机制(如Sparse Transformers)和低秩逼近(如Low-Rank Attention),有效降低计算复杂度。近年来,异构架构逐渐兴起,将不同机制结合,提升效率和性能平衡,如Jamba、InfiniteVL等,但多为手工设计,缺乏自动化优化工具。神经架构搜索(NAS)技术的发展,为模型结构自动优化提供可能,但多针对单一任务或模型规模,少涉及多模态场景的异构结构自动搜索。本文在此基础上,提出结合多目标优化的自动异构架构搜索,为多模态模型硬件适应性带来新突破。

核心问题

现有异构Transformer架构多依赖手工设计的静态混合模式,难以在不同硬件平台上实现最优性能。手工调优耗时长,缺乏系统性,且难以满足硬件特定的延迟和算力约束。模型结构的静态配置限制了模型在不同应用场景中的适应性,尤其在长序列处理和边缘设备部署中表现不佳。如何自动化搜索出既满足硬件约束,又能最大化模型性能的异构架构,成为亟待解决的关键问题。

核心创新

本研究提出多目标混合整数规划(MIP)框架,自动搜索多机制(线性、稀疏、低秩)融合的异构Transformer架构。创新点包括:• 定义统一搜索空间,支持多机制的层级选择;• 利用块级局部蒸馏初始化候选模块,减少搜索成本;• 设计多能力评分体系,全面评估模块性能;• 采用多目标优化在硬件延迟限制下找到最优结构;• 引入两阶段参数恢复策略,缓解结构变换带来的性能损失。这些创新使模型在保持性能的同时,实现了极高的推理效率和硬件适应性。

方法详解

  • �� 定义多机制的统一搜索空间,涵盖标准全注意力、线性注意力(如KDA、GDN)、稀疏注意(SWA)和低秩机制(MLA),每层可独立选择。
  • �� 采用块级局部蒸馏(BLD)对候选模块进行初始化,确保每个模块与教师模型输出对齐,降低搜索难度。
  • �� 设计多能力评分指标(如Perplexity、KL散度、任务性能)评估每个候选模块,建立能力集。
  • �� 构建多目标混合整数规划(MIP)模型,将结构选择问题转化为优化任务,目标为最大化多能力指标,同时满足硬件延迟约束。
  • �� 利用Tchebycheff标量化方法求解多目标问题,得到Pareto最优结构。
  • �� 通过两阶段参数恢复:先全局离策略蒸馏稳定模型内部表征,再双教师策略蒸馏结合大模型和原始教师,确保性能恢复。
  • �� 最终模型在多个任务上验证,性能与原始模型持平,推理速度大幅提升。

实验设计

采用Qwen3-VL-4B-Instruct作为基础模型,构建36层变体,定义五种注意机制和七种FFN缩放配置,组合形成3536个候选架构。通过块级蒸馏初始化候选模块,利用多能力评分筛选优质模块,再用多目标MIP优化结构配置。模型在多个视觉-语言任务(如图像理解、问答)上进行评估,比较性能、延迟和训练成本。实验还包括消融分析,验证不同机制的贡献和搜索策略的有效性。训练采用大规模图像-文本配对和多模态数据集,硬件延迟目标设定为特定值,确保模型满足实际部署需求。

结果分析

MOSAIC-4B模型在多个任务中表现与原始4B模型一致,平均性能提升不超过1%。推理速度显著提升,预填充速度达1.76倍,解码速度达2.54倍,训练成本降低至原模型的2%以下。模型结构的自动化搜索显著优于手工设计的静态混合模式,验证了多目标优化的有效性。消融实验显示,机制多样性和能力评分体系对性能提升起到关键作用。整体结果表明,自动化异构架构搜索能在硬件约束下实现性能最大化,为多模态模型的高效部署提供新路径。

应用场景

该方法适用于需要在边缘设备或特定硬件平台上部署的多模态应用,如智能助手、自动驾驶视觉系统和工业检测。模型可根据硬件特性自动调整架构,实现低延迟和高效率。未来,结合端到端训练,将进一步提升模型在实际场景中的表现,推动多模态AI的普及。

局限与展望

目前方法依赖预定义机制池,可能限制探索空间多样性。搜索过程仍需一定时间,尽管低于端到端训练成本。模型在极端硬件环境下的适应性尚未充分验证,未来需扩展机制池,优化搜索算法,提升泛化能力。

通俗解读 非专业人士也能看懂

想象你在做一道复杂的菜肴,厨房里有不同的厨具和食材。传统做法是用同一种锅和调料,虽然简单,但效率不高,也难以适应不同的菜肴。现在,假设你可以根据每道菜的需要,自动选择最合适的厨具和调料组合,这样既能保证菜的味道,又能节省时间。这就像这篇论文里的方法——它能自动为模型选择最合适的“厨具组合”,让模型在不同硬件上既快又好吃(准确)。它用一种智能的“菜单规划”方法,找到最优的搭配方案,既保证性能,又节省资源,就像厨师根据菜肴调整用料一样。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的拼图游戏,有很多不同的拼图块可以用,但每个块的形状和颜色都不一样。你想用最少的时间拼出最漂亮的图案,但每次用不同的拼图块可能会让拼图变得不稳定或者不漂亮。这个论文就像是发明了一种智能助手,它能帮你自动选择最合适的拼图块组合,让你既能快速拼好,又能拼出最漂亮的图案。它会考虑每个拼图块的特点,还会根据你的目标(比如速度和美观)来调整选择。这样,你不用自己试来试去,就能得到最棒的拼图方案。这就像给模型装上了一个聪明的“拼图助手”,让它在不同的硬件上都能表现得又快又准!

原文摘要

Vision-Language Models (VLMs) have achieved success using homogeneous Transformers to process multimedia data. Recent studies show that heterogeneous structures interleaving efficient mechanisms, like linear attention, improve both performance and inference latency over homogeneous designs. However, these efforts rely on handcrafted static mixing patterns, which are sub-optimal and difficult to adapt to specific hardware. To bridge this gap, we propose Multi-Objective Search for Adaptive Inter-layer Composition (MOSAIC), a hardware-aware search method that automatically transforms homogeneous models into optimized heterogeneous architectures. MOSAIC integrates diverse efficiency mechanisms--including linear, sparse, and low-rank operators--into a unified search space. By formulating the selection as a multi-objective Mixed Integer Programming (MIP) problem, our method identifies optimal configurations that maximize downstream performance under strict hardware latency constraints. To mitigate performance degradation from structural transitions, we introduce a two-stage parameter recovery process: global off-policy distillation to stabilize internal representations, followed by a dual-teacher on-policy distillation leveraging a 235B oracle for knowledge expansion and the original 4B teacher for distributional stability. We validate MOSAIC through MOSAIC-4B, derived from Qwen3-VL-4B-Instruct. Results demonstrate that MOSAIC-4B matches the baseline's performance across multiple benchmarks while requiring less than 2% of the original training cost. Furthermore, it substantially improves inference efficiency, achieving 1.76x prefilling and 2.54x decoding speedups.

cs.CV