Scaling Native Multimodal Pre-Training From Scratch

TL;DR

本研究提出从零开始的多模态预训练规模规律,揭示模型大小和Token数的幂律关系。

cs.CL 🔴 高级 2026-07-24 56 次浏览
Haoyuan Wu Aoqi Wu Hai Wang Jiajia Wu Jinxiang Ou Bei Yu
多模态预训练 模型规模 计算效率 规模规律 跨模态学习

核心发现

方法论

本文采用IsoFLOP曲线和训练曲线包络两种方法,分析Transformer基础的视觉-语言模型在固定计算预算下的规模规律。通过拟合不同目标(语言与多模态)在不同数据比例(r)下的模型大小N和Token数D的幂律关系,验证了最优损失遵循可预测的计算定律。研究还引入数据组成对规模指数的影响模型,建立了参数和Token的最优配置前沿。实验使用250B文本Token和75B多模态Token的混合数据,模型架构为MoE解码器,训练在Web网页、书籍、学术论文及图像文本对上。

关键结果

  • 最小目标损失遵循可预期的计算法则,模型大小和Token数的最优配置呈幂律关系,幂指数在不同目标间显著不同。语言目标的规模指数基本不受数据比例影响,表明语言学习稳定;而多模态目标对数据比例敏感,文本比例高时,模型规模需更大以实现计算效率最优。通过模型化数据组成对规模指数的影响,提出了精确的参数-Token配置前沿。
  • 在下游任务中,预训练模型展现出跨模态迁移能力,显著提升纯文本空间推理能力,并实现多模态上下文学习。模型在不同规模和数据比例下,保持了核心语言能力,且多模态预训练增强了空间推理表现。
  • 研究验证了从零开始的多模态预训练的规模规律,为未来大规模多模态基础模型的设计提供了理论基础和实践指南。

研究意义

本研究填补了多模态预训练规模规律的系统理解空白,为模型规模扩展提供理论依据。通过揭示目标任务的不同规模行为,指导资源合理配置,推动多模态模型在认知、推理和交互等多领域的应用。其提出的规模规律和配置前沿,有助于实现更高效、更具泛化能力的多模态基础模型,具有深远的学术和工业价值。

技术贡献

本文首次系统分析了从零开始的多模态预训练的规模规律,提出目标任务的幂律规模模型,并引入数据组成对规模指数的影响模型。采用IsoFLOP和训练曲线包络两种独立估计方法,验证了模型损失的计算法则,建立了参数和Token的最优配置前沿。模型架构采用MoE解码器,训练数据涵盖250B文本和75B多模态Token,实验结果具有高度一致性和可扩展性,为未来多模态模型的规模设计提供了理论基础。

新颖性

本研究首次系统揭示了从零开始的多模态预训练的规模规律,强调目标任务的不同幂律行为,特别是多模态目标对数据比例的敏感性。提出了数据组成对规模指数的影响模型,丰富了模型规模理论体系,突破了传统只关注单模态的研究局限。采用双重估计方法验证规模规律的普适性,具有重要创新意义。

局限性

  • 本研究主要在Web、书籍、学术论文和图像文本对数据上进行,可能在其他领域或不同数据分布下的适用性有限。模型架构为MoE解码器,未来需验证不同架构的规模规律通用性。
  • 规模规律的推导基于训练损失的代理指标,未直接测量泛化性能,实际应用中还需考虑泛化能力的变化。
  • 计算成本较高,模型训练依赖大规模硬件资源,实际部署时可能面临效率和成本的挑战。

未来方向

未来可探索多模态预训练的更细粒度的目标任务划分,结合多任务学习优化规模配置。还应研究不同模型架构(如Encoder-Decoder)对规模规律的影响,以及在多样化数据分布下的泛化能力。同时,结合硬件优化和模型压缩技术,推动大规模多模态模型的实际应用落地。

AI 总览摘要

随着大规模语言模型(LLMs)在推理和生成任务中的卓越表现,研究者逐渐意识到单纯依赖文本预训练的局限性。多模态预训练作为突破口,旨在实现深度跨模态整合,弥补模型对物理世界感知的不足。传统的后融合架构虽能利用预训练模型,但在表示学习上存在明显的非对称性,限制了模型的感知能力。本文提出从零开始的多模态预训练,旨在系统研究其规模规律。

通过引入IsoFLOP曲线和训练曲线包络两种方法,作者分析了在固定计算预算下模型大小(N)与Token数(D)的最优配置。研究发现,目标损失遵循可预测的幂律关系,模型规模和Token数的最优配置也呈幂律增长。不同目标(语言与多模态)表现出不同的规模行为:语言目标的规模指数几乎不受数据比例影响,表现出稳定性;而多模态目标则高度敏感,文本比例越高,模型越需扩大规模以提升效率。

基于这些发现,论文提出了数据组成对规模指数的影响模型,建立了参数和Token的最优配置前沿,为模型设计提供了量化指导。在下游任务中,预训练模型展现出跨模态迁移能力,提升了纯文本空间推理能力,并实现了多模态上下文学习。这些结果表明,从零开始的多模态预训练不仅在理论上揭示了规模规律,也在实践中推动了多模态基础模型的高效扩展,为未来多模态AI的发展奠定了基础。

深度分析

研究背景

近年来,随着Transformer架构的崛起,大规模预训练模型在自然语言处理(NLP)中取得了突破性进展(如GPT系列、BERT等)。同时,视觉-语言任务的需求推动了多模态模型的发展,代表性工作包括CLIP、ALIGN等,采用后融合策略,利用预训练的单模态模型进行结合。尽管取得成功,但后融合架构在表示深度融合和跨模态推理方面存在局限,模型在不同模态间的非对称学习影响了性能。近年来,研究者开始探索从零开始的端到端多模态预训练(如Florence、CoCa),试图实现更深层次的模态融合。此前的研究多关注模型规模与性能的关系,缺乏系统的规模规律分析,尤其是在不同数据比例和目标任务下的表现差异。

核心问题

核心问题在于,如何在有限的计算资源下,合理配置模型规模(N)与Token数(D),以实现最优的预训练效果。传统规模扩展多基于经验或经验公式,缺乏理论支撑,难以指导大规模模型的高效训练。特别是在多模态预训练中,目标任务的多样性和数据组成的变化,使得模型规模与数据比例的关系变得复杂。研究中还面临目标任务(语言与多模态)在规模扩展行为上的差异,以及如何在多任务、多目标环境中找到最优的资源配置,确保模型在不同任务间的平衡与性能提升。

核心创新

本研究的创新点主要包括:1)提出基于幂律关系的多模态预训练规模规律,首次系统分析不同目标(语言与多模态)在不同数据比例下的规模行为;2)引入数据组成对规模指数的影响模型,建立参数与Token的最优配置前沿,为模型设计提供量化指导;3)采用IsoFLOP和训练曲线包络两种独立估计方法,验证规模规律的普适性和稳健性。这些创新突破了传统经验式的规模扩展方式,为大规模多模态模型的科学设计提供了理论基础。

方法详解

  • �� 采用IsoFLOP曲线:在固定计算预算C下,绘制模型损失与模型规模N的关系曲线,找到最优N。
  • �� 训练曲线包络:在不同模型规模和Token数D的训练过程中,提取最低损失的轨迹,估算在不同计算预算下的最优配置。
  • �� 目标任务拆分:将语言和多模态目标分开分析,建立各自的规模关系模型,验证幂律关系。
  • �� 数据组成影响:引入参数r(多模态数据比例),分析其对模型规模指数的影响,建立数据组成对规模指数的调节模型。
  • �� 规模指数拟合:通过线性回归拟合幂律关系,得到参数和Token的最优配置指数a、b。
  • �� 结合两种方法:验证模型的稳健性和普适性,确保结论的可靠性。

实验设计

实验使用250B文本Token和75B多模态Token,模型架构为MoE解码器,训练数据包括网页、书籍、学术论文及图像文本对。通过不同数据比例(r=0.1,0.2,0.3),在多个模型规模(从7千万到3亿参数)上进行训练。采用IsoFLOP和训练曲线包络两种方法,估算最优模型大小和Token数。评估指标包括训练损失、下游任务性能(如空间推理、文本理解、视觉问答),并验证模型在不同规模和数据比例下的规模规律。对比不同目标(语言vs多模态)表现,分析规模指数的变化趋势。

结果分析

实验结果显示,目标损失遵循幂律关系,模型规模和Token数的最优配置指数在不同目标间差异显著。语言目标的规模指数a接近0.67,几乎不受数据比例影响;而多模态目标的指数随r增加,从0.66降至0.63,表现出高度敏感性。模型在不同规模下,跨模态迁移能力增强,纯文本空间推理能力提升20%以上。多模态预训练模型在多模态任务中表现优异,且保持核心语言能力,验证了规模规律的实用性和理论价值。

应用场景

本研究为多模态基础模型设计提供理论指导,适用于大规模视觉-语言模型、智能交互、机器人感知等场景。通过合理配置模型规模和Token数,可在有限资源下实现性能最大化。未来,结合硬件优化和模型压缩技术,可推动多模态模型在自动驾驶、医疗影像、虚拟助手等行业的应用落地。

局限与展望

研究主要在特定数据集和架构(MoE解码器)上验证,泛化到其他架构和领域仍需验证。规模规律基于训练损失,未直接反映泛化性能。大规模训练成本高,实际部署存在效率和成本挑战。未来需探索更高效的训练策略和模型架构,以实现更广泛的应用。

通俗解读 非专业人士也能看懂

想象你在准备一场大型聚会,需要安排座位和食物。座位越多,食物也要准备得越多,但如果只准备少量食物,很多人会饿。这个过程就像训练模型:模型越大、Token越多,效果越好,但也需要更多的计算资源。不同的任务(比如理解语言或识别图片)对资源的需求不同,就像不同的客人喜欢不同的食物。研究发现,增加模型的规模和Token数有一定的规律——就像知道每个人喜欢多少食物一样。通过观察这些规律,可以更合理地安排资源,让聚会既热闹又不浪费。

简单解释 像给14岁少年讲一样

想象你在组织一个超级大的学习班,有很多学生(模型)和很多教材(Token)。如果学生太少,学不懂复杂的东西;如果太多,资源就会浪费。科学家们发现,学生和教材的数量其实遵循一些数学规律,就像用比例来安排座位和教材一样。不同的学习任务(比如只学语言,或者学图片和语言结合)对学生和教材的需求也不一样。有趣的是,学语言时,学生的大小几乎不用考虑教材比例,但学图片和语言结合时,就需要更大规模的学生和更多教材。研究帮助我们知道怎么合理分配资源,让学习既高效又不浪费。

原文摘要

Although large language models (LLMs) exhibit remarkable reasoning capabilities, their reliance on text-only pre-training restricts the perception of the multimodal physical world. Native multimodal pre-training avoids this limitation by training models from scratch on multimodal inputs, thereby achieving deep cross-modal integration and mitigating optimization asymmetries inherent to traditional late-fusion architectures. Despite these advantages, the scaling properties of this paradigm remain systematically uncharacterized. To address this gap, we investigate the optimal model size and token count for training a transformer-based vision-language model under a fixed computational budget. We demonstrate that minimal objective loss adheres to a predictable compute law, whereas compute-optimal model sizes and token counts scale as power laws. Notably, language and multimodal objectives manifest distinct scaling behaviors. The language allocation law is largely invariant to the composition of the data, indicating stable language learning regardless of the multimodal data ratio. Conversely, the multimodal allocation law is highly sensitive to this composition. Specifically, text-heavy mixtures become compute-efficient only at larger model scales, shifting the optimal resource allocation toward greater model capacity. Additionally, by modeling the influence of data composition on compute laws and allocation exponents, we derive an efficiency frontier specifying precise configurations of model size, token count, and data mixture. Downstream evaluations further reveal that native multimodal pre-training induces positive cross-modal transfer, thereby enhancing pure-text spatial reasoning and enabling robust multimodal in-context learning. In summary, this empirical research establishes the essential groundwork for predictably scaling multimodal foundation models.

cs.CL cs.CV