LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models

TL;DR

LLaDA MoE v2通过混合专家扩散语言模型,在23.5T数据上训练,接近Qwen3表现。

cs.AI 🔴 高级 2026-08-04 2 次浏览
Fengqi Zhu Shaoxuan Xu Jingyang Ou Zebin You Yipeng Xing Huabin Liu Xiaolu Zhang Jun Zhou Zhenzhong Lan Yankai Lin Wayne Xin Zhao Jianguo Li Chongxuan Li Ji-Rong Wen
扩散模型 混合专家 语言模型 深度学习 自然语言处理

核心发现

方法论

研究采用混合专家扩散语言模型(MoE dLLM),通过调整优化超参数、计算分配和架构设计,系统性地研究其扩展行为。具体来说,优化中,最佳批量大小随计算增长更快,而最佳学习率衰减更快。模型-数据分配中,IsoFLOP分析显示最佳token预算增长快于激活的模型计算。架构上,较大规模更倾向于更大的专家池,适度的专家粒度始终有效。

关键结果

  • LLaDA MoE v2在23.5T tokens上训练,使用约Qwen3预训练tokens的65%,在多个知识、推理和编码基准上接近Qwen3。
  • 在七个推理和编码基准上,经过监督微调后,LLaDA MoE v2优于SDAR Chat。
  • 实验表明,较大的专家池和适度的专家粒度在不同规模上保持有效。

研究意义

该研究为混合专家扩散语言模型提供了实用的扩展法则和设计原则,填补了该领域的研究空白。通过系统性地研究优化超参数、计算分配和架构设计的扩展行为,研究为未来大规模语言模型的设计提供了重要指导。

技术贡献

LLaDA MoE v2展示了与现有自回归模型不同的扩展趋势,提供了新的理论保障和工程可能性。研究揭示了混合专家架构在扩散语言模型中的独特优势,尤其是在计算分配和架构设计方面。

新颖性

该研究首次系统性地研究了混合专家扩散语言模型的扩展行为,与传统自回归模型的扩展趋势不同。其核心创新在于揭示了优化超参数和计算分配的独特扩展规律。

局限性

  • 在某些任务上,LLaDA MoE v2与Qwen3仍有差距,尤其是在中文知识基准上。
  • 模型的计算成本较高,可能限制实际应用。

未来方向

未来研究可以探索更高效的计算分配策略和架构设计,以进一步提高模型性能。此外,研究可以扩展到更多任务和语言,以验证其通用性。

AI 总览摘要

LLaDA MoE v2通过混合专家扩散语言模型(MoE dLLM)提供了一种替代自回归语言模型的方法。研究系统性地研究了优化超参数、计算分配和架构设计的扩展行为,揭示了与自回归模型不同的扩展趋势。

在实验中,LLaDA MoE v2在23.5T tokens上训练,使用约Qwen3预训练tokens的65%,在多个知识、推理和编码基准上接近Qwen3。经过监督微调后,LLaDA MoE v2在七个推理和编码基准上优于SDAR Chat。

该研究为混合专家扩散语言模型提供了实用的扩展法则和设计原则,填补了该领域的研究空白。未来研究可以探索更高效的计算分配策略和架构设计,以进一步提高模型性能。

深度分析

研究背景

近年来,大规模语言模型在自然语言处理领域取得了显著进展。自回归模型通过逐步预测下一个token来生成文本,然而其扩展性受到限制。扩散语言模型(dLLMs)提供了一种新的生成方法,通过迭代去噪过程并行解码多个token。混合专家模型(MoE)通过引入多个专家模块,显著提高了模型的计算效率和扩展能力。

核心问题

尽管混合专家模型在自回归语言模型中取得了成功,但其在扩散语言模型中的扩展行为尚不明确。研究需要系统性地探讨优化超参数、计算分配和架构设计在扩散语言模型中的作用,以揭示其独特的扩展规律。

核心创新

研究首次系统性地研究了混合专家扩散语言模型的扩展行为。通过分析优化超参数、计算分配和架构设计,研究揭示了与自回归模型不同的扩展趋势。这些发现为未来大规模语言模型的设计提供了重要指导。

方法详解

  • �� 采用混合专家扩散语言模型(MoE dLLM)
  • �� 系统性地分析优化超参数、计算分配和架构设计的扩展行为
  • �� 使用IsoFLOP分析揭示模型-数据分配的最佳策略
  • �� 通过实验验证不同规模下的专家池和专家粒度的有效性

实验设计

实验在23.5T tokens上训练LLaDA MoE v2,使用约Qwen3预训练tokens的65%。基准测试包括多个知识、推理和编码任务。模型在推理和编码基准上与Qwen3和SDAR Chat进行比较,以验证其性能。

结果分析

LLaDA MoE v2在多个基准上接近Qwen3,尤其是在推理和编码任务上。经过监督微调后,模型在七个推理和编码基准上优于SDAR Chat。这些结果表明,混合专家架构在扩散语言模型中的独特优势。

应用场景

混合专家扩散语言模型可以应用于自然语言处理的多个领域,包括自动文本生成、机器翻译和智能问答系统。其高效的计算分配策略和架构设计使其在大规模数据处理任务中具有显著优势。

局限与展望

尽管LLaDA MoE v2在多个任务上表现优异,但在某些中文知识基准上仍与Qwen3存在差距。此外,模型的计算成本较高,可能限制其在实际应用中的推广。未来研究可以探索更高效的计算策略以降低成本。

通俗解读 非专业人士也能看懂

想象一个大型工厂,里面有许多不同的专家,每个专家负责不同的任务。传统的工厂只能让一个专家逐个完成任务,而LLaDA MoE v2就像一个智能工厂,可以同时让多个专家合作完成任务。这种合作方式大大提高了效率,使得工厂能够更快地完成生产任务。

简单解释 像给14岁少年讲一样

想象你在玩一个大型多人在线游戏,每个玩家都有自己的技能。传统游戏里,玩家需要一个个完成任务,而LLaDA MoE v2就像一个超级团队,能让多个玩家同时合作完成任务。这种合作让游戏更快更有趣!

术语表

扩散语言模型 (Diffusion Language Model)

一种通过迭代去噪过程生成文本的模型,允许并行解码多个token。

在论文中用于替代自回归模型的方法。

混合专家 (Mixture-of-Experts)

一种通过引入多个专家模块来提高模型计算效率的架构。

用于扩展语言模型的计算能力。

IsoFLOP分析

一种用于分析模型-数据分配策略的技术,帮助确定最佳计算分配。

用于揭示最佳token预算和模型计算的增长趋势。

自回归模型 (Autoregressive Model)

一种通过逐步预测下一个token生成文本的模型。

与扩散语言模型对比的传统方法。

监督微调 (Supervised Fine-Tuning)

一种通过额外标注数据微调模型以提高特定任务性能的方法。

用于提高LLaDA MoE v2在推理和编码任务上的表现。

开放问题 这项研究留下的未解疑问

  • 1 如何在不增加计算成本的情况下进一步提高模型性能?目前的方法在某些任务上表现仍不理想。
  • 2 混合专家扩散语言模型在多语言任务中的表现如何?需要更多研究来验证其通用性。

应用场景

近期应用

智能问答系统

利用LLaDA MoE v2的高效计算能力,开发更智能的问答系统,提高用户体验。

远期愿景

自动文本生成

在未来,LLaDA MoE v2可以用于大规模自动文本生成,推动内容创作行业的变革。

原文摘要

Diffusion language models (dLLMs) offer an alternative to autoregressive (AR) language modeling, yet the scaling behavior of Mixture-of-Experts (MoE) dLLMs remains poorly understood. We systematically characterize how optimization hyperparameters, compute allocation, and architecture scale for MoE dLLMs, identifying quantitative differences from scaling trends previously reported for AR models. Specifically, for optimization, the optimal nominal batch size grows faster, while the optimal learning rate decays more rapidly with compute. For model--data allocation, IsoFLOP analysis reveals a slight data-side tilt: the optimal token budget grows faster than activated model-side computation. For MoE architecture, larger scales increasingly favor larger expert pools at fixed activated capacity, while moderate expert granularity remains consistently effective and the preferred fraction of activated capacity assigned to shared experts remains stable across scales. Guided by these findings, we train LLaDA MoE v2, a 30B-A3B dLLM, from scratch on 23.5T tokens. With approximately 65\% as many pretraining tokens as Qwen3, LLaDA MoE v2 approaches Qwen3 on several knowledge, reasoning, and coding benchmarks. After supervised fine-tuning alone, it outperforms SDAR Chat on seven of eight reasoning and coding benchmarks and remains close to Qwen3 on several tasks. These results establish practical scaling laws and design principles for MoE dLLMs.

cs.AI