Looped Diffusion Language Models

TL;DR

提出LoopMDM,通过选择性循环早中层Transformer层,显著提升训练效率和推理性能,节省3.3倍FLOPs。

cs.LG 🔴 高级 2026-05-26 50 次浏览
Sanghyun Lee Chunsan Hong Seungryong Kim Jonghyun Lee Jongho Park Dongmin Park
深度学习 扩散模型 Transformer 模型压缩 推理优化

核心发现

方法论

本文提出LoopMDM架构,利用选择性循环早中层Transformer层,结合随机循环次数训练策略,实现深度等效的重复计算。通过在不同预训练语料(如OpenWebText、LM1B、FineWeb-Edu)上实验,比较非循环模型与循环模型的训练FLOPs和性能。采用特定位置(第1-2层)循环,结合多次推理时动态调整循环次数,有效提升模型训练效率和推理灵活性。核心算法为基于噪声调度的Masked Diffusion,结合共享参数的循环Transformer,优化了模型的参数利用率和信息交互。

关键结果

  • 在多语料上,LoopMDM在相同参数规模下,训练FLOPs节省达3.3倍,性能与非循环模型持平甚至优越,特别在GSM8K数学推理任务中提升8.5点准确率。
  • 在推理阶段,增加循环次数显著改善生成质量,最大提升达+8.5点,且通过自适应调整循环数,兼顾效率与性能。
  • 通过注意力分析发现,循环促进掩码位置间的交互,增强模型的推理能力,尤其在中间噪声水平下效果最优。

研究意义

该研究突破了传统深度扩展的局限,通过参数共享和选择性循环,有效模拟更深网络的表达能力,显著降低训练成本,推动Masked Diffusion模型在大规模文本生成和推理任务中的应用。其提出的动态推理策略,为未来模型的自适应推理提供新思路,具有重要的学术和工业价值。

技术贡献

首次将循环机制引入Masked Diffusion语言模型,提出选择性循环策略,结合随机循环训练,提升训练效率和推理灵活性。模型架构设计支持在不增加参数的情况下实现深度等效的重复计算,结合注意力机制分析,揭示循环促进掩码位置交互的机制,为模型设计提供新范式。

新颖性

本工作首次系统性引入选择性层循环到MDMs中,突破了传统深度扩展的限制。通过在训练和推理中动态调整循环次数,实现了参数高效的深度模拟,显著优于纯堆叠层的深度模型,开创了Diffusion模型的深度优化新路径。

局限性

  • 当前方法对循环位置和层数较敏感,需精细调节参数以达到最佳效果,可能影响模型的泛化能力。
  • 在极端循环次数下,模型可能出现性能下降,且训练过程复杂,调参成本较高。
  • 模型在某些任务(如长文本生成)中的适应性仍需验证,未来需结合更复杂的噪声调度策略。

未来方向

未来将探索多层次、多位置循环结合的架构,结合自适应噪声调度和多任务训练,进一步提升模型的泛化能力和推理效率。同时,结合稀疏注意力和模型剪枝技术,降低推理成本,推动大规模Diffusion模型的实用化。

AI 总览摘要

随着深度学习模型规模的不断扩大,训练成本和推理效率成为制约其实际应用的关键因素。传统的堆叠深层Transformer虽然能提升模型表达能力,但带来参数膨胀和计算负担。本文提出LoopMDM架构,通过在早中层引入选择性循环,实现深度等效的重复计算,显著降低训练FLOPs(节省达3.3倍),同时在推理时通过动态调节循环次数,提升模型的灵活性和效率。

实验结果显示,LoopMDM在多个预训练语料上表现优异,不仅在训练效率上优于非循环模型,还在数学推理任务(如GSM8K)中提升8.5点准确率。更重要的是,模型通过注意力机制分析,揭示了循环促进掩码位置间交互的机制,增强了模型的推理能力。

该方法的核心创新在于选择性层循环和随机循环训练策略,突破了传统深度模型的参数瓶颈,为未来大规模Diffusion模型的设计提供了新思路。未来,结合自适应噪声调度和稀疏注意力,将进一步推动模型的实用化和推广应用。

深度分析

研究背景

近年来,扩散模型在图像和文本生成中取得突破,Masked Diffusion Models(MDMs)逐渐成为替代自回归模型的有力候选。通过噪声调度和变换器架构,提升了生成质量和训练效率。代表性工作如Dream、Seed Diffusion等,推动模型规模不断扩大,但仍面临训练成本高、推理速度慢等挑战。传统深层模型虽能提升性能,但参数膨胀严重,难以部署。近年来,循环结构在自回归模型中被用以参数共享和深度模拟,但在MDMs中的探索较少,尚未充分利用其潜力。

核心问题

现有MDMs在追求性能的同时,训练成本居高不下,尤其是在大规模模型中。深层堆叠带来参数膨胀和训练时间增长的问题,限制了模型的实际应用。同时,推理效率不足,难以满足实时需求。如何在不增加参数的情况下,提升模型深度和推理能力,成为亟待解决的核心问题。此外,模型在复杂推理任务中的表现仍有提升空间,尤其在数学和逻辑推理方面。

核心创新

本研究提出选择性循环机制,将早中层Transformer层作为循环对象,实现深度的重复利用,避免参数膨胀。结合随机循环次数训练策略,使模型在不同推理深度下都能保持稳定表现。创新点包括:• 在特定层引入循环,提升深度模拟能力;• 采用随机循环训练,增强模型泛化;• 支持推理时动态调整循环次数,提升效率。此设计突破了传统堆叠深层模型的参数瓶颈,为Diffusion模型的深度优化提供新路径。

方法详解

  • �� 将Transformer分为头部、中部(循环层)和尾部三部分,尾部用于输出预测;• 共享中部层参数,循环多次,形成深度等效;• 在训练中随机采样循环次数S,覆盖不同深度,增强模型鲁棒性;• 通过噪声调度和条件概率训练,优化模型的逆向过程;• 在不同预训练语料上进行多轮实验,调整循环位置和层数,验证性能提升;• 利用注意力分析,研究循环对掩码位置交互的影响;• 在推理阶段,根据任务需求动态调节循环次数,优化效率。

实验设计

在OpenWebText、LM1B和FineWeb-Edu上训练170M参数模型,比较非循环与循环模型的训练FLOPs和性能。采用不同循环层位置(第1-2层)和最大循环次数(Smax=12),在数学推理(GSM8K)和语言理解任务中评估。通过调整循环次数,分析模型在生成质量、零-shot表现和下游任务中的表现差异。所有模型参数一致,确保公平性。还进行消融实验,验证循环位置和层数对性能的影响。

结果分析

LoopMDM在相同参数下,训练FLOPs节省达3.3倍,性能与非循环模型持平甚至优越。在GSM8K任务中,提升8.5点准确率,超越深层模型(如21层)表现。推理时增加循环次数,显著改善生成质量,最高提升达+8.5点。注意力分析显示,循环增强掩码位置间交互,尤其在中间噪声水平效果最佳。模型在多任务和零-shot评估中表现优异,验证了其广泛适用性。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,锅里放着各种食材。传统做法是把所有食材一次性放进去,等待熟透再出锅,但这样可能浪费时间也不够灵活。现在,厨师采用一种新方法:先放一些基础食材,反复炒几次,让味道更融合,然后再加入其他材料。这就像模型中的循环机制,反复处理部分内容,提升整体效果。通过这种方式,厨师可以根据需要多次调整味道,既节省时间,又保证菜肴的品质。模型也是一样,选择性地多次“炒”某些层,让结果更好,效率更高。

简单解释 像给14岁少年讲一样

想象你在学校做一个大项目,任务很复杂,需要很多步骤。以前,你会一次做完所有步骤,但这样很慢,也容易出错。现在,你的老师告诉你,可以把任务拆成几部分,先做一部分,然后反复检查和改进,再做下一部分。这样做可以让你更快完成任务,而且质量更高。这就像模型中的循环机制,反复处理某些内容,让最终结果更准确。通过只在关键部分反复“炒”几次,不仅节省时间,还能做得更好。这个方法就像你在厨房反复炒菜一样,味道会更融合,效果更棒。

术语表

Masked Diffusion Model (MDM) (掩码扩散模型)

一种基于噪声调度的生成模型,通过逐步去噪实现文本生成,结合掩码机制提高效率。

论文中的核心模型架构。

Looped Transformer (循环变换器)

参数共享、多次应用的变换器结构,用以模拟更深网络的表达能力,减少参数量。

模型架构创新部分。

FLOPs (浮点运算次数)

衡量模型计算复杂度的指标,表示模型每次推理所需的浮点运算总数。

性能评估标准之一。

噪声调度 (Noise Schedule)

控制噪声加入和去除的策略,影响模型的训练和生成过程。

训练目标和逆向过程设计。

注意力机制 (Attention Mechanism)

模型中用于衡量不同位置信息交互的机制,增强信息融合能力。

分析模型掩码位置交互的工具。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化循环位置和层数的选择,以适应不同任务的需求。
  • 2 模型在长文本生成和复杂推理中的表现机制尚未完全理解。
  • 3 结合稀疏注意力和模型剪枝,降低推理成本的潜力待探索。

应用场景

近期应用

高效文本生成

可用于大规模对话系统、内容创作平台,通过选择性循环提升生成速度和质量,降低训练成本。

数学推理优化

在数学题解和逻辑推理任务中,利用循环机制增强模型推理能力,提升准确率。

远期愿景

智能推理助手

未来模型可成为多任务智能助手,结合自适应循环实现高效推理和决策支持,推动AI普及。

原文摘要

Masked diffusion models (MDMs) have emerged as a promising alternative to autoregressive models for language modeling, yet the effective design of transformer architectures for MDMs remains underexplored. In this paper, we show that selectively looping the early-middle transformer layers significantly improves both training efficiency and model performance in MDMs. We call this approach LoopMDM(Looped Masked Diffusion Model), which brings two key benefits: looping layers at training-time yields a depth-scaling effect without adding parameters, while varying the number of loops at inference-time enables flexible compute scaling. Despite the simplicity, the results are striking: across multiple pre-training corpora, LoopMDM matches the performance of same-size MDMs with up to 3.3 fewer training FLOPs, while its final performance outperforms them on various reasoning benchmarks, including up to 8.5 points on GSM8K. It even surpasses deeper non-looped MDMs trained with comparable per-step compute, indicating that selective looping is more effective than naive depth scaling. Furthermore, LoopMDM can scale inference-time compute by increasing the number of loops. Adaptively adjusting the number of loops throughout the sampling process further yields additional gains in compute efficiency while maintaining performance. Lastly, with attention analysis, we provide evidence that looping is effective in MDMs by promoting interactions among masked positions. Our code and weights will be publicly released.

cs.LG