核心发现
方法论
DepCap是免训练、可插拔的块式DLM推理框架,包含DepGA-Block与CAP-Decoding。前者用最后已解码块前后的预测分布KL散度衡量跨步影响,并以熵惩罚决定下一块边界;后者先按置信度建候选集,再用成对冲突分数筛选可安全并行解码的token。
关键结果
- 在LLaDA-8B-Instruct、Dream-v0-base-7B和LLaDA-1.5上,DepCap覆盖GSM8K、Math-500、MBPP与HumanEval;LLaDA系列平均较vanilla提速3.57倍,质量基本保持。
- LLaDA-1.5的MBPP上,DepCap最高达到5.63倍加速,并使准确率相对提升7.4%;LLaDA-8B-Instruct上,CAP-Decoding配合32-token块在GSM8K达到21.6 TPS、NFE 71.5。
- 消融显示DepGA-Block改善块边界稳定性,CAP-Decoding扩大安全并行度;其理论依据是局部条件互信息在位置间近似可加。
研究意义
论文针对DLM最关键的速度—质量矛盾提出统一解决方案。它不改变模型参数、不需额外训练,仅利用推理时分布,因此能直接覆盖LLaDA与Dream等不同骨干,并与KV-cache兼容。对推理和代码生成而言,这意味着更少的函数评估、更高吞吐,同时避免盲目扩大块或降低置信度阈值造成的质量崩溃。
技术贡献
技术上,DepCap把块边界从固定长度或当前步启发式信号,转化为跨步的last-block influence。其分数为S_k=I~_k−λH~_k,首次低于零处截断;块长再限制于[L_min,L_window]。CAP-Decoding定义D_ij=log p_i(ŷ_j)+log p_j(ŷ_i),以高置信优先和贪心最大独立集式筛选冲突自由子集。分析将期望KL联系到I(Z_k;B|c)。
新颖性
多数AdaBlock、Swordsman和GeoBlock分别依赖特殊符号、熵变化或注意力几何;DepCap首次在该框架中明确把已完成块对未来位置的跨步影响用于分块,并将token间冲突纳入并行决策。核心新意不是单一启发式,而是为两个决策分别提供依赖信号与冲突信号。
局限性
- 方法依赖预测分布具有足够校准性;若KL影响与真实语义依赖不一致,块边界仍可能过长或过短。
- CAP-Decoding需计算候选位置两两冲突,候选集很大时开销增加;论文主要在A100、256-token生成长度和四个基准上验证。
未来方向
未来可研究更低复杂度的冲突图近似、跨模型自适应λ与阈值,以及长上下文和更大规模LLaDA 2.0上的表现。还应评估不同采样策略、KV-cache刷新频率与DepCap联合时的系统级收益。
AI 总览摘要
扩散语言模型(DLM)能够同时更新多个位置,并利用双向上下文,因此有望比自回归模型更快。然而,多步去噪使速度和质量彼此牵制:固定块大小浪费并行性,大块又容易把相互依赖的token同时确定;仅按置信度并行也可能引发冲突。
DepCap提出免训练的依赖感知推理框架。DepGA-Block比较最后解码块前后的预测分布,以KL散度I_k衡量其对未来位置的影响,再用熵H_k表示剩余不确定性,依据S_k=I~_k−λH~_k自适应决定边界。CAP-Decoding先保留置信度至少τ_low=0.8的候选,再用D_ij=log p_i(ŷ_j)+log p_j(ŷ_i)排除冲突,并优先选择τ_high=0.95的token。
在LLaDA-8B-Instruct、Dream-v0-base-7B和LLaDA-1.5上,方法覆盖GSM8K、Math-500、MBPP和HumanEval。LLaDA系列平均提速3.57倍;LLaDA-1.5的MBPP达到5.63倍加速且相对准确率提升7.4%。该结果表明,跨步依赖和token级冲突比固定计划及单纯置信度更适合控制DLM推理。
深度分析
研究背景
DLM把文本生成建模为掩码迭代去噪,可并行更新并使用双向注意力。LLaDA、Dream和Mercury推动了实用化,但多步函数评估成本高。Fast-dLLM等块式方法缩小每步刷新范围,AdaBlock使用特殊符号,Swordsman利用熵变化,GeoBlock利用注意力几何;它们仍主要使用固定或当前步信号。
核心问题
块式推理有两个决策:下一块延伸多远,以及块内哪些位置能同时确定。固定大小不能适应输入和阶段变化;降低置信度阈值虽提高速度,却可能并行提交互相影响的token。需要跨步、位置级且无需训练的可靠信号。
核心创新
DepGA-Block把最后解码块视为信息源,用前后预测分布的KL散度追踪其对未来位置的影响,并用熵判断不确定性何时占优。CAP-Decoding进一步显式检测token冲突,而非假设候选彼此独立。两者均只读取推理分布,可插入既有DLM和KV-cache流程。
方法详解
- �� 初始化目标序列为[MASK],从当前frontier建立窗口L_window=min(L_max,L_remain)。
- �� 对候选位置计算I_k=KL(p_curr^k||p_prev^k)与H_k=H(p_curr^k),局部平滑归一化后得S_k=I~_k−λH~_k。
- �� 扫描首个S_k<0的位置确定边界,并将长度裁剪到[L_min,L_window];冷启动使用L_min。
- �� 块内以c_i=max_v p_i(v)建立c_i≥τ_low的候选集。
- �� 计算D_ij;高置信token先入安全集,移除冲突者,再按置信度贪心补充;若为空,至少解码最高置信token。
- �� 理论上,I(Z_1:L;B|c)在局部重叠较小时近似为各位置条件互信息之和。
实验设计
实验使用LLaDA-8B-Instruct、Dream-v0-base-7B和LLaDA-1.5,生成长度256,在单张NVIDIA A100 40GB上运行。数据集为5-shot GSM8K、4-shot Math-500、3-shot MBPP和0-shot HumanEval。比较vanilla、置信度解码、固定16/32/64块、AdaBlock、DepGA-Block与完整CAP-Decoding;指标为准确率、TPS和NFE。默认λ=1.2、L_min=8、L_max=128、τ_low=0.8、τ_high=0.95、γ=-16。
结果分析
DepCap在多个骨干上取得稳定速度—质量折中。LLaDA系列平均提速3.57倍;LLaDA-1.5的MBPP达到5.63倍并相对增准7.4%。LLaDA-8B-Instruct上,32块CAP-Decoding在GSM8K为21.6 TPS、NFE 71.5;完整DepCap为21.4 TPS、NFE 74.8且准确率78.8。固定大块虽快,却常牺牲准确率。
应用场景
适用于需要高吞吐文本、数学推理和代码生成的DLM服务。部署者可直接把DepCap接入LLaDA或Dream推理栈,并复用块式KV-cache;无需重新训练模型。它尤其适合GPU批量服务、交互式代码助手和对延迟敏感的推理API,但需校准阈值并监控额外冲突计算。
局限与展望
理论近似依赖局部信息重叠有限,长距离语义依赖或分布失准时可能失效。CAP-Decoding的两两冲突计算在大候选块上会增加开销。实验规模仍有限:主要是四个基准、256-token生成和A100;论文未充分报告长上下文、采样生成、批量并发及极大模型的系统吞吐。
通俗解读 非专业人士也能看懂
把生成文字想成一条餐厅流水线。传统做法每次固定处理同样数量的订单:少了慢,多了容易把互相依赖的菜做错。DepCap先观察上一批订单完成后,后面哪些订单的安排发生了明显变化;变化大,说明上一批提供了有用线索,可以把下一批做得更长。若后面的订单仍很混乱,就提前停下。
同一批订单里,也不能只看每道菜自己有多确定,因为两道菜可能争抢同一个关键食材。DepCap会检查两道菜的选择是否互相打架,先处理最可靠且不冲突的订单,再逐步加入其他安全订单。这样既保留多人同时工作的速度,也避免同时做出互相矛盾的决定。它不修改厨师的能力,只改变工作安排,所以能直接用于已有系统。
简单解释 像给14岁少年讲一样
想象一个会不断擦掉和重写作文的超级写作机器人。它不是从第一个字写到最后一个字,而是先同时猜很多位置,再不断修改。问题是:如果一次改太多,速度快但容易把互相依赖的句子改乱;如果一次只改一个,又会慢得像蜗牛。
DepCap像一个聪明的班长。上一组句子写完后,它观察这组内容对后面哪些空格影响最大。如果影响还很强,就让下一组长一点;如果后面看起来很不确定,就缩短范围。这样每一步都根据实际情况安排,而不是死守“每次32个字”。
它还检查同一组里的“吵架”。两个空格如果可能互相改变答案,就不让它们同时提交;很有把握、彼此不冲突的空格可以一起完成。实验中,LLaDA系列平均快3.57倍,LLaDA-1.5做MBPP代码题最高快5.63倍,准确率还相对提高7.4%。
所以它不是让模型变聪明,而是让模型少走冤枉路。它仍可能在特别长、特别复杂的句子上判断失误,检查冲突也会花一点时间,但这是把“快”和“准”平衡得更好的实用办法。
术语表
Diffusion Language Model(扩散语言模型)
通过反复去除掩码和修正预测来生成文本,而非严格左到右生成。它能并行更新多个位置并使用双向上下文。
DepCap针对掩码式DLM推理。
Block-wise Decoding(块式解码)
把目标序列划分为连续块,并按块顺序完成。每次只刷新当前块,减少全序列反复计算。
DepCap在此框架上自适应划块。
Last-block Influence(最后块影响)
最后解码块前后某位置预测分布的KL散度。数值越大,表示该块对该位置的信息改变越明显。
DepGA-Block的跨步信号。
CAP-Decoding(冲突感知并行解码)
先按置信度筛候选,再根据位置对之间的冲突分数选择安全子集。它近似构造不冲突的并行集合。
用于块内token选择。
Function Evaluations,NFE(函数评估次数)
去噪过程中调用模型的次数,通常越少代表计算成本越低。它不同于TPS,后者还受硬件和序列长度影响。
论文报告NFE与TPS。
开放问题 这项研究留下的未解疑问
- 1 KL影响是否能在长上下文、强采样噪声或跨段依赖下稳定代表真实语义依赖,仍缺乏系统验证。
- 2 冲突图的近似独立集是否能在大批量和超长块上保持低开销,需要更完整的复杂度与硬件分析。
应用场景
近期应用
代码生成服务
将DepCap接入LLaDA或Dream代码助手,使用MBPP、HumanEval式任务校准λ、τ和γ,并复用KV-cache。预期是在保持功能正确率的同时降低端到端延迟。
数学推理API
对GSM8K、Math-500类请求采用自适应块和冲突筛选,避免固定大块破坏中间推理。服务方可用TPS、NFE和准确率联合选择阈值。
远期愿景
自适应DLM推理栈
把依赖信号、冲突图和KV-cache统一为运行时控制器,按模型、任务和硬件动态调整块长,实现面向质量约束的自动吞吐优化。
原文摘要
Diffusion language models (DLMs) have emerged as a promising alternative to autoregressive language generation due to their potential for parallel decoding and global refinement of the entire sequence. To unlock this potential, DLM inference must carefully balance generation quality and decoding speed. Recent block-wise DLM decoding methods improve this trade-off by performing diffusion-based decoding sequentially in blocks. However, existing methods typically rely on fixed block schedules or current-step local signals to determine block boundaries, and use conservative confidence-based parallel decoding to avoid conflicts, limiting the quality-speed trade-off. In this paper, we argue that block-wise DLM inference requires more suitable signals for its two core decisions: cross-step signals for determining block boundaries, and token-level conflict signals for parallel decoding. Based on this view, we propose DepCap, a training-free framework for efficient block-wise DLM inference. Specifically, DepCap instantiates the cross-step signal as the influence of the last decoded block and uses it to adaptively determine how far the next block should extend, while identifying a conflict-free subset of tokens for safe parallel decoding within each block, enabling substantial inference acceleration with negligible quality degradation. DepCap is a plug-and-play method applicable to various DLMs, and compatible with existing KV-cache strategies for block-wise DLM. An information-theoretic analysis further suggests that the cumulative last-block influence on a candidate block is approximately additive across tokens, supporting the proposed block-partitioning criterion. Experimental results show that DepCap achieves favorable speed-quality trade-offs across multiple DLM backbones and reasoning and coding benchmarks, with up to 5.63$\times$ speedup without significant performance degradation.