PSD: Pushing the Pareto Frontier of Diffusion LLMs via Parallel Speculative Decoding

TL;DR

PSD通过并行推测解码提升扩散LLM的推理效率,达到每次前向传递5.5倍的token数。

cs.CL 🔴 高级 2026-05-15 3 次浏览
Shengyin Sun Yiming Li Renxi Liu Xinqi Li Hui-Ling Zhen Weizhe Lin Chen Chen Xianzhi Yu Mingxuan Yuan Chen Ma
扩散模型 大语言模型 推测解码 推理效率 生成质量

核心发现

方法论

PSD是一种无训练框架,通过并行推测解码提高扩散LLM的推理效率。该方法利用单次前向传递的置信度分数选择解码位置,并构建多深度推测草稿,最终通过批量验证保留与更新预测一致的最深草稿。

关键结果

  • PSD在数学推理和代码生成任务中实现了推理效率与生成质量的良好平衡,达到每次前向传递5.5倍的token数,准确度与贪婪解码相当。
  • 在GSM8K基准上,PSD在保持75.1%准确率的同时实现了2.7倍的并行解码。
  • 在HumanEval基准上,PSD在4.2倍并行性下保持35.4%的通过率。

研究意义

PSD在学术界和工业界具有重要意义,它解决了扩散LLM推理效率低下的问题,通过结合空间和时间加速策略,提供了更高效的推理方法。

技术贡献

PSD通过结合空间和时间加速策略,突破了单一加速策略的瓶颈,提供了新的工程可能性和理论保证。

新颖性

PSD首次结合空间和时间加速策略,提供了一种无训练的框架来提高扩散LLM的推理效率,与现有方法相比具有显著创新。

局限性

  • PSD在极端并行性设置下可能会导致生成质量下降。
  • 在某些任务中,推测草稿的准确性可能会受到上下文变化的影响。

未来方向

未来工作可以探索PSD在不同模型架构和任务上的应用,以及进一步优化推测草稿的准确性。

AI 总览摘要

扩散大语言模型(dLLMs)通过迭代去噪生成文本,尽管它们可以在每一步中并行预测所有被掩盖的位置,但大量的去噪迭代仍然使推理成本高昂。并行推测解码(PSD)是一种无训练框架,通过结合空间和时间加速策略来提高推理效率。PSD利用单次前向传递的置信度分数选择解码位置,并构建多深度推测草稿,最终通过批量验证保留与更新预测一致的最深草稿。实验表明,PSD在数学推理和代码生成任务中实现了推理效率与生成质量的良好平衡,达到每次前向传递5.5倍的token数,准确度与贪婪解码相当。尽管PSD在极端并行性设置下可能会导致生成质量下降,但其结合空间和时间加速策略的设计为扩散LLM的推理提供了新的可能性。

深度分析

研究背景

扩散大语言模型(dLLMs)通过迭代去噪生成文本,近年来成为一种有前途的替代方案。尽管dLLMs可以在每一步中并行预测所有被掩盖的位置,但大量的去噪迭代仍然使推理成本高昂。现有的加速策略包括并行解码和推测解码,但各自存在瓶颈。

核心问题

扩散LLM的推理效率低下是一个重要问题。尽管它们可以在每一步中并行预测所有被掩盖的位置,但大量的去噪迭代仍然使推理成本高昂。如何在保持生成质量的同时提高推理效率是一个关键挑战。

核心创新

PSD结合了空间和时间加速策略,通过无训练框架提高扩散LLM的推理效率。它利用单次前向传递的置信度分数选择解码位置,并构建多深度推测草稿,最终通过批量验证保留与更新预测一致的最深草稿。

方法详解

  • �� 空间并行解码:通过可配置的转移策略在每一步揭示多个token。
  • �� 时间推测草稿:利用当前步骤的置信度分数构建未来去噪结果的候选。
  • �� 批量验证与分层接受:在单次前向传递中评估所有候选,并保留与验证器更新预测一致的最深分支。

实验设计

在数学推理和代码生成任务上评估PSD,使用GSM8K、HumanEval和MBPP基准。比较七个代表性空间和时间解码基线,分析推测解码的预测能力和并行解码的阶段性贡献。

结果分析

PSD在数学推理和代码生成任务中实现了推理效率与生成质量的良好平衡,达到每次前向传递5.5倍的token数,准确度与贪婪解码相当。

应用场景

PSD可用于提高扩散LLM在数学推理和代码生成任务中的推理效率,适用于需要高效文本生成的场景。

局限与展望

PSD在极端并行性设置下可能会导致生成质量下降。在某些任务中,推测草稿的准确性可能会受到上下文变化的影响。

通俗解读 非专业人士也能看懂

想象一个工厂,工人在生产线上工作。传统的工厂需要工人一个接一个地完成任务,这样效率很低。PSD就像是一个自动化的生产线,工人可以同时处理多个任务,并且在每个步骤中都能预测未来的工作。这种方法不仅提高了生产效率,还确保了产品质量。

简单解释 像给14岁少年讲一样

想象你在玩一个拼图游戏。传统的方法是一个一个地放置拼图块,这样很慢。PSD就像是一个超级助手,它可以同时放置多个拼图块,并且在每个步骤中预测未来的拼图。这种方法不仅让你更快完成游戏,还确保拼图的完整性。

术语表

扩散模型 (Diffusion Model)

一种通过迭代去噪生成文本的模型。

用于生成文本的迭代去噪过程。

推测解码 (Speculative Decoding)

一种通过预测未来去噪结果加速推理的方法。

用于加速扩散LLM的推理过程。

置信度分数 (Confidence Score)

模型对预测结果的置信度评估。

用于选择解码位置的指标。

批量验证 (Batched Verification)

在单次前向传递中评估多个候选的过程。

用于验证推测草稿的准确性。

分层接受 (Hierarchical Acceptance)

保留与验证器更新预测一致的最深分支的过程。

用于防止错误传播的机制。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化推测草稿的准确性以提高生成质量?
  • 2 在不同任务和模型架构上,PSD的适用性如何?

应用场景

近期应用

数学推理

PSD可用于提高数学推理任务的推理效率,适用于需要快速生成复杂推理的场景。

代码生成

PSD可用于提高代码生成任务的推理效率,适用于需要高效生成代码的场景。

远期愿景

智能文本生成

PSD可用于开发更智能的文本生成系统,提供更高效的文本生成解决方案。

原文摘要

Diffusion large language models (dLLMs) generate text by iteratively denoising masked token sequences. Although dLLMs can predict all masked positions in parallel within each step, the large number of denoising iterations still makes inference expensive. This cost can be reduced spatially by unmasking multiple tokens per step, or temporally by collapsing multiple denoising steps into one verification call. We propose Parallel Speculative Decoding (PSD), a training-free framework that jointly improves inference along both axes. Using the confidence scores from a single forward pass, PSD selects positions to unmask via a configurable, adaptive unmasking policy and constructs multi-depth speculative drafts without extra model calls. A final batched verification pass then applies hierarchical acceptance, keeping the deepest draft that remains consistent with the updated predictions. Experiments on three dLLMs across reasoning and code generation tasks show that PSD achieves favorable trade-offs between inference efficiency and generation quality, reaching up to $5.5\times$ tokens per forward pass with accuracy comparable to greedy decoding.

cs.CL