Margins, Not Windows: Training-Free Per-Step Lossy Speculative Decoding

TL;DR

AdaptiveSpec通过动态调整草稿树形状和松散验证规则,实现推理速度提升56%,准确率恢复93%。

cs.CL 🔴 高级 2026-07-04 5 次浏览
Oszkár Urbán Young D. Kwon Stylianos I. Venieris Cecilia Mascolo
自回归解码 推理加速 大语言模型 动态调整 无训练

核心发现

方法论

AdaptiveSpec是一种无需训练的逐步自适应推测解码方法,通过内部信号动态调整草稿树的深度、宽度和节点数,并采用基于概率边际的松散验证规则,提升推理效率。

关键结果

  • 在GSM8K、MATH-500和HumanEval上,AdaptiveSpec在DeepSeek-R1-8B模型上实现了高达56%的吞吐量提升,同时保持93%的任务准确率。
  • 在Llama-3.1-8B模型上,AdaptiveSpec的动态调整实现了49%的单元增益。
  • 在Qwen3-8B模型上,AdaptiveSpec结合动态调整和松散验证,平均速度提升38%。

研究意义

AdaptiveSpec通过动态调整草稿树形状和松散验证规则,显著提升了大语言模型的推理效率,解决了传统自回归解码的效率瓶颈,为学术界和工业界提供了更高效的推理方案。

技术贡献

AdaptiveSpec在不依赖外部训练的情况下,通过内部信号实现草稿树的动态调整和松散验证规则,突破了现有方法的局限性,提供了新的工程可能性。

新颖性

AdaptiveSpec首次在无需训练的情况下,实现了草稿树形状和验证规则的动态调整,显著提升了推理效率。

局限性

  • 在低接受率情况下,松散验证可能导致错误累积。
  • 对不同模型的适应性需要进一步验证。

未来方向

未来工作将探索AdaptiveSpec在更多模型和任务上的适用性,并优化其在不同硬件上的性能表现。

AI 总览摘要

当前大语言模型的自回归设计限制了推理效率,尤其在长链推理任务中。AdaptiveSpec通过动态调整草稿树形状和松散验证规则,显著提升了推理效率。其核心技术包括基于草稿信号的树形状调整和基于概率边际的验证规则,允许在不影响准确率的情况下提升吞吐量。实验结果表明,AdaptiveSpec在多个数据集上实现了显著的速度提升,并保持高准确率。这一方法为大语言模型的高效推理提供了新的思路,尽管在某些情况下仍存在错误累积的风险。未来的研究将进一步优化其在不同模型和硬件上的性能。

深度分析

研究背景

大语言模型在自然语言处理领域的应用日益广泛,但其自回归设计导致推理效率低下。现有的推测解码方法如EAGLE-3虽然有所改进,但仍存在固定草稿树形状和严格验证规则的局限。

核心问题

自回归解码的核心问题在于每个令牌的生成都依赖于前一个令牌,导致推理速度随着模型规模的增加而显著下降,尤其在长链推理任务中。

核心创新

AdaptiveSpec的核心创新在于无需训练即可实现草稿树形状的动态调整和松散验证规则。通过内部信号动态调整草稿树的深度、宽度和节点数,并采用基于概率边际的验证规则,提升了推理效率。

方法详解

  • �� 利用草稿信号动态调整草稿树形状。
  • �� 基于概率边际的松散验证规则。
  • �� 在SGLang引擎上实现,确保生产级性能。

实验设计

实验在GSM8K、MATH-500和HumanEval数据集上进行,比较了AdaptiveSpec与EAGLE-3、TALON和FLy等方法的性能,使用A100 GPU进行测试。

结果分析

AdaptiveSpec在多个数据集上实现了显著的速度提升,尤其在DeepSeek-R1-8B模型上,吞吐量提升高达56%,同时保持高任务准确率。

应用场景

AdaptiveSpec可用于需要高效推理的大规模自然语言处理任务,如实时翻译和对话系统,显著提升系统响应速度。

局限与展望

AdaptiveSpec在低接受率情况下,松散验证可能导致错误累积。此外,其对不同模型和任务的适应性需要进一步验证。

通俗解读 非专业人士也能看懂

想象一个工厂,工人们需要根据前一个工序的结果来完成自己的工作,这样效率很低。AdaptiveSpec就像给工厂配备了一套智能系统,能够根据每个工序的复杂程度动态调整工人的数量和工作方式,从而提高整体效率。

简单解释 像给14岁少年讲一样

想象你在玩一个需要逐步解锁的游戏,每个关卡都要等前一个关卡完成才能继续。AdaptiveSpec就像一个超级助手,能帮你同时解锁多个关卡,还能根据你的表现调整策略,让你更快通关!

术语表

Speculative Decoding (推测解码)

一种通过草稿和验证加速推理的方法。

用于提高大语言模型的推理效率。

Tree-attention Drafter (树注意力草稿器)

一种生成多个候选令牌的模型。

用于草稿阶段生成候选令牌。

AdaptiveSpec (自适应推测解码)

一种动态调整草稿树形状和验证规则的方法。

本文提出的核心方法。

Margin-based Rule (基于边际的规则)

一种基于概率边际的松散验证规则。

用于验证阶段的令牌接受。

SGLang (SGLang引擎)

一种生产级推理引擎。

用于实现AdaptiveSpec的方法。

开放问题 这项研究留下的未解疑问

  • 1 如何在不同硬件上优化AdaptiveSpec的性能?
  • 2 AdaptiveSpec在其他模型上的适用性如何?

应用场景

近期应用

实时翻译

通过提升推理速度,AdaptiveSpec可用于实时翻译系统,提高响应速度。

远期愿景

智能对话系统

在对话系统中应用AdaptiveSpec,提升用户体验,减少延迟。

原文摘要

Speculative decoding accelerates LLM inference by drafting candidate tokens and verifying them in parallel. Tree-attention drafters such as EAGLE-3 are widely adopted, yet typically hold two decisions fixed: (1) a strict token-match verification rule and (2) a static draft-tree shape. Prior work relaxes each in isolation under limiting assumptions: long draft chains for training-free lossy verification, and adaptive tree shaping under a fixed token budget. We introduce AdaptiveSpec, a training-free per-step speculative decoding method that adapts both decisions from internal signals already produced during decoding. A per-step margin rule promotes a mismatched draft-proposed token when the ratio of the target's probability on the drafted token to its top-1 probability exceeds a threshold with no dependence on draft length or underlying drafter architecture. A per-step tree policy adjusts the draft tree's depth, width, and node count directly from a fused signal of draft top-1 confidence and a rolling acceptance history capturing recent draft-target agreement, allowing the total draft count to vary rather than only be redistributed. The two adaptations operate on orthogonal axes and compound in effect. Implemented on the SGLang production-grade serving engine, AdaptiveSpec improves throughput over the state-of-the-art autoregressive speculative decoding method EAGLE-3 by up to 56%, recovering 93% to fully lossless task accuracy across GSM8K, MATH-500, and HumanEval on three target models (DeepSeek-R1-Distill-Llama-8B, Llama-3.1-8B-Instruct, Qwen3-8B).

cs.CL