LiLiCorr: Lightweight Likelihood Correlation of Parallel Drafts for Speculative Decoding

TL;DR

LiLiCorr通过轻量化的似然相关性提高草稿接受长度9-19%。

cs.CL 🔴 高级 2026-08-21 2 次浏览
Matan Rusanovsky Yoav Miron Roy Uziel Omer Belhasin Ran Zilberstein Maor Ashkenazi Michael Elad
语言模型 推测解码 轻量化 并行草稿 似然相关性

核心发现

方法论

LiLiCorr模型通过相关每个位置的边际分布来提高语言模型的推测解码效率。它保留每个位置的top-k候选词,并联合处理这些候选词,生成输入和输出向量。相邻候选词的匹配通过早期候选词的输出向量与后期候选词的输入向量的余弦相似度来实现。

关键结果

  • LiLiCorr在每个基准上将接受长度提高了9%到19%,其评分头仅占每块延迟的约2.8%。
  • 在72个设置中,LiLiCorr在70个设置中提供最高吞吐量。
  • LiLiCorr在输入长度比训练长度长一个数量级时仍保持领先。

研究意义

LiLiCorr通过提高语言模型的推测解码效率,解决了现有方法在草稿时间恢复连贯性的问题。它在学术界和工业界具有重要影响,尤其是在高并发和计算受限的环境中。

技术贡献

LiLiCorr通过轻量化的似然相关性解决了边际问题,提供了新的理论保证和工程可能性。与现有的SOTA方法相比,它在草稿时间提供了更高的效率和连贯性。

新颖性

LiLiCorr首次在草稿时间通过单次网络传递恢复连贯性,与现有的逐槽网络传递方法相比,显著提高了效率。

局限性

  • LiLiCorr在极端长输入情况下可能会出现性能下降。
  • 在某些复杂语言结构中,可能无法完全恢复连贯性。

未来方向

未来工作可以探索LiLiCorr在多语言环境中的应用,以及如何进一步优化其在极端长输入情况下的性能。

AI 总览摘要

LiLiCorr是一种新的轻量化似然相关性模型,旨在提高语言模型的推测解码效率。现有的方法在草稿时间恢复连贯性时通常需要多次网络传递,这导致了额外的计算开销。LiLiCorr通过单次网络传递生成候选词的输入和输出向量,并通过余弦相似度进行匹配,从而在不显著增加计算成本的情况下提高了草稿的接受长度。实验结果表明,LiLiCorr在多个基准测试中表现优异,显著提高了吞吐量,并在输入长度超过训练长度的情况下仍保持领先。尽管LiLiCorr在某些极端情况下可能会出现性能下降,但其在语言模型推测解码领域的贡献是显著的,未来的研究可以进一步探索其在多语言环境中的应用。

深度分析

研究背景

语言模型的推测解码是一种加速推理的方法,通过草稿模型并行验证多个未来词汇。现有方法如DFlash通过单次前向传递预测未来词汇块,但由于训练时只关注每个位置的边际分布,导致生成的词汇块可能不连贯。

核心问题

现有的推测解码方法在生成词汇块时,通常只关注每个位置的边际分布,导致生成的词汇块可能不连贯。这种不连贯性限制了草稿的接受长度,影响了推理效率。

核心创新

LiLiCorr通过轻量化的似然相关性模型,联合处理每个位置的候选词,生成输入和输出向量。这种方法通过余弦相似度匹配相邻候选词,显著提高了草稿的接受长度。

方法详解

  • �� 保留每个位置的top-k候选词
  • �� 生成输入和输出向量
  • �� 通过余弦相似度匹配相邻候选词
  • �� 单次网络传递生成所有向量
  • �� 并行计算匹配分数

实验设计

实验使用多个基准测试,包括数学、代码和聊天数据集。通过比较LiLiCorr与现有方法的接受长度和吞吐量,验证其性能。实验结果表明,LiLiCorr在多个设置中表现优异。

结果分析

LiLiCorr在每个基准上将接受长度提高了9%到19%,其评分头仅占每块延迟的约2.8%。在72个设置中,LiLiCorr在70个设置中提供最高吞吐量。

应用场景

LiLiCorr可用于加速语言模型的推测解码,尤其是在高并发和计算受限的环境中。它在提高推理效率和连贯性方面具有重要影响。

局限与展望

LiLiCorr在极端长输入情况下可能会出现性能下降。在某些复杂语言结构中,可能无法完全恢复连贯性。未来的研究可以进一步优化其性能。

通俗解读 非专业人士也能看懂

想象你在一个厨房里做饭。你有一个助手,他会提前准备好所有的食材,但有时他会把不相关的食材放在一起,这让你很难做出美味的菜肴。LiLiCorr就像一个聪明的助手,他会根据每个食材的相似度来匹配它们,确保你得到的是一个连贯的食材组合,从而做出美味的菜肴。

简单解释 像给14岁少年讲一样

嘿,想象一下你在玩一个游戏,你需要快速选择正确的物品来通过关卡。LiLiCorr就像一个超级助手,他会提前帮你选好最可能成功的物品组合,这样你就能更快地通过关卡!是不是很酷?它还会确保你选的物品都是相互匹配的,这样你就不会在游戏中卡住。

术语表

推测解码 (Speculative Decoding)

一种加速语言模型推理的方法,通过并行验证多个未来词汇。

LiLiCorr用于提高推测解码的效率。

边际分布 (Marginal Distribution)

每个位置的词汇概率分布。

LiLiCorr通过相关边际分布来提高连贯性。

余弦相似度 (Cosine Similarity)

衡量两个向量之间相似度的指标。

用于匹配相邻候选词的输入和输出向量。

吞吐量 (Throughput)

系统在单位时间内处理的任务数量。

LiLiCorr在多个设置中提供最高吞吐量。

DFlash

一种预测未来词汇块的草稿模型。

LiLiCorr在DFlash基础上提高连贯性。

开放问题 这项研究留下的未解疑问

  • 1 如何在多语言环境中应用LiLiCorr?
  • 2 LiLiCorr在极端长输入情况下的性能如何优化?

应用场景

近期应用

语言模型加速

LiLiCorr可用于加速语言模型的推测解码,尤其是在高并发环境中。

远期愿景

多语言支持

探索LiLiCorr在多语言环境中的应用,可能改变全球语言处理领域。

原文摘要

Speculative decoding accelerates language-model inference by drafting future tokens that the target model verifies in parallel. A diffusion-style block head such as DFlash is an attractive drafter, predicting an entire block of future tokens in one forward pass. However, it is trained on per-position marginals rather than the joint block distribution, so the tokens it emits are individually plausible yet jointly incoherent. We introduce LiLiCorr, a Lightweight Likelihood-based model that Correlates the per-position marginal distributions a drafter already produces. It keeps the top-k tokens at each position as candidates and processes them jointly, producing for each an in and an out vector. A pair of adjacent candidates matches when the earlier one's out vector has high cosine similarity with the later one's in vector. These matches capture the block's joint structure without ever materializing the full joint distribution. One lightweight network pass produces all the vectors, and the pairwise scores are then computed in parallel as batched matrix operations, leaving only a cheap greedy walk sequential. We further co-train the drafter with LiLiCorr, so it learns to propose candidates that correlate into longer accepted sequences. Over the vanilla DFlash drafter, LiLiCorr raises acceptance length on every benchmark by 9 to 19%, while its scoring head accounts for about 2.8% of the per-block latency. Against DFlash and two concurrent methods that also restore coherence at draft time, LiLiCorr delivers the highest throughput in 70 of 72 settings: nine benchmarks at two target sizes under greedy and temperature-one decoding, and a throughput sweep over six concurrencies, two input lengths and three entropy tiers, with all systems equally optimized on a common serving stack. Extending LiLiCorr to inputs an order of magnitude longer than it was trained on preserves that lead.

cs.CL