SJD++: Improved Speculative Jacobi Decoding for Training-free Acceleration of Discrete Auto-regressive Text-to-Image Generation

TL;DR

SJD++通过多token预测和高置信度重用,实现AR文本到图像生成的2-3倍加速。

cs.CV 🔴 高级 2025-12-08 38 次浏览
Yao Teng Zhihuan Jiang Han Shi Xian Liu Xuefei Ning Guohao Dai Yu Wang Zhenguo Li Xihui Liu
加速 自回归模型 文本到图像 无训练 并行解码

核心发现

方法论

SJD++结合Jacobi解码的多token预测和推测采样的草稿验证机制。通过高置信度token重用,减少了生成步骤。该方法无需训练,直接应用于现有模型。

关键结果

  • 在Lumina-mGPT上,SJD++实现了2-3倍的推理延迟减少和2-7倍的步骤压缩,同时保持图像质量。
  • 在COCO2017等基准上,SJD++的FID和CLIP分数与基线相当,显示出无质量下降的加速效果。
  • 在不同模型上,SJD++的步骤压缩率达到2.5-7.5倍,实际延迟加速为2.3-3.1倍。

研究意义

SJD++显著加速了AR文本到图像生成,解决了生成速度慢的痛点。其无训练的特性使其易于集成到现有系统中,具有广泛的学术和工业应用潜力。

技术贡献

SJD++提出了高置信度token重用机制,突破了传统Jacobi解码的确定性限制,支持随机采样。该方法无需额外的模型或训练,提供了新的工程可能性。

新颖性

SJD++首次将推测采样与Jacobi解码结合,形成完全概率化的并行解码算法,适用于大规模AR模型的加速。

局限性

  • 在高度复杂的场景中,token重用可能导致局部不一致,影响图像质量。
  • 该方法对模型架构有一定依赖,可能不适用于所有AR模型。

未来方向

未来研究可探索在不同模型架构上的适应性,并优化token重用策略以提高复杂场景下的图像质量。

AI 总览摘要

自回归模型在生成高质量图像时面临生成速度慢的问题。SJD++通过多token预测和高置信度token重用,显著减少了生成步骤和推理延迟。实验表明,该方法在多个基准上实现了2-3倍的加速,而不影响图像质量。SJD++无需训练,易于集成,具有广泛的应用潜力。然而,在复杂场景中,token重用可能导致局部不一致,未来研究将优化该策略以提高质量。

深度分析

研究背景

自回归模型在文本到图像生成中表现出色,但其逐步预测的特性导致生成速度慢。传统的加速方法多依赖于训练,计算成本高。SJD++通过无训练的并行解码策略,提供了一种高效的解决方案。

核心问题

AR模型生成速度慢,尤其在高分辨率图像生成中,需数百到数千次前向传递。现有方法多依赖训练,计算成本高,难以应用于大规模模型。

核心创新

SJD++通过结合Jacobi解码和推测采样,实现了多token并行预测和高置信度token重用。这种方法无需训练,直接应用于现有模型,显著加速生成过程。

方法详解

  • �� 使用Jacobi解码进行多token预测
  • �� 结合推测采样的草稿验证机制
  • �� 高置信度token重用以减少重采样
  • �� 空间先验初始化策略以加速收敛

实验设计

在Lumina-mGPT、Janus-Pro等模型上进行评估,使用COCO2017等基准。设置top-K为2000,比较FID、CLIP分数等指标。进行消融研究以验证token重用的效果。

结果分析

SJD++在多个模型上实现了2-3倍的推理延迟减少和2-7倍的步骤压缩。FID和CLIP分数与基线相当,显示出无质量下降的加速效果。

应用场景

SJD++适用于需要快速生成高质量图像的场景,如实时图像生成、交互式应用等。其无训练特性使其易于集成到现有系统中。

局限与展望

在复杂场景中,token重用可能导致局部不一致。该方法对模型架构有一定依赖,可能不适用于所有AR模型。未来研究将优化token重用策略以提高质量。

通俗解读 非专业人士也能看懂

想象你在厨房做饭。传统方法像是每次只切一片菜,然后决定下一步。而SJD++就像同时切多片,并在每次切完后检查哪些切得好,哪些需要重新切。这样可以更快地完成整个过程。

简单解释 像给14岁少年讲一样

想象你在玩一个拼图游戏。通常你每次只能放一块,但SJD++让你每次可以放多块!如果有些放错了,你可以很快调整,这样你就能更快完成拼图!

术语表

Speculative Sampling (推测采样)

一种通过小模型快速生成序列的技术,然后由大模型验证。

用于SJD++的草稿验证机制。

Jacobi Decoding (Jacobi解码)

一种多token并行解码策略,通过迭代更新直到收敛。

SJD++的基础解码策略。

Token Reuse (token重用)

在多次迭代中保留高置信度的token,减少重采样。

SJD++中的加速机制。

Top-K Sampling (Top-K采样)

从概率分布中选择前K个最可能的选项进行采样。

控制生成多样性和随机性。

Inference Latency (推理延迟)

模型生成结果所需的时间。

SJD++通过减少推理延迟实现加速。

开放问题 这项研究留下的未解疑问

  • 1 如何在复杂场景中优化token重用策略以提高图像质量?
  • 2 SJD++在不同模型架构上的适应性如何?

应用场景

近期应用

实时图像生成

SJD++可用于需要快速生成高质量图像的应用,如实时图像生成。

远期愿景

多模态系统

SJD++的加速特性可促进多模态系统的发展,提升其实时交互能力。

原文摘要

Large autoregressive models can generate high-quality, high-resolution images but suffer from slow generation speed, because these models require hundreds to thousands of sequential forward passes for next-token prediction during inference. To accelerate autoregressive text-to-image generation, we propose Speculative Jacobi Decoding++ (SJD++), a training-free probabilistic parallel decoding algorithm. Unlike traditional next-token prediction, SJD++ performs multi-token prediction in each forward pass, drastically reducing generation steps. Specifically, it integrates the iterative multi-token prediction mechanism from Jacobi decoding, with the probabilistic drafting-and-verification mechanism from speculative sampling. More importantly, for further acceleration, SJD++ reuses high-confidence draft tokens after each verification phase instead of resampling them all. We conduct extensive experiments on several representative autoregressive text-to-image generation models and demonstrate that SJD++ achieves $2\times$ to $3\times$ inference latency reduction and $2\times$ to $7\times$ step compression, while preserving visual quality with no observable degradation.

cs.CV