Parallel Rollout Approximation for Pixel-Space Autoregressive Image Generation

TL;DR

提出并实现了并行展开近似法(PRA),在ImageNet-1K上实现了1.94的FID。

cs.CV 🔴 高级 2026-06-26 38 次浏览
Jiayi Xu Di He Guolin Ke
图像生成 自回归模型 并行计算 深度学习 计算机视觉

核心发现

方法论

本文提出了一种新的并行展开近似法(PRA),通过生成低维中间状态并将其解码回像素空间,解决了像素空间自回归生成中的高维生成难题和训练-推理不匹配问题。PRA保留了像素输入和输出接口,并通过扰动中间状态构建类似推理的训练输入。

关键结果

  • PRA-S在ImageNet-1K 256×256的生成任务中,以135M参数实现了2.58的FID,超越了之前的十亿级像素空间自回归结果3.60。
  • 扩展到PRA-L(511M参数)后,FID进一步提高到1.94,创下像素空间自回归模型的新纪录。
  • PRA在ImageNet分类探测准确性上也优于其他自回归和扩散基线,显示出其在像素空间图像生成和理解中的潜力。

研究意义

PRA在像素空间自回归图像生成领域取得了显著进展,不仅在生成质量上超越了现有的基线模型,还在图像理解任务中表现出色。这表明PRA不仅适用于高质量图像生成,还可能在统一的图像生成和理解框架中发挥重要作用。

技术贡献

PRA通过低维中间状态和并行训练输入的创新设计,解决了像素空间自回归模型中的关键瓶颈。与现有的扩散模型和两阶段潜在自回归模型相比,PRA无需预训练的编码器,直接在像素空间进行端到端训练,提供了新的工程可能性。

新颖性

PRA首次在像素空间自回归生成中引入了低维中间状态的概念,并通过并行构建推理样式的训练输入,解决了训练-推理不匹配的问题。这种方法在不依赖预训练编码器的情况下,实现了高效的像素空间生成。

局限性

  • PRA在高分辨率图像生成时仍面临计算成本高的问题,尤其是在参数规模较大时。
  • 在某些复杂场景下,生成质量可能不如特定任务优化的模型。

未来方向

未来的研究可以探索如何进一步降低PRA的计算成本,尤其是在高分辨率生成任务中。此外,可以研究PRA在其他视觉任务中的应用潜力,如视频生成和多模态学习。

AI 总览摘要

像素空间自回归图像生成面临高维生成和训练-推理不匹配的挑战。现有方法如x预测和输入噪声注入只能部分缓解这些问题。本文提出的并行展开近似法(PRA)通过生成低维中间状态并将其解码回像素空间,解决了这些挑战。在ImageNet-1K上,PRA-S以135M参数实现了2.58的FID,超越了之前的十亿级像素空间自回归结果。扩展到PRA-L后,FID进一步提高到1.94,创下新纪录。PRA不仅在生成质量上表现出色,还在ImageNet分类探测准确性上优于其他基线,显示出其在统一的图像生成和理解框架中的潜力。尽管如此,PRA在高分辨率生成时的计算成本仍需进一步优化。未来的研究可以探索如何降低计算成本,并研究其在其他视觉任务中的应用潜力。

深度分析

研究背景

自回归生成在大语言模型中的成功激发了其在图像生成中的应用。然而,大多数成功的自回归图像生成器在离散或潜在空间中操作,而不是直接在像素空间。离散方法依赖于向量量化或预训练的标记器,而连续标记方法通常在学习的潜在或特征空间中建模。虽然这些标记空间使自回归建模更易处理,但也引入了额外的阶段,使最终生成质量受限于标记器或自动编码器。

核心问题

像素空间自回归生成看似简单:图像可以分为若干像素块,模型预测下一个像素块。然而,生成高维像素块导致单步误差大,教师强制训练导致训练-推理不匹配,使误差在自回归步骤中积累。

核心创新

PRA通过生成低维中间状态并将其解码回像素空间,解决了高维生成难题。它还通过扰动中间状态构建类似推理的训练输入,减少了训练-推理不匹配。

方法详解

  • �� 生成低维中间状态,减少单步生成难度。• 使用像素解码器将中间状态映射回像素空间。• 通过扰动中间状态构建类似推理的训练输入。• 保持像素输入和输出接口。

实验设计

在ImageNet-1K上进行类条件生成实验,使用256×256分辨率的原始像素块作为连续标记。实验包括PRA-S、PRA-B和PRA-L三种模型规模,分别具有135M、250M和511M参数。

结果分析

PRA-S在ImageNet-1K上实现了2.58的FID,超越了之前的十亿级像素空间自回归结果。PRA-L进一步提高到1.94,创下新纪录。PRA在ImageNet分类探测准确性上也优于其他基线。

应用场景

PRA可用于高质量图像生成,特别是在需要高分辨率和细节的场景中。它还可能在统一的图像生成和理解框架中发挥作用。

局限与展望

PRA在高分辨率生成时的计算成本较高,尤其是在参数规模较大时。此外,在某些复杂场景下,生成质量可能不如特定任务优化的模型。

通俗解读 非专业人士也能看懂

想象一个工厂,PRA就像一个新的生产线,它不直接生产复杂的产品,而是先生产简单的零件,然后再组装成完整的产品。这样做的好处是每个步骤都更简单,出错的可能性更小。PRA通过这种方式解决了生成高维像素块的难题,并通过模拟推理时的输入,减少了训练和推理之间的差异。

简单解释 像给14岁少年讲一样

想象你在玩一个拼图游戏,PRA就像是一个聪明的助手,它不直接给你所有的拼图块,而是先给你一些简单的线索,让你更容易找到正确的拼图块。这样你就能更快地完成拼图,而不会因为一开始的错误而影响后面的步骤。PRA通过这种方式帮助计算机更好地生成图像。

术语表

自回归模型 (Autoregressive Model)

一种通过依次生成数据点来建模序列数据的方法。

用于像素空间图像生成,逐步生成像素块。

FID (Fréchet Inception Distance)

一种用于评估生成图像质量的指标,数值越低表示质量越高。

用于评估PRA在ImageNet-1K上的生成性能。

中间状态 (Intermediate State)

在生成过程中用于简化计算的低维表示。

PRA通过生成低维中间状态来减少生成难度。

教师强制训练 (Teacher-Forced Training)

一种训练方法,模型在训练时使用真实数据作为输入。

导致训练和推理之间的差异。

像素解码器 (Pixel Decoder)

将低维中间状态映射回高维像素空间的组件。

PRA使用像素解码器保持像素输入和输出接口。

开放问题 这项研究留下的未解疑问

  • 1 如何在不增加计算成本的情况下提高PRA在高分辨率生成任务中的效率?
  • 2 PRA在其他视觉任务中的应用潜力如何,如视频生成和多模态学习?

应用场景

近期应用

高质量图像生成

PRA可用于生成高分辨率图像,适用于需要细节的场景,如医学成像和艺术创作。

远期愿景

统一图像生成和理解框架

PRA可能在未来成为一个统一的框架,用于同时进行图像生成和理解,推动视觉AI的发展。

原文摘要

Pixel-space continuous-token autoregressive (AR) generation directly models images as sequences of raw pixel patches, avoiding discrete tokenization or a separately pretrained tokenizer. However, it faces coupled challenges: high-dimensional patch generation causes large single-step errors, and teacher-forced training creates a train--inference gap that makes these errors accumulate across AR steps. Existing fixes such as $x$-prediction and input noise injection only partially mitigate these issues. Exact rollout training better matches inference-time conditions, but is impractical due to prohibitively slow sequential sampling. We propose \emph{Parallel Rollout Approximation} (PRA), a scalable framework that addresses both challenges jointly. PRA generates low-dimensional intermediate states instead of high-dimensional pixel patches, then maps them back to pixel-space tokens with a pixel decoder, preserving a pixel-in, pixel-out AR interface. It also constructs inference-like pixel inputs through the same intermediate-state-to-pixel path used at inference, independently across positions, approximating the pixel-feedback interface encountered during inference-time rollout while retaining parallel teacher-forced training. On class-conditional ImageNet-1K generation at $256\times256$ resolution, PRA-S with 135M parameters achieves an FID of 2.58, surpassing the previous billion-scale pixel-space AR result of 3.60. Scaling to PRA-L with 511M parameters further improves FID to 1.94, establishing a new state of the art among pixel-space AR models. Beyond generation, PRA achieves higher ImageNet classification probing accuracy than other AR and diffusion baselines, suggesting its potential for unified pixel-space image generation and understanding.

cs.CV cs.AI