VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations

TL;DR

VibeToken是一种支持任意分辨率的1D Transformer图像编码器,极大提升了自动回归模型效率。

cs.CV 🔴 高级 2026-04-28 47 次浏览
Maitreya Patel Jingtao Li Weiming Zhuang Yezhou Yang Lingjuan Lv
图像生成 Transformer 分辨率-无关 效率优化 自动回归

核心发现

方法论

VibeToken采用动态位置嵌入、可变补丁大小和动态长度编码,结合预训练策略实现对任意分辨率的高效编码。核心算法包括基于Transformer的序列编码、可调节的Patch Embedding和多码本量化(MVQ)技术,支持从32到256个可控Token序列,解码支持任意目标分辨率。VibeToken-Gen在此基础上,结合类别条件和分辨率条件,设计出一种常数计算成本的高效生成器。模型在ImageNet-1k数据集上训练,支持多分辨率、多长短的编码,显著降低了推理计算量。

关键结果

  • VibeToken在高压缩比下实现了优异的重建质量,支持1024×1024图像仅用64个Token,达到3.94的gFID,远优于需1024 Token的扩散模型(5.87 gFID);推理FLOPs保持恒定在179G,远低于传统AR模型(如LlamaGen在1024×1024时的11T FLOPs),效率提升63倍。
  • 在多分辨率、多比例场景下,VibeToken-Gen表现出优异的生成质量和灵活性,支持任意分辨率和宽高比,且在推理速度上比NiT快2.35倍(0.46秒对比1.08秒),同时保持较低的gFID。
  • 通过消融实验验证了动态位置嵌入和可变补丁大小对模型性能的贡献,支持在不同分辨率和比例下的高质量生成,展现出极强的泛化能力。

研究意义

该研究突破了传统AR模型在分辨率适应性上的瓶颈,提出的VibeToken实现了高效、灵活的图像生成,极大推动了AR模型在工业生产中的应用潜力。相比 diffusion 模型,VibeToken在保持竞争性能的同时,显著降低了计算成本,为大规模、多场景应用提供了可能。其创新的分辨率-无关编码策略,为未来高效多尺度视觉生成奠定了基础,有望引领新一代图像生成技术的发展方向。

技术贡献

提出一种支持任意分辨率的1D Transformer图像编码器VibeToken,结合动态位置嵌入、可变补丁和动态长度编码,有效解决了传统Token数量随分辨率线性增长的问题。基于此,设计出常数计算成本的VibeToken-Gen生成器,显著提升了推理效率。模型采用多码本量化(MVQ)技术,增强压缩能力,支持多尺度、多比例的高质量生成。该方案在保持高压缩比的同时,实现了极强的泛化能力和计算效率,为AR模型的实际应用提供了新思路。

新颖性

首次提出支持任意分辨率和宽高比的动态位置嵌入与可变补丁机制,突破了传统固定分辨率限制。结合多码本量化技术,实现极高压缩比和泛化能力。与现有1D Tokenizer相比,VibeToken在支持多尺度和超分辨率方面具有明显优势,显著降低了推理计算成本,为AR模型在工业级应用中铺平了道路。

局限性

  • 模型在极端非标准比例或超高分辨率场景下仍可能出现细节损失或拉伸伪影,需进一步优化解码策略。
  • 预训练依赖大量多尺度、多比例样本,训练成本较高,模型泛化能力受限于训练数据的多样性。
  • 尽管推理成本低,但在极大分辨率或复杂场景中,仍存在一定的性能瓶颈,未来需结合更高效的解码机制。

未来方向

未来将探索更强的多尺度特征融合策略,提升模型在极端场景下的表现。计划引入更高效的多码本优化算法,进一步降低存储和计算成本。同时,将模型扩展到视频和三维场景的生成任务,推动多模态、多尺度视觉生成技术的发展。

AI 总览摘要

VibeToken的提出标志着图像生成领域迈入了支持任意分辨率的新时代。传统的自动回归(AR)模型在高分辨率场景中面临着Token数量线性增长带来的巨大计算压力,限制了其在工业应用中的推广。Diffusion模型虽然在生成质量上表现优异,但计算成本高昂,难以实现实时应用。针对这一瓶颈,本文提出了VibeToken,一种基于Transformer的动态位置嵌入和可变补丁机制,支持将任意分辨率的图像编码成少量Token(32-256),并能解码出任意目标分辨率的图像。通过引入多码本量化(MVQ)技术,VibeToken在保持高压缩比的同时,实现了极强的泛化能力和效率。基于此,作者设计了VibeToken-Gen,一种常数计算成本的AR生成器,能够在不同分辨率和宽高比下高速生成高质量图像。实验证明,VibeToken-Gen在1024×1024分辨率下仅用64个Token,达到3.94的gFID,远优于需1024 Token的Diffusion模型(5.87 gFID),推理FLOPs保持在179G,效率提升63倍。这一突破极大推动了AR模型在工业生产中的应用潜力,为未来多尺度、多场景的视觉生成提供了新思路。尽管如此,模型在极端比例和超高分辨率场景中仍存在细节损失和伪影问题,未来工作将集中在优化解码策略和多尺度特征融合,以实现更广泛的应用。

深度分析

研究背景

近年来,图像生成技术经历了从GAN到VAE,再到扩散模型和AR模型的演变。扩散模型如Denoising Diffusion Probabilistic Models(DDPM)在高质量生成方面表现出色,但计算成本高,难以在实时场景中部署。AR模型如LlamaGen、VQGAN+Transformer等,通过离散潜在空间实现高效生成,但在高分辨率和宽高比适应性方面存在瓶颈。传统Tokenizers(如VQGAN)在Token数量随分辨率线性增长,导致推理成本剧增。近年来,1D Transformer Tokenizer(如TiTok、VAR)在压缩效率上取得突破,但仍受限于固定分辨率。解决方案亟需支持任意分辨率、多比例和超分辨率的编码机制,以满足工业级应用需求。

核心问题

现有AR模型在高分辨率场景中面临Token数量线性增长的问题,导致推理计算成本随分辨率指数级上升,严重限制了其实际应用。传统Tokenizers难以支持宽高比变化和超分辨率重建,限制了模型的泛化能力。同时,Diffusion模型虽能自然适应多尺度,但计算成本高,难以实现实时生成。如何在保证生成质量的同时,显著降低推理成本,成为当前研究的核心难题。

核心创新

提出VibeToken,支持任意分辨率的动态位置嵌入和可变补丁机制,突破Token数量线性增长的瓶颈。结合多码本量化(MVQ)技术,实现极高的压缩比和泛化能力。设计VibeToken-Gen,采用常数FLOPs的推理策略,支持多尺度、多比例的高效生成。创新点在于将Transformer序列编码与动态空间适应相结合,极大提升了模型的灵活性和效率,推动AR模型走向工业化应用。

方法详解

  • �� 设计动态位置嵌入,通过可调节的网格位置编码,支持不同分辨率和比例。
  • �� 实现可变补丁大小,结合多尺度训练,增强模型泛化能力。
  • �� 引入多码本量化(MVQ),提升压缩比,支持多尺度编码。
  • �� 采用动态长度Token编码,支持从32到256 Token的可调节序列。
  • �� 在ImageNet-1k上进行多尺度、多比例训练,优化模型的泛化能力。
  • �� 构建VibeToken-Gen,结合类别和分辨率条件,设计常数FLOPs推理机制。
  • �� 训练过程中采用随机采样分辨率和Token长度,增强模型适应性。

实验设计

在ImageNet-1k、FFHQ等数据集上进行训练,比较VibeToken与传统Tokenizers(如LlamaGen、IBQ)在不同分辨率和比例下的重建质量(gFID)和推理效率。采用多尺度、多比例训练策略,验证模型的泛化能力。通过消融实验分析位置嵌入、补丁大小和Token长度对性能的影响,确保模型在高压缩比和多尺度场景下表现优异。

结果分析

VibeToken在1024×1024图像中仅用64 Token实现3.94 gFID,远优于需1024 Token的扩散模型(5.87 gFID);推理FLOPs恒定在179G,显著优于传统AR模型(如LlamaGen在1024×1024时的11T FLOPs)。在多比例、多分辨率场景中,表现出优异的生成质量和泛化能力,支持任意宽高比和超分辨率重建。消融实验验证了动态位置嵌入和多码本量化的有效性,模型在不同场景下均保持高性能。

应用场景

该技术可广泛应用于工业级图像生成、内容创作、虚拟现实和增强现实等场景,满足高效、多尺度、多比例的生成需求。支持实时内容生成和高质量超分辨率重建,推动智能内容生产的普及。未来还可结合视频和三维场景,拓展多模态生成应用。

局限与展望

模型在极端比例或超高分辨率场景中仍可能出现细节缺失或伪影,需进一步优化解码机制。训练成本较高,依赖大量多尺度、多比例样本,泛化能力受限于数据多样性。未来需结合更高效的编码和解码策略,提升模型的鲁棒性和适应性。

通俗解读 非专业人士也能看懂

想象你在一家工厂里,工厂每天都要生产各种不同大小和形状的产品。过去,工厂的机器只能生产固定尺寸的产品,每次换尺寸都要重新调整设备,非常麻烦。而现在,这个工厂引入了一种新技术,可以根据订单的不同要求,自动调整生产线,快速生产出各种尺寸的产品。这就像VibeToken一样,它能把不同大小的图片编码成少量的“标签”,然后根据需要,快速“解码”出不同尺寸的图片。这样不仅节省了时间和成本,还能灵活应对各种需求。这种技术让图像生成变得像工厂生产一样高效、灵活,未来可以用在很多地方,比如游戏、电影、虚拟现实等。

简单解释 像给14岁少年讲一样

想象你在玩一个超级酷的拼图游戏,你可以用很少的拼图片段拼出各种不同大小的图片。以前的拼图游戏每次都需要很多拼图片段,拼出大图片时特别慢。而这个新技术就像一个神奇的拼图工具,只用很少的拼图片段,就能拼出1024×1024的大图片,而且还能随意变大变小,就像魔法一样!它用一种聪明的方法,把图片的内容变成一串神奇的标签,然后再用这些标签拼出不同尺寸的图片。这样,不仅快,还能拼出各种奇形怪状的图片,非常厉害!未来,这个技术可以用在制作游戏、动画,甚至虚拟世界里,让我们的数字世界变得更加神奇和方便。

术语表

Transformer(变换器)

一种基于自注意力机制的深度学习模型,擅长处理序列数据,广泛应用于自然语言和图像任务。

VibeToken利用Transformer编码图像序列,实现高效压缩和泛化。

多码本量化(MVQ)

一种将潜在空间划分为多个码本的量化技术,用于提升模型压缩比和表达能力。

MVQ在VibeToken中用于支持多尺度高效编码。

位置嵌入(Positional Embedding)

在Transformer中加入的位置信息,用于保持序列中元素的空间关系。

VibeToken采用动态位置嵌入以支持任意分辨率。

自回归模型(Autoregressive Model)

逐步预测序列中下一个元素的模型,广泛用于生成任务。

VibeToken-Gen是基于自回归机制的高效生成器。

gFID(生成质量指标)

衡量生成图像与真实图像差异的指标,数值越低代表质量越高。

实验中VibeToken实现了3.94的gFID,优于传统模型。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升极端比例和超高分辨率场景下的细节还原能力,仍是未来研究重点。
  • 2 模型在多模态、多场景融合中的适应性和泛化能力尚未充分验证,需要更多跨领域实验。
  • 3 优化训练成本和数据多样性,提升模型在实际工业环境中的鲁棒性和稳定性。

应用场景

近期应用

工业内容生成

支持高效、多尺度的图像内容生产,满足虚拟现实、游戏开发等行业的实时需求。

虚拟现实与增强现实

实现高质量超分辨率图像快速生成,提升沉浸体验和交互效果。

远期愿景

多模态内容创造

结合视频、三维场景等多模态数据,推动智能内容生产和虚拟世界的构建。

原文摘要

We introduce an efficient, resolution-agnostic autoregressive (AR) image synthesis approach that generalizes to arbitrary resolutions and aspect ratios, narrowing the gap to diffusion models at scale. At its core is VibeToken, a novel resolution-agnostic 1D Transformer-based image tokenizer that encodes images into a dynamic, user-controllable sequence of 32-256 tokens, achieving a state-of-the-art efficiency and performance trade-off. Building on VibeToken, we present VibeToken-Gen, a class-conditioned AR generator with out-of-the-box support for arbitrary resolutions while requiring significantly fewer compute resources. Notably, VibeToken-Gen synthesizes 1024x1024 images using only 64 tokens and achieves 3.94 gFID; by comparison, a diffusion-based state-of-the-art alternative requires 1,024 tokens and attains 5.87 gFID. In contrast to fixed-resolution AR models such as LlamaGen -- whose inference FLOPs grow quadratically with resolution (11T FLOPs at 1024x1024) -- VibeToken-Gen maintains a constant 179G FLOPs (63.4x efficient) independent of resolution. We hope VibeToken can help unlock the wide adoption of AR visual generative models in production use cases.

cs.CV cs.LG