Improving Flexible Image Tokenizers for Autoregressive Image Generation

TL;DR

提出ReToK,通过冗余Token填充和层级语义正则化,显著改善灵活图像Tokenizer的生成性能。

cs.CV 🔴 高级 2026-01-04 40 次浏览
Zixuan Fu Lanqing Guo Chong Wang Binbin Song Ding Liu Bihan Wen
图像生成 Tokenization 自回归模型 深度学习 视觉表示

核心发现

方法论

本文提出ReToK,结合冗余Token填充(Redundant Token Padding)和层级语义正则化(Hierarchical Semantic Regularization)两大创新。通过在训练中引入额外的尾部Token,激活尾部Token的使用频率,缓解信息过度集中在前部Token的问题。同时,利用预训练视觉基础模型(如DINOv2)对早期Token的解码特征进行语义对齐,逐步降低正则化强度以细粒度还原图像细节。训练过程中采用多尺度重建损失结合语义正则化,提升模型对长序列的利用效率。实验在ImageNet 256×256上验证,ReToK在不同Token长度(32-256)下均优于传统灵活和固定Tokenizer,显著改善生成质量。

关键结果

  • 在ImageNet 256×256上,ReToK在256Token长度下实现的gFID为2.66,优于传统灵活Tokenizer(如One-D-Piece的2.75)和部分固定长度模型(如GigaTok的2.86),显示出其在长序列生成中的优势。
  • 引入冗余Token填充后,Tail Token的激活频率提升,贡献度分布趋于均衡,增强了模型对尾部信息的利用率,提升了生成细节的丰富度。
  • 层级语义正则化显著改善了早期Token的语义表达能力,提升了短Token(如32、64)生成的图像质量,减少了模糊和失真现象。

研究意义

该研究突破了现有灵活Tokenizer在长序列生成中的瓶颈,推动了基于变长Token的图像生成技术向更高质量、更长序列的方向发展。其创新机制不仅提升了生成效果,也为未来多模态融合、细粒度图像理解提供了新的思路。尤其在大规模预训练模型和高分辨率图像生成中,ReToK展现出广泛的应用潜力,有望引领行业迈向更智能、更高效的视觉内容生成新纪元。

技术贡献

技术上,ReToK引入冗余Token填充机制,有效激活尾部Token的利用,打破信息集中在前部的局限。结合层级语义正则化,通过对早期Token的高层语义对齐,增强其表达能力,同时逐步放宽正则化,确保细节还原。训练过程中采用多尺度重建损失和预训练模型的语义引导,提升模型的泛化能力和细粒度还原能力。这些设计使得模型在长序列生成中表现出更优的稳定性和细节丰富度,显著优于现有的灵活和固定Tokenizer。

新颖性

本研究首次系统性引入冗余Token填充与层级语义正则化相结合,解决灵活Tokenizer在长序列生成中的信息利用不充分问题。相较于传统的嵌套Dropout策略,ReToK通过激活尾部Token,优化信息分布,突破了以往在长序列生成中的性能瓶颈。这一创新在视觉Tokenization领域具有开创性意义,为未来多模态和高分辨率图像生成提供了新的技术路径。

局限性

  • 当前方法在极长序列(超过512Token)下仍存在信息稀疏和细节丢失的问题,未来需进一步优化正则化策略和模型容量。
  • 训练过程中引入的冗余Token填充增加了计算负担,可能影响模型的训练效率和部署成本。
  • 对预训练模型(如DINOv2)的依赖较强,迁移到不同任务或数据集时可能需要重新调优。

未来方向

未来可探索自适应正则化策略,动态调节不同阶段的语义对齐强度;结合多模态信息丰富尾部Token的表达能力;提升模型在超长序列(如512-1024Token)中的表现。此外,结合高效的模型压缩和推理优化,推动ReToK在实际应用中的部署,拓展其在视频、3D重建等多模态内容生成中的潜力。

AI 总览摘要

随着深度学习在图像生成领域的飞速发展,基于自回归模型的高质量图像生成技术逐渐成为研究焦点。传统的Tokenization方法多采用固定长度或二维网格结构,难以充分捕获自然图像的复杂多样性,限制了模型的灵活性和细节还原能力。近年来,灵活长度的Tokenizer如FlexTok和One-D-Piece试图突破这一限制,但在长序列生成中表现出明显瓶颈,信息过度集中在前部Token,导致生成质量随着Token数增加而下降。针对这一问题,本文提出ReToK,一种结合冗余Token填充和层级语义正则化的创新方法,显著改善了长序列图像生成的效果。通过在训练中引入尾部Token的激活机制,ReToK缓解了信息分布不均的问题,同时利用预训练视觉模型对早期Token进行语义对齐,增强其表达能力。大量实验在ImageNet 256×256数据集上验证,ReToK在不同Token长度(32-256)下均优于现有方法,不仅提升了生成质量,也增强了模型的细节还原能力。这一突破为未来多模态内容生成提供了新的技术路径,推动图像生成技术迈向更高的水平。尽管如此,模型在超长序列和高分辨率场景下仍有优化空间,未来的研究将聚焦于自适应正则化策略和多模态融合,期待ReToK在实际应用中展现更大潜力。

深度分析

研究背景

图像生成技术经历了从像素级重建到基于深度学习的高层次语义理解的演变。早期方法如VQ-VAE和VQ-GAN通过离散Token化实现了图像的压缩与生成,推动了生成模型的快速发展。近年来,Transformer架构的引入带来了更强的表达能力,诸如TiTok、GigaTok等模型实现了更高效的Token编码。尽管如此,现有Tokenizers多采用固定网格或短序列,难以捕获自然图像的多样性和复杂性。灵活长度的Tokenizer如FlexTok试图解决这一问题,但在长序列生成中表现不佳,信息过度集中在前部Token,导致生成质量随Token数增加而下降。这些问题限制了模型在高分辨率和细粒度场景中的应用。近年来,结合预训练视觉模型进行语义对齐成为提升生成质量的重要手段,但仍未解决信息分布不均和细节还原的根本问题。本文的研究旨在突破这一瓶颈,提出更有效的Tokenization策略,推动生成模型的进一步发展。

核心问题

核心问题在于灵活Tokenizer在长序列生成中存在信息利用不充分的问题。传统的嵌套Dropout训练策略使得大部分图像信息集中在前部Token,尾部Token几乎未被激活,导致模型难以充分利用尾部信息,限制了长序列的生成质量。随着Token数量的增加,生成效果反而下降,严重影响模型的实用性。此外,现有方法在细节还原和语义表达方面仍存在不足,尤其是在高分辨率、多样化场景中表现不佳。这些问题的根源在于信息分布不均和缺乏有效的尾部Token激活机制,亟需创新的策略以改善信息利用效率。

核心创新

本文的创新点主要包括:1)引入冗余Token填充机制,通过在训练中添加尾部Token,激活尾部Token的使用频率,改善信息分布不均的问题;2)设计层级语义正则化,利用预训练视觉模型对早期Token进行高层次语义对齐,增强其表达能力,同时逐步放宽正则化,确保细节还原;3)结合多尺度重建损失,提升模型对长序列的利用效率和细节还原能力。这些创新突破了传统嵌套Dropout的局限,显著改善了长序列生成的效果,为灵活Tokenization提供了新的解决方案。

方法详解

  • �� 采用GigaTok架构,结合Transformer编码器和解码器实现图像的离散Token化。• 在训练中引入冗余Token填充,将额外的尾部Token拼接到原始序列后,形成扩展序列。• 对扩展序列应用嵌套Dropout,激活尾部Token,促进信息均衡分布。• 利用预训练的DINOv2模型对早期Token的解码特征进行语义对齐,增强其高层次表达能力。• 逐步降低正则化强度,允许尾部Token捕获低层细节。• 结合多尺度重建损失,包括像素级、感知级和对抗损失,提升整体重建质量。• 训练过程中采用多尺度正则化和解码微调,优化长序列生成效果。

实验设计

  • �� 在ImageNet 256×256数据集上进行训练,采用不同Token长度(32-256)进行评估。• 比较基线GigaTok与改进版本ReToK的性能,指标包括gFID、rFID、PSNR、SSIM。• 设计消融实验验证冗余Token填充、层级语义正则化和解码微调的贡献。• 使用不同的自回归模型(LlamaGen系列)进行生成质量测试,确保结果的稳健性。• 通过多次实验调优正则化参数和训练策略,确保模型在长序列中的表现。

结果分析

  • �� ReToK在256Token长度下实现的gFID为2.66,优于传统灵活Tokenizer(如One-D-Piece的2.75)和部分固定模型(如GigaTok的2.86),显示出长序列生成的优势。• 引入冗余Token填充后,尾部Token激活频率提升,贡献度分布趋于均衡,增强细节丰富度。• 层级语义正则化显著改善早期Token的语义表达能力,提升短Token(如32、64)生成的图像质量,减少模糊和失真。• 解码微调进一步优化了短序列的重建效果,整体性能达到或超过现有最优模型。

应用场景

  • �� 适用于高分辨率图像生成、内容创作、虚拟现实等场景,特别在需要长序列细粒度控制的应用中表现优越。• 结合预训练模型和灵活Tokenization,可实现多模态内容的高效编码与生成。• 未来可扩展至视频、3D模型等多维内容的生成与理解,推动智能内容创作产业升级。

局限与展望

  • �� 在超长序列(如512以上Token)场景中仍存在信息稀疏和细节丢失问题,需进一步优化正则化策略。• 训练引入冗余Token增加计算成本,影响模型效率。• 依赖预训练视觉模型,迁移到不同任务或数据集时可能需要重新调优。

通俗解读 非专业人士也能看懂

想象你在做一份复杂的拼图。每一块拼图代表一段信息,拼图越多,画面越完整。传统的方法就像只用前几块拼图,后面的块根本没用上,画面虽然完整但细节缺失。而ReToK就像在拼图时,特别强调每一块都要用得上,不让任何一块闲着。它还会用一层特殊的“放大镜”来看早期的拼图块,确保它们都能表达出大致的内容,然后逐步加入细节。这样拼出来的画面既丰富又细腻,效果比以前更好。这就像在做一份精致的拼图,所有部分都发挥作用,最终拼出一幅完美的画卷。

简单解释 像给14岁少年讲一样

想象你在玩拼图游戏。以前的拼图方法就像只用前几块拼好大部分,后面的块都没怎么用,拼出来的图虽然还可以,但缺少细节。而ReToK就像告诉你:每一块都要用上,不管是前面的大块还是后面的小块。它还用一种特别的放大镜,帮你确认早期的拼图块都能表达出大概的内容,然后慢慢加入更多细节。这样拼出来的图片就会更清楚、更漂亮,就像你用心拼的那样。这个方法让拼图变得更聪明,也让最终的图片更逼真,像专业的画家一样。

术语表

Tokenization(Token化)

将图像或文本分解成离散的基本单元(Token),便于模型处理。

本文中指将图像压缩成一系列离散Token以进行生成。

Nested Dropout(嵌套Dropout)

一种训练策略,通过随机截断尾部Token,使模型学习不同长度的表示。

用于训练灵活长度Tokenizer,提升其泛化能力。

Hierarchical Semantic Regularization(层级语义正则化)

利用预训练模型的高层次特征,对早期Token进行语义对齐,增强表达能力。

提升早期Token的语义信息,改善生成质量。

gFID(生成质量指标)

衡量生成图像与真实图像的差异,数值越低越好。

用以评估不同Tokenizer在生成质量上的差异。

ReToK(改进的Tokenizer)

本文提出的结合冗余Token填充和层级语义正则化的灵活Tokenizer。

核心创新方法,用于提升长序列图像生成性能。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化尾部Token的激活机制以适应超长序列(如512+Token)场景?
  • 2 是否可以结合多模态信息(如文本、声音)提升Tokenizer的表达能力?
  • 3 在不同数据集和任务中,ReToK的迁移能力和泛化性能如何?

应用场景

近期应用

高分辨率内容生成

可用于电影、游戏中的高质量场景渲染,提升细节丰富度和真实感。

虚拟现实与增强现实

支持更长序列的场景描述和内容生成,增强沉浸感和交互体验。

远期愿景

多模态内容创作平台

结合图像、文本、声音等多模态信息,打造智能化内容生成生态系统。

原文摘要

Flexible image tokenizers aim to represent an image using an ordered 1D variable-length token sequence. This flexible tokenization is typically achieved through nested dropout, where a portion of trailing tokens is randomly truncated during training, and the image is reconstructed using the remaining preceding sequence. However, this tail-truncation strategy inherently concentrates the image information in the early tokens, limiting the effectiveness of downstream AutoRegressive (AR) image generation as the token length increases. To overcome these limitations, we propose \textbf{ReToK}, a flexible tokenizer with \underline{Re}dundant \underline{Tok}en Padding and Hierarchical Semantic Regularization, designed to fully exploit all tokens for enhanced latent modeling. Specifically, we introduce \textbf{Redundant Token Padding} to activate tail tokens more frequently, thereby alleviating information over-concentration in the early tokens. In addition, we apply \textbf{Hierarchical Semantic Regularization} to align the decoding features of earlier tokens with those from a pre-trained vision foundation model, while progressively reducing the regularization strength toward the tail to allow finer low-level detail reconstruction. Extensive experiments demonstrate the effectiveness of ReTok: on ImageNet 256$\times$256, our method achieves superior generation performance compared with both flexible and fixed-length tokenizers. Code will be available at: \href{https://github.com/zfu006/ReTok}{https://github.com/zfu006/ReTok}

cs.CV