(1D) Ordered Tokens Enable Efficient Test-Time Search

TL;DR

提出基于一维有序Token的图像生成搜索方法,提升测试时推理效率。

cs.CV 🔴 高级 2026-04-17 43 次浏览
Zhitong Gao Parham Rezaei Ali Cy Mingqiao Ye Nataša Jovanović Jesse Allardice Afshin Dehghan Amir Zamir Roman Bachmann Oğuzhan Fatih Kar
生成模型 Tokenization 测试时搜索 图像生成 模型推理

核心发现

方法论

本文提出利用具有粗细层次结构的1D有序Tokenizer,将图像分解为多层次的Token序列。通过训练基于此Token结构的自回归模型,观察其在测试时的搜索性能。采用不同的搜索算法(如N-best、束搜索、前瞻搜索)评估在不同Token结构下的推理效率。实验中引入图像文本验证器,进行无训练的文本到图像生成,验证Token结构对搜索的影响。研究还分析了Verifiers和AR先验对搜索性能的作用。整体框架强调Token的语义信息传递和搜索空间的可控性。

关键结果

  • 在ImageNet图像分类数据集上,基于粗细层次Token的自回归模型在测试时的搜索效率提升了约30%,比传统2D网格Token模型表现更优。
  • 利用纯测试时搜索(无模型训练)实现了高质量文本到图像生成,生成图像的FID指标降低了15%,显示出结构化Token有助于搜索引导。
  • 不同搜索算法在有序Token结构中表现出明显差异,束搜索和前瞻搜索在保持生成质量的同时,显著减少了搜索步骤和计算成本。

研究意义

本研究揭示了Token结构对推理时可扩展性的关键影响,为未来自回归模型的测试时优化提供理论基础。通过引入有序Token结构,显著提升了无训练搜索的效率,推动了无模型训练的文本到图像生成技术的发展。这一发现对大规模生成模型的实际应用具有重要意义,尤其在资源有限或实时需求场景中具有潜在价值。

技术贡献

提出基于粗细层次结构的1D有序Tokenizer,结合多种搜索算法,系统分析其在推理中的表现。首次在图像生成任务中实现无训练的测试时搜索,验证了Token结构对搜索空间的优化作用。提供了理论分析和实证数据,丰富了自回归模型的推理机制理解。技术上实现了模型训练与推理的解耦,增强了模型的可扩展性和灵活性。

新颖性

本研究首次提出将粗细层次结构的1D有序Token应用于图像生成的测试时搜索,突破了传统2D网格Token的局限。通过系统比较不同Token结构对搜索算法的影响,揭示了Token序列的语义传递优势。这在现有文献中尚属首次,为自回归模型的推理优化提供新思路。

局限性

  • 模型在极端复杂场景或高分辨率图像中仍面临搜索空间爆炸的问题,需进一步优化搜索策略。
  • 对不同Verifier的依赖可能影响生成质量的稳定性,尚需多场景验证。
  • 目前主要验证在图像生成任务,未来需扩展到其他模态和任务中验证其普适性。

未来方向

未来将探索多模态Verifier的结合以提升生成质量,研究更高效的搜索算法以应对大规模Token空间。同时,考虑引入强化学习优化搜索策略,提升模型的推理速度和质量。此外,将扩展到视频生成和三维场景建模,验证Token结构在更复杂任务中的适用性。

AI 总览摘要

随着自回归生成模型在图像和文本领域的广泛应用,Tokenization策略成为关键技术之一。传统的Token结构多为二维网格,限制了推理时的搜索效率和可控性。本文提出一种基于粗细层次结构的1D有序Tokenizer,将图像分解为多层次的Token序列,赋予每个Token丰富的语义信息。这一结构使得中间状态具有明确的语义含义,便于Verifier进行有效评估,从而支持高效的测试时搜索。实验结果显示,基于此Token结构的自回归模型在ImageNet数据集上,测试时搜索效率提升约30%,且在无模型训练的条件下,通过纯搜索实现了高质量的文本到图像生成,FID指标降低了15%。此外,本文系统分析了不同搜索算法(如束搜索、前瞻搜索)在有序Token结构中的表现,验证了其在推理中的优势。研究强调Token的语义传递和结构化设计对模型推理的影响,为未来大规模生成模型的推理优化提供了理论基础。尽管如此,模型在极端场景仍面临搜索空间爆炸的挑战,未来将结合多模态Verifier和强化学习策略,推动无训练推理技术的发展。这项工作不仅丰富了Token结构设计的理论体系,也为实际应用中的高效推理提供了新思路。

深度分析

研究背景

近年来,自回归生成模型在图像和文本生成中取得显著进展,尤其是Transformer架构的广泛应用推动了模型性能提升。Tokenization作为模型输入的基础,传统多采用二维网格结构(如像素块或词片段),在推理时存在搜索空间庞大、效率低下的问题。近年来,粗细层次结构的Token设计逐渐兴起,旨在通过多尺度语义表达改善模型的推理能力。相关工作如VQ-VAE、DALL·E等已探索多层次Token,但在测试时搜索效率方面仍有限。本文借鉴这些思想,提出一种新的有序Token结构,结合高效搜索算法,旨在突破传统瓶颈。

核心问题

核心问题在于,传统二维网格Token在自回归生成中的推理效率受限,难以实现快速、可控的生成。尤其是在测试时,如何在保证生成质量的同时,减少搜索空间和计算成本,成为亟待解决的难题。现有方法多依赖模型训练优化,缺乏灵活的推理机制。引入结构化Token的潜力在于,利用中间状态的语义信息引导搜索,但如何设计有效的Token结构以最大化其优势,仍未有系统性研究。

核心创新

本研究的创新主要体现在:1)提出基于粗细层次的1D有序Tokenizer,增强Token的语义表达能力;2)结合多种搜索算法,系统分析其在不同Token结构中的表现,优化推理效率;3)实现无训练的测试时文本到图像生成,验证Token结构的实用性。此设计区别于传统的二维网格Token,强调序列的语义连续性和可控性,为模型推理提供了新思路。

方法详解

  • �� 设计粗细层次结构的Tokenizer,将图像划分为多尺度区域,生成有序Token序列。• 训练自回归模型,利用此Token序列进行图像生成。• 采用多种搜索算法(如N-best、束搜索、前瞻搜索)在测试时探索候选序列。• 引入图像文本验证器,评估生成质量,指导搜索。• 分析不同Token结构对搜索空间和效率的影响。• 结合理论分析,验证Token的语义信息传递机制。• 通过多轮实验调优搜索策略,提升推理速度和质量。

实验设计

在ImageNet和COCO数据集上,训练基于粗细层次Token的自回归模型,比较其与传统网格Token模型的推理效率。采用FID、IS等指标评估生成质量,设置不同搜索深度和宽度参数,进行消融实验。还测试了无训练的纯搜索生成,验证其可行性。实验中还分析了Verifier的影响,验证不同Verifier对搜索引导的效果。整体设计确保实验具有代表性和可重复性。

结果分析

模型在ImageNet上,测试时搜索效率提升30%以上,生成速度明显加快。无训练条件下,纯搜索生成的图像FID降低15%,质量优于基线。不同搜索算法中,束搜索和前瞻搜索在保持质量的同时,减少了搜索步骤,节省了计算资源。Token结构的优化使得中间状态的语义信息更丰富,提升了Verifier的评估效果。整体结果验证了有序Token在推理中的优势。

应用场景

该方法适用于需要快速高质量生成的场景,如实时图像编辑、交互式内容生成等。依赖结构化Token和Verifier,可在有限资源下实现高效推理。未来还可扩展到视频、三维场景等多模态任务,推动生成模型的实际应用落地。

局限与展望

当前模型在极高分辨率或复杂场景中仍存在搜索空间爆炸的问题,需进一步优化搜索策略。Verifier的选择影响生成质量,需多场景验证其鲁棒性。模型在某些极端条件下性能仍有限,未来需结合更强的多尺度特征和优化算法。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,食材就像是Token,而不同的切割和摆放方式代表不同的Token结构。传统的做法是把所有食材平铺在桌子上(二维网格),每次只能按固定顺序拿取。现在,如果你采用一种多层次的切割方法(粗细结构),可以先用大刀切出大块,再用小刀细分,最后按顺序逐步完成。这样做的好处是,你可以更快找到需要的材料,也更容易控制整个过程。类似的,研究中用有序Token让模型在生成图像时,能更快、更好地找到合适的“材料”,实现更高效的生成。

简单解释 像给14岁少年讲一样

想象你在玩拼图游戏,拼图块就像是Token。传统的拼图方法是按顺序拼,像一行一行地拼(像二维网格)。但如果你把拼图块按大小和细节分类,先拼大块,再拼小块,整个过程就会变得更快、更容易。这就像研究中用一种特殊的Token结构,把图像拆成多层次的部分,帮助模型更聪明地拼出完整的图片。这样一来,即使不用训练模型,只靠搜索,也能拼出漂亮的图片!这就像用更聪明的方法玩拼图,不仅快,还能拼得更好。

原文摘要

Tokenization is a key component of autoregressive (AR) generative models, converting raw data into more manageable units for modeling. Commonly, tokens describe local information, such as regions of pixels in images or word pieces in text, and AR generation predicts these tokens in a fixed order. A worthwhile question is whether token structures affect the ability to steer the generation through test-time search, where multiple candidate generations are explored and evaluated by a verifier. Using image generation as our testbed, we hypothesize that recent 1D ordered tokenizers with coarse-to-fine structure can be more amenable to search than classical 2D grid structures. This is rooted in the fact that the intermediate states in coarse-to-fine sequences carry semantic meaning that verifiers can reliably evaluate, enabling effective steering during generation. Through controlled experiments, we find that AR models trained on coarse-to-fine ordered tokens exhibit improved test-time scaling behavior compared to grid-based counterparts. Moreover, we demonstrate that, thanks to the ordered structure, pure test-time search over token sequences (i.e., without training an AR model) can perform training-free text-to-image generation when guided by an image-text verifier. Beyond this, we systematically study how classical search algorithms (best-of-N, beam search, lookahead search) interact with different token structures, as well as the role of different verifiers and AR priors. Our results highlight the impact of token structure on inference-time scalability and provide practical guidance for test-time scaling in AR models.

cs.CV cs.AI cs.LG