Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining

TL;DR

Lumina-mGPT是一种基于解码器的多模态自回归模型,通过多模态生成预训练实现高效、灵活的高分辨率照片级图像生成,具备多任务能力。

cs.CV 🔴 高级 2024-08-06 158 引用 48 次浏览
Dongyang Liu Shitian Zhao Le Zhuo Weifeng Lin Yi Xin Xinyue Li Qi Qin Yu Qiao Hongsheng Li Peng Gao
多模态生成 自回归模型 图像合成 多任务学习 深度学习

核心发现

方法论

Lumina-mGPT采用解码器单一架构,基于多模态生成预训练(mGPT)进行初始化,结合灵活的渐进式监督微调(FP-SFT)实现高质量高分辨率图像生成。模型引入Unambiguous image Representation(UniRep)以解决不同纵横比图像的表示歧义,支持多尺度、多比例的图像生成。通过Omni-SFT,模型实现多模态任务的统一,包括文本到图像、多视角生成、图像编辑、语义分割和深度估计等。训练过程中采用“下一令牌预测”机制,结合z-loss稳定训练,利用大规模多模态数据进行微调,充分利用预训练模型的知识基础。模型架构简洁,仅由解码器组成,避免复杂的编码器-解码器结构,便于扩展和迁移,兼容多任务、多模态输入输出。整体流程包括多模态token化、UniRep编码、渐进式高分辨率微调及多任务微调,确保模型在多场景下的灵活性和高性能。

关键结果

  • 在文本到图像生成任务中,Lumina-mGPT实现了1K分辨率的原生自回归生成,显著优于以往的自回归模型(如LlamaGen、Parti),在多个基准(如T2I-CompBench、GenEval)上超越Chameleon,性能指标提升20%以上,生成图像的细节和语义一致性达到行业领先水平。
  • 模型在多模态任务中表现出色,支持多轮对话、图像多视角生成、图像编辑、深度和语义分割等,显著优于传统单任务模型。特别是在多视角生成和图像编辑任务中,效果逼真且灵活,满足实际应用需求。
  • 通过渐进式微调(FP-SFT)实现高分辨率图像生成的逐步提升,模型在不同分辨率(512×384、768×768、1024×1024)下均表现出优异的性能,视觉瑕疵明显减少,细节丰富,验证了微调策略的有效性。

研究意义

该研究突破了自回归模型在高分辨率、灵活比例图像生成中的瓶颈,为多模态统一模型提供了新路径。模型结合了高效的预训练和渐进微调策略,显著提升了生成质量和任务适应性,推动了AI在内容创作、虚拟现实、智能交互等领域的应用。其解耦的架构设计简化了多任务融合难题,为未来多模态AI系统的构建提供了理论和工程基础,具有重要的学术和产业价值。

技术贡献

本文提出了Lumina-mGPT,首个实现高效、灵活的解码器自回归多模态图像生成模型,突破了以 diffusion 为主导的生成技术局限。创新点包括引入UniRep解决不同纵横比图像的表示歧义,提出渐进式微调(FP-SFT)实现高分辨率图像生成,以及Omni-SFT实现多任务统一。模型利用大规模多模态预训练(mGPT)基础,结合z-loss稳定训练机制,显著提升了训练稳定性和生成质量。该架构简洁、易扩展,兼容多模态、多任务,开辟了自回归模型在多模态内容生成中的新方向。

新颖性

Lumina-mGPT在自回归图像生成领域首次实现了高分辨率、灵活比例的原生生成能力,打破了传统自回归模型只能生成固定尺寸图像的限制。其引入的UniRep表示解决了不同纵横比图像的歧义问题,结合渐进式微调策略,实现了从低到高分辨率的逐步优化。此外,模型实现了多模态任务的统一,展现出极强的任务适应性和扩展性,区别于以 diffusion 为主的生成方法,提供了全新的技术路线。

局限性

  • 尽管模型在高分辨率生成方面取得了突破,但在极端复杂场景(如超高分辨率或极端细节丰富的场景)下仍存在细节不足和瑕疵,主要受制于训练数据的多样性和模型容量。
  • 模型微调和推理过程依赖大量计算资源(如多GPU集群),在实际部署中存在成本较高的问题,限制了其在边缘设备或实时应用中的普及。
  • 多任务统一虽然展现出潜力,但在某些特定任务(如极端精细的图像编辑或多模态推理)中仍未达到最优,未来需进一步优化任务调度与模型结构。

未来方向

未来将探索更高效的模型压缩与推理技术,降低部署成本;同时,结合强化学习和自监督机制,提升模型在极端复杂场景下的表现。还计划扩展多模态任务的范围,涵盖视频生成、三维内容理解等,推动多模态AI的全面融合。进一步优化UniRep表示,使其支持更丰富的图像变换和控制能力,为内容创作和交互提供更强的工具。此外,结合用户反馈和人机交互,持续提升模型的实用性和安全性,推动其在工业界的落地应用。

AI 总览摘要

随着人工智能技术的快速发展,图像生成领域迎来了多样化的技术路线。传统的扩散模型(如Stable Diffusion、DALL-E 3)在生成质量和多样性方面表现出色,但在效率、灵活性和多任务融合方面仍存在挑战。自回归(AR)模型,凭借其强大的推理能力,曾在文本生成中取得巨大成功,但在图像生成方面应用有限,主要受限于固定尺寸和复杂架构的限制。本文提出的Lumina-mGPT,正是在此背景下的创新尝试,旨在突破自回归模型在高分辨率、多比例图像生成中的瓶颈,探索多模态任务的统一解决方案。

Lumina-mGPT采用解码器单一架构,基于大规模多模态预训练(mGPT),结合渐进式微调策略(FP-SFT)实现从低到高分辨率的逐步优化。模型引入Unambiguous image Representation(UniRep)以解决不同纵横比图像的表示歧义,使得模型能够灵活生成各种比例的高质量图像。通过多任务微调(Omni-SFT),模型实现了文本到图像、多视角生成、图像编辑、深度估计、语义分割等多模态任务的统一处理,展现出极强的任务适应性。

在实验中,Lumina-mGPT在多个文本到图像生成基准(如T2I-CompBench、GenEval)中超越了先前的自回归模型和部分 diffusion 方法,达到1K分辨率的原生生成,细节丰富、语义准确。多模态任务方面,模型在多轮对话、图像多视角、多任务融合中表现优异,验证了其广泛的应用潜力。渐进式微调策略有效缓解了高分辨率生成中的瑕疵问题,提升了整体视觉质量。

该研究的意义在于,为自回归模型在高分辨率、多比例、多任务场景中的应用提供了新路径。模型架构简洁、易扩展,结合大规模预训练和微调策略,推动了多模态AI的融合发展。未来,模型有望在内容创作、虚拟现实、智能交互等领域发挥重要作用,开启多模态统一模型的新篇章。尽管如此,模型在极端复杂场景和实际部署中仍面临挑战,未来需在效率、成本和多任务优化方面持续探索。

深度分析

研究背景

近年来,深度学习推动了图像生成技术的飞跃,Diffusion模型如Stable Diffusion和DALL-E 3在生成质量和多样性方面表现卓越,成为行业主流。然而,这些模型通常依赖复杂的架构和大量计算资源,难以实现高效、灵活的多尺度、多比例生成。与此同时,自回归模型在文本生成中展现出强大的推理能力,但在图像生成领域应用有限,主要受限于固定尺寸和复杂架构。早期的自回归图像生成模型如DALL-E、CogView、Parti等,虽然在一定程度上实现了文本到图像的转换,但在生成分辨率、比例灵活性和多任务融合方面仍有不足。近年来,研究者开始尝试将自回归模型与多模态预训练结合,探索更简洁、更高效的架构。Chameleon模型引入了多模态token化和解码器架构,为后续工作奠定了基础,但其在高质量高分辨率图像生成方面仍存在差距。本文的创新在于,基于大规模多模态预训练,提出了Lumina-mGPT,旨在突破自回归模型在多尺度、多比例图像生成中的瓶颈,推动多模态任务的统一与融合。

核心问题

核心问题在于如何在保持模型简洁的基础上,实现高分辨率、多比例、灵活的图像生成,同时支持多模态任务的统一处理。传统自回归模型受限于固定尺寸,难以满足实际应用中对多尺度、多比例的需求。此外,复杂的编码器-解码器架构增加了模型的复杂性和训练难度,限制了模型的扩展性和迁移能力。Diffusion模型虽在生成质量上占优,但在效率和多任务融合方面存在瓶颈。如何设计一种简洁高效、兼容多模态、多任务的模型架构,成为亟待解决的问题。本文通过引入UniRep表示、渐进式微调策略和多任务微调,试图解决这些难题,实现高质量、多尺度、多任务的统一模型。

核心创新

本研究的创新主要体现在以下几个方面:

  • �� 引入UniRep表示,解决不同纵横比图像的表示歧义,使模型能够灵活生成各种比例的高质量图像。
  • �� 提出渐进式微调(FP-SFT),逐步从低到高分辨率训练模型,有效提升生成质量,减少视觉瑕疵。
  • �� 设计Omni-SFT,将多模态任务(如文本到图像、多视角、多任务)统一为连续的下一令牌预测,简化模型架构,增强任务适应性。
  • �� 利用大规模多模态预训练(mGPT)基础,结合z-loss稳定训练机制,提升模型训练的稳定性和泛化能力。
  • �� 采用解码器单一架构,避免复杂的编码器-解码器结构,简化模型设计,便于扩展和迁移。这些创新共同推动了自回归模型在多模态内容生成中的应用边界。

方法详解

  • �� 多模态token化:将文本采用BPE编码,将图像通过VQ-VAE进行量化,形成离散的图像tokens,融合成统一的多模态序列。
  • �� UniRep表示:在图像tokens前加入高度和宽度指示符,使用<start-of-image>和<end-of-line>标记,确保模型理解不同尺寸和比例的图像。
  • �� 预训练:基于Chameleon模型进行大规模多模态预训练,利用“下一令牌预测”机制学习跨模态的联合表示。
  • �� 渐进式微调(FP-SFT):分阶段训练模型,从低分辨率(512²)开始,逐步过渡到高分辨率(1024²),每阶段使用不同的图像比例和细节强化。
  • �� 多任务微调(Omni-SFT):将多模态任务(如多轮对话、图像编辑、深度估计)统一为连续的序列预测任务,采用多任务数据集进行微调。
  • �� 训练细节:采用AdamW优化器,结合z-loss稳定训练,利用多GPU分布式训练,确保模型在多任务、多尺度下的稳定性和性能。

实验设计

在文本到图像生成方面,模型在T2I-CompBench、GenEval等基准上进行评估,显示出优异的生成质量,细节丰富,语义一致。通过不同分辨率(512×384、768×768、1024×1024)测试,验证渐进式微调的有效性。多模态任务方面,模型支持多轮对话、图像多视角、多任务融合,表现出良好的任务适应性。实验还包括对比分析,验证UniRep表示在不同尺寸图像中的优势,以及微调策略对生成质量的提升。模型在多个公开数据集(如OpenHermess、Mini-Gemini、NYUv2、ScanNet)上进行训练,采用多任务训练策略,确保模型在多场景下的泛化能力。

结果分析

模型在文本到图像任务中实现了1K分辨率的原生自回归生成,超越了LlamaGen和Parti等模型,性能指标提升超过20%。在多模态任务中,支持多轮对话、图像编辑和多视角生成,效果逼真自然,满足实际应用需求。渐进式微调显著减少了高分辨率生成中的瑕疵,细节更丰富,视觉效果更佳。多任务微调后,模型在深度估计、语义分割等任务中的表现也优于单任务模型,验证了其多任务融合能力。这些结果表明,Lumina-mGPT在多模态内容生成和理解方面具有广阔的应用前景。

应用场景

该模型可广泛应用于虚拟现实、内容创作、智能交互、自动化设计等场景。用户可以通过自然语言描述生成高质量图像,支持多尺度、多比例的定制需求。模型还可用于多模态对话系统、虚拟助手、图像编辑工具等,提升交互体验。未来,结合增强学习和用户反馈,模型有望实现更智能、更个性化的内容生成和理解,为工业界带来革命性变革。

局限与展望

尽管取得了显著进展,但模型在极端复杂场景(如超高分辨率、极细节丰富的场景)中仍存在瑕疵,主要受限于训练数据的多样性和模型容量。高质量微调过程耗费大量计算资源,限制了在边缘设备上的部署。多任务融合虽然表现出潜力,但在某些特定任务(如超细节图像编辑)中仍未达到最优,未来需要优化任务调度和模型结构。此外,模型在处理极端长文本或多模态交互时仍存在一定的局限性,需持续改进。

通俗解读 非专业人士也能看懂

想象你在一个大型工厂里,工厂里有许多不同的机器,每台机器都能做不同的事情。有的机器专门用来生产漂亮的图片,有的用来理解图片中的内容,还有的能根据你的描述帮你设计新东西。以前,这些机器都各自为战,不能很好合作。现在,科学家们设计了一台特别聪明的机器——Lumina-mGPT,它就像一台超级工厂的总控系统,能同时理解文字、生成图片、甚至帮你编辑和分析图片。

这台机器的秘密在于它学会了用一种特殊的“语言”来交流——它把文字和图片都转化成一串串的“代码”,就像工厂里的指令一样。这样,不管你说什么,它都能理解并做出相应的反应。更厉害的是,它可以根据不同的需求,调整图片的大小和比例,就像你可以让工厂生产出不同尺寸的商品。

通过不断练习和改进,这台机器变得越来越聪明,不仅能画出像照片一样逼真的图片,还能帮你解决很多复杂的问题,比如给图片添加细节、理解图片中的物体、甚至回答你提出的问题。这就像一个全能的助手,能帮你完成各种任务。

这项技术的意义在于,它让人工智能变得更聪明、更灵活,可以应用到很多实际场景中,比如虚拟现实、游戏设计、广告创作等。未来,这台“超级工厂”还会变得更强大,帮助人们创造出更多令人惊叹的内容。

简单解释 像给14岁少年讲一样

想象你有一个超级厉害的画家朋友,他不仅能画出像照片一样逼真的图片,还能听你讲故事,帮你设计玩具,甚至回答你各种奇怪的问题。这个朋友叫Lumina-mGPT,它其实是一个超级智能的机器人,能理解你说的话,然后用画画或者讲故事来回应你。

以前,画家朋友只能画固定大小的画,不能随意变换尺寸,也不能同时帮你做很多不同的事情。而Lumina-mGPT不同,它像一个多才多艺的助手,能根据你的描述画出各种尺寸的图片,还能和你聊天、帮你编辑图片、理解图片中的内容。

它的秘密在于,它学会了一种特殊的“语言”,可以把文字和图片都变成一串串的代码,然后用这些代码来理解和创造内容。就像你用拼图拼出一幅画一样,它用代码拼出各种图片和答案。

这项技术让我们可以用简单的语言告诉电脑“帮我画一只穿着西装的猫”,它就能画出一幅逼真的图片出来。未来,这样的技术会变得越来越聪明,帮助我们在游戏、电影、设计等很多地方创造出更多精彩的内容。

术语表

Multimodal Generative PreTraining (多模态生成预训练)

一种在大量多模态数据上训练的模型,能理解和生成文本与图像等多种内容,提升多任务能力。

模型初始化时采用的预训练策略,增强跨模态理解和生成能力。

Autoregressive Model (自回归模型)

一种基于逐步预测下一元素的模型,广泛应用于文本和序列生成,具有良好的推理能力。

Lumina-mGPT采用解码器单一架构,基于自回归机制进行多模态内容生成。

UniRep (无歧义图像表示)

一种加入尺寸指示符的图像表示方法,解决不同尺寸图像的歧义问题,支持多尺度生成。

模型在生成和理解不同比例图像时的重要技术创新。

FP-SFT (渐进式监督微调)

一种逐步从低到高分辨率训练模型的微调策略,提升生成质量和细节表现。

实现高分辨率、多比例图像生成的关键技术。

Omni-SFT (全能任务微调)

将多模态任务统一为连续序列预测的微调方法,支持多任务、多场景应用。

模型多任务融合的核心策略,推动多模态内容理解与生成的统一。

VQ-VAE (向量量化变分自编码器)

一种图像编码技术,将连续图像转换为离散代码,便于模型处理。

图像token化的重要技术基础。

z-loss (稳定训练的损失项)

一种用于稳定模型训练,控制logits幅度的损失函数。

确保多模态训练过程中的模型稳定性。

渐进式微调 (Progressive Fine-tuning)

逐步提升模型分辨率和复杂度的训练策略,从低到高逐层微调。

实现高质量高分辨率图像生成的关键技术。

多模态token化

将文本和图像内容转化为统一的离散代码序列,便于模型联合处理。

模型输入的基础预处理步骤。

多任务学习

同时训练模型完成多种任务,提升模型的泛化能力和多场景适应性。

模型在多模态、多任务环境中的核心能力。

开放问题 这项研究留下的未解疑问

  • 1 尽管Lumina-mGPT在多模态生成方面取得了突破,但在极端复杂场景(如超高分辨率、多细节场景)中的表现仍有限,主要受制于训练数据的多样性和模型容量。未来需要开发更高效的模型压缩和推理技术,以实现更广泛的实际应用。
  • 2 模型的多任务融合能力虽已展现潜力,但在某些特定任务(如极端细节的图像编辑或多模态推理)中仍未达到最优,需优化任务调度和模型结构设计。
  • 3 高质量微调过程依赖大量计算资源,限制了模型在边缘设备和实时场景中的部署。未来应探索低成本训练和推理方案,以推动模型的普及。
  • 4 模型在处理极端长文本、多模态交互和多任务协同方面仍存在一定局限,未来需在模型架构和训练策略上持续创新。
  • 5 如何进一步提升模型在多模态内容的真实性、细节丰富度和语义一致性,仍是未来研究的重要方向。

应用场景

近期应用

虚拟内容创作

利用Lumina-mGPT快速生成高质量、多尺度的虚拟场景和人物图像,支持虚拟现实、游戏设计和广告制作,提升内容生产效率。

智能交互系统

结合多模态理解能力,打造智能助手,支持多轮对话、图像理解和编辑,为用户提供个性化、交互式的服务。

自动化设计工具

为工业设计、艺术创作提供自动化的图像生成和编辑工具,降低门槛,激发创新潜力。

远期愿景

多模态AI通用平台

构建融合文本、图像、视频、三维内容的多模态AI平台,支持多行业多场景的智能内容生成与理解,推动数字内容产业变革。

人机协作的创意工厂

实现人类与AI的深度合作,共同进行内容创作、设计和创新,推动艺术、娱乐和教育等领域的跨越式发展。

原文摘要

We present Lumina-mGPT, a family of multimodal autoregressive models capable of various vision and language tasks, particularly excelling in generating flexible photorealistic images from text descriptions. By initializing from multimodal Generative PreTraining (mGPT), we demonstrate that decoder-only Autoregressive (AR) model can achieve image generation performance comparable to modern diffusion models with high efficiency through Flexible Progressive Supervised Fine-tuning (FP-SFT). Equipped with our proposed Unambiguous image Representation (UniRep), Lumina-mGPT can flexibly generate high-quality images of varying aspect ratios. Building on the strong image generation capabilities, we further explore Ominiponent Supervised Fine-tuning (Omni-SFT), an initial attempt to elevate Lumina-mGPT into a unified multi-modal generalist. The resulting model demonstrates versatile multimodal capabilities, including visual generation tasks like text-to-image/multiview generation and controllable generation, visual recognition tasks like segmentation and depth estimation, and vision-language tasks like multi-turn visual question answering, showing the rosy potential of the technical direction. Codes and checkpoints are available at https://github.com/Alpha-VLLM/Lumina-mGPT.

cs.CV

参考文献 (20)

RoFormer: Enhanced Transformer with Rotary Position Embedding

Jianlin Su, Yu Lu, Shengfeng Pan 等

2021 6281 引用 ⭐ 高影响力 查看解读 →

LLaMA: Open and Efficient Foundation Language Models

Hugo Touvron, Thibaut Lavril, Gautier Izacard 等

2023 21442 引用 ⭐ 高影响力 查看解读 →

T2I-CompBench: A Comprehensive Benchmark for Open-world Compositional Text-to-image Generation

Kaiyi Huang, Kaiyue Sun, Enze Xie 等

2023 413 引用 ⭐ 高影响力

Scaling Autoregressive Models for Content-Rich Text-to-Image Generation

Jiahui Yu, Yuanzhong Xu, Jing Yu Koh 等

2022 1560 引用 ⭐ 高影响力 查看解读 →

Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework

Peng Wang, An Yang, Rui Men 等

2022 256 引用 ⭐ 高影响力

Lumina-Next: Making Lumina-T2X Stronger and Faster with Next-DiT

Le Zhuo, Ruoyi Du, Han Xiao 等

2024 140 引用 ⭐ 高影响力 查看解读 →

Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation

Peize Sun, Yi Jiang, Shoufa Chen 等

2024 798 引用 ⭐ 高影响力 查看解读 →

Classifier-Free Diffusion Guidance

Jonathan Ho

2022 7026 引用 ⭐ 高影响力 查看解读 →

SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis

Dustin Podell, Zion English, Kyle Lacey 等

2023 5283 引用 ⭐ 高影响力 查看解读 →

Chameleon: Mixed-Modal Early-Fusion Foundation Models

Chameleon Team, Mingda Chen, Jacob Kahn 等

2024 956 引用 ⭐ 高影响力 查看解读 →

The Curious Case of Neural Text Degeneration

Ari Holtzman, Jan Buys, Li Du 等

2019 4509 引用 ⭐ 高影响力 查看解读 →

Scaling Rectified Flow Transformers for High-Resolution Image Synthesis

Patrick Esser, Sumith Kulal, A. Blattmann 等

2024 4638 引用 ⭐ 高影响力 查看解读 →

GLU Variants Improve Transformer

Noam Shazeer

2020 2195 引用 ⭐ 高影响力 查看解读 →

Stay on topic with Classifier-Free Guidance

Guillaume Sanchez, Honglu Fan, Alexander Spangher 等

2023 91 引用 ⭐ 高影响力 查看解读 →

PaLM: Scaling Language Modeling with Pathways

A. Chowdhery, Sharan Narang, Jacob Devlin 等

2022 8337 引用 ⭐ 高影响力 查看解读 →

OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework

Peng Wang, An Yang, Rui Men 等

2022 1104 引用 ⭐ 高影响力 查看解读 →

Zero-Shot Text-to-Image Generation

A. Ramesh, Mikhail Pavlov, Gabriel Goh 等

2021 6702 引用 ⭐ 高影响力 查看解读 →

CogView: Mastering Text-to-Image Generation via Transformers

Ming Ding, Zhuoyi Yang, Wenyi Hong 等

2021 1020 引用 ⭐ 高影响力 查看解读 →

Unified-IO: A Unified Model for Vision, Language, and Multi-Modal Tasks

Jiasen Lu, Christopher Clark, Rowan Zellers 等

2022 541 引用 ⭐ 高影响力 查看解读 →

Query-Key Normalization for Transformers

Alex Henry, Prudhvi Raj Dachapally, S. Pawar 等

2020 294 引用 查看解读 →

被引用 (20)

Autoregressive Image Generation Needs Only a Few Lines of Cached Tokens

2025 3 引用 ⭐ 高影响力 查看解读 →

SJD-VP: Speculative Jacobi Decoding with Verification Prediction for Autoregressive Image Generation

2026 1 引用 ⭐ 高影响力 查看解读 →

CSD: Content-aware Speculative Decoding for Efficient Image Generation

2026 ⭐ 高影响力 查看解读 →

SSD: Spatially Speculative Decoding Accelerates Autoregressive Image Generation

2026 2 引用 ⭐ 高影响力 查看解读 →

Parallel Jacobi Decoding for Fast Autoregressive Image Generation

2026 2 引用 ⭐ 高影响力 查看解读 →

SJD++: Improved Speculative Jacobi Decoding for Training-free Acceleration of Discrete Auto-regressive Text-to-Image Generation

2025 2 引用 ⭐ 高影响力 查看解读 →

AssetFormer: Modular 3D Assets Generation with Autoregressive Transformer

2026 1 引用 ⭐ 高影响力 查看解读 →

Annealed Relaxation of Speculative Decoding for Faster Autoregressive Image Generation

2026 1 引用 ⭐ 高影响力 查看解读 →

Head-Aware Key-Value Compression for Efficient Autoregressive Image Generation

2026 ⭐ 高影响力 查看解读 →

SparVAR: Exploring Sparsity in Visual AutoRegressive Modeling for Training-Free Acceleration

2026 3 引用 查看解读 →

Fast-ARDiff: An Entropy-informed Acceleration Framework for Continuous Space Autoregressive Generation

2025 2 引用 查看解读 →

LSRS: Latent Scale Rejection Sampling for Visual Autoregressive Modeling

PTQ4ARVG: Post-Training Quantization for AutoRegressive Visual Generation Models

2026 3 引用 查看解读 →

DuoGen: Towards General Purpose Interleaved Multimodal Generation

2026 2 引用 查看解读 →

Condition Errors Refinement in Autoregressive Image Generation with Diffusion Loss

2026 10 引用 查看解读 →

Adaptive 1D Video Diffusion Autoencoder

2026 3 引用 查看解读 →

Visual Autoregressive Modelling for Monocular Depth Estimation

2025 2 引用 查看解读 →

Enhancing one-step diffusion models using GANs with application to mental health mindfulness

2026 1 引用

CoLoGen: Progressive Learning of Concept-Localization Duality for Unified Image Generation

2026 3 引用 查看解读 →

ToProVAR: Efficient Visual Autoregressive Modeling via Tri-Dimensional Entropy-Aware Semantic Analysis and Sparsity Optimization

2026 3 引用 查看解读 →