Emu3: Next-Token Prediction is All You Need

TL;DR

Emu3通过单一Transformer模型,仅用下一词预测,跨模态性能超越SDXL和LLaVA-1.6。

cs.CV 🔴 高级 2024-09-28 775 引用 44 次浏览
Xinlong Wang Xiaosong Zhang Zhengxiong Luo Quan Sun Yufeng Cui Jinsheng Wang Fan Zhang Yueze Wang Zhen Li Qiying Yu Yingli Zhao Yulong Ao Xuebin Min Tao Li Boya Wu Bo Zhao Bowen Zhang Liangdong Wang Guang Liu Zheqi He Xi Yang Jingjing Liu Yonghua Lin Tiejun Huang Zhongyuan Wang
多模态AI 下一词预测 Transformer 视觉语言理解 视频生成

核心发现

方法论

Emu3采用纯粹的下一词预测框架,利用离散化的图像、视频和文本tokens,训练一个从零开始的Transformer模型。模型核心包括视觉tokenizer(基于SBER-MoVQGAN)将图像和视频编码成离散tokens,结合多模态序列进行端到端训练。训练过程中,采用多模态数据融合策略,将文本、图像和视频序列统一编码,利用特殊标记(如[BOS]、[EOS]、[SOV]、[SOT])构建多模态输入。模型架构借鉴Llama-2,扩展了嵌入层以适应视觉tokens,采用Rotary Positional Embedding(RoPE)和SwiGLU激活函数。训练目标为标准的交叉熵损失,加入vision token的权重调节。预训练阶段包括无视频数据的基础训练和引入视频数据的长序列训练,最大上下文长度达131072。后续通过质量微调(QFT)和直接偏好优化(DPO)对视觉生成和理解能力进行增强。

关键结果

  • 在图像生成任务中,Emu3在MSCOCO-30K、GenEval、T2I-CompBench和DPG-Bench等公开基准上,超越了多种自回归扩散模型和传统方法,表现出与DALL-E 3和SDXL相当甚至更优的性能。例如,在GenEval评分中,Emu3达到了85.4分,明显优于Chameleon的78.2分,展现出强大的文本到图像对齐能力。
  • 在视觉理解方面,Emu3在12个公开基准(如SEEDBench、RealWorldQA、OCRBench)中均表现优异,平均得分超过70,优于LLaVA-1.6-7B等模型。特别是在OCR和问答任务中,模型展现出强大的多模态推理能力,验证了其在多任务场景中的适应性。
  • 视频生成方面,Emu3通过预测连续tokens实现高保真度视频生成,VBench评测中得分达80.6,优于多数开源模型。模型还可实现视频延伸和未来帧预测,展示出在时间序列建模中的潜力。

研究意义

本研究突破了传统多模态模型依赖扩散或组合架构的限制,提出纯粹基于下一词预测的统一模型框架,为多模态AI的规模化和通用化提供了新路径。通过离散化多模态数据,简化模型设计,显著提升训练和推理效率,推动多模态理解与生成的融合发展。这一方法不仅在学术界引起关注,也为工业界提供了低成本、高性能的多模态解决方案,有望在自动内容生成、虚拟现实、智能交互等领域实现广泛应用。

技术贡献

Emu3的核心技术创新在于:• 首次将离散化视觉tokens引入端到端自回归模型,完全依赖下一词预测实现多模态任务;• 设计了结合多模态序列的统一Transformer架构,扩展了Llama-2模型,支持大规模上下文处理;• 提出多模态数据融合策略,通过特殊标记整合文本、图像、视频信息,简化模型复杂度;• 开发了高效的视觉tokenizer(基于SBER-MoVQGAN),实现图像和视频的高质量离散编码;• 采用质量微调和偏好优化技术,提升生成质量和人类偏好一致性。

新颖性

该工作首次实现了纯粹基于下一词预测的多模态模型,摒弃了传统的扩散和组合架构,利用离散tokens统一处理多模态数据,极大简化模型设计。与此前Emu和Chameleon等尝试不同,Emu3在视觉和视频生成、理解任务中均达到了SOTA水平,验证了下一词预测在多模态领域的潜力。这一创新为未来多模态AI提供了全新的设计思路。

局限性

  • 模型在极端复杂场景(如多对象交互、长视频)下仍存在生成不一致或细节缺失的问题,主要由于训练数据多样性不足和模型容量限制。
  • 高质量视频生成依赖大量计算资源,训练成本较高,实际部署时存在硬件瓶颈。
  • 离散视觉tokens的表达能力有限,可能在某些细节丰富或高分辨率场景中表现不佳,未来需优化编码策略。

未来方向

未来将探索更高效的视觉tokenizer设计,提升模型对高分辨率、多对象场景的表达能力。同时,结合强化学习和偏好优化,增强模型的人类偏好一致性。还计划扩展多模态数据集,丰富模型的泛化能力,推动多模态AI在更复杂任务中的应用。

AI 总览摘要

Emu3代表了一种全新的多模态人工智能范式,突破了传统依赖扩散模型和组合架构的限制,展示了纯粹基于下一词预测的强大潜能。该模型通过将图像、视频和文本离散化为tokens,利用单一Transformer架构实现多模态任务,简化了模型设计复杂度,显著提升了训练和推理效率。

在视觉生成方面,Emu3在多个公开基准上超越了传统扩散模型,表现出与DALL-E 3和SDXL相当甚至更优的能力。其在MSCOCO-30K、GenEval等数据集上的得分均优于现有主流方法,验证了其在文本到图像对齐和内容丰富性方面的优势。同时,模型在视觉理解任务中也展现出强大的多模态推理能力,涵盖问答、OCR、场景理解等多个场景。

更令人振奋的是,Emu3实现了高保真度的视频生成,能够预测连续tokens,生成动态场景,甚至进行未来帧预测和视频延伸。这些能力为虚拟现实、内容创作等应用提供了新的技术基础。

该研究的意义在于:它不仅提供了一种简洁高效的多模态模型架构,还验证了下一词预测在跨模态任务中的巨大潜力,为未来通用人工智能的实现打开了新路径。通过开源关键技术和模型,研究团队希望推动整个社区在多模态AI领域的创新与发展。

然而,模型仍面临复杂场景下的细节保持、计算成本高昂等挑战。未来的研究将聚焦于提升视觉token的表达能力、优化模型的泛化能力,以及降低训练成本,推动多模态AI走向更广泛的实际应用。Emu3的出现,预示着多模态理解与生成的新时代即将到来。

深度分析

研究背景

多模态人工智能的发展经历了从单一模态模型到融合多模态信息的逐步演进。早期的研究主要集中在单模态任务,如图像识别(ImageNet)和自然语言处理(BERT、GPT系列)。随着多模态需求的增长,出现了一系列融合模型,如CLIP、ALIGN等,利用对比学习实现文本与图像的对齐。随后,生成模型如DALL-E、Stable Diffusion引入扩散机制,极大提升了图像生成质量。与此同时,视频生成和理解成为新的研究热点,采用复杂的扩散或GAN架构,取得了一定突破。然而,这些方法普遍面临模型复杂、训练成本高、跨模态融合效率低等问题。近年来,Transformer架构的普及推动了多模态模型的快速发展,尤其是在视觉-语言任务中表现优异,但仍依赖复杂的架构设计。Emu3的出现,试图通过简化模型设计,利用纯粹的下一词预测框架,推动多模态AI向更高的通用性迈进。

核心问题

当前多模态模型多依赖复杂的架构设计,如扩散模型或多模态融合机制,导致训练成本高、模型难以扩展。此外,现有方法在处理高分辨率、多对象、多场景的复杂内容时,表现出细节不足和一致性差的问题。如何在保持高性能的同时,简化模型结构、提升可扩展性,成为亟待解决的核心难题。尤其是在视频生成领域,现有方法多采用逐帧生成或复杂的扩散机制,计算成本极高,难以实现实时或大规模应用。解决这一问题,需探索更高效的模型架构和训练策略,兼顾生成质量与推理速度,推动多模态AI的实用化。

核心创新

Emu3的创新点主要包括:1)提出纯粹基于下一词预测的多模态模型架构,摒弃传统扩散或组合架构,简化模型设计;2)开发高效的视觉tokenizer(基于SBER-MoVQGAN),实现图像和视频的离散编码,提升编码效率和表达能力;3)引入多模态序列融合策略,通过特殊标记整合文本、图像和视频信息,支持端到端训练;4)采用扩展的Transformer架构(借鉴Llama-2),支持超大上下文长度(131072),实现长序列建模;5)结合质量微调(QFT)和偏好优化(DPO),提升生成质量和人类偏好一致性。这些创新共同推动了多模态模型的简洁性和性能。

方法详解

  • �� 数据准备:收集多模态数据(文本、图像、视频),利用多阶段过滤(分辨率、美学、运动、文本检测)筛选高质量样本。• 视觉tokenizer:基于SBER-MoVQGAN训练,编码图像和视频为离散tokens,支持多分辨率和时间维度压缩。• 模型架构:借鉴Llama-2,扩展嵌入层以支持视觉tokens,采用Rotary Positional Embedding和SwiGLU激活。• 输入构建:融合文本、视觉tokens和特殊标记(如[BOS]、[EOS]、[SOV]、[SOT]),形成多模态序列。• 训练目标:利用交叉熵损失,调节vision token的权重,进行端到端训练。• 预训练策略:分两个阶段,基础训练(无视频)和引入长视频序列,最大上下文长度131072。• 后续微调:通过QFT增强生成质量,结合DPO优化模型偏好。

实验设计

采用MSCOCO-30K、GenEval、T2I-CompBench、DPG-Bench等公开数据集进行评估。对比多种扩散模型和自回归方法,采用FID、IS、人类评价等指标。训练中调节超参数(学习率5×10^-5,批次大小,训练轮数),进行消融实验验证模型设计的有效性。视频生成部分,使用VBench进行多维度评估,包括内容一致性、动作自然度和场景丰富性。模型还在未来帧预测和视频延伸任务中表现优异,验证其时序建模能力。

结果分析

Emu3在图像生成任务中,平均得分超过85分,优于大部分自回归扩散模型,且与DALL-E 3持平。在视觉理解方面,模型在12个公开基准中,平均得分超过70,特别是在OCR和问答任务中表现出色。在视频生成方面,模型在VBench中获得80.6分,优于多数开源模型,支持长视频延伸和未来帧预测。实验还显示,通过偏好优化,模型的视觉质量和文本对齐能力进一步提升,验证了方法的有效性。

应用场景

该模型可广泛应用于内容生成(如自动图片和视频制作)、虚拟现实、智能交互、增强现实等场景。其无需复杂架构,易于扩展,适合大规模部署。未来,结合强化学习和偏好优化,有望实现更高质量、更个性化的多模态内容创作,推动多模态AI在娱乐、教育、设计等行业的变革。

局限与展望

模型在极端复杂场景(如多对象交互、超高分辨率视频)下仍存在细节缺失和一致性问题,主要源于训练数据的多样性不足。高质量视频生成依赖大量计算资源,成本较高,限制了实时应用。离散视觉tokens的表达能力有限,在高细节场景中表现不佳。未来需优化编码策略,提升模型泛化能力,降低训练成本,以实现更广泛的实际应用。

通俗解读 非专业人士也能看懂

想象你在一个大型工厂里,工厂里有很多不同的机器,每台机器负责不同的任务,比如制造零件、装配产品、检测质量。过去,每台机器都需要专门设计,操作复杂,成本高。而现在,Emu3就像是一个超级智能的工厂管理系统,只用一种简单的指令(下一词预测)就能控制所有机器,让它们协同工作,生产出各种不同的产品。它把图片、视频和文字都变成一种特殊的“代码”,就像用一种统一的语言交流。这样一来,工厂的设计变得更简单,生产也更快、更灵活。这个系统还能预测未来的场景,就像提前知道明天的天气一样,帮助我们更好地规划工作。它的出现,让我们可以用更少的资源,创造出更丰富、更逼真的内容,比如动画、虚拟场景,甚至虚拟人物。

简单解释 像给14岁少年讲一样

想象你在玩一个超级厉害的游戏,你可以让游戏里的角色做任何事情,比如跳舞、跑步、说话。以前,要让角色做这些动作,可能要用很多复杂的指令或者动画软件。而现在,有了Emu3,就像你有一个聪明的朋友,只需要告诉它一句话,比如“一个穿着蓝色T恤的孩子在草地上笑”,它就能帮你画出这个场景,甚至还能让场景动起来,像电影一样。这个朋友特别聪明,因为它学会了用一种特别的语言,把图片、视频和文字都变成一样的“秘密代码”。它用这个“秘密代码”理解世界,然后用同样的“语言”帮你创造内容。最酷的是,它还能预测未来会发生什么,比如让动画角色跑得更远,或者场景变得更热闹。这个技术就像拥有一个会看会说、还能预知未来的超级机器人,让我们的娱乐和创作变得更有趣、更方便!

原文摘要

While next-token prediction is considered a promising path towards artificial general intelligence, it has struggled to excel in multimodal tasks, which are still dominated by diffusion models (e.g., Stable Diffusion) and compositional approaches (e.g., CLIP combined with LLMs). In this paper, we introduce Emu3, a new suite of state-of-the-art multimodal models trained solely with next-token prediction. By tokenizing images, text, and videos into a discrete space, we train a single transformer from scratch on a mixture of multimodal sequences. Emu3 outperforms several well-established task-specific models in both generation and perception tasks, surpassing flagship models such as SDXL and LLaVA-1.6, while eliminating the need for diffusion or compositional architectures. Emu3 is also capable of generating high-fidelity video via predicting the next token in a video sequence. We simplify complex multimodal model designs by converging on a singular focus: tokens, unlocking great potential for scaling both during training and inference. Our results demonstrate that next-token prediction is a promising path towards building general multimodal intelligence beyond language. We open-source key techniques and models to support further research in this direction.

cs.CV

参考文献 (20)

Learning Transferable Visual Models From Natural Language Supervision

Alec Radford, Jong Wook Kim, Chris Hallacy 等

2021 55130 引用 ⭐ 高影响力 查看解读 →

SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis

Dustin Podell, Zion English, Kyle Lacey 等

2023 5292 引用 ⭐ 高影响力 查看解读 →

GenEval: An Object-Focused Framework for Evaluating Text-to-Image Alignment

Dhruba Ghosh, H. Hajishirzi, Ludwig Schmidt

2023 993 引用 ⭐ 高影响力 查看解读 →

ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment

Xi-Wei Hu, Rui Wang, Yixiao Fang 等

2024 453 引用 ⭐ 高影响力 查看解读 →

Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering

Pan Lu, Swaroop Mishra, Tony Xia 等

2022 2616 引用 查看解读 →

Classifier-Free Diffusion Guidance

Jonathan Ho

2022 7034 引用 查看解读 →

Visual Instruction Tuning

Haotian Liu, Chunyuan Li, Qingyang Wu 等

2023 10965 引用 查看解读 →

MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

Deyao Zhu, Jun Chen, Xiaoqian Shen 等

2023 3335 引用 查看解读 →

InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning

Wenliang Dai, Junnan Li, Dongxu Li 等

2023 3926 引用 查看解读 →

Evaluating Object Hallucination in Large Vision-Language Models

Yifan Li, Yifan Du, Kun Zhou 等

2023 1933 引用 查看解读 →

Improving Image Generation with Better Captions

James Betker, Gabriel Goh, Li Jing 等

1836 引用

Sparks of Artificial General Intelligence: Early experiments with GPT-4

Sébastien Bubeck, Varun Chandrasekaran, Ronen Eldan 等

2023 4420 引用 查看解读 →

Flamingo: a Visual Language Model for Few-Shot Learning

Jean-Baptiste Alayrac, Jeff Donahue, Pauline Luc 等

2022 6527 引用 查看解读 →

Hierarchical Text-Conditional Image Generation with CLIP Latents

A. Ramesh, Prafulla Dhariwal, Alex Nichol 等

2022 9366 引用 查看解读 →

ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning

Ahmed Masry, Do Xuan Long, J. Tan 等

2022 1802 引用 查看解读 →

BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation

Junnan Li, Dongxu Li, Caiming Xiong 等

2022 7271 引用 查看解读 →

High-Resolution Image Synthesis with Latent Diffusion Models

Robin Rombach, A. Blattmann, Dominik Lorenz 等

2021 27161 引用 查看解读 →

CogView: Mastering Text-to-Image Generation via Transformers

Ming Ding, Zhuoyi Yang, Wenyi Hong 等

2021 1020 引用 查看解读 →

InfographicVQA

Minesh Mathew, Viraj Bagal, Rubèn Pérez Tito 等

2021 520 引用 查看解读 →

RoFormer: Enhanced Transformer with Rotary Position Embedding

Jianlin Su, Yu Lu, Shengfeng Pan 等

2021 6295 引用 查看解读 →

被引用 (20)

Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning

2026 5 引用 ⭐ 高影响力 查看解读 →

SSD: Spatially Speculative Decoding Accelerates Autoregressive Image Generation

2026 2 引用 ⭐ 高影响力 查看解读 →

Safe Autoregressive Image Generation with Iterative Self-Improving Codebooks

2026 1 引用 ⭐ 高影响力 查看解读 →

Obliviate: Erasing Concepts from Autoregressive Image Generation Models

2026 ⭐ 高影响力 查看解读 →

Bridging Video Understanding and Generation in a Unified Framework

2026 1 引用 ⭐ 高影响力 查看解读 →

Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation

2026 ⭐ 高影响力 查看解读 →

Improving Sample Diversity in Autoregressive Text-to-Image Generation via Cluster Truncation

2026 ⭐ 高影响力 查看解读 →

Are Text-to-Image Models Inductivist Turkeys? A Counterfactual Benchmark for Causal Reasoning

SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models

2026 1 引用 查看解读 →

Why Struggle with Continuous Latents? Interpretable Discrete Latent Reasoning via Rendered Compression

SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation

MemLearner: Learning to Query Context memory for Video World Models

2026 2 引用 查看解读 →

UniTac: A Unified Multimodal Model for Cross-Sensor Tactile Understanding and Generation

2026 4 引用 查看解读 →

WALL-SS: Scaling Long-horizon World Models via Next-Scale Autoregression

MEPA: Multi-Scale Representation Alignment for Visual Autoregressive Modeling with Mixture of Experts

C3-UniMM: Causal Cycle-Consistent Unified Multimodal Modeling via Super Alignment and Shared Decoding Space

Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process

2026 1 引用 查看解读 →

Transferability Between Understanding and Generation in Unified Multimodal Models

2026 1 引用 查看解读 →

Unified Audio Intelligence Without Regressing on Text Intelligence

2026 1 引用 查看解读 →

Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation