Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling

TL;DR

Janus-Pro通过优化训练策略、扩展数据和模型规模,在多模态理解与生成方面实现显著提升,模型规模达7B参数。

cs.AI 🔴 高级 2025-01-30 841 引用 43 次浏览
Xiaokang Chen Zhiyu Wu Xingchao Liu Zizheng Pan Wen Liu Zhenda Xie Xingkai Yu Chong Ruan
多模态理解 生成模型 模型扩展 训练策略 视觉语言模型

核心发现

方法论

Janus-Pro采用了基于独立视觉编码的架构,将理解与生成两个任务的视觉编码解耦,利用SigLIP提取高维语义特征进行理解,同时采用VQ tokenizer将图像离散化用于生成。模型基于HAIL-LLM(1.5B和7B)进行训练,结合优化的训练策略,包括延长Stage I训练时间、在Stage II中专注于纯文本描述的训练,以及调整数据比例。训练数据方面,扩展了包括YFCC、Docmatix等多源多模态数据,加入了约7200万合成美学数据,提升生成稳定性和美学质量。模型规模由1.5B扩展至7B参数,显著改善了收敛速度和性能表现。训练采用AdamW优化器,结合学习率调度和早停策略,确保模型在多模态理解和生成任务中的优异表现。

关键结果

  • Janus-Pro-7B在多模态理解基准MMBench中取得79.2分,超越Janus(69.4)和TokenFlow(68.9),显示出在多任务场景下的优越能力。其在POPE、MME-Perception、GQA等任务中表现优异,平均准确率提升显著。
  • 在文本到图像生成任务中,Janus-Pro-7B在GenEval中达到了80%的整体准确率,优于Janus(61%)和DALL-E 3(67%),显示出更强的指令遵循和细节还原能力。DPG-Bench得分也超过84,表明其在复杂密集指令下的生成能力优于现有模型。
  • 通过扩展训练数据和优化训练策略,模型在生成稳定性、细节丰富度和美学质量方面均有显著提升。实验还验证了模型在不同尺度(1B与7B)上的良好扩展性,模型收敛速度和性能均随参数规模增加而提升。

研究意义

该研究突破了多模态理解与生成的瓶颈,提出了视觉编码解耦的创新架构,有效缓解了理解与生成任务的冲突问题。模型在多个公开基准中均优于现有SOTA,推动了多模态模型在实际应用中的落地。其在视觉理解、指令遵循和高质量图像生成方面的能力,为智能助手、内容创作、虚拟现实等行业提供了强大技术支撑。通过模型规模的扩展和数据的丰富,Janus-Pro展示了多模态模型未来的巨大潜力,预示着多模态AI的广泛应用前景。

技术贡献

本研究的技术创新主要体现在三个方面:一是提出视觉编码的解耦架构,有效缓解理解与生成任务的冲突,提升模型整体性能;二是引入优化训练策略,包括延长Stage I训练时间、在Stage II中专注纯文本描述训练,显著提高训练效率和模型效果;三是大规模扩展训练数据,结合合成美学数据,提升模型的稳定性和生成质量。模型在多模态理解和生成两个任务上实现了双赢,突破了以往模型在短文本生成和细节还原方面的瓶颈。此外,模型参数从1.5B扩展到7B,验证了架构的良好扩展性和训练效率的提升,为未来大规模多模态模型提供了技术路线。

新颖性

该工作首次系统性地将视觉编码解耦应用于多模态理解与生成,提出了基于SigLIP和VQ tokenizer的双重视觉特征提取机制,解决了多模态任务中的表征冲突问题。通过优化训练流程和扩展多源数据,显著提升了模型的理解与生成能力。与传统端到端统一编码不同,Janus-Pro采用了任务专用的视觉编码策略,确保理解和生成任务的特征表达互不干扰。这一创新为多模态模型的架构设计提供了新的思路,推动了视觉语言融合技术的前沿发展。

局限性

  • 模型输入分辨率限制在384×384,影响细粒度任务(如OCR和微细结构识别)的性能,未来需提升输入分辨率以增强细节表现。
  • 生成图像的分辨率较低,受限于视觉编码器的重建损失,导致细节丰富度不足,尤其在面部细节和微小元素上表现欠佳。
  • 训练成本较高,模型参数规模扩大带来计算资源消耗增加,未来需优化模型压缩和推理效率以实现更广泛的应用。

未来方向

未来将探索更高分辨率的视觉输入与输出,提升模型在细粒度任务中的表现。还计划引入更丰富的多模态数据源,增强模型的跨领域泛化能力。此外,将结合最新的视觉编码技术和优化算法,降低训练成本,提升推理速度,推动模型在实际场景中的部署与应用。进一步研究模型在多任务、多模态融合中的鲁棒性和可解释性,推动多模态AI向更智能、更高效方向发展。

AI 总览摘要

在人工智能领域,多模态理解与生成一直是研究的热点与难点。传统模型多依赖单一模态或简单融合策略,难以兼顾理解深度与生成质量。随着大规模预训练模型的发展,诸如GPT、BERT等在文本领域取得巨大成功,但在视觉与多模态任务中仍面临表现不足、稳定性差等问题。

本研究提出了Janus-Pro,一种创新的多模态统一模型架构,核心在于视觉编码的解耦设计。通过引入SigLIP和VQ tokenizer,模型分别提取高维语义特征和离散图像表示,有效缓解理解与生成任务的表征冲突。这一架构允许模型在不同任务中采用专用的视觉编码策略,显著提升了多模态理解的准确性和生成的细节丰富度。

在训练策略方面,作者优化了传统的三阶段训练流程,延长了Stage I中的像素建模训练时间,确保模型在类别信息基础上学习像素依赖。同时,Stage II中舍弃了ImageNet的类别训练,直接使用丰富的纯文本描述数据,提升了模型在复杂指令下的生成能力。数据方面,扩展了多源多模态数据集,包括YFCC、Docmatix等,并加入7200万合成美学数据,增强模型的稳定性和美学表现。

模型规模从1.5B扩展到7B参数,实验结果显示,Janus-Pro在多个公开基准中均优于现有SOTA模型。在多模态理解任务中,Janus-Pro-7B在MMBench中获得79.2分,超越Janus(69.4)和TokenFlow(68.9);在文本到图像生成任务中,GenEval得分达80%,优于Janus(61%)和DALL-E 3(67%)。这些结果充分验证了架构设计和训练优化的有效性。

该研究的意义在于突破了多模态模型在理解与生成之间的瓶颈,为未来大规模、多任务、多模态模型的发展提供了技术基础。模型的成功不仅推动了学术研究的前沿,也为工业界在智能内容创作、虚拟助手、增强现实等应用场景中提供了强大工具。未来,模型将朝着更高分辨率、更丰富模态、更高效率的方向发展,期待其在实际场景中的广泛应用。

深度分析

研究背景

多模态理解与生成技术经历了从早期的单模态模型到多模态融合的快速发展。早期代表性工作包括ViLBERT、UNITER等,采用双流或多流架构实现视觉与文本的联合编码。随后,诸如LXMERT、VisualBERT等引入了多任务训练策略,增强模型在视觉问答、图像描述等任务中的表现。近年来,基于Transformer的统一模型如Janus、InstructBLIP、TokenFlow等,通过共享视觉编码实现多任务能力,但依然存在理解与生成任务的表征冲突、模型复杂度高等问题。现有模型在多模态理解、指令遵循和高质量生成方面取得了一定突破,但在细节还原、生成稳定性和模型扩展性方面仍有提升空间。随着大规模多模态数据的出现,结合深度学习的最新算法,推动了多模态模型的持续演进。

核心问题

当前多模态模型在理解与生成任务中面临两个主要瓶颈:一是表征冲突,视觉编码同时服务于理解和生成任务,导致性能互相制约;二是训练效率低,模型在多源多模态数据上训练时,存在数据利用率不高、训练成本高的问题。此外,模型在细粒度任务(如OCR、微细结构识别)表现不足,生成图像细节缺失,限制了其实际应用潜力。这些问题阻碍了多模态模型在更复杂场景中的部署与普及。

核心创新

本研究的核心创新在于提出视觉编码的解耦架构,采用SigLIP提取高维语义特征用于理解,VQ tokenizer将图像离散化用于生成,确保理解与生成任务的特征表达互不干扰。通过优化训练流程,包括延长像素建模训练时间和专注纯文本描述训练,提升模型的训练效率和效果。数据方面,扩展多源多模态数据集,加入7200万合成美学样本,增强模型的稳定性和生成质量。模型参数由1.5B扩展至7B,验证了架构的良好扩展性。这些创新共同推动了多模态模型在理解与生成任务中的性能提升。

方法详解

  • �� 视觉编码解耦:采用SigLIP提取图像高维语义特征,将二维特征展平为一维序列,输入理解适配器映射到LLM。
  • �� 图像离散化:使用VQ tokenizer将图像编码为离散ID序列,经过生成适配器映射到LLM。
  • �� 独立训练策略:延长Stage I训练时间,确保像素依赖建模;在Stage II中,舍弃ImageNet类别数据,直接用丰富的纯文本描述进行训练;在Stage III中,调整多模态与纯文本数据比例,优化训练效率。
  • �� 数据扩展:引入YFCC、Docmatix等多源多模态数据,加入7200万合成美学样本,提升模型的泛化能力和生成美学。
  • �� 模型扩展:从1.5B到7B参数,利用更大模型提升收敛速度和性能表现。
  • �� 训练细节:采用AdamW优化器,结合学习率调度和早停策略,确保模型在多任务中的稳定性和性能。

实验设计

实验在多个公开基准上进行,包括MMBench(多模态理解)、GenEval和DPG-Bench(文本到图像生成)。模型在理解任务中,Janus-Pro-7B获得79.2分,超越Janus(69.4)和TokenFlow(68.9),显示出在复杂多任务场景中的优越性。在生成任务中,GenEval得分达80%,明显优于Janus(61%)和DALL-E 3(67%),验证了指令遵循和细节还原能力。实验还包括不同模型尺度的对比、数据扩展的效果分析,以及训练策略的 Ablation 研究,确保模型在多方面的性能提升。

结果分析

模型在多模态理解和生成任务中均取得了突破性进展,具体表现为:在MMBench中,Janus-Pro-7B的得分为79.2,较Janus(69.4)提升了近10分,显示出在多任务场景下的强大能力。在文本到图像生成方面,GenEval得分达80%,超越了多种对比模型,表明其指令遵循和细节还原能力显著增强。通过引入合成美学数据,模型生成的图像在稳定性和美学质量方面也有明显改善,尤其在复杂密集指令下表现优异。这些结果验证了架构设计、数据扩展和训练优化的有效性,为未来多模态模型的发展提供了坚实基础。

应用场景

该模型可广泛应用于智能内容创作、虚拟助手、增强现实、自动化设计等场景。其强大的理解能力支持复杂指令的执行,丰富的生成能力满足多样化内容需求。模型的多模态融合特性,使其在多领域、多任务环境中表现优异,尤其适合需要高质量图像生成和深度理解的应用。未来,结合行业需求,模型还可用于个性化内容定制、虚拟人交互、智能导览等,推动人工智能在实际生活中的深度融合。

局限与展望

模型输入分辨率限制在384×384,影响细粒度任务(如OCR、微细结构识别)的性能,未来需提升输入分辨率以增强细节表现。生成图像的分辨率较低,受限于视觉编码器的重建损失,导致细节丰富度不足,尤其在面部细节和微小元素上表现欠佳。训练成本较高,模型参数规模扩大带来计算资源消耗增加,未来需优化模型压缩和推理效率,以实现更广泛的应用。模型在复杂场景下的泛化能力仍有提升空间,特别是在极端或偏离训练分布的任务中表现有限。

通俗解读 非专业人士也能看懂

想象你在一家大型厨房里,厨师们需要准备各种菜肴。以前,每个厨师都只专注于一种菜,比如炒菜或烘焙,但他们用的工具和方法都一样,导致效率低下,也难以做出既美味又复杂的菜肴。

现在,厨房里引入了一套新系统,把不同的厨师和工具分开使用。炒菜的厨师专注于炒菜的技巧,烘焙的厨师专注于烘焙的工艺。这样一来,每个厨师都能发挥最大优势,厨房的效率和菜肴的质量都大大提高。

类似地,Janus-Pro在人工智能的“厨房”中,把理解和生成的“厨师”用不同的工具(视觉编码)分别处理,避免他们互相干扰。通过优化“厨房流程”和“工具”,模型可以更快学会如何理解复杂的图片和描述,也能更稳定地生成漂亮的图片。这就像让厨师们专注于自己的拿手菜,厨房变得更高效,菜肴也更好吃了。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的拼图游戏,你需要把图片看得很清楚,然后用这些图片拼出新的画面。以前的AI模型就像是一个只会拼简单拼图的机器人,它在拼复杂图片时经常出错,拼出来的图片也不够漂亮。

这次,科学家们发明了一种新方法,就像给这个机器人装上了两个不同的“眼睛”。一个“眼睛”专门用来看图片的内容,帮它理解图片里的东西;另一个“眼睛”用来帮它画出新图片。这样一来,机器人就不会把理解和画画搞混了,拼出来的图片也会更漂亮、更细致。

他们还让这个机器人学习了更多不同类型的图片和描述,比如风景、人物、动物等等。经过训练,它变得越来越聪明,能理解复杂的指令,也能画出令人惊叹的图片。虽然还不能完美做到每一件事,但已经比以前强多了。这就像你变成了拼图高手,能拼出各种漂亮的画面,朋友们都觉得你很厉害!

术语表

多模态 (Multimodal)

指同时处理多种类型的数据,如图像、文本、声音等,融合多源信息以实现更丰富的理解和生成能力。

在论文中,强调模型同时理解和生成多种模态信息。

SigLIP (Signature-based Local Image Processing)

一种视觉特征提取方法,基于局部签名技术,提取图像中的高维语义信息,用于理解任务。

用于Janus-Pro的理解编码部分。

VQ tokenizer (Vector Quantization tokenizer)

将图像编码为离散的向量ID序列的技术,便于图像的离散化处理和生成任务。

用于Janus-Pro的生成编码部分。

解耦 (Decoupling)

将复杂任务中的不同子任务或特征分离处理,减少相互干扰,提高模型性能。

模型架构中的核心设计思想。

多源多模态数据 (Multi-source Multimodal Data)

来自不同平台或类型的数据集合,包括图片、文本、表格等,用于丰富模型训练。

扩展训练数据的主要策略之一。

模型扩展 (Model Scaling)

增加模型参数规模,以提升模型能力和性能表现。

从1.5B到7B参数的扩展。

训练策略优化 (Training Strategy Optimization)

调整训练流程和数据使用方式,以提升效率和效果。

包括延长Stage I、专注纯文本训练等。

合成美学数据 (Synthetic Aesthetic Data)

由算法生成的高质量图像数据,用于增强模型的生成能力和稳定性。

加入训练集以改善生成质量。

多任务学习 (Multi-task Learning)

同时训练模型完成多个相关任务,提高泛化能力。

模型在理解与生成两个任务中均表现优异。

视觉编码 (Visual Encoding)

将图像信息转化为模型可处理的特征表示的过程。

核心创新之一。

指令遵循 (Instruction Following)

模型根据用户指令生成符合要求的内容的能力。

在文本到图像生成中的表现。

细节还原 (Detail Restoration)

在生成内容中保持丰富细节的能力。

评估模型生成质量的重要指标。

模型性能 (Model Performance)

模型在特定任务上的准确率、效率和稳定性。

通过基准测试验证。

训练效率 (Training Efficiency)

在有限资源下达到最佳模型性能的能力。

优化训练策略的目标之一。

美学质量 (Aesthetic Quality)

生成图像的视觉吸引力和艺术表现力。

评价生成模型的重要指标。

开放问题 这项研究留下的未解疑问

  • 1 尽管模型在384×384分辨率下表现优异,但在高细节需求的任务(如微细结构识别、OCR)中仍存在不足。未来需要研究更高分辨率的视觉编码方案,以提升细节还原能力。
  • 2 模型在复杂场景和极端条件下的泛化能力仍有限,特别是在偏离训练分布的任务中表现不佳。如何增强模型的鲁棒性和适应性,是未来的重要方向。
  • 3 训练成本较高,尤其是在参数规模扩大到7B时,计算资源消耗巨大。未来应探索模型压缩、剪枝和高效推理技术,以实现更广泛的应用。
  • 4 视觉编码解耦虽然缓解了理解与生成的冲突,但在某些细粒度任务中仍存在信息丢失或不一致的问题,需进一步优化编码机制。
  • 5 多模态数据的质量和多样性仍是限制模型性能的关键因素。未来应引入更丰富、更高质量的数据源,提升模型的泛化能力和应用范围。

应用场景

近期应用

智能内容创作平台

利用Janus-Pro实现高质量图片生成和内容理解,支持自动化广告、艺术设计和虚拟场景制作,提升效率和创意水平。

虚拟助手与交互系统

结合模型的多模态理解能力,打造更智能的虚拟助手,支持语音、图像和文本的多模态交互,改善用户体验。

增强现实与虚拟现实

在AR/VR场景中实现实时场景理解与生成,提升沉浸感和交互性,应用于游戏、教育和培训等领域。

远期愿景

多模态智能生态系统

构建融合视觉、语言、动作等多模态的智能系统,推动人机交互的全面升级,实现更自然、更智能的交互体验。

自主内容生成与编辑

实现自动化的高质量内容生成、编辑和个性化定制,推动数字内容产业的变革,降低人力成本。

原文摘要

In this work, we introduce Janus-Pro, an advanced version of the previous work Janus. Specifically, Janus-Pro incorporates (1) an optimized training strategy, (2) expanded training data, and (3) scaling to larger model size. With these improvements, Janus-Pro achieves significant advancements in both multimodal understanding and text-to-image instruction-following capabilities, while also enhancing the stability of text-to-image generation. We hope this work will inspire further exploration in the field. Code and models are publicly available.

cs.AI cs.CL cs.CV

被引用 (20)

DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

2026 ⭐ 高影响力 查看解读 →

VIG-RL: Learning to Search and Insert for Verified Image Grounding

2026 ⭐ 高影响力 查看解读 →

Do Unified Multimodal Models Think in One Space? A Lens Through Cross-Branch Steering

2026 ⭐ 高影响力 查看解读 →

Transferability Between Understanding and Generation in Unified Multimodal Models

2026 ⭐ 高影响力 查看解读 →

One Rewrite to Fix Them All? Type-Aware Repair Allocation for Text-to-Image Prompt Optimization

2026 ⭐ 高影响力 查看解读 →

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

2026 ⭐ 高影响力 查看解读 →

Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation

2026 ⭐ 高影响力 查看解读 →

Improving Sample Diversity in Autoregressive Text-to-Image Generation via Cluster Truncation

Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation

Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis

Cross-Branch Conflict as a Shield: Safeguarding Facial Identities in Unified Multimodal Image Editing

Orca: The World is in Your Mind

2026 3 引用 查看解读 →

Unified Audio Intelligence Without Regressing on Text Intelligence

SymbOmni: Evolving Agentic Omni Models via Symbolic Concept Learning

Evaluating and Understanding Model Editing for Medical Vision Language Models

BrainJanus: A Unified Model for Understanding and Generation across Brain, Vision, and Language

SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation

Scaling GUI Agents with Visual State Transitions

Show Me Examples: Inferring Visual Concepts from Image Sets

RADIANCE: Relative Adaptive Denoising with IP-Adapter for Novel Concept Enhancement