DuoGen: Towards General Purpose Interleaved Multimodal Generation

TL;DR

DuoGen框架通过数据策划和架构设计,实现通用交错多模态生成,提升文本质量和图像一致性。

cs.CV 🔴 高级 2026-01-31 37 次浏览
Min Shi Xiaohui Zeng Jiannan Huang Yin Cui Francesco Ferroni Jialuo Li Shubham Pachori Zhaoshuo Li Yogesh Balaji Haoxiang Wang Tsung-Yi Lin Xiao Fu Yue Zhao Chieh-Yun Chen Ming-Yu Liu Humphrey Shi
多模态生成 数据策划 架构设计 文本图像一致性 深度学习

核心发现

方法论

DuoGen框架结合了预训练的多模态大语言模型(MLLM)和视频生成的扩散变换器(DiT)。通过两阶段解耦策略,首先对MLLM进行指令微调,然后使用精心策划的交错图文序列对DiT进行对齐。

关键结果

  • 在CoMM和InterleavedBench基准上,DuoGen在文本质量、图像保真度和图像-上下文一致性方面超越了现有开源模型。
  • 在文本到图像和图像编辑任务中,DuoGen实现了最先进的性能,优于Bagel和OmniGen2等统一生成模型。
  • 通过298k交错对话样本和30k高质量合成数据,显著提高了指令微调数据的视觉质量。

研究意义

DuoGen框架在学术界和工业界具有重要意义。它解决了现有交错生成模型在训练数据不足和基础模型能力有限方面的长期痛点。通过系统性的数据策划和架构设计,DuoGen提升了文本和图像生成的质量和一致性。

技术贡献

DuoGen在技术上提供了重要贡献。与现有方法相比,它避免了高成本的单模态预训练,允许灵活选择基础模型,并通过解耦的训练策略实现了高效的交错生成。

新颖性

DuoGen首次系统性地解决了通用交错生成中的数据、训练和评估问题。与现有视觉思维链系统相比,DuoGen在任务覆盖和生成质量上具有显著创新。

局限性

  • 在某些复杂场景中,生成的图像可能缺乏细节和真实感,这可能是由于训练数据的多样性不足。
  • 模型在处理极端长文本或图像序列时可能会出现性能下降。

未来方向

未来的研究方向包括扩展数据集的多样性和规模,进一步优化模型的生成能力,以及探索更多的应用场景。

AI 总览摘要

DuoGen框架旨在解决现有交错多模态生成模型在训练数据不足和基础模型能力有限方面的挑战。通过结合预训练的多模态大语言模型和视频生成的扩散变换器,DuoGen实现了高效的交错生成。实验结果表明,DuoGen在文本质量、图像保真度和图像-上下文一致性方面超越了现有开源模型。

DuoGen的核心技术包括两阶段解耦训练策略,首先对多模态大语言模型进行指令微调,然后使用精心策划的交错图文序列对扩散变换器进行对齐。这种方法避免了高成本的单模态预训练,允许灵活选择基础模型。

尽管DuoGen在多个基准上表现出色,但在某些复杂场景中,生成的图像可能缺乏细节和真实感。未来的研究方向包括扩展数据集的多样性和规模,以及探索更多的应用场景。

深度分析

研究背景

近年来,多模态生成模型在图像生成和文本理解方面取得了显著进展。然而,现有模型在处理交错多模态生成任务时,常常受到训练数据不足和基础模型能力有限的限制。DuoGen框架通过系统性的数据策划和架构设计,旨在解决这些问题。

核心问题

交错多模态生成需要紧密结合的文本和图像输出,以支持逐步指导、视觉规划和交互编辑等应用。现有模型在处理这些任务时,往往缺乏高质量的指令调优数据和灵活的基础模型选择。

核心创新

DuoGen的核心创新包括:1) 结合预训练的多模态大语言模型和视频生成的扩散变换器,避免高成本的单模态预训练;2) 采用两阶段解耦训练策略,首先进行指令微调,然后对齐扩散变换器。

方法详解

  • �� 数据策划:构建大规模高质量指令调优数据集,结合多模态对话和合成示例。
  • �� 架构设计:利用预训练的多模态大语言模型和扩散变换器,实现灵活的基础模型选择。
  • �� 解耦训练:首先对MLLM进行指令微调,然后使用交错图文序列对DiT进行对齐。

实验设计

实验在CoMM和InterleavedBench基准上进行,涵盖多种任务和输入格式。新构建的基准测试多样化的日常问题,评估模型在文本质量、图像保真度和图像-上下文一致性方面的性能。

结果分析

DuoGen在所有基准上均优于现有开源方法,在文本质量、图像保真度和图像-上下文一致性方面取得显著提升。与Bagel和OmniGen2等模型相比,DuoGen在文本到图像和图像编辑任务中表现出色。

应用场景

DuoGen适用于需要紧密结合的文本和图像输出的应用场景,如逐步指导、视觉规划和交互编辑。其灵活的基础模型选择和高效的生成能力使其在学术界和工业界具有广泛的应用潜力。

局限与展望

尽管DuoGen在多个基准上表现出色,但在某些复杂场景中,生成的图像可能缺乏细节和真实感。此外,模型在处理极端长文本或图像序列时可能会出现性能下降。未来的研究方向包括扩展数据集的多样性和规模,以及探索更多的应用场景。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。DuoGen就像一个聪明的助手,它能帮你同时准备食材和烹饪步骤。你告诉助手你想做什么菜,它会根据你的指示,帮你准备好所有需要的食材,并一步步指导你完成整个烹饪过程。助手不仅能给你提供详细的文字说明,还能展示每一步的图片,让你更直观地了解每个步骤。这样,即使你是个新手,也能轻松做出美味的菜肴。

简单解释 像给14岁少年讲一样

嘿,小伙伴!想象一下你在玩一个超酷的游戏,叫做DuoGen。这个游戏能让你同时看到文字和图片,就像你在看一本互动小说。你可以告诉游戏你想要什么,它会帮你生成故事情节和相关的图片。比如,你想知道如何做一个美味的汉堡,DuoGen会一步步告诉你怎么做,还会给你看每个步骤的图片。是不是很酷?

术语表

多模态大语言模型 (MLLM)

一种结合文本和图像理解的预训练模型,能够生成和理解多模态内容。

在DuoGen中用于生成文本和触发图像生成。

扩散变换器 (DiT)

一种用于图像生成的模型,能够在给定条件下生成高质量的图像序列。

在DuoGen中用于生成交错的图像内容。

指令微调

通过特定的指令数据对模型进行微调,以提高其在特定任务上的性能。

用于优化MLLM的生成能力。

交错图文序列

一种结合文本和图像的序列,用于训练和评估多模态生成模型。

用于对齐DiT和MLLM的生成能力。

视频生成

一种生成连续图像序列的技术,通常用于模拟动态场景。

在DuoGen中作为DiT的预训练任务。

开放问题 这项研究留下的未解疑问

  • 1 如何在更复杂的场景中提高生成图像的细节和真实感?
  • 2 如何进一步优化模型在极端长文本或图像序列上的性能?

应用场景

近期应用

交互式教程

DuoGen可以用于创建交互式教程,提供逐步指导和视觉示例,帮助用户更好地理解和完成任务。

远期愿景

智能助手

DuoGen可以发展为智能助手,能够在多种场景中提供实时的文本和图像支持,提升用户体验。

原文摘要

Interleaved multimodal generation enables capabilities beyond unimodal generation models, such as step-by-step instructional guides, visual planning, and generating visual drafts for reasoning. However, the quality of existing interleaved generation models under general instructions remains limited by insufficient training data and base model capacity. We present DuoGen, a general-purpose interleaved generation framework that systematically addresses data curation, architecture design, and evaluation. On the data side, we build a large-scale, high-quality instruction-tuning dataset by combining multimodal conversations rewritten from curated raw websites, and diverse synthetic examples covering everyday scenarios. Architecturally, DuoGen leverages the strong visual understanding of a pretrained multimodal LLM and the visual generation capabilities of a diffusion transformer (DiT) pretrained on video generation, avoiding costly unimodal pretraining and enabling flexible base model selection. A two-stage decoupled strategy first instruction-tunes the MLLM, then aligns DiT with it using curated interleaved image-text sequences. Across public and newly proposed benchmarks, DuoGen outperforms prior open-source models in text quality, image fidelity, and image-context alignment, and also achieves state-of-the-art performance on text-to-image and image editing among unified generation models. Data and code will be released at https://research.nvidia.com/labs/dir/duogen/.

cs.CV