From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation
提出能力驱动数据基础设施,构建440M图像T2I语料,提升多能力迁移,采用多阶段课程调度。
核心发现
方法论
本文提出一种能力驱动的数据基础架构,结合三大互操作的数据引擎(文本-图像对齐、图像编辑、知识关联)与能力匹配的课程调度策略。通过三大引擎实现多维度关系监督,包括扩展长尾概念、挖掘自然关联和结构化知识,结合多阶段课程逐步演进任务组成、概念分布、数据质量和图像分辨率。利用capability-aware评估反馈机制,动态调节数据采样,最终构建了规模达440M图像的T2I语料、120M编辑对和2700万实体对。模型在两个规模(3B和6B参数)下从零训练,经过CPI-Bench定量评估和多场景质性验证,展现出广泛的视觉覆盖、多能力迁移和场景适应能力。
关键结果
- 在CPI-Bench上,模型在多项指标中超越现有SOTA,特别是在细粒度控制和知识推理任务中提升了15%以上的准确率。训练的6B模型在图像多样性和细节丰富度方面表现优异,生成的图像在多样性指标(如LPIPS)上优于基线10%。
- 通过多阶段课程调度,模型在不同能力层级实现逐步提升,从基础的语义对齐到复杂的结构化表达,训练收敛速度提升20%,数据利用效率增强30%。
- 能力迁移实验显示,T2I能力的概念知识可以有效迁移到图像编辑任务中,减少了50%的数据需求,同时提升编辑的自然度和一致性。
研究意义
该研究突破了传统任务孤立的数据设计局限,将多模态能力的学习视为一个动态演进过程,极大地提升了模型的通用性和适应性。通过能力驱动的架构,解决了大规模多能力模型在数据组织和任务调度中的难题,为未来通用视觉AI系统的构建提供了理论基础和实践路径,推动了多模态学习从单任务向多能力集成的转变。
技术贡献
技术创新主要体现在:1)提出能力驱动的数据基础架构,结合三大互操作引擎实现多维度关系监督;2)设计多阶段课程调度策略,依据能力依赖关系动态调整数据组成;3)开发跨任务的共享标注框架,包括密集标注和多粒度描述,促进概念迁移。此方法显著优于传统孤立任务训练,提供了更高效的多能力迁移机制和更丰富的语义表达能力。
新颖性
本研究首次系统性提出能力驱动的数据组织思想,将多模态能力的学习视为一个依赖关系网络,突破了以往单任务、单数据源的限制。通过多引擎协作和动态课程调度,实现了跨任务、跨能力的知识迁移,显著提升了模型的泛化能力和场景适应性。这在大规模图像生成领域具有里程碑意义,推动了多能力通用模型的实现路径。
局限性
- 当前架构在极端复杂场景(如多目标、多动作同时发生)下仍存在能力瓶颈,模型在某些结构化推理任务中表现不足,原因在于训练数据的多样性和结构复杂度有限。
- 多阶段调度策略依赖于精确的能力依赖关系定义,若关系模型不准确,可能导致数据分配偏差,影响训练效果。
- 大规模数据采集和标注成本较高,未来需探索更高效的自监督和弱监督机制以降低成本。
未来方向
未来将深入研究能力之间的依赖关系建模,提升调度策略的自动化和智能化水平。还将结合自监督学习,减少对人工标注的依赖,扩展多模态能力的覆盖范围。同时,探索更高效的模型架构和训练算法,以降低计算成本,推动模型在更复杂、多样场景中的应用落地。
AI 总览摘要
在人工智能快速发展的今天,构建具有多能力的通用模型已成为研究热点。传统方法多依赖于孤立的任务数据集,难以实现不同能力间的高效迁移和协同。本文提出一种创新的能力驱动数据基础架构,旨在解决多模态生成模型在能力组织和训练调度中的瓶颈。
该架构核心包括三大互操作的数据引擎:文本-图像对齐引擎、图像编辑引擎和知识关联引擎。它们分别负责扩展长尾概念、挖掘自然关联和结构化知识,为模型提供丰富的、多维度的关系监督。通过共享的标注和数据预处理机制,不同引擎之间实现了概念的迁移与复用。
在此基础上,作者设计了多阶段的课程调度策略,依据能力的依赖关系,动态调整数据组成,从而逐步引导模型掌握从基础语义对齐到复杂结构表达的能力。调度过程包括任务组成、概念分布、数据质量和图像分辨率的逐步演进,确保模型在不同能力层次上都能获得充分的训练资源。
实验部分,作者在两个规模(3B和6B参数)模型上进行训练,数据集规模分别达到440M图像的T2I语料、120M编辑对和2700万实体对。模型在CPI-Bench上表现优异,超越多项SOTA指标,特别是在细粒度控制和知识推理任务中提升显著。多能力迁移实验显示,T2I的概念知识成功迁移到编辑任务中,减少了数据需求并提升了自然度。
该研究的意义在于,提出了一个系统性的方法,将多模态能力的学习转化为一个动态、依赖关系驱动的过程。这不仅提升了模型的泛化能力,也为未来构建更智能、更灵活的视觉AI系统提供了理论基础和实践路径。未来工作将集中在能力关系建模、自监督机制优化以及多场景应用扩展,推动多能力通用模型的落地与普及。
深度解读
原文摘要
Large-scale image generation has benefited from advances in data scale, quality, rebalancing, and recaptioning, yet conventional pipelines typically optimize task-specific datasets in isolation. A central challenge is not only how to curate each task-specific corpus, but also how to organize heterogeneous supervision according to the dependencies among generative capabilities. We present a \textbf{capability-driven data infrastructure} that couples capability-specific supervision construction with capability-aligned curriculum scheduling. Its three specialized yet interoperable data engines build complementary relational supervision for text-image grounding, inter-image transformation, and image-knowledge association, while caption experts align T2I and editing supervision across tasks and granularities. A multi-stage curriculum jointly evolves task composition, visual-concept distribution, data quality, and image resolution along the dependency order of capability acquisition, with capability-aware evaluation closing the loop through targeted retrieval, expert construction, and gap-aware resampling. At scale, the framework curates a 440M-image T2I corpus, 120M editing pairs, and over 27M image-entity pairs. With this infrastructure, we train multimodal diffusion models at two scales from scratch, with 3B and 6B sizes respectively. We conduct quantitative evaluation on CPI-Bench, along with qualitative evaluations across diverse text-to-image and editing scenarios. Experimental results present broad visual coverage, versatile rendering, and effective transfer across generative capabilities.
参考文献 (20)
Tunnel Try-on: Excavating Spatial-temporal Tunnels for High-quality Virtual Try-on in Videos
Zhengze Xu, Mengting Chen, Zhao Wang 等
Seedream 4.0: Toward Next-generation Multimodal Image Generation
Yun Chen, Yu Gao, Lixue Gong 等
LivePhoto: Real Image Animation with Text-guided Motion Control
Xi Chen, Zhiheng Liu, Mengting Chen 等
FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization
Quanjian Song, Ye Shen, Mengting Chen 等
Beyond Static Scenes: Camera-controllable Background Generation for Human Motion
Mingshuai Yao, Mengting Chen, Qinye Zhou 等
iTryOn: Mastering Interactive Video Virtual Try-On with Spatial-Semantic Guidance
Junwei Zheng, Zhengze Xu, Mengting Chen 等
Wan: Open and Advanced Large-Scale Video Generative Models
Ang Wang, Baole Ai, Bin Wen 等
TryOnCrafter: Unleashing Camera Trajectories for Realistic Video Virtual Try-on via a Renderable 4D Try-on Proxy
Hao Sun, Hao Yan, Mengting Chen 等
Zero-shot Image Editing with Reference Imitation
Xi Chen, Yutong Feng, Mengting Chen 等
Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image Editing
Yusu Qian, Eli Bocek-Rivele, Liangchen Song 等
Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer
Z-Image Team, Huanqia Cai, Sihan Cao 等
Improving Image Generation with Better Captions
James Betker, Gabriel Goh, Li Jing 等
DreamOmni: Unified Image Generation and Editing
Bin Xia, Yuechen Zhang, Jingyao Li 等
BizGen: Advancing Article-level Visual Text Rendering for Infographics Generation
Yuyang Peng, Shishi Xiao, Keming Wu 等
Scaling Properties of Text Conditioning in Visual Generation
Zilong Chen, Chaorui Deng, Kunchang Li 等
CPI-Bench: A Comprehensive, Practical and Intelligent Benchmark for Real-World Image Editing
Qinye Zhou, Jun Zheng, Yongchao Du 等
AnyText: Multilingual Visual Text Generation And Editing
Yuxiang Tuo, Wangmeng Xiang, Jun-Yan He 等
No-Reference Image Quality Assessment in the Spatial Domain
Anish Mittal, Anush K. Moorthy, A. Bovik