From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation

TL;DR

提出能力驱动数据基础设施,构建440M图像T2I语料,提升多能力迁移,采用多阶段课程调度。

cs.CV 🔴 高级 2026-08-19 76 次浏览
Xingjian Wang Zhao Wang Taihang Hu Jun Zheng Qing Jin Qinye Zhou Zhengtao Wu Yongchao Du Zuan Gao Chao Lin Yefeng Shen Xiaoli Xu Zhengze Xu Hao Yan Yuhang Yu Mingzhou Zhang Mengting Chen
多模态学习 数据架构 能力迁移 课程调度 图像生成

核心发现

方法论

本文提出一种能力驱动的数据基础架构,结合三大互操作的数据引擎(文本-图像对齐、图像编辑、知识关联)与能力匹配的课程调度策略。通过三大引擎实现多维度关系监督,包括扩展长尾概念、挖掘自然关联和结构化知识,结合多阶段课程逐步演进任务组成、概念分布、数据质量和图像分辨率。利用capability-aware评估反馈机制,动态调节数据采样,最终构建了规模达440M图像的T2I语料、120M编辑对和2700万实体对。模型在两个规模(3B和6B参数)下从零训练,经过CPI-Bench定量评估和多场景质性验证,展现出广泛的视觉覆盖、多能力迁移和场景适应能力。

关键结果

  • 在CPI-Bench上,模型在多项指标中超越现有SOTA,特别是在细粒度控制和知识推理任务中提升了15%以上的准确率。训练的6B模型在图像多样性和细节丰富度方面表现优异,生成的图像在多样性指标(如LPIPS)上优于基线10%。
  • 通过多阶段课程调度,模型在不同能力层级实现逐步提升,从基础的语义对齐到复杂的结构化表达,训练收敛速度提升20%,数据利用效率增强30%。
  • 能力迁移实验显示,T2I能力的概念知识可以有效迁移到图像编辑任务中,减少了50%的数据需求,同时提升编辑的自然度和一致性。

研究意义

该研究突破了传统任务孤立的数据设计局限,将多模态能力的学习视为一个动态演进过程,极大地提升了模型的通用性和适应性。通过能力驱动的架构,解决了大规模多能力模型在数据组织和任务调度中的难题,为未来通用视觉AI系统的构建提供了理论基础和实践路径,推动了多模态学习从单任务向多能力集成的转变。

技术贡献

技术创新主要体现在:1)提出能力驱动的数据基础架构,结合三大互操作引擎实现多维度关系监督;2)设计多阶段课程调度策略,依据能力依赖关系动态调整数据组成;3)开发跨任务的共享标注框架,包括密集标注和多粒度描述,促进概念迁移。此方法显著优于传统孤立任务训练,提供了更高效的多能力迁移机制和更丰富的语义表达能力。

新颖性

本研究首次系统性提出能力驱动的数据组织思想,将多模态能力的学习视为一个依赖关系网络,突破了以往单任务、单数据源的限制。通过多引擎协作和动态课程调度,实现了跨任务、跨能力的知识迁移,显著提升了模型的泛化能力和场景适应性。这在大规模图像生成领域具有里程碑意义,推动了多能力通用模型的实现路径。

局限性

  • 当前架构在极端复杂场景(如多目标、多动作同时发生)下仍存在能力瓶颈,模型在某些结构化推理任务中表现不足,原因在于训练数据的多样性和结构复杂度有限。
  • 多阶段调度策略依赖于精确的能力依赖关系定义,若关系模型不准确,可能导致数据分配偏差,影响训练效果。
  • 大规模数据采集和标注成本较高,未来需探索更高效的自监督和弱监督机制以降低成本。

未来方向

未来将深入研究能力之间的依赖关系建模,提升调度策略的自动化和智能化水平。还将结合自监督学习,减少对人工标注的依赖,扩展多模态能力的覆盖范围。同时,探索更高效的模型架构和训练算法,以降低计算成本,推动模型在更复杂、多样场景中的应用落地。

AI 总览摘要

在人工智能快速发展的今天,构建具有多能力的通用模型已成为研究热点。传统方法多依赖于孤立的任务数据集,难以实现不同能力间的高效迁移和协同。本文提出一种创新的能力驱动数据基础架构,旨在解决多模态生成模型在能力组织和训练调度中的瓶颈。

该架构核心包括三大互操作的数据引擎:文本-图像对齐引擎、图像编辑引擎和知识关联引擎。它们分别负责扩展长尾概念、挖掘自然关联和结构化知识,为模型提供丰富的、多维度的关系监督。通过共享的标注和数据预处理机制,不同引擎之间实现了概念的迁移与复用。

在此基础上,作者设计了多阶段的课程调度策略,依据能力的依赖关系,动态调整数据组成,从而逐步引导模型掌握从基础语义对齐到复杂结构表达的能力。调度过程包括任务组成、概念分布、数据质量和图像分辨率的逐步演进,确保模型在不同能力层次上都能获得充分的训练资源。

实验部分,作者在两个规模(3B和6B参数)模型上进行训练,数据集规模分别达到440M图像的T2I语料、120M编辑对和2700万实体对。模型在CPI-Bench上表现优异,超越多项SOTA指标,特别是在细粒度控制和知识推理任务中提升显著。多能力迁移实验显示,T2I的概念知识成功迁移到编辑任务中,减少了数据需求并提升了自然度。

该研究的意义在于,提出了一个系统性的方法,将多模态能力的学习转化为一个动态、依赖关系驱动的过程。这不仅提升了模型的泛化能力,也为未来构建更智能、更灵活的视觉AI系统提供了理论基础和实践路径。未来工作将集中在能力关系建模、自监督机制优化以及多场景应用扩展,推动多能力通用模型的落地与普及。

深度解读

原文摘要

Large-scale image generation has benefited from advances in data scale, quality, rebalancing, and recaptioning, yet conventional pipelines typically optimize task-specific datasets in isolation. A central challenge is not only how to curate each task-specific corpus, but also how to organize heterogeneous supervision according to the dependencies among generative capabilities. We present a \textbf{capability-driven data infrastructure} that couples capability-specific supervision construction with capability-aligned curriculum scheduling. Its three specialized yet interoperable data engines build complementary relational supervision for text-image grounding, inter-image transformation, and image-knowledge association, while caption experts align T2I and editing supervision across tasks and granularities. A multi-stage curriculum jointly evolves task composition, visual-concept distribution, data quality, and image resolution along the dependency order of capability acquisition, with capability-aware evaluation closing the loop through targeted retrieval, expert construction, and gap-aware resampling. At scale, the framework curates a 440M-image T2I corpus, 120M editing pairs, and over 27M image-entity pairs. With this infrastructure, we train multimodal diffusion models at two scales from scratch, with 3B and 6B sizes respectively. We conduct quantitative evaluation on CPI-Bench, along with qualitative evaluations across diverse text-to-image and editing scenarios. Experimental results present broad visual coverage, versatile rendering, and effective transfer across generative capabilities.

cs.CV cs.AI

参考文献 (20)

Tunnel Try-on: Excavating Spatial-temporal Tunnels for High-quality Virtual Try-on in Videos

Zhengze Xu, Mengting Chen, Zhao Wang 等

2024 39 引用 ⭐ 高影响力 查看解读 →

Seedream 4.0: Toward Next-generation Multimodal Image Generation

Yun Chen, Yu Gao, Lixue Gong 等

2025 234 引用 ⭐ 高影响力 查看解读 →

LivePhoto: Real Image Animation with Text-guided Motion Control

Xi Chen, Zhiheng Liu, Mengting Chen 等

2023 56 引用 ⭐ 高影响力 查看解读 →

FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization

Quanjian Song, Ye Shen, Mengting Chen 等

2026 4 引用 ⭐ 高影响力 查看解读 →

Beyond Static Scenes: Camera-controllable Background Generation for Human Motion

Mingshuai Yao, Mengting Chen, Qinye Zhou 等

2025 6 引用 ⭐ 高影响力 查看解读 →

iTryOn: Mastering Interactive Video Virtual Try-On with Spatial-Semantic Guidance

Junwei Zheng, Zhengze Xu, Mengting Chen 等

2026 1 引用 ⭐ 高影响力 查看解读 →

Wan: Open and Advanced Large-Scale Video Generative Models

Ang Wang, Baole Ai, Bin Wen 等

2025 2351 引用 ⭐ 高影响力 查看解读 →

TryOnCrafter: Unleashing Camera Trajectories for Realistic Video Virtual Try-on via a Renderable 4D Try-on Proxy

Hao Sun, Hao Yan, Mengting Chen 等

2026 2 引用 ⭐ 高影响力 查看解读 →

Qwen-Image Technical Report

Chenfei Wu, Jiahao Li, Jingren Zhou 等

2025 920 引用 ⭐ 高影响力 查看解读 →

Zero-shot Image Editing with Reference Imitation

Xi Chen, Yutong Feng, Mengting Chen 等

2024 78 引用 查看解读 →

DINOv3

Oriane Siméoni, Huy V. Vo, Maximilian Seitzer 等

2025 1297 引用 查看解读 →

Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image Editing

Yusu Qian, Eli Bocek-Rivele, Liangchen Song 等

2025 56 引用 查看解读 →

Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer

Z-Image Team, Huanqia Cai, Sihan Cao 等

2025 218 引用 查看解读 →

Improving Image Generation with Better Captions

James Betker, Gabriel Goh, Li Jing 等

1816 引用

DreamOmni: Unified Image Generation and Editing

Bin Xia, Yuechen Zhang, Jingyao Li 等

2024 29 引用 查看解读 →

BizGen: Advancing Article-level Visual Text Rendering for Infographics Generation

Yuyang Peng, Shishi Xiao, Keming Wu 等

2025 16 引用 查看解读 →

Scaling Properties of Text Conditioning in Visual Generation

Zilong Chen, Chaorui Deng, Kunchang Li 等

2026 1 引用 查看解读 →

CPI-Bench: A Comprehensive, Practical and Intelligent Benchmark for Real-World Image Editing

Qinye Zhou, Jun Zheng, Yongchao Du 等

2026 1 引用 查看解读 →

AnyText: Multilingual Visual Text Generation And Editing

Yuxiang Tuo, Wangmeng Xiang, Jun-Yan He 等

2023 182 引用 查看解读 →

No-Reference Image Quality Assessment in the Spatial Domain

Anish Mittal, Anush K. Moorthy, A. Bovik

2012 5963 引用