Wukong: A 100 Million Large-scale Chinese Cross-modal Pre-training Benchmark
Wukong:含1亿中文跨模态预训练数据集,结合对比学习和token交互提升模型性能。
核心发现
方法论
Wukong采用双流Transformer架构,包括ViT和SwinT作为视觉编码器,中文文本采用WordPiece编码。训练目标结合对比损失(CLIP风格)和细粒度token交互(FILIP风格),引入token缩减层以提升效率。采用锁定图像编码器和可训练文本编码器(LiT策略),实现跨模态对齐。数据筛选包括图像尺寸过滤、中文文本过滤(长度、频次、敏感词)和人工验证,确保数据质量。模型训练在多GPU集群上进行,优化目标包括全局相似度和token-wise相似度,结合多种预训练策略。
关键结果
- WukongViT-L在10个零样本图像分类任务中平均准确率达73.03%,优于以往中文模型。其在AIC-ICC检索任务中实现平均召回率71.6%,比WenLan 2.0高出12.9%。在多个下游任务(如Flickr8K-CN、COCO-CN)上表现优异,验证了数据集和模型的有效性。
- 模型在不同视觉编码器(ViT-B/ViT-L/SwinT)上均表现出良好迁移能力,尤其是ViT-L版本,展现出最优性能。对比不同预训练技术,结合token缩减和锁定图像编码器的模型在细粒度对齐和效率方面具有优势。
- 通过丰富的实验验证,Wukong模型在零样本分类和检索任务中均优于行业内已有模型,显示出大规模中文跨模态预训练的潜力。
研究意义
该研究填补了中文跨模态预训练数据的空白,提供了规模最大、质量保障的中文视觉-文本数据集,为多模态模型的研究提供了标准平台。模型在零样本识别和检索任务中的优异表现,推动了中文AI应用的普及和多语言模型的发展。数据集和模型的开源,有助于学界和产业界实现公平竞争与创新,加速中文VLP的产业化落地。
技术贡献
提出结合对比学习和token交互的多模态预训练框架,创新性引入token缩减机制以提升效率。采用多架构(ViT、SwinT)和多预训练策略(CLIP、FILIP、LiT),实现跨模态对齐的多样性。数据筛选策略确保数据质量,模型在多任务上表现领先,验证了大规模中文数据集的有效性。
新颖性
首次构建含1亿规模的中文跨模态数据集,结合多模态对比学习和细粒度token交互技术,显著提升模型性能。引入token缩减层,兼顾效率与细粒度对齐,突破了以往模型在中文场景下的局限。创新性在于跨模态多架构融合和数据质量保障,为中文VLP奠定基础。
局限性
- 数据采集主要依赖网页爬取,可能存在偏差和噪声,尽管经过筛选和人工验证,但仍有部分不一致的样本。
- 模型训练成本高昂,需大量GPU资源,限制了更大规模模型的普及。
- 对中文文本的处理依赖WordPiece,可能在语义表达上存在局限,未来需探索更先进的分词和编码技术。
未来方向
未来将探索多模态预训练模型的多任务学习能力,提升模型在复杂场景下的理解和生成能力。同时,计划引入更丰富的多模态数据源,优化数据筛选策略,降低训练成本,推动中文多模态AI的产业应用。
AI 总览摘要
Wukong项目推出了中国首个规模达1亿的跨模态数据集,填补了中文视觉-文本预训练的空白。该数据集由网页采集,经过严格筛选和人工验证,确保数据的多样性和高质量。基于此,研究团队构建了多架构、多预训练策略的模型,包括ViT和SwinT视觉编码器,结合对比学习和token交互技术,显著提升了模型在零样本分类和检索任务中的表现。
模型采用锁定图像编码器与可训练文本编码器的LiT策略,结合多模态对齐机制,实现跨模态信息的高效融合。引入token缩减机制,有效降低计算成本,同时保持细粒度的语义对齐。实验结果显示,WukongViT-L在10个零样本图像分类任务中平均准确率达73.03%,优于行业内其他模型,验证了大规模中文数据集的有效性。
此外,模型在AIC-ICC检索任务中实现71.6%的平均召回率,比WenLan 2.0高出12.9%。在多个下游任务中表现优异,充分证明了其广泛应用潜力。该研究不仅推动了中文多模态AI的发展,也为多语言、多场景模型的构建提供了宝贵经验。未来,团队计划扩展多模态数据源,优化模型架构,降低训练成本,推动中文AI的产业化落地。
深度分析
研究背景
近年来,视觉-语言预训练(VLP)模型在多模态任务中展现出巨大潜力,代表性工作如CLIP、ALIGN等推动了跨模态对齐技术的发展。英文数据集如LAION-400M、YFCC100M规模庞大,极大促进了模型性能提升。然而,中文VLP缺乏大规模公开数据集,限制了中文模型的研究深度。现有中文数据多为小规模标注数据,难以支撑复杂任务。随着多模态应用需求增长,构建规模大、质量高的中文跨模态数据集成为亟需解决的问题。本研究正是在此背景下,提出了Wukong数据集,涵盖1亿中文图文对,极大丰富了中文多模态资源。
核心问题
中文VLP模型发展受限于缺乏大规模高质量数据集,导致模型泛化能力不足,难以满足实际应用需求。现有数据多为小规模或私有,难以进行公平评估和模型对比。此外,中文文本的复杂性(如成语、俚语)使得简单翻译无法满足模型训练需求。如何在保证数据多样性和质量的同时,降低训练成本,成为核心难题。解决这一问题对于推动中文AI技术的普及具有重要意义。
核心创新
本研究的创新点包括:1)构建含1亿规模的中文跨模态数据集,确保多样性和代表性;2)引入多架构(ViT、SwinT)结合多预训练策略(CLIP、FILIP、LiT),实现跨模态对齐的多样性;3)采用token缩减机制,提升模型效率,兼顾细粒度对齐;4)筛选和验证数据,确保高质量,避免噪声影响。此方案突破了以往中文VLP数据和模型的局限,为多模态技术提供了坚实基础。
方法详解
- �� 数据采集:以高频关键词搜索图像和描述,筛除低质量样本,人工验证确保准确性。
- �� 数据筛选:过滤图像尺寸、中文文本长度、频次及敏感词,确保多样性和合规性。
- �� 模型架构:采用双流Transformer,视觉端用ViT或SwinT,文本端用中文WordPiece编码,结合对比学习目标。
- �� 预训练目标:结合全局相似度(点积)和token级别相似度(FILIP风格),引入token缩减层以提升效率。
- �� 训练策略:采用LiT策略,锁定预训练图像编码器,训练中文文本编码器,优化多模态对齐效果。
实验设计
在多项零样本分类和检索任务中评估模型,使用10个中文标注数据集,比较不同架构(ViT-B/ViT-L/SwinT)和预训练策略。采用准确率、召回率等指标,进行消融实验验证token缩减和对比学习的贡献。模型训练在多GPU集群上进行,超参数调优确保性能最大化。
结果分析
WukongViT-L在10个零样本分类任务中平均准确率达73.03%,优于行业内其他模型。在AIC-ICC检索任务中实现71.6%的平均召回率,比WenLan 2.0高出12.9%。模型在多个下游任务中表现优异,验证了数据集和架构的有效性。模型对不同视觉编码器均表现出良好迁移能力,尤其是ViT-L版本,展现出最优性能。
应用场景
模型可广泛应用于中文图像检索、内容理解、智能问答等场景。依赖大规模数据和GPU资源,适合企业和研究机构部署,推动中文AI的产业化。未来还可结合生成模型,拓展多模态内容生成与理解能力。
局限与展望
数据采集依赖网页爬取,可能存在偏差和噪声,影响模型泛化。训练成本高昂,硬件资源需求大,限制普及。中文文本编码受WordPiece限制,未来需探索更先进的编码技术。模型在某些细粒度任务上仍有提升空间,需持续优化。
通俗解读 非专业人士也能看懂
想象你在一家大型工厂里,工厂里有很多不同的机器(代表模型),每台机器都能做不同的工作。为了让这些机器更聪明,工厂会收集大量的原材料(数据),比如图片和文字,就像收集各种零件。然后,工厂用特殊的技术(算法)把这些零件组合成完整的产品(模型),让它们能理解图片和文字之间的关系。比如,看到一只猫的图片,模型能告诉你它是“猫”,或者根据文字找到对应的图片。这个过程就像工厂里用不同的工具(技术)把零件拼装成最终的商品。Wukong就像是这个工厂,提供了大量的原材料和工具,让机器变得更聪明,能更好地理解中文图片和文字的关系。
简单解释 像给14岁少年讲一样
想象你在玩一个超级复杂的拼图游戏,你需要把图片和文字匹配起来。以前,拼图的材料很少,拼出来的图片也不太清楚。现在,Wukong就像是给你准备了上亿块拼图碎片,帮你拼出更清晰、更准确的图片和文字匹配。它用一种特别的“拼图方法”——叫对比学习——让电脑学会看图片和文字的关系,就像你学会快速找到匹配的拼图块一样。通过这个方法,电脑可以在没有看到全部拼图的情况下,猜出图片里的内容,比如“猫”、“车”等。这个大数据集和新技术让电脑变得更聪明,能更好地理解中文图片和文字的关系,就像你变成了拼图高手!
原文摘要
Vision-Language Pre-training (VLP) models have shown remarkable performance on various downstream tasks. Their success heavily relies on the scale of pre-trained cross-modal datasets. However, the lack of large-scale datasets and benchmarks in Chinese hinders the development of Chinese VLP models and broader multilingual applications. In this work, we release a large-scale Chinese cross-modal dataset named Wukong, which contains 100 million Chinese image-text pairs collected from the web. Wukong aims to benchmark different multi-modal pre-training methods to facilitate the VLP research and community development. Furthermore, we release a group of models pre-trained with various image encoders (ViT-B/ViT-L/SwinT) and also apply advanced pre-training techniques into VLP such as locked-image text tuning, token-wise similarity in contrastive learning, and reduced-token interaction. Extensive experiments and a benchmarking of different downstream tasks including a new largest human-verified image-text test dataset are also provided. Experiments show that Wukong can serve as a promising Chinese pre-training dataset and benchmark for different cross-modal learning methods. For the zero-shot image classification task on 10 datasets, $Wukong_{ViT-L}$ achieves an average accuracy of 73.03%. For the image-text retrieval task, it achieves a mean recall of 71.6% on AIC-ICC which is 12.9% higher than WenLan 2.0. Also, our Wukong models are benchmarked on downstream tasks with other variants on multiple datasets, e.g., Flickr8K-CN, Flickr-30K-CN, COCO-CN, et al. More information can be referred to: https://wukong-dataset.github.io/wukong-dataset/.