Wukong: A 100 Million Large-scale Chinese Cross-modal Pre-training Benchmark

TL;DR

Wukong:含1亿中文跨模态预训练数据集,结合对比学习和token交互提升模型性能。

cs.CV 🔴 高级 2022-02-14 65 次浏览
Jiaxi Gu Xiaojun Meng Guansong Lu Lu Hou Minzhe Niu Xiaodan Liang Lewei Yao Runhui Huang Wei Zhang Xin Jiang Chunjing Xu Hang Xu
跨模态预训练 中文数据集 大规模数据 对比学习 模型评估

核心发现

方法论

Wukong采用双流Transformer架构,包括ViT和SwinT作为视觉编码器,中文文本采用WordPiece编码。训练目标结合对比损失(CLIP风格)和细粒度token交互(FILIP风格),引入token缩减层以提升效率。采用锁定图像编码器和可训练文本编码器(LiT策略),实现跨模态对齐。数据筛选包括图像尺寸过滤、中文文本过滤(长度、频次、敏感词)和人工验证,确保数据质量。模型训练在多GPU集群上进行,优化目标包括全局相似度和token-wise相似度,结合多种预训练策略。

关键结果

  • WukongViT-L在10个零样本图像分类任务中平均准确率达73.03%,优于以往中文模型。其在AIC-ICC检索任务中实现平均召回率71.6%,比WenLan 2.0高出12.9%。在多个下游任务(如Flickr8K-CN、COCO-CN)上表现优异,验证了数据集和模型的有效性。
  • 模型在不同视觉编码器(ViT-B/ViT-L/SwinT)上均表现出良好迁移能力,尤其是ViT-L版本,展现出最优性能。对比不同预训练技术,结合token缩减和锁定图像编码器的模型在细粒度对齐和效率方面具有优势。
  • 通过丰富的实验验证,Wukong模型在零样本分类和检索任务中均优于行业内已有模型,显示出大规模中文跨模态预训练的潜力。

研究意义

该研究填补了中文跨模态预训练数据的空白,提供了规模最大、质量保障的中文视觉-文本数据集,为多模态模型的研究提供了标准平台。模型在零样本识别和检索任务中的优异表现,推动了中文AI应用的普及和多语言模型的发展。数据集和模型的开源,有助于学界和产业界实现公平竞争与创新,加速中文VLP的产业化落地。

技术贡献

提出结合对比学习和token交互的多模态预训练框架,创新性引入token缩减机制以提升效率。采用多架构(ViT、SwinT)和多预训练策略(CLIP、FILIP、LiT),实现跨模态对齐的多样性。数据筛选策略确保数据质量,模型在多任务上表现领先,验证了大规模中文数据集的有效性。

新颖性

首次构建含1亿规模的中文跨模态数据集,结合多模态对比学习和细粒度token交互技术,显著提升模型性能。引入token缩减层,兼顾效率与细粒度对齐,突破了以往模型在中文场景下的局限。创新性在于跨模态多架构融合和数据质量保障,为中文VLP奠定基础。

局限性

  • 数据采集主要依赖网页爬取,可能存在偏差和噪声,尽管经过筛选和人工验证,但仍有部分不一致的样本。
  • 模型训练成本高昂,需大量GPU资源,限制了更大规模模型的普及。
  • 对中文文本的处理依赖WordPiece,可能在语义表达上存在局限,未来需探索更先进的分词和编码技术。

未来方向

未来将探索多模态预训练模型的多任务学习能力,提升模型在复杂场景下的理解和生成能力。同时,计划引入更丰富的多模态数据源,优化数据筛选策略,降低训练成本,推动中文多模态AI的产业应用。

AI 总览摘要

Wukong项目推出了中国首个规模达1亿的跨模态数据集,填补了中文视觉-文本预训练的空白。该数据集由网页采集,经过严格筛选和人工验证,确保数据的多样性和高质量。基于此,研究团队构建了多架构、多预训练策略的模型,包括ViT和SwinT视觉编码器,结合对比学习和token交互技术,显著提升了模型在零样本分类和检索任务中的表现。

模型采用锁定图像编码器与可训练文本编码器的LiT策略,结合多模态对齐机制,实现跨模态信息的高效融合。引入token缩减机制,有效降低计算成本,同时保持细粒度的语义对齐。实验结果显示,WukongViT-L在10个零样本图像分类任务中平均准确率达73.03%,优于行业内其他模型,验证了大规模中文数据集的有效性。

此外,模型在AIC-ICC检索任务中实现71.6%的平均召回率,比WenLan 2.0高出12.9%。在多个下游任务中表现优异,充分证明了其广泛应用潜力。该研究不仅推动了中文多模态AI的发展,也为多语言、多场景模型的构建提供了宝贵经验。未来,团队计划扩展多模态数据源,优化模型架构,降低训练成本,推动中文AI的产业化落地。

深度分析

研究背景

近年来,视觉-语言预训练(VLP)模型在多模态任务中展现出巨大潜力,代表性工作如CLIP、ALIGN等推动了跨模态对齐技术的发展。英文数据集如LAION-400M、YFCC100M规模庞大,极大促进了模型性能提升。然而,中文VLP缺乏大规模公开数据集,限制了中文模型的研究深度。现有中文数据多为小规模标注数据,难以支撑复杂任务。随着多模态应用需求增长,构建规模大、质量高的中文跨模态数据集成为亟需解决的问题。本研究正是在此背景下,提出了Wukong数据集,涵盖1亿中文图文对,极大丰富了中文多模态资源。

核心问题

中文VLP模型发展受限于缺乏大规模高质量数据集,导致模型泛化能力不足,难以满足实际应用需求。现有数据多为小规模或私有,难以进行公平评估和模型对比。此外,中文文本的复杂性(如成语、俚语)使得简单翻译无法满足模型训练需求。如何在保证数据多样性和质量的同时,降低训练成本,成为核心难题。解决这一问题对于推动中文AI技术的普及具有重要意义。

核心创新

本研究的创新点包括:1)构建含1亿规模的中文跨模态数据集,确保多样性和代表性;2)引入多架构(ViT、SwinT)结合多预训练策略(CLIP、FILIP、LiT),实现跨模态对齐的多样性;3)采用token缩减机制,提升模型效率,兼顾细粒度对齐;4)筛选和验证数据,确保高质量,避免噪声影响。此方案突破了以往中文VLP数据和模型的局限,为多模态技术提供了坚实基础。

方法详解

  • �� 数据采集:以高频关键词搜索图像和描述,筛除低质量样本,人工验证确保准确性。
  • �� 数据筛选:过滤图像尺寸、中文文本长度、频次及敏感词,确保多样性和合规性。
  • �� 模型架构:采用双流Transformer,视觉端用ViT或SwinT,文本端用中文WordPiece编码,结合对比学习目标。
  • �� 预训练目标:结合全局相似度(点积)和token级别相似度(FILIP风格),引入token缩减层以提升效率。
  • �� 训练策略:采用LiT策略,锁定预训练图像编码器,训练中文文本编码器,优化多模态对齐效果。

实验设计

在多项零样本分类和检索任务中评估模型,使用10个中文标注数据集,比较不同架构(ViT-B/ViT-L/SwinT)和预训练策略。采用准确率、召回率等指标,进行消融实验验证token缩减和对比学习的贡献。模型训练在多GPU集群上进行,超参数调优确保性能最大化。

结果分析

WukongViT-L在10个零样本分类任务中平均准确率达73.03%,优于行业内其他模型。在AIC-ICC检索任务中实现71.6%的平均召回率,比WenLan 2.0高出12.9%。模型在多个下游任务中表现优异,验证了数据集和架构的有效性。模型对不同视觉编码器均表现出良好迁移能力,尤其是ViT-L版本,展现出最优性能。

应用场景

模型可广泛应用于中文图像检索、内容理解、智能问答等场景。依赖大规模数据和GPU资源,适合企业和研究机构部署,推动中文AI的产业化。未来还可结合生成模型,拓展多模态内容生成与理解能力。

局限与展望

数据采集依赖网页爬取,可能存在偏差和噪声,影响模型泛化。训练成本高昂,硬件资源需求大,限制普及。中文文本编码受WordPiece限制,未来需探索更先进的编码技术。模型在某些细粒度任务上仍有提升空间,需持续优化。

通俗解读 非专业人士也能看懂

想象你在一家大型工厂里,工厂里有很多不同的机器(代表模型),每台机器都能做不同的工作。为了让这些机器更聪明,工厂会收集大量的原材料(数据),比如图片和文字,就像收集各种零件。然后,工厂用特殊的技术(算法)把这些零件组合成完整的产品(模型),让它们能理解图片和文字之间的关系。比如,看到一只猫的图片,模型能告诉你它是“猫”,或者根据文字找到对应的图片。这个过程就像工厂里用不同的工具(技术)把零件拼装成最终的商品。Wukong就像是这个工厂,提供了大量的原材料和工具,让机器变得更聪明,能更好地理解中文图片和文字的关系。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的拼图游戏,你需要把图片和文字匹配起来。以前,拼图的材料很少,拼出来的图片也不太清楚。现在,Wukong就像是给你准备了上亿块拼图碎片,帮你拼出更清晰、更准确的图片和文字匹配。它用一种特别的“拼图方法”——叫对比学习——让电脑学会看图片和文字的关系,就像你学会快速找到匹配的拼图块一样。通过这个方法,电脑可以在没有看到全部拼图的情况下,猜出图片里的内容,比如“猫”、“车”等。这个大数据集和新技术让电脑变得更聪明,能更好地理解中文图片和文字的关系,就像你变成了拼图高手!

原文摘要

Vision-Language Pre-training (VLP) models have shown remarkable performance on various downstream tasks. Their success heavily relies on the scale of pre-trained cross-modal datasets. However, the lack of large-scale datasets and benchmarks in Chinese hinders the development of Chinese VLP models and broader multilingual applications. In this work, we release a large-scale Chinese cross-modal dataset named Wukong, which contains 100 million Chinese image-text pairs collected from the web. Wukong aims to benchmark different multi-modal pre-training methods to facilitate the VLP research and community development. Furthermore, we release a group of models pre-trained with various image encoders (ViT-B/ViT-L/SwinT) and also apply advanced pre-training techniques into VLP such as locked-image text tuning, token-wise similarity in contrastive learning, and reduced-token interaction. Extensive experiments and a benchmarking of different downstream tasks including a new largest human-verified image-text test dataset are also provided. Experiments show that Wukong can serve as a promising Chinese pre-training dataset and benchmark for different cross-modal learning methods. For the zero-shot image classification task on 10 datasets, $Wukong_{ViT-L}$ achieves an average accuracy of 73.03%. For the image-text retrieval task, it achieves a mean recall of 71.6% on AIC-ICC which is 12.9% higher than WenLan 2.0. Also, our Wukong models are benchmarked on downstream tasks with other variants on multiple datasets, e.g., Flickr8K-CN, Flickr-30K-CN, COCO-CN, et al. More information can be referred to: https://wukong-dataset.github.io/wukong-dataset/.

cs.CV cs.LG