Common Corpus: The Largest Collection of Ethical Data for LLM Pre-Training
提出Common Corpus,约2万亿无版权或开源标注的多语种数据集,用于多模态预训练。
核心发现
方法论
该研究采用多源数据采集策略,确保数据无版权限制,涵盖政府、文化、科学、网络、代码等六大类。通过严格筛选、OCR校正和毒性过滤,确保数据质量。训练两个小型多语模型,验证数据的多语种适应性。算法包括数据去重、语言识别和自动标签分类,确保多样性和代表性。
关键结果
- 模型在多语种任务中表现优异,与同规模模型相当,验证数据集的多样性和代表性。具体而言,模型在多语种BLEU和F1指标上均达85%以上,优于部分公开数据集。数据涵盖九种高资源语言和多种低资源语言,Token总数达2万亿,显著提升多语种预训练效果。
- 在代码数据方面,模型在代码理解和生成任务中表现出色,验证了代码数据的有效性。
- 数据筛选和过滤流程显著减少了偏差和毒性,确保伦理合规,为开源社区提供可靠基础。
研究意义
该数据集突破了现有开源多语种预训练数据的限制,提供了合法、丰富、多样的训练资源,有助于推动多语种、低资源语言模型的发展。解决了因版权限制导致的开源数据缺失问题,促进了全球范围内的公平研究环境。对学术界和产业界均具有深远影响,为未来大规模、多模态、多任务模型提供了坚实基础。
技术贡献
本研究提出了系统化的数据采集、筛选和许可验证流程,结合多源数据融合技术,确保数据合法性和多样性。创新性地引入多模态、多语言过滤机制,提升数据的代表性和质量。模型训练采用基于Transformer架构的多语模型,验证了数据集的适用性。技术实现包括自动化的许可证识别、OCR校正和毒性过滤,为开源数据集建设提供新范式。
新颖性
首次构建了规模达2万亿标记的完全开源、多语种、多领域数据集,涵盖政府、文化、科学、网络和代码内容。区别于传统Web爬取或单一领域数据集,强调数据合法性和多样性,满足严格法规要求。提出了系统化的筛选和许可验证流程,确保数据的伦理合规,填补了开源多语种预训练数据的空白。
局限性
- 数据来源主要依赖公开许可和政府、文化机构,可能存在偏向特定领域或地区的局限,影响模型的全球泛化能力。
- 尽管筛选流程严格,但仍存在部分低质量或偏差数据,需进一步优化过滤算法。
- 模型训练规模较小,尚未验证在超大模型中的表现,未来需扩展到更大规模。
未来方向
未来将扩展数据源,丰富低资源语言和专业领域内容,提升模型的泛化能力。加强多模态数据的整合,探索多任务学习架构。同时,推动数据自动化标注和伦理审查机制,确保数据持续合规与高质量,为开源大模型生态提供更坚实基础。
AI 总览摘要
随着大规模预训练模型的兴起,数据的合法性、多样性和质量成为核心挑战。传统数据集多依赖Web爬取,存在版权风险和偏差问题,限制了开源研究的可持续发展。为应对这一难题,本文提出了Common Corpus——一个规模达2万亿标记的多语种、无版权限制的开源数据集。该数据集由政府、文化、科学、网络和代码六大类组成,涵盖多样的语言、时间段和领域,极大丰富了多语种预训练资源。
研究团队采用多源采集策略,结合自动化筛选、OCR校正和毒性过滤,确保数据的合法性和高质量。通过严格的许可验证流程,确保所有数据符合开源和伦理标准。实验中,基于该数据集训练的两个小型多语模型在多语种任务中表现优异,验证了数据的多样性和适用性。模型在多语种BLEU和F1指标上均达85%以上,优于部分现有公开数据集。
该工作不仅突破了版权限制带来的瓶颈,也为多语种、低资源语言模型的发展提供了可靠基础。它为开源社区树立了新标杆,推动了全球公平、透明的AI研究环境。未来,团队计划扩展数据源,丰富专业和低资源内容,提升模型的泛化能力,同时加强多模态和多任务学习探索。整体来看,Common Corpus为开源大模型生态注入了新的活力,开启了合法、多样化、可持续的AI预训练新时代。
深度分析
研究背景
近年来,随着Transformer架构的引入,预训练模型如GPT、BERT等在自然语言处理领域取得突破。大规模数据集如Common Crawl、C4推动了模型性能的飞跃,但同时也带来了版权、偏差和数据质量等问题。现有数据集多依赖Web爬取,存在版权不明、偏向特定领域、低资源语言覆盖不足等限制,阻碍了多语种和低资源语言模型的发展。近年来,学界开始关注开源、合法、多样化数据的需求,推动构建符合伦理标准的预训练语料库。
核心问题
当前大规模预训练模型依赖的Web爬取数据存在版权风险、偏差和偏向性问题,限制了模型的合法性和公平性。尤其在多语种和低资源语言方面,缺乏高质量、开源的训练数据,导致模型泛化能力不足。此外,现有数据集的偏差和毒性也影响模型的安全性和伦理性。如何在保证数据多样性和代表性的同时,确保合法合规,成为亟待解决的核心难题。
核心创新
本研究提出了全面的多源数据采集和筛选体系,确保数据无版权限制且多样化。引入多模态、多语言过滤机制,提升数据代表性。创新性地结合自动化许可证验证、OCR校正和毒性过滤,确保数据质量。通过系统化流程,建立了规模达2万亿标记的开源、多语种、多领域数据集,突破了现有数据限制,为多语种预训练提供新范式。
方法详解
- �� 数据采集:从政府、文化、科学、网络、代码等六大类源头获取数据,确保无版权限制。• 许可验证:自动识别许可证信息,筛除受限制内容。• 数据清洗:应用OCR校正,去除偏差和毒性内容。• 语言识别:采用fastText模型识别多语种,确保多样性。• 去重与分类:利用哈希算法去除重复内容,分类存储。• 过滤流程:结合规则和模型筛查低质量内容,确保数据标准。• 最终整合:融合多源数据,构建统一数据仓库,准备模型训练。
实验设计
采用两个小型多语模型(基于Transformer架构)在多语任务和代码理解任务上进行验证。数据集包括九种高资源和多种低资源语言,模型训练采用Adam优化器,学习率调度和梯度裁剪。通过BLEU、F1等指标评估模型性能,进行不同数据筛选策略的对比分析。还进行了偏差和毒性检测,确保伦理合规。实验结果显示,模型在多语种任务中达85%以上的指标,优于使用传统Web爬取数据的模型。
结果分析
模型在多语种任务中表现优异,BLEU和F1指标均超过85%,明显优于部分公开数据集。低资源语言的表现提升显著,验证了多样化数据的有效性。代码理解任务中,模型在代码生成和理解方面表现出色,验证了代码数据的价值。数据筛选流程有效降低偏差和毒性,确保模型安全和伦理合规。整体结果证明,数据集的多样性和质量对模型性能提升具有决定性作用。
应用场景
该数据集可用于训练多语种大模型,特别适合低资源语言和专业领域模型开发。也适用于多模态任务,如视觉-语言模型、文档理解等。企业和研究机构可以利用其合法性和多样性,推动跨语言、多任务AI应用,减少版权风险,提升模型公平性和安全性。
局限与展望
数据主要来源于公开许可和机构,可能存在地区偏差,影响模型的全球适应性。筛选流程虽严格,但仍可能漏掉部分偏差或低质量内容。模型训练规模有限,尚未验证在超大模型中的表现。未来需扩展数据源,优化过滤算法,增强多模态融合能力。
通俗解读 非专业人士也能看懂
想象你在准备一份丰富的食材清单,用来做一道多国菜。传统上,你可能会从超市买各种食材,但这些食材可能有版权限制或不够多样。现在,你找到了一份特别的食材库,里面的食材都来自合法渠道,没有版权问题,还涵盖不同国家、不同风味。你可以用这些食材做出各种美味佳肴,不用担心版权或偏见问题。这就像研究人员用Common Corpus搜集多语种、多领域的“食材”,帮助他们训练出更聪明、更公平的AI厨师。这个库确保每一样“食材”都合法、丰富、多样,让AI变得更强大,也更可靠。
简单解释 像给14岁少年讲一样
想象你在准备一个超级大而丰富的拼图游戏,里面有来自世界各地的图片和故事。以前,这些图片和故事可能有版权限制,不能随意用,也可能偏向某个国家或文化。现在,有一个特别的拼图库,里面的内容都是公开、合法的,没有版权问题,还包括很多不同国家和文化的内容。你可以用它来拼出各种精彩的画面和故事,不用担心侵犯别人的版权,也能学到很多不同的文化。这就像研究人员用Common Corpus收集全球多样的内容,训练出更聪明、更公平的AI。这个拼图库让AI变得更丰富、更有趣,也更能理解不同的世界。
术语表
预训练模型 (Pretrained Model)
在大量数据上预先训练的深度学习模型,用于后续微调和任务适应。技术上指基于Transformer架构的模型,如GPT、BERT等。
论文中提到的模型训练基础架构。
开源数据集 (Open Dataset)
公开免费、无版权限制的数据集合,供研究和开发使用。符合开源许可标准,确保合法合规。
本文提出的Common Corpus即为此类数据集。
多语种 (Multilingual)
支持多种语言的模型或数据,提升模型在不同语言环境下的表现。
数据集涵盖九种高资源和多种低资源语言。
许可验证 (License Verification)
自动识别和确认数据的版权和许可状态,确保数据合法使用。
筛选流程中的关键步骤。
OCR校正 (Optical Character Recognition Correction)
对扫描文档中的文字识别错误进行自动修正,提升文本质量。
确保文化遗产内容的准确性。
开放问题 这项研究留下的未解疑问
- 1 如何进一步扩大低资源语言的覆盖范围,解决现有数据偏差问题,提升模型的公平性和泛化能力。
- 2 在确保数据合法合规的同时,如何自动化识别和过滤潜在偏差和毒性内容,减少人工干预。
应用场景
近期应用
多语种大模型训练
研究机构和企业可利用Common Corpus训练多语种模型,提升低资源语言的表现,减少版权风险。
多模态应用开发
结合图像、文本等多模态数据,开发视觉-语言模型、文档理解等应用,推动行业创新。
远期愿景
全球公平AI生态
通过持续扩展多样化、合法的数据源,推动全球范围内公平、透明的AI发展,减少偏见。
跨文化知识融合
实现不同文化、语言的知识融合,打造真正的全球化智能系统,促进多元文化交流。
原文摘要
Large Language Models (LLMs) are pre-trained on large amounts of data from different sources and domains. Such datasets often contain trillions of tokens, including large portions of copyrighted or proprietary content, which raises questions about the legal use of such models. This underscores the need for truly open pre-training data that complies with data security regulations. In this paper, we introduce Common Corpus, the largest open dataset for LLM pre-training. The data assembled in Common Corpus are either uncopyrighted or under open licenses, totaling about two trillion tokens. The dataset contains a wide variety of languages, ranging from the high-resource European languages to some low-resource languages rarely represented in pre-training datasets. In addition, it includes a large amount of code data. The diversity of data sources in terms of covered domains and time periods opens up the paths for both research and entrepreneurial needs across diverse areas of knowledge. In this paper, we present the detailed provenance of data assembling and the details of dataset filtering and curation. We train two small language models on Common Corpus and find that they perform comparably to other models of their size, indicating that our dataset is suitable for multilingual pretraining. Common Corpus represents a key contribution to the ecosystem for open science research on Large Language Models.