Data Darwinism Part II: DataEvolve -- AI can Autonomously Evolve Pretraining Data Curation

TL;DR

提出DataEvolve,利用迭代优化实现预训练数据策略自动演化,显著提升模型性能。

cs.AI 🔴 高级 2026-03-15 42 次浏览
Tiantian Mi Dongming Shan Zhen Huang Yiwei Qin Muhang Xie Yuxuan Qiao Yixiu Liu Chenyang Zhou Pengfei Liu
AI数据处理 自动化策略 预训练模型 数据清洗 演化算法

核心发现

方法论

DataEvolve采用闭环演化框架,包括数据质量检测、策略生成、样本执行与评估。通过经验池存储发现的问题,策略池追踪策略表现,逐代优化。每个类别独立演化,利用诊断反馈指导变异,避免人工设计瓶颈。核心算法结合遗传算法与样本评估,提升策略适应性。实验中,针对8个类别,经过30代演化,生成Darwin-CC数据集,显著优于原始数据,模型在18项基准中平均提升3.96点。策略趋向噪声去除与格式标准化,体现L4(生成优化)原则。

关键结果

  • 在3B参数模型上,训练500B tokens,Darwin-CC数据集使平均分提升至44.13,比原始数据高出3.96点,特别在知识密集任务MMLU提升18.64点。
  • 与手工设计策略相比,自动演化策略在18项基准中表现更优,验证了策略自动演化的有效性。 ablation研究显示,未演化策略仅提升1点,演化显著优于非演化方法。
  • 分析显示,策略趋向于针对不同类别进行噪声过滤和格式规范,保持领域特征,验证了演化过程的收敛性和实用性。

研究意义

该研究突破了预训练数据策略设计的规模瓶颈,将手工调优转向自动演化,极大提高数据质量与模型性能。为大规模多类别数据处理提供新范式,推动AI预训练向更高效、更智能方向发展。解决了传统策略难以扩展、依赖专家经验的问题,开启自动化数据治理新时代。

技术贡献

提出基于遗传算法的策略演化框架,结合样本评估与知识池机制,实现多类别策略的自动优化。创新在于用诊断反馈引导变异,避免盲目搜索,显著降低成本。实现从手工设计到自动演化的转变,为大规模预训练数据筛选提供理论基础和工程方案。

新颖性

首次将演化算法应用于预训练数据策略自动优化,突破了类别特异性策略设计的规模限制。不同于传统过滤或手工调优,DataEvolve实现策略的自我学习与适应,展现出高度的自动化与可扩展性。

局限性

  • 当前方法依赖大规模LLM样本评估,计算成本仍然较高,难以在极端规模下实时应用。
  • 策略演化主要集中在噪声去除和格式标准化,未来需扩展到内容丰富性和知识增强方面。
  • 对不同任务和数据分布的适应性尚需验证,可能在某些特殊类别表现有限。

未来方向

未来将探索多目标优化策略,结合内容丰富性与语义保持,提升数据多样性。同时,结合强化学习与元学习技术,增强策略的泛化能力。还将尝试在更大规模、多模态数据中验证演化框架的普适性,推动自动化数据治理的全面应用。

AI 总览摘要

在大规模预训练模型的发展中,数据质量一直是核心瓶颈。传统策略依赖人工设计,难以应对数百类别、多样内容的复杂场景。本文提出DataEvolve框架,利用遗传算法和样本评估机制,实现预训练数据策略的自动演化。该系统通过闭环反馈,包括质量检测、策略生成、样本执行与效果评估,逐代优化策略,显著提升数据质量与模型性能。实验在Nemotron-CC数据集上,针对8个类别,经过30代演化,生成了Darwin-CC数据集,模型在18项基准测试中平均提升3.96点,特别在知识密集任务中表现优异。分析显示,演化策略趋向于噪声去除和格式标准化,验证了其有效性和收敛性。该方法突破了手工策略设计的瓶颈,为大规模、多类别数据的自动化治理提供了新思路。未来,结合多目标优化和强化学习,将进一步推动自动化数据策略的广泛应用,助力AI模型的高效训练与知识获取。

深度分析

研究背景

随着大规模预训练模型的兴起,数据质量成为影响模型性能的关键因素。早期工作如WebText、C4等采用简单过滤策略,但在面对多样化内容和类别时,效果有限。近年来,研究逐渐转向内容重构和知识增强,如Rephrasing、Guided Rewriting等,但仍依赖人工规则,难以扩展到数百类别。传统方法在规模和适应性方面存在瓶颈,难以满足未来模型对高质量、多样化数据的需求。自动化策略优化成为解决方案的关键方向,但现有研究多集中在单一类别或有限内容类型,缺乏系统性框架。本文提出的DataEvolve,结合演化算法和样本评估,为多类别数据策略自动优化提供了理论基础和实践路径。

核心问题

当前预训练数据策略设计主要依赖人工经验,难以应对数百类别的多样性和规模。手工调优耗时耗力,难以实现大规模自动化。如何在保证策略效果的同时,降低人力成本,提升适应性,成为核心难题。此外,缺乏有效的自动化机制来探索和优化不同类别的特定策略,导致数据质量参差不齐,影响模型性能。解决这一问题,需开发可扩展、自动化、智能的策略优化框架,满足未来大规模预训练的需求。

核心创新

本研究的创新点在于引入基于遗传算法的策略演化机制,结合样本评估和知识池管理,实现多类别策略的自动优化。区别于传统过滤和手工调优,DataEvolve通过诊断反馈引导变异,避免盲目搜索,显著降低成本。其核心在于:

  • �� 设计闭环演化流程,包括质量检测、策略生成、样本执行、效果评估;
  • �� 利用样本评估替代全模型训练,提升效率;
  • �� 通过知识池积累问题与经验,实现跨代学习与优化。这些创新使得自动化策略设计成为可能,并在大规模预训练中展现出优越性能。

方法详解

  • �� 数据质量检测:利用GPT-4-mini分析样本,识别类别特定的噪声和格式问题;• 策略生成:结合经验池信息,利用GPT-4-mini合成初始策略,后续通过遗传变异优化;• 样本执行:用GPT-OSS-120B在样本数据上应用策略,生成清洗后文本;• 评估:由gpt-4o对样本对进行打分和诊断,获得策略效果指标;• 反馈机制:将问题与效果存入经验池和策略池,指导下一轮变异;• 迭代优化:重复上述步骤30轮,逐步演化出最优策略,最终应用于全数据集。

实验设计

采用Nemotron-CC数据集,涵盖8个类别,总计672B tokens。每类别进行30轮演化,利用GPT-4-mini分析样本,GPT-4-120B执行策略,gpt-4o评估。训练3B参数模型,使用500B tokens,比较原始数据、低效策略和演化策略的模型性能。评估指标包括18项基准测试的平均得分,特别关注知识密集任务的提升。通过ablation验证演化的重要性,分析策略收敛性和效果差异。

结果分析

演化策略显著优于手工和非演化策略,模型平均得分从40.17提升至44.13,提升3.96点。知识任务如MMLU提升18.64点,验证了策略在保持事实信息方面的有效性。ablation显示未演化策略仅提升1点,验证演化的必要性。分析策略发现趋向于噪声去除和格式标准化,体现L4原则,验证了演化过程的有效性和收敛性。

应用场景

该方法可广泛应用于大规模预训练数据的自动筛选与清洗,特别适合多类别、多内容类型的场景。企业和研究机构可利用此框架提升数据质量,减少人工成本,加快模型训练周期。未来,结合内容丰富性和知识增强,将推动AI在教育、医疗、科研等领域的应用革新。

局限与展望

目前方法依赖大规模LLM样本评估,计算成本较高,难以实时应用。策略主要集中在噪声过滤和格式标准化,内容丰富性和知识深度仍需提升。对极端类别或特殊任务的适应性有限,未来需结合多目标优化和强化学习,增强泛化能力。

通俗解读 非专业人士也能看懂

想象你在整理一个巨大的图书馆,里面有各种各样的书籍。有些书可能夹杂着错误的内容、格式不一致,甚至重复。你希望把这些书整理得更干净、更有用,但每次手动整理太费时间,也难以应对如此庞大的书库。于是,你设计了一套自动化的“清理机器人”。这个机器人可以先扫描一部分书,找出常见的问题,比如错别字、格式不统一、重复内容。然后,它会尝试不同的清理方法,比如删除多余的广告、规范排版、保留专业术语。每次清理后,它会检查效果,看看哪些方法最有效。通过不断试错和学习,机器人逐渐掌握了最适合这个图书馆的整理策略。这就像本文中的DataEvolve,用AI让数据“自己学习”变得更干净、更有价值。最终,整理好的书库让读者更容易找到所需内容,也让图书馆管理变得更高效。

简单解释 像给14岁少年讲一样

想象你有一个超级大的学校,每天都要整理很多学生的作业。有些作业乱七八糟,有拼写错误,有的格式不一样。你希望让所有作业都变得整整齐齐、没有错误,但手动检查太慢了。于是,你让一个聪明的机器人帮忙。这个机器人可以先看一部分作业,找出常见的问题,比如错字、格式不一致、重复内容。然后,它会试着用不同的方法来改正,比如删除多余的内容、统一排版、保留重要的内容。每次改完后,它会检查效果,看哪些方法效果最好。通过不断试错和学习,机器人逐渐掌握了最有效的整理技巧。这样,所有的作业都变得更整洁,老师也省了很多时间。这就像论文里的DataEvolve,让AI自己学习怎么整理和清理大量数据。最终,整理好的数据可以帮助训练出更聪明、更可靠的模型,就像学生的作业变得更棒一样。

术语表

DataEvolve(数据演化)

一种利用遗传算法和样本评估机制自动优化预训练数据策略的方法,旨在提升模型性能。

论文中提出的核心框架,用于多类别数据的自动策略演化。

策略池(Strategy Pool)

存储不同策略及其性能指标的数据库,用于指导下一轮策略变异和选择。

实现策略逐代优化的关键机制。

经验池(Experience Pool)

存放在演化过程中发现的各种数据质量问题,用于引导策略改进。

支持策略在不同类别间的知识迁移。

L4(生成优化)

数据处理层级,强调通过模型生成或重写提升数据质量的方法。

本研究中策略趋向于噪声去除和格式标准化,体现L4原则。

Nemotron-CC

基于Common Crawl的海量网页语料库,经过质量标注和筛选。

本研究数据来源,用于演化策略的训练和验证。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步降低策略演化的计算成本,提升效率,成为未来研究的重点。
  • 2 多模态、多任务场景下策略自动演化的适应性和泛化能力仍需验证。
  • 3 结合强化学习、元学习等技术,提升策略在极端类别或新兴内容中的表现,是未来方向。

应用场景

近期应用

大规模数据预处理

企业和研究机构可利用DataEvolve自动筛选和清理海量多类别数据,减少人工成本,加快模型训练。

内容质量提升

通过自动策略优化,提升网页、文档等内容的质量,为搜索引擎、知识库提供更优数据基础。

远期愿景

自动化数据治理

未来可实现全自动化、多模态、多任务的数据治理体系,推动AI行业的智能化升级。

原文摘要

Data Darwinism (Part I) established a ten-level hierarchy for data processing, showing that stronger processing can unlock greater data value. However, that work relied on manually designed strategies for a single category. Modern pretraining corpora comprise hundreds of heterogeneous categories spanning domains and content types, each demanding specialized treatment. At this scale, manual strategy design becomes prohibitive. This raises a key question: can strategies evolve in an automated way? We introduce DataEvolve, a framework that enables strategies to evolve through iterative optimization rather than manual design. For each data category, DataEvolve operates in a closed evolutionary loop: it identifies quality issues, generates candidate strategies, executes them on sampled data, evaluates results, and refines approaches across generations. The process accumulates knowledge through an experience pool of discovered issues and a strategy pool tracking performance across iterations. Applied to 8 categories spanning 672B tokens from Nemotron-CC, DataEvolve produces Darwin-CC, a 504B-token dataset with strategies evolved through 30 iterations per category. Training 3B models on 500B tokens, Darwin-CC outperforms raw data (+3.96 points) and achieves a 44.13 average score across 18 benchmarks, surpassing DCLM, Ultra-FineWeb, and FineWeb-Edu, with strong gains on knowledge-intensive tasks such as MMLU. Analysis shows evolved strategies converge on cleaning-focused approaches: targeted noise removal and format normalization with domain-aware preservation, echoing the L4 (Generative Refinement) principles from Part I. Ablation studies confirm iterative evolution is essential: optimized strategies outperform suboptimal ones by 2.93 points, establishing evolutionary strategy design as feasible and necessary for pretraining-scale data curation.

cs.AI