核心发现
方法论
DataEvolve采用闭环演化框架,包括数据质量检测、策略生成、样本执行与评估。通过经验池存储发现的问题,策略池追踪策略表现,逐代优化。每个类别独立演化,利用诊断反馈指导变异,避免人工设计瓶颈。核心算法结合遗传算法与样本评估,提升策略适应性。实验中,针对8个类别,经过30代演化,生成Darwin-CC数据集,显著优于原始数据,模型在18项基准中平均提升3.96点。策略趋向噪声去除与格式标准化,体现L4(生成优化)原则。
关键结果
- 在3B参数模型上,训练500B tokens,Darwin-CC数据集使平均分提升至44.13,比原始数据高出3.96点,特别在知识密集任务MMLU提升18.64点。
- 与手工设计策略相比,自动演化策略在18项基准中表现更优,验证了策略自动演化的有效性。 ablation研究显示,未演化策略仅提升1点,演化显著优于非演化方法。
- 分析显示,策略趋向于针对不同类别进行噪声过滤和格式规范,保持领域特征,验证了演化过程的收敛性和实用性。
研究意义
该研究突破了预训练数据策略设计的规模瓶颈,将手工调优转向自动演化,极大提高数据质量与模型性能。为大规模多类别数据处理提供新范式,推动AI预训练向更高效、更智能方向发展。解决了传统策略难以扩展、依赖专家经验的问题,开启自动化数据治理新时代。
技术贡献
提出基于遗传算法的策略演化框架,结合样本评估与知识池机制,实现多类别策略的自动优化。创新在于用诊断反馈引导变异,避免盲目搜索,显著降低成本。实现从手工设计到自动演化的转变,为大规模预训练数据筛选提供理论基础和工程方案。
新颖性
首次将演化算法应用于预训练数据策略自动优化,突破了类别特异性策略设计的规模限制。不同于传统过滤或手工调优,DataEvolve实现策略的自我学习与适应,展现出高度的自动化与可扩展性。
局限性
- 当前方法依赖大规模LLM样本评估,计算成本仍然较高,难以在极端规模下实时应用。
- 策略演化主要集中在噪声去除和格式标准化,未来需扩展到内容丰富性和知识增强方面。
- 对不同任务和数据分布的适应性尚需验证,可能在某些特殊类别表现有限。
未来方向
未来将探索多目标优化策略,结合内容丰富性与语义保持,提升数据多样性。同时,结合强化学习与元学习技术,增强策略的泛化能力。还将尝试在更大规模、多模态数据中验证演化框架的普适性,推动自动化数据治理的全面应用。
AI 总览摘要
在大规模预训练模型的发展中,数据质量一直是核心瓶颈。传统策略依赖人工设计,难以应对数百类别、多样内容的复杂场景。本文提出DataEvolve框架,利用遗传算法和样本评估机制,实现预训练数据策略的自动演化。该系统通过闭环反馈,包括质量检测、策略生成、样本执行与效果评估,逐代优化策略,显著提升数据质量与模型性能。实验在Nemotron-CC数据集上,针对8个类别,经过30代演化,生成了Darwin-CC数据集,模型在18项基准测试中平均提升3.96点,特别在知识密集任务中表现优异。分析显示,演化策略趋向于噪声去除和格式标准化,验证了其有效性和收敛性。该方法突破了手工策略设计的瓶颈,为大规模、多类别数据的自动化治理提供了新思路。未来,结合多目标优化和强化学习,将进一步推动自动化数据策略的广泛应用,助力AI模型的高效训练与知识获取。
深度分析
研究背景
随着大规模预训练模型的兴起,数据质量成为影响模型性能的关键因素。早期工作如WebText、C4等采用简单过滤策略,但在面对多样化内容和类别时,效果有限。近年来,研究逐渐转向内容重构和知识增强,如Rephrasing、Guided Rewriting等,但仍依赖人工规则,难以扩展到数百类别。传统方法在规模和适应性方面存在瓶颈,难以满足未来模型对高质量、多样化数据的需求。自动化策略优化成为解决方案的关键方向,但现有研究多集中在单一类别或有限内容类型,缺乏系统性框架。本文提出的DataEvolve,结合演化算法和样本评估,为多类别数据策略自动优化提供了理论基础和实践路径。
核心问题
当前预训练数据策略设计主要依赖人工经验,难以应对数百类别的多样性和规模。手工调优耗时耗力,难以实现大规模自动化。如何在保证策略效果的同时,降低人力成本,提升适应性,成为核心难题。此外,缺乏有效的自动化机制来探索和优化不同类别的特定策略,导致数据质量参差不齐,影响模型性能。解决这一问题,需开发可扩展、自动化、智能的策略优化框架,满足未来大规模预训练的需求。
核心创新
本研究的创新点在于引入基于遗传算法的策略演化机制,结合样本评估和知识池管理,实现多类别策略的自动优化。区别于传统过滤和手工调优,DataEvolve通过诊断反馈引导变异,避免盲目搜索,显著降低成本。其核心在于:
- �� 设计闭环演化流程,包括质量检测、策略生成、样本执行、效果评估;
- �� 利用样本评估替代全模型训练,提升效率;
- �� 通过知识池积累问题与经验,实现跨代学习与优化。这些创新使得自动化策略设计成为可能,并在大规模预训练中展现出优越性能。
方法详解
- �� 数据质量检测:利用GPT-4-mini分析样本,识别类别特定的噪声和格式问题;• 策略生成:结合经验池信息,利用GPT-4-mini合成初始策略,后续通过遗传变异优化;• 样本执行:用GPT-OSS-120B在样本数据上应用策略,生成清洗后文本;• 评估:由gpt-4o对样本对进行打分和诊断,获得策略效果指标;• 反馈机制:将问题与效果存入经验池和策略池,指导下一轮变异;• 迭代优化:重复上述步骤30轮,逐步演化出最优策略,最终应用于全数据集。
实验设计
采用Nemotron-CC数据集,涵盖8个类别,总计672B tokens。每类别进行30轮演化,利用GPT-4-mini分析样本,GPT-4-120B执行策略,gpt-4o评估。训练3B参数模型,使用500B tokens,比较原始数据、低效策略和演化策略的模型性能。评估指标包括18项基准测试的平均得分,特别关注知识密集任务的提升。通过ablation验证演化的重要性,分析策略收敛性和效果差异。
结果分析
演化策略显著优于手工和非演化策略,模型平均得分从40.17提升至44.13,提升3.96点。知识任务如MMLU提升18.64点,验证了策略在保持事实信息方面的有效性。ablation显示未演化策略仅提升1点,验证演化的必要性。分析策略发现趋向于噪声去除和格式标准化,体现L4原则,验证了演化过程的有效性和收敛性。
应用场景
该方法可广泛应用于大规模预训练数据的自动筛选与清洗,特别适合多类别、多内容类型的场景。企业和研究机构可利用此框架提升数据质量,减少人工成本,加快模型训练周期。未来,结合内容丰富性和知识增强,将推动AI在教育、医疗、科研等领域的应用革新。
局限与展望
目前方法依赖大规模LLM样本评估,计算成本较高,难以实时应用。策略主要集中在噪声过滤和格式标准化,内容丰富性和知识深度仍需提升。对极端类别或特殊任务的适应性有限,未来需结合多目标优化和强化学习,增强泛化能力。
通俗解读 非专业人士也能看懂
想象你在整理一个巨大的图书馆,里面有各种各样的书籍。有些书可能夹杂着错误的内容、格式不一致,甚至重复。你希望把这些书整理得更干净、更有用,但每次手动整理太费时间,也难以应对如此庞大的书库。于是,你设计了一套自动化的“清理机器人”。这个机器人可以先扫描一部分书,找出常见的问题,比如错别字、格式不统一、重复内容。然后,它会尝试不同的清理方法,比如删除多余的广告、规范排版、保留专业术语。每次清理后,它会检查效果,看看哪些方法最有效。通过不断试错和学习,机器人逐渐掌握了最适合这个图书馆的整理策略。这就像本文中的DataEvolve,用AI让数据“自己学习”变得更干净、更有价值。最终,整理好的书库让读者更容易找到所需内容,也让图书馆管理变得更高效。
简单解释 像给14岁少年讲一样
想象你有一个超级大的学校,每天都要整理很多学生的作业。有些作业乱七八糟,有拼写错误,有的格式不一样。你希望让所有作业都变得整整齐齐、没有错误,但手动检查太慢了。于是,你让一个聪明的机器人帮忙。这个机器人可以先看一部分作业,找出常见的问题,比如错字、格式不一致、重复内容。然后,它会试着用不同的方法来改正,比如删除多余的内容、统一排版、保留重要的内容。每次改完后,它会检查效果,看哪些方法效果最好。通过不断试错和学习,机器人逐渐掌握了最有效的整理技巧。这样,所有的作业都变得更整洁,老师也省了很多时间。这就像论文里的DataEvolve,让AI自己学习怎么整理和清理大量数据。最终,整理好的数据可以帮助训练出更聪明、更可靠的模型,就像学生的作业变得更棒一样。
术语表
DataEvolve(数据演化)
一种利用遗传算法和样本评估机制自动优化预训练数据策略的方法,旨在提升模型性能。
论文中提出的核心框架,用于多类别数据的自动策略演化。
策略池(Strategy Pool)
存储不同策略及其性能指标的数据库,用于指导下一轮策略变异和选择。
实现策略逐代优化的关键机制。
经验池(Experience Pool)
存放在演化过程中发现的各种数据质量问题,用于引导策略改进。
支持策略在不同类别间的知识迁移。
L4(生成优化)
数据处理层级,强调通过模型生成或重写提升数据质量的方法。
本研究中策略趋向于噪声去除和格式标准化,体现L4原则。
Nemotron-CC
基于Common Crawl的海量网页语料库,经过质量标注和筛选。
本研究数据来源,用于演化策略的训练和验证。
开放问题 这项研究留下的未解疑问
- 1 如何进一步降低策略演化的计算成本,提升效率,成为未来研究的重点。
- 2 多模态、多任务场景下策略自动演化的适应性和泛化能力仍需验证。
- 3 结合强化学习、元学习等技术,提升策略在极端类别或新兴内容中的表现,是未来方向。
应用场景
近期应用
大规模数据预处理
企业和研究机构可利用DataEvolve自动筛选和清理海量多类别数据,减少人工成本,加快模型训练。
内容质量提升
通过自动策略优化,提升网页、文档等内容的质量,为搜索引擎、知识库提供更优数据基础。
远期愿景
自动化数据治理
未来可实现全自动化、多模态、多任务的数据治理体系,推动AI行业的智能化升级。
原文摘要
Data Darwinism (Part I) established a ten-level hierarchy for data processing, showing that stronger processing can unlock greater data value. However, that work relied on manually designed strategies for a single category. Modern pretraining corpora comprise hundreds of heterogeneous categories spanning domains and content types, each demanding specialized treatment. At this scale, manual strategy design becomes prohibitive. This raises a key question: can strategies evolve in an automated way? We introduce DataEvolve, a framework that enables strategies to evolve through iterative optimization rather than manual design. For each data category, DataEvolve operates in a closed evolutionary loop: it identifies quality issues, generates candidate strategies, executes them on sampled data, evaluates results, and refines approaches across generations. The process accumulates knowledge through an experience pool of discovered issues and a strategy pool tracking performance across iterations. Applied to 8 categories spanning 672B tokens from Nemotron-CC, DataEvolve produces Darwin-CC, a 504B-token dataset with strategies evolved through 30 iterations per category. Training 3B models on 500B tokens, Darwin-CC outperforms raw data (+3.96 points) and achieves a 44.13 average score across 18 benchmarks, surpassing DCLM, Ultra-FineWeb, and FineWeb-Edu, with strong gains on knowledge-intensive tasks such as MMLU. Analysis shows evolved strategies converge on cleaning-focused approaches: targeted noise removal and format normalization with domain-aware preservation, echoing the L4 (Generative Refinement) principles from Part I. Ablation studies confirm iterative evolution is essential: optimized strategies outperform suboptimal ones by 2.93 points, establishing evolutionary strategy design as feasible and necessary for pretraining-scale data curation.