Demystifying Synthetic Data in LLM Pre-training: A Systematic Study of Scaling Laws, Benefits, and Pitfalls
采用统一预训练协议,验证合成数据在LLM中的缩放规律、优势与风险,发现混合使用可提升训练效率。
核心发现
方法论
本研究基于超过1000个不同参数规模(最高3B参数)模型,利用超过10万GPU小时,系统比较自然网页数据、重述合成文本和教材式合成文本的预训练效果。采用统一的缩放法律模型,分析不同合成数据类型、比例及生成模型能力对训练收敛速度、验证损失和下游任务表现的影响。通过多轮实验,验证了合成数据在不同数据预算和模型规模下的优势与局限,特别关注“模型崩溃”风险。
关键结果
- 单独用重述合成数据预训练未快于自然网页文本,但在1/3合成+2/3自然混合条件下,训练速度提升5-10倍(达到相同验证损失),尤其在大数据预算下效果显著。
- 教材式纯合成数据在多领域任务中表现较差,验证损失明显高于自然数据,且合成比例超过30%时效果下降,模型规模越大越敏感。
- 生成模型参数(如8B或70B)对合成数据质量影响有限,8B模型生成的合成文本在预训练中表现优于70B模型,提示“更大不一定更好”。
研究意义
该研究系统揭示了合成数据在大规模预训练中的条件性优势,打破了“模型崩溃”的误区,为未来合成数据的合理使用提供理论基础和实践指南。通过大规模实证,明确了不同合成数据类型、比例、生成模型能力对训练效率和模型性能的影响,为优化LLM训练流程提供了关键参考,有助于缓解高质量数据有限的瓶颈,推动AI模型的普及与应用。
技术贡献
本研究首次在统一框架下系统评估多种合成数据生成策略(重述文本、教材式文本)及其混合比例,结合缩放规律模型(如验证了验证损失与数据规模、模型规模的幂律关系),提出了“30%最佳合成比例”经验法则。还验证了不同生成模型参数对合成文本质量的影响,挑战了“模型越大越好”的假设,提供了合成数据在预训练中的理论指导。研究还对“模型崩溃”风险进行了实证分析,发现合理比例的合成数据不会导致性能退化。
新颖性
本研究首次在大规模、多模型、多数据规模条件下,系统分析合成数据的缩放规律、最佳比例及生成模型能力对预训练效果的影响。区别于以往单一任务或小规模实验,提出了统一的实证框架,验证了合成数据在不同场景中的条件性优势,突破了“模型崩溃”的传统担忧,为合成数据在预训练中的应用提供了理论支持。
局限性
- 实验主要集中在英文文本,未来需验证多语言环境下的适用性。
- 合成数据生成依赖预训练模型,存在偏差传递风险,未充分探索多样化生成策略。
- 模型规模最大到3B参数,尚未验证超大模型(如GPT-4级别)中的表现与风险。
未来方向
未来将扩展多语言、多任务、多模态场景,探索更大规模模型的合成数据效果。研究将结合强化学习和自监督机制,优化合成数据生成策略,进一步降低“模型崩溃”风险。还计划开发自动化比例调节算法,实现动态优化合成与自然数据混合比例,以提升预训练效率和模型泛化能力。
AI 总览摘要
在大规模预训练中,训练数据的质量与规模一直是制约模型性能的关键因素。随着模型参数不断增长,获取高质量自然文本变得愈发困难,合成数据作为一种潜在的替代方案引起广泛关注。本研究系统性地评估了不同类型合成数据(重述文本、教材式文本)在预训练中的效果,利用统一的缩放规律模型,分析了合成数据比例、生成模型能力对训练速度、验证损失和下游任务性能的影响。
通过对超过1000个模型的实证分析,发现单独使用重述合成数据并不能加快训练速度,但在合成比例约30%的情况下,与自然网页数据混合训练可以大幅提升效率(5-10倍),尤其在大数据预算下表现突出。教材式纯合成数据在多任务场景中表现较差,验证了其局限性。值得注意的是,较大生成模型(如70B参数)并不一定生成更优质的合成文本,8B模型反而表现更佳。
这些发现挑战了“模型崩溃”的担忧,表明合理比例的合成数据在预训练中具有条件性优势,有助于缓解高质量数据短缺问题。研究还提出了“30%合成比例”经验法则,为实际应用提供指导。未来,研究将关注多语言、多模态、多任务场景的扩展,优化合成数据生成策略,推动大规模预训练的持续发展。
深度分析
研究背景
近年来,随着Transformer架构的普及和模型参数的指数级增长,预训练数据的规模和质量成为模型性能的核心驱动力。代表性工作如GPT系列、LLaMA、PaLM等,均强调大规模、多样化数据的重要性。自然网页文本(如CommonCrawl)是主要数据源,但其有限的高质量内容限制了模型的进一步提升。合成数据作为一种补充手段,已在指令调优和对齐任务中展现潜力(如Meta的中间训练阶段),但在基础预训练阶段的系统性研究仍不足,存在理论与实践的双重不确定性。
核心问题
核心问题在于,合成数据能否在大规模预训练中有效提升模型性能?不同合成策略(重述、教材式)对训练速度和模型泛化能力的影响机制尚不清楚。尤其在模型规模不断扩大、数据预算有限的背景下,如何合理配置合成与自然数据比例,避免“模型崩溃”或性能退化,成为亟待解决的关键难题。现有研究多为小规模或单一任务验证,缺乏系统性和规模化的实证支持。
核心创新
本研究创新点在于:1)建立统一的预训练协议,系统比较多种合成数据类型及其混合比例;2)结合缩放规律模型,量化合成数据对训练速度和验证损失的影响,提出“30%合成比例”经验法则;3)验证不同生成模型参数对合成文本质量的影响,挑战“越大越好”的假设;4)实证分析“模型崩溃”风险,发现合理比例合成数据不会导致性能退化。这些创新极大丰富了合成数据在大规模预训练中的理论基础。
方法详解
- �� 设计多模型、多数据规模的预训练实验,涵盖自然网页、重述合成文本和教材式合成文本。
- �� 采用统一的Transformer架构(基于Llama 3)进行训练,参数规模从1亿到3B,数据规模从1B到200B tokens。
- �� 利用缩放规律模型(如验证验证损失与数据规模、模型规模的幂律关系)进行拟合和预测。
- �� 生成合成数据:使用预训练模型(如Mistral-7B)对网页文本进行重述(高质量和问答风格)和教材式生成。
- �� 设计不同合成比例(0%、33%、67%、100%)的混合数据集,训练多个模型以确保统计显著性。
- �� 评估指标包括验证损失、下游任务表现(如文本理解、推理任务)和模型“ irreducible loss”。
实验设计
- �� 采用CommonCrawl作为自然数据基础,利用RedPajama-v2处理。
- �� 合成数据由Mistral-Instruct-7B模型生成,覆盖重述(高质量、问答)和教材式文本。
- �� 通过不同合成比例(0%、33%、67%、100%)构建混合数据集,训练多模型,验证不同数据比例对训练速度和性能的影响。
- �� 训练模型参数从1亿到3B,数据预算从1B到200B tokens,采用一致的训练超参数(如学习率、批次大小、上下文长度)。
- �� 利用缩放规律模型拟合验证损失与数据规模、模型规模的关系,预测超大模型(如400B参数)在不同数据配置下的表现。
结果分析
- �� 合成数据单独使用未优于自然网页数据,但在合成比例约30%的混合条件下,训练速度提升5-10倍,验证损失与纯自然数据相当。
- �� 教材式纯合成文本在多任务表现中较差,验证损失明显高于自然数据,且比例超过30%时效果下降。
- �� 生成模型参数(8B vs 70B)对合成文本质量影响有限,8B模型生成的文本更适合预训练。
- �� 通过缩放规律模型预测,合成数据在不同规模下的效果存在差异,合理比例在不同模型规模中表现出一定的稳定性。
应用场景
- �� 立即应用:可在自然数据有限时,利用合成数据提升预训练效率,适用于资源有限的研究机构和企业。
- �� 长远愿景:推动合成数据在多语言、多模态预训练中的应用,降低高质量数据依赖,促进AI模型的普及与公平。
局限与展望
- �� 仅在英文文本和有限模型规模下验证,跨语言和超大模型表现尚未充分探索。
- �� 合成数据生成依赖预训练模型,可能引入偏差和偏向性,影响模型公平性。
- �� 计算成本高,未来需优化生成效率和比例调节策略。
通俗解读 非专业人士也能看懂
想象你在准备一场大餐,食材就像训练模型用的数据。自然网页文本就像从市场买来的新鲜食材,但有时候新鲜食材有限,难以满足所有需求。于是,你用厨房里的厨师(合成模型)来“加工”已有的食材,变成不同风味的菜肴(合成数据)。如果只用合成的菜肴,味道可能不够丰富,但合理搭配(比如30%的合成+70%的自然食材)可以让菜肴既丰富又高效。不同厨师(生成模型)能力不同,能力强的厨师能做出更美味的菜,但不一定比中等厨师更适合所有菜肴。这样,厨房里的食材和厨师配比,就像训练中的数据比例和生成模型能力,合理搭配能让大厨(模型)做出更棒的菜(性能)。
简单解释 像给14岁少年讲一样
想象你在准备一场盛大的派对,食材就像训练机器学习模型用的数据。自然网页文本就像你从市场买来的新鲜食材,但有时候这些食材不够多,不能满足所有的需求。于是,你请厨师(合成模型)帮忙,把已有的食材变成不同的菜肴(合成数据)。如果只用厨师做的菜,可能味道不够丰富,但如果你把一部分新鲜食材和厨师做的菜混在一起,就能做出又快又好吃的饭。不同厨师(生成模型)能力不同,能力强的厨师能做出更好吃的菜,但不一定比中等厨师更适合所有菜肴。这样,食材和厨师的比例就像训练中的数据比例和生成模型的能力,合理搭配可以让你做出最棒的饭,既省时间又保证质量。
原文摘要
Training data plays a crucial role in Large Language Models (LLM) scaling, yet high quality data is of limited supply. Synthetic data techniques offer a potential path toward sidestepping these limitations. We conduct a large-scale empirical investigation (>1000 LLMs with >100k GPU hours) using a unified protocol and scaling laws, comparing natural web data, diverse synthetic types (rephrased text, generated textbooks), and mixtures of natural and synthetic data. Specifically, we found pre-training on rephrased synthetic data \textit{alone} is not faster than pre-training on natural web texts; while pre-training on 1/3 rephrased synthetic data mixed with 2/3 natural web texts can speed up 5-10x (to reach the same validation loss) at larger data budgets. Pre-training on textbook-style synthetic data \textit{alone} results in notably higher loss on many downstream domains especially at small data budgets. "Good" ratios of synthetic data in training data mixtures depend on the model size and data budget, empirically converging to ~30% for rephrased synthetic data. Larger generator models do not necessarily yield better pre-training data than ~8B-param models. These results contribute mixed evidence on "model collapse" during large-scale single-round (n=1) model training on synthetic data--training on rephrased synthetic data shows no degradation in performance in foreseeable scales whereas training on mixtures of textbook-style pure-generated synthetic data shows patterns predicted by "model collapse". Our work demystifies synthetic data in pre-training, validates its conditional benefits, and offers practical guidance.