Internal Data Repetition Destroys Language Models

TL;DR

利用无重复比例的扩展规模定律,量化模型中重复数据对性能的系统性损害,发现中间重复次数最为有害。

cs.LG 🔴 高级 2026-06-24 45 次浏览
Jessica Chudnovsky Joshua Kazdan Noam Levi Rylan Schaeffer Yegor Denisov-Blanch Bo He Mehmet Donmez Sanmi Koyejo David Donoho
语言模型 重复数据 规模定律 训练效率 统计模型

核心发现

方法论

本文基于Chinchilla规模定律,结合训练计算(FLOPs)指标,系统分析不同重复数据配置对模型性能的影响。采用精确控制重复文档比例(10%)的实验,测量不同重复次数(R)对验证损失的影响,利用拟合的无重复模型规模定律计算Compute-Equivalent Gain(CEG)和Compute-Equivalent Loss(CEL),并提出统计模型解释非单调损失峰的机制。

关键结果

  • 在344M参数的Qwen3模型上,最有害的重复次数(R)约为155,导致CEL高达0.33,相当于用67%的FLOPs完成无重复训练的损失水平,表明重复数据在训练中造成了显著的计算浪费。
  • 模型规模越大,最有害的重复次数越少,且损害呈幂律关系(Rpeak ∝ N^−0.96),验证了损害的可预测性和规模依赖性。
  • 统计模型模拟显示,重复样本的非单调损失峰源于样本容量与模型容量的统计权衡,非模型特定机制,揭示了重复数据对泛化能力的系统性影响。

研究意义

本研究突破了以往只通过参数数量衡量重复损害的局限,提出基于计算量的损失评估框架,为预训练数据中重复结构的量化提供了精确工具。研究揭示了重复数据在大规模预训练中的系统性损害机制,为优化训练数据策略和模型规模设计提供理论依据,有助于提升模型训练效率和泛化能力。

技术贡献

提出结合Chinchilla规模定律的重复数据损害量化指标(CEG、CEL),实现不同模型规模和训练配置下的损失比较。引入统计线性回归模型,解析重复样本引起的非单调损失峰,提供理论支撑。通过拟合损失与重复次数的幂律关系,预测最有害重复结构,增强了损害机制的可解释性和可预测性。

新颖性

首次系统结合计算量尺度,量化重复数据对大规模语言模型性能的影响,超越传统参数数目指标。提出统计模型解释非单调损失峰,揭示重复样本的统计本质,填补了重复数据影响的理论空白,具有较强的创新性。

局限性

  • 实验仅在特定数据集(FineWeb-Edu-Dedup)和模型架构(Qwen3风格)上验证,泛化到其他数据域和模型类型仍需验证。
  • 模型规模和重复比例的范围有限,未覆盖极大模型和极端重复配置,未来需扩展规模和复杂性。
  • 统计模型简化了复杂的训练动态,未考虑注意力机制、优化器等因素对损害的潜在影响。

未来方向

未来将探索不同类型的重复(如语义重述、近似重复)对模型的影响,结合更复杂的训练动态模型,优化数据采样策略,减少重复带来的计算浪费。同时,研究如何在训练中自动检测和调整重复结构,提升训练效率和模型泛化能力。

AI 总览摘要

随着大规模预训练模型的不断发展,训练数据的质量和多样性成为关键瓶颈。尽管采取了去重措施,重复数据仍在训练语料中普遍存在,严重影响模型性能和训练效率。传统研究多关注参数规模与性能关系,忽视了重复数据的系统性损害。本文基于现代化的Chinchilla规模定律,结合精确控制的重复数据实验,提出了量化重复损害的计算等价指标(CEG和CEL),揭示了重复次数与模型规模的非单调关系。研究发现,重复数据在中间重复次数时对性能的损害最为严重,且这种损害随模型规模增长呈幂律关系。通过引入统计线性回归模型,解释了非单调损失峰的统计机制,强调了重复样本与模型容量的权衡关系。这一发现不仅丰富了对模型泛化和记忆机制的理解,也为优化预训练数据结构提供了理论基础。实验结果显示,重复数据造成的损失在实际训练中可能相当于用更少计算完成的无重复训练,提示我们应在数据采样和训练策略中更好地控制重复结构。未来,结合更复杂的动态模型和多样化的重复类型,将有助于进一步减少训练中的计算浪费,提升模型性能和泛化能力。

深度分析

研究背景

近年来,预训练语言模型不断扩大规模,推动了自然语言处理的突破。代表性工作如GPT系列、BERT、T5等,推动了模型在多任务、多语言环境中的应用。然而,随着模型规模的增长,训练数据的质量和多样性成为瓶颈。尽管采用了去重和过滤技术,重复数据仍难以完全避免,尤其是在大规模网络中,重复的网页、模板和语义相似内容普遍存在。早期研究如Hernandez等通过控制重复比例,发现重复会引起性能非单调变化,但缺乏明确的量化指标。随着Chinchilla等规模定律的提出,学界开始用计算量(FLOPs)作为衡量训练效率的标准,强调模型的训练成本与性能关系。本文在此基础上,系统分析了在现代规模定律框架下,重复数据对模型性能的影响,填补了理论与实践之间的空白。

核心问题

重复数据在预训练中难以避免,且其对模型性能的具体影响尚未被充分量化。传统研究多关注参数数量或训练轮次,忽视了重复样本在训练中的统计结构和计算浪费。重复数据可能导致模型过度记忆某些样本,影响泛化能力,甚至引发性能非单调变化。如何在保证训练效率的同时,减少重复带来的性能损失,成为当前的核心难题。尤其是在大模型训练中,重复样本的存在可能造成显著的计算浪费,影响模型的实际应用效果。

核心创新

本研究提出了基于无重复规模定律的损害量化指标(CEG、CEL),实现不同模型规模和训练配置下的损失比较。引入精确控制的重复数据实验,发现中间重复次数对性能影响最大,提出重复次数与模型规模的幂律关系。通过统计线性回归模型,解释了非单调损失峰的统计机制,揭示了重复样本与模型容量的统计权衡。这些创新使得对重复数据的理解更为系统和量化,为优化训练数据结构提供了理论依据。

方法详解

  • �� 采用Chinchilla规模定律,结合训练计算(FLOPs)指标,设计重复数据实验。• 固定重复样本比例(10%),调节重复次数(R)和重复池大小(Dr),控制训练总计算量。• 训练不同规模(34M-344M参数)模型,测量验证损失。• 利用拟合的无重复模型规模定律,计算Compute-Equivalent Gain(CEG)和Compute-Equivalent Loss(CEL)。• 引入统计线性回归模型,分析重复样本引起的非单调损失峰。• 通过模拟和实证实验验证模型机制,预测最有害的重复配置。

实验设计

在FineWeb-Edu-Dedup数据集上,训练六个不同规模模型(34M至344M参数),调节过训练倍数(OT)和重复次数(R),测量验证集损失。采用精确控制的重复样本比例(10%),确保不同配置下的计算量一致。通过拟合无重复模型的规模定律,计算损失的计算等价指标。实验还包括线性回归模拟,验证统计机制的合理性。所有模型在固定验证集上评估,比较不同重复配置的性能变化,分析重复次数与模型规模的关系。

结果分析

验证发现,重复数据在中间重复次数(R)时导致损失最大,且损害随模型规模增加呈幂律关系(Rpeak ∝ N^−0.96)。在344M参数模型上,最有害重复次数约为155,CEL达0.33,相当于用67%的FLOPs完成无重复训练的损失水平。统计模型模拟表明,非单调损失峰源于样本容量与模型容量的统计权衡,非模型特定机制。这些结果验证了重复数据的系统性损害,强调了合理控制重复结构的重要性。

应用场景

该研究为预训练数据采样策略提供理论指导,帮助设计更高效的训练流程,减少重复带来的计算浪费。可应用于大规模预训练模型的训练调度、数据过滤和样本采样优化,提升模型性能和训练效率。未来还可结合自动检测和调整重复结构的技术,实现动态优化。

局限与展望

实验局限于特定数据集和模型架构,泛化到其他任务和模型仍需验证。统计模型简化了训练动态,未考虑注意力机制等因素。未来需扩展到更复杂的训练场景,探索多样化重复类型的影响,优化模型训练中的重复控制策略。

通俗解读 非专业人士也能看懂

想象你在准备一份大餐,食材就像训练数据。重复的食材,比如多次放入盐,虽然能让菜变得更咸,但如果放得太多,菜就会变得难吃。同样,在训练模型时,重复的内容会让模型记住一些东西,但如果重复太多,模型反而学得不好,变得“只会背书”,而不能灵活应对新问题。研究发现,重复内容越到中间程度,损害越大,就像盐放得太多一样。模型越大,这个“盐”的最佳放置点越少。就像厨房里,合理用盐才能做出好菜,合理控制训练中的重复,也能让模型更聪明、更有效。这个研究帮我们理解,怎么在训练时避免“放太多盐”,让模型既记得重要内容,又能灵活应变。

简单解释 像给14岁少年讲一样

想象你在学习一门新技能,比如弹吉他。你每天反复练习一些相同的歌曲,刚开始会帮你记得更快,但如果反复练习太多,反而会让你变得死板,学不会弹其他歌曲。这个研究发现,模型训练也是一样,重复的内容在一定程度上会帮助记忆,但如果重复太多,就会影响学习新东西。特别是当模型变得更大时,重复的“坏影响”会变得更明显。科学家用数学模型解释了为什么会这样,就像你反复练习某个动作到极限,最终反而变得不灵活。这个发现告诉我们,要让模型既记住重要信息,又能灵活应对新问题,就要合理控制重复的次数,就像练习时要有节制一样。未来的研究会帮我们找到更聪明的训练方法,让模型变得更厉害!

原文摘要

Language models are running out of high-quality training data, and even aggressively deduplicated corpora retain some amount of repetition. Earlier controlled studies predated Chinchilla-style scaling laws and could only measure the cost of repetition indirectly. We revisit repetition in the Chinchilla era, using a fitted no-repetition scaling law to report Compute-Equivalent Gain and Compute-Equivalent Loss. We show that under this modernized paradigm, repetition damage is systematic in three ways. First, holding compute allocated to repeated data constant, eval loss peaks at an intermediate repeat count $\Rep$; repeating a moderately sized subset a moderate number of times damages performance more than repeating a large subset a few times or a small subset many times. Second, the location of this peak is well-fit by a power law in model size; this scaling law reveals that the most damaging number of repeated data grows more quickly than compute. Finally, when repeated documents consume 10\% of the FLOPs budget in a controlled exact-document repetition setting, the compute-equivalent loss can be large: on FineWeb-Edu-Dedup, the most damaging repeat count for a Qwen3-style 344M-parameter model at $\OT=1$ matches the loss of a no-repetition run using 67% of the FLOPs. We demonstrate that these phenomena are not language-model-specific, and can be analytically understood in a simple statistical model: a misspecified linear regression with verbatim duplicates reproduces the same qualitative loss peak, quantifying how such peaks can arise from a statistical tradeoff between memorization and generalization. Our findings add precision to the study of duplication in language models, allowing practitioners to quantify the wasted compute incurred by the presence and repeat structure of duplicates in pretraining corpora.

cs.LG cs.AI