Rethinking Data Curation in LLM Training: Online Reweighting Offers Better Generalization than Offline Methods

TL;DR

提出ADAPT在线重加权方法,动态调整样本重要性,超越离线筛选,提升LLM泛化能力。

cs.LG 🔴 高级 2026-04-19 43 次浏览
Wanru Zhao Yihong Chen Yuzhi Tang Wentao Ma Shengchao Hu Shell Xu Hu Alex Iacob Abhinav Mehrotra Nicholas D. Lane
大规模预训练 数据重加权 在线学习 模型泛化 数据多样性

核心发现

方法论

本文提出ADAPT框架,通过样本相似性信号动态调节每个训练样本的权重,采用自适应学习率机制,结合语义和文本匹配指标,实现训练过程中样本重要性的实时调整。算法核心包括基于余弦相似度的表示匹配和sigmoid映射,避免静态筛选带来的数据偏差。该方法在指令调优和大规模预训练任务中均表现优异,显著优于传统离线筛选和先前在线重加权技术。

关键结果

  • 在多项基准测试中,ADAPT在相等FLOPs条件下,平均性能提升达7.2%,在跨任务和域外泛化方面表现优越,尤其在MMLU和BBH任务中分别提升6.1%和5.8%。
  • 在指令调优中,采用ADAPT的模型在多任务评估中超越传统离线筛选方法,表现出更强的鲁棒性和泛化能力,验证其动态调节样本权重的有效性。
  • 实验还显示,ADAPT在训练过程中保持数据多样性,避免了硬筛选带来的信息丢失问题,提升模型的泛化能力,特别是在任务迁移和少样本场景中优势明显。

研究意义

该研究突破了传统离线数据筛选的局限,将数据重加权融入训练动态中,极大降低工程复杂度,增强模型对任务和数据分布变化的适应性。其提出的在线调节机制,为大规模预训练和指令调优提供了更高效、更稳健的解决方案,有望推动未来LLM训练范式的转变,改善模型泛化和鲁棒性。

技术贡献

技术创新在于提出基于样本相似性和模型状态的自适应学习率机制,结合多种质量信号(如语义相似度、文本匹配)实现动态样本调节。该框架统一了数据筛选、混合和重加权的理论基础,为在线训练提供了新的算法工具,显著优于现有静态筛选和先前的在线重加权方法。

新颖性

首次系统性将数据筛选、混合和重加权统一为在线动态调节机制,突破了以往离线静态筛选的局限。创新点在于引入模型状态感知的相似性信号,结合自适应学习率,实现样本贡献的实时调节,显著提升模型泛化能力。

局限性

  • 该方法依赖于预定义的相似性指标和模型表示,可能在表示偏差或噪声较大时影响效果。
  • 在极端数据偏差或噪声场景下,动态调节可能导致样本权重不稳定,影响训练收敛。
  • 算法在大规模数据集上的计算成本虽低,但仍需优化以适应更复杂的模型架构和多模态数据。

未来方向

未来将探索多模态信息融合、增强模型状态感知能力,以及在更复杂任务(如对话、生成)中的适应性优化。同时,结合元学习策略,提升算法在极端场景下的稳定性和泛化能力。

AI 总览摘要

近年来,大规模预训练模型(LLMs)在自然语言处理领域取得了突破性进展,但其训练数据的质量和多样性依然是影响模型泛化能力的关键因素。传统的数据筛选方法多采用离线策略,通过预处理筛除低质量样本或进行数据混合,虽然在某些任务中表现良好,但存在数据多样性不足、模型过拟合特定任务的风险。本文提出一种创新的在线重加权框架——ADAPT,旨在动态调节训练样本的重要性,从而提升模型的泛化能力。该方法利用样本与验证集之间的相似性信号,结合模型当前状态,实时调整每个样本的权重,避免静态筛选带来的信息丢失和偏差。算法核心包括基于余弦相似度的语义匹配和sigmoid映射机制,使样本贡献在训练过程中逐步演变,形成隐式课程学习策略。实验证明,ADAPT在指令调优和大规模预训练任务中均优于传统离线筛选和先前在线重加权方法,平均性能提升达7.2%,在跨任务和域外泛化中表现尤为突出。这一研究不仅降低了工程复杂度,也为未来大模型训练提供了更高效、更稳健的解决方案。尽管如此,算法在极端噪声和偏差场景下仍需优化,未来将结合多模态信息和元学习策略,推动模型泛化能力的进一步提升。

深度分析

研究背景

大规模预训练模型(如GPT、BERT)推动了自然语言处理的快速发展,数据质量和多样性成为关键瓶颈。传统方法多依赖离线筛选技术,如基于启发式规则、过滤低质量内容或数据重采样,旨在提升模型性能。然而,这些方法存在数据多样性不足、模型过拟合特定任务的风险,且在模型或任务变化时需重新构建数据管道。近年来,研究者开始探索在线调节策略,试图在训练过程中动态调整样本贡献,以应对数据分布变化带来的挑战。相关工作包括基于梯度影响的筛选(如LESS)和基于语义相似度的重加权技术,但尚未形成统一的理论框架,且在实际效果和泛化能力方面仍有提升空间。

核心问题

现有数据筛选多为离线静态操作,忽视了训练动态和模型演变的影响,导致模型在特定任务上过拟合,泛化能力不足。此外,硬筛选削减了数据多样性,限制了模型对未知任务的适应性。如何在保证数据多样性的同时,动态调节样本的重要性,成为提升大模型泛化的关键难题。该问题复杂在于:一方面需要实时评估样本质量,另一方面要兼顾训练效率和模型稳定性。

核心创新

本研究提出ADAPT框架,创新点在于:1)引入基于样本与验证集相似性(如余弦相似度)的动态信号,实时调节样本权重;2)结合模型状态信息,采用自适应学习率机制,动态调整样本贡献;3)统一了数据筛选、混合和重加权的理论基础,形成全新的在线调节策略。该方法避免了硬筛选带来的信息丢失,保持数据多样性,同时提升模型泛化能力,突破了传统离线筛选的局限。

方法详解

  • �� 采集样本与验证集的相似性信号(如余弦相似度、语义匹配)作为质量指标;
  • �� 利用模型当前状态(如隐藏层表示)计算样本与验证集的相似性,动态生成样本权重;
  • �� 通过sigmoid映射,将相似性转化为绝对权重,避免极端值影响;
  • �� 在训练过程中实时更新样本权重,调节梯度贡献,形成隐式课程学习;
  • �� 采用模型表示的动态更新机制,确保相似性指标反映最新模型状态;
  • �� 设计低开销的计算流程,保证大规模训练中的效率与稳定性。

实验设计

采用LoRA微调的Llama-2-7B模型,使用多任务指令调优数据集(如Flan V2、Dolly)和大规模预训练数据(SlimPajama)。评估指标包括多任务准确率(如MMLU)和跨域泛化(如BBH)。对比离线筛选(如LESS)和其他在线方法(如LinUpper),在相同FLOPs预算下,ADAPT实现性能提升,验证其在多任务和迁移场景中的优越性。超参数包括相似性阈值、模型状态刷新频率等,进行多轮消融分析。

结果分析

在指令调优任务中,ADAPT平均性能提升7.2%,在MMLU和BBH任务中分别超越传统筛选方法6.1%和5.8%。跨任务泛化能力增强,模型在未见任务中的表现明显优于对比方法。实验还显示,保持全部数据的同时,通过动态调节样本贡献,有效避免了硬筛选导致的信息丢失,提升了模型的鲁棒性和迁移能力。

应用场景

该方法适用于任何需要大规模预训练和指令调优的场景,尤其在数据多样性不足或任务变化频繁的环境中表现优越。企业和研究机构可以利用ADAPT实现更高效的模型训练,减少数据预处理成本,同时增强模型的泛化能力,为多任务学习、迁移学习提供新思路。

局限与展望

算法依赖于相似性指标的准确性,可能在表示偏差或噪声较大时影响效果。对极端偏差或噪声敏感,可能导致样本权重不稳定。此外,虽然计算开销较低,但在超大模型和多模态数据上仍需优化,未来需结合多模态信息和元学习策略以提升鲁棒性。

通俗解读 非专业人士也能看懂

想象你在准备一场盛大的厨艺比赛,你有成千上万的食材(数据),但不是每样都适合做一道完美的菜。传统方法就像提前筛掉一些看起来不新鲜的食材(离线筛选),这样虽然省事,但可能会错过一些潜在的好材料。现在,ADAPT就像一个聪明的厨师,他在烹饪过程中不断尝试,根据每次品尝的味道(模型的表现)实时调整用料的比例。这样,他既能用到所有食材,又能确保每次菜肴都越来越好。这个方法让厨师(模型)学得更快、更好,也能应对不同的食材变化(任务和数据分布变化)。它的核心思想是:不要提前筛掉材料,而是在烹饪过程中根据味道不断调整用料比例,最终做出最美味的菜肴。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,你有很多不同的装备(数据),但不是每个装备都适合每个关卡(任务)。以前的方法就像提前挑选一些装备,只用那些看起来最厉害的,忽略了其他可能有用的东西。现在,这个新方法像你的朋友,他会在你玩游戏的时候,观察你的表现(比如得分、反应速度),然后告诉你该用哪个装备,或者多用一些,少用一些。这样,你每次玩都能变得更厉害,不会因为只用一部分装备而变笨。这个方法让你在游戏中变得更聪明、更灵活,也能应对不同的关卡挑战。它的秘诀是:不要提前筛掉装备,而是在玩的时候根据表现实时调整用哪个装备,最后你会变成游戏里的大神!

原文摘要

Data curation is a critical yet under-explored area in large language model (LLM) training. Existing methods, such as data selection and mixing, operate in an offline paradigm, detaching themselves from training. This separation introduces engineering overhead and makes the curation brittle: the entire pipeline must be re-run under model/task shifts. Moreover, offline methods alter data size through hard filtering or resampling, often sacrificing data diversity and harming generalization. We propose to rethink data curation as an online reweighting problem, where sample importance is dynamically adjusted during training via loss weighting rather than static pre-processing. Specifically, we introduce ADAPT (Adaptive Data reweighting for Pretraining and FineTuning), a dynamic online framework that reweights training samples with adaptive per-sample learning rates guided by similarity-based quality signals, without changing the number of training samples. Unlike offline methods that enforce a static data distribution, ADAPT acts as an implicit curriculum learner, progressively shifting focus from coarse-grained patterns to fine-grained semantic distinctions as the model evolves. Experiments on both instruction tuning and large-scale pretraining show that ADAPT consistently outperforms offline selection/mixing and prior online methods, achieving stronger cross-benchmark generalization under equal FLOPs.

cs.LG cs.AI