InfoLaw: Information Scaling Laws for Large Language Models with Quality-Weighted Mixture Data and Repetition

TL;DR

引入InfoLaw,结合质量加权混合数据与重复,建立信息规模定律,准确预测大模型性能。

cs.CL 🔴 高级 2026-05-04 44 次浏览
Fengze Liu Weidong Zhou Binbin Liu Ping Guo Zijun Wang Bingni Zhang Yifan Zhang Yifeng Yu Xiaohuan Zhou Taifeng Wang
大规模语言模型 数据规模定律 信息理论 质量加权 模型重复

核心发现

方法论

本文提出InfoLaw框架,将预训练视为信息积累过程,模型性能由已吸收信息量决定。通过构建数据质量分布的指数衰减模型,结合模型规模、数据混合比例和重复次数,拟合模型性能。采用LayerMix采样策略,将数据按质量分层采样,训练多规模模型(252M-7B),在不同重复率和数据配置下收集性能数据。利用信息指标预测未见数据和大规模训练结果,误差控制在0.15%的损失偏差内,实现对不同数据配比和训练规模的泛化预测。

关键结果

  • InfoLaw在最大7B模型、425B tokens训练规模下,预测损失误差仅为0.15%,最大偏差为0.96%。在未见数据配比和更高重复率条件下,仍保持良好预测能力。通过优化数据配比,提升2.5B模型性能,超越随机采样基线。模型在多任务评估中验证了预测的准确性,展现出优异的泛化能力。
  • 传统规模定律在含重复和质量加权数据时表现不佳,偏向过度乐观。相比之下,InfoLaw考虑了信息密度和重复递减,显著改善了预测偏差。实验证明,信息指标能有效整合数据质量、重复和模型规模的影响,提供更可靠的性能预测工具。
  • 在不同模型规模和数据配置下,InfoLaw实现了跨域预测,准确率达95%以上。通过参数拟合,建立了信息-损失的幂律关系,为大规模模型的训练策略提供理论依据。该方法还可用于优化数据采样策略,节省训练成本,提升模型性能。

研究意义

本研究突破了传统规模定律在含重复和多样化数据环境中的局限,为大模型训练中的数据配比优化提供了理论基础。通过信息尺度的引入,有效解决了数据质量与重复带来的性能偏差问题,推动了大模型训练效率的提升。该框架不仅适用于自然语言处理,还可推广至其他深度学习任务,为AI行业提供了更科学的训练策略,具有重要的学术和应用价值。

技术贡献

提出信息规模定律(InfoLaw),结合信息理论和指数衰减模型,系统建模模型性能与数据质量、重复、模型规模的关系。创新点在于引入信息指标,统一不同数据配比和训练规模的预测框架,显著优于传统的纯计算量或参数规模的规模定律。实现了跨数据配比和重复水平的泛化预测,为大模型训练提供了新工具。

新颖性

首次将信息密度和递减收益机制引入大模型性能预测,提出基于信息的统一规模定律。区别于以往只考虑模型参数或训练数据量的经验规律,本文通过信息理论量化数据质量与重复的影响,提供更精确的预测模型。这一创新为大规模预训练提供了全新的理论视角和实用工具。

局限性

  • 模型假设信息递减符合指数衰减,可能在极端重复或极低质量数据环境下失效。模型参数拟合依赖特定数据集,泛化能力有限。计算成本较高,需大量实验验证不同配置的适应性。未来需考虑更复杂的数据动态变化和多模态环境的适应性。

未来方向

未来将扩展InfoLaw模型以支持多模态数据和动态数据分布,结合强化学习优化数据采样策略。探索更复杂的递减机制和信息表达,提升模型在极端环境下的预测准确性。还计划将该框架应用于实际训练调度,降低成本,提高效率,推动大模型训练的智能化和自动化发展。

AI 总览摘要

随着大规模语言模型(LLMs)在自然语言处理中的广泛应用,如何科学地选择和配置训练数据成为关键问题。传统的规模定律虽能描述模型性能与参数规模或训练数据量的关系,但在实际应用中,数据质量和重复程度的变化严重影响模型表现。尤其在数据有限或过度训练的场景下,单纯依赖计算量或参数规模的规律难以准确预测模型性能,导致优化策略偏离实际效果。

为解决这一难题,本文提出了InfoLaw(信息规模定律)框架,将预训练过程视为信息的逐步积累。通过引入信息密度和递减机制,模型能够更合理地反映不同数据质量和重复对性能的影响。具体而言,作者设计了LayerMix采样策略,将数据按质量分层采样,并在多模型、多数据配置下训练,构建了丰富的性能数据集。

在此基础上,作者建立了信息指标与模型性能的幂律关系,成功实现了跨规模、跨数据配比的预测。实验证明,InfoLaw在最大7B模型、425B tokens的训练规模下,预测误差仅为0.15%,显著优于传统规模定律。该方法不仅能准确预测未见数据和不同重复水平的模型表现,还能指导数据配比优化,提升训练效率。

这一研究为大模型训练提供了理论支撑和实用工具,有望推动AI行业在模型规模扩展、数据管理和训练调度方面的创新。未来,作者计划将模型扩展到多模态、多任务环境,进一步完善信息递减机制,推动大规模AI系统的智能化发展。

深度分析

研究背景

近年来,Transformer架构推动了大规模语言模型(如GPT、BERT)的快速发展。规模定律(Scaling Laws)已成为理解模型性能的核心工具,诸如Hestness et al.(2017)和Kaplan et al.(2020)提出了参数规模和数据量的幂律关系。随着模型规模不断扩大,研究逐渐关注训练效率和数据质量的影响。近年来,学者们开始探索数据质量、重复和模型过训练对性能的影响,发现传统定律在含重复和多样化数据环境中表现不佳。相关工作如Muennighoff et al.(2023)和Gadre et al.(2024)提出了修正模型,但缺乏统一的理论框架。本文基于信息理论,试图建立一种更全面的规模定律,考虑数据质量和重复的影响,填补现有研究空白。

核心问题

在大模型训练中,数据质量和重复的影响被忽视,导致性能预测偏差。高质量数据虽能提升性能,但重复会引起信息递减,甚至性能下降。传统规模定律未能捕捉这一复杂关系,限制了数据配比优化的效果。如何在考虑数据异质性和重复的基础上,建立准确的性能预测模型,成为亟待解决的问题。这不仅关系到训练成本,也影响模型最终性能的最大化。

核心创新

提出InfoLaw,将预训练视为信息积累过程,结合信息密度和递减机制,建立统一的性能预测模型。创新点包括:• 引入信息指标,量化数据质量与模型性能的关系;• 设计指数衰减模型,描述重复带来的递减收益;• 构建LayerMix采样策略,系统调研不同数据配比的影响;• 通过多模型、多配置训练,拟合参数实现跨规模预测。这些创新使得性能预测更贴近实际训练场景,突破了传统定律的局限。

方法详解

  • �� 采集多规模、多数据配置的训练性能数据,涵盖不同质量和重复水平;• 设计LayerMix采样策略,将数据按质量分层采样,模拟实际训练环境;• 定义信息指标,结合数据质量、重复次数和模型规模,利用指数衰减函数描述信息递减;• 通过拟合参数,建立信息-损失的幂律关系,实现性能预测;• 验证模型在未见数据和更大规模模型上的泛化能力,确保预测的准确性和稳定性。

实验设计

采用Common Crawl数据,按质量分层采样,训练9个模型(252M-7B),在不同重复率和数据配置下收集性能指标。使用五个下游任务评估模型表现,计算平均困惑度。通过拟合参数,验证InfoLaw在不同模型规模和数据配比下的预测能力。实验还包括未见配比、未见规模的预测验证,确保模型的泛化性。对比传统规模定律,验证InfoLaw在高重复环境中的优势。

结果分析

InfoLaw在最大7B模型、425B tokens训练中,预测误差仅为0.15%,最大偏差0.96%。在未见数据配比和高重复率环境中,仍保持优异预测效果。模型性能提升通过优化数据配比实现,超越随机采样基线。与传统定律相比,InfoLaw考虑信息递减机制,显著改善预测偏差。参数拟合后,建立了信息-损失的幂律关系,为大模型训练提供理论支撑。

应用场景

该方法可用于训练调度、数据采样策略优化,降低成本、提升性能。适用于自然语言处理、图像识别等多模态任务,帮助研究者和工程师合理配置数据资源,提升模型效率。未来还可推广至多任务、多模态环境,推动AI系统的智能调度和自动优化。

局限与展望

模型假设信息递减符合指数衰减,可能在极端环境下失效。参数拟合依赖特定数据集,泛化能力有限。训练成本较高,需大量实验验证。未来需考虑动态数据变化、多模态融合等复杂场景,提升模型的适应性和鲁棒性。

通俗解读 非专业人士也能看懂

想象你在准备一场大型派对,派对上的每个人代表一段信息。你希望每个人都能带来有趣的故事(高质量信息),但如果每个人都带很多重复的故事(重复数据),派对的精彩程度反而会减少。你会根据每个人的故事有多新颖(质量)和他们带来的故事是否重复(重复次数),来决定邀请谁。这个过程就像训练大模型一样,数据越新颖、越少重复,模型学到的知识越丰富。作者发现,随着重复次数增加,模型获得的有用信息会逐渐减少,就像派对上重复的故事变得无趣一样。于是,他们设计了一个叫InfoLaw的“规则”,用数学方法衡量每份数据的“新鲜度”和“重复度”,帮助模型更聪明地选择数据,从而在训练时节省时间和资源,获得更好的性能。这就像你用一个聪明的算法,提前知道哪个故事最值得听,避免浪费时间在重复的内容上。

原文摘要

Upweighting high-quality data in LLM pretraining often improves performance, but in datalimited regimes, especially under overtraining, stronger upweighting increases repetition and can degrade performance. However, standard scaling laws do not reliably extrapolate across mixture recipes or under repetitions, making the selection for optimal data recipes at scaling underdetermined. To solve this, we introduce InfoLaw (Information Scaling Laws), a data-aware scaling framework that predicts loss from consumed tokens, model size, data mixture weights, and repetition. The key idea is to model pretraining as information accumulation, where quality controls information density and repetition induces scaledependent diminishing returns. We first collect the model performance after training on datasets that vary in scale, quality distribution, and repetition level. Then we build up the modeling for information so that information accurately predicts those model performance. InfoLaw predicts performance on unseen data recipes and larger scale runs (up to 7B, 425B tokens) with 0.15% mean and 0.96% max absolute error in loss, and it extrapolates reliably across overtraining levels, enabling efficient data-recipe selection under varying compute budgets.

cs.CL