Should We Still Pretrain Encoders with Masked Language Modeling?
本研究比较MLM与CLM预训练对文本表示的影响,发现MLM更优,但CLM更高效。
核心发现
方法论
采用大规模、控制严密的预训练实验,训练38个模型(210M-1B参数),比较MLM、CLM及其结合策略。通过15,000余次微调评估,确保公平性。模型架构基于EuroBERT,数据来自FineWeb-Edu,采用不同遮蔽比例和训练策略,涵盖从零开始训练到持续预训练。核心算法包括MLM的双向注意力机制和CLM的因果注意力机制,结合两者的两阶段训练策略。实验还分析了模型在不同任务(分类、问答、信息检索)上的表现差异,特别关注训练稳定性和数据效率。
关键结果
- MLM模型在大部分文本表示任务中表现优异,尤其在问答和分类任务上,性能提升达3-5点F1或准确率,显示出其在双向上下文建模中的优势。
- CLM模型在数据效率和训练稳定性方面表现更佳,早期训练中表现优于MLM,且对学习率敏感性较低,适合低资源场景或作为warm-up策略。
- 两阶段训练(CLM后MLM)在固定计算预算下实现性能最优,特别是在从预训练的CLM模型继续微调时,效果优于纯MLM或纯CLM,验证了策略的有效性。
研究意义
本研究揭示了MLM在文本表示中的核心优势,同时强调CLM在数据效率和训练稳定性上的潜力,为未来预训练策略提供了理论依据。通过控制模型规模和数据量,澄清了模型规模和目标任务的影响,为设计高效、稳健的预训练方案提供指导。研究成果对推动大规模预训练模型的优化、降低训练成本具有重要意义,特别是在资源有限或多任务场景中具有实际应用价值。
技术贡献
提出了结合CLM与MLM的两阶段预训练策略,系统性分析了不同训练目标在模型性能、数据效率和稳定性上的差异。采用大规模实验验证了CLM在早期训练中的优势及其在微调中的稳定性,创新性地结合了两者的优点。还首次在不同模型规模和任务上系统性评估了预训练目标的影响,为未来多目标、多阶段预训练提供了理论基础。
新颖性
本研究首次系统性比较MLM与CLM在相同模型规模和数据条件下的表现差异,提出了结合两者的两阶段训练策略,验证其在资源受限环境中的优越性。不同于以往只关注单一目标的研究,强调目标目标的互补性,推动了预训练目标设计的理论发展。
局限性
- 实验主要集中在英语数据和特定模型架构,泛化到其他语言或模型类型仍需验证。
- 训练成本较高,尤其是在大规模模型上,限制了更广泛的参数规模和任务扩展。
- 对不同任务的适应性和迁移能力尚未深入探讨,未来需结合多任务学习进行优化。
未来方向
未来将探索多阶段、多目标预训练的自动化策略,结合迁移学习和少样本微调,提升模型在低资源场景的表现。同时,考虑多语言、多任务环境,优化预训练目标的自适应调整机制,以实现更广泛的应用和更低的训练成本。
AI 总览摘要
在自然语言处理领域,学习高质量的文本表示一直是核心目标。传统上,编码器预训练依赖于Masked Language Modeling(MLM),其通过双向注意力机制捕获丰富上下文信息,广泛应用于BERT等模型中。然而,近年来,基于因果语言模型(CLM)的解码器模型在预训练后被成功迁移为编码器,并在文本表示任务中表现出色,甚至超越了传统的MLM模型。尽管如此,关于这种优势是否源自模型目标本身,或仅由模型规模和数据量驱动,仍存在争议。本研究通过大规模、控制严密的预训练实验,系统比较了MLM与CLM在相同架构和数据条件下的表现差异,训练了38个模型(210M到1B参数),并进行了超过15,000次微调评估。结果显示,MLM在大多数任务中表现更优,尤其在文本分类和问答任务上,但CLM模型在数据效率和训练稳定性方面具有明显优势。基于此,研究提出了结合两者的两阶段训练策略——先CLM后MLM,在固定计算预算下实现性能最优,且从预训练的CLM模型继续微调时效果更佳。这一策略在资源有限环境中尤为适用,显著降低了训练成本。研究成果不仅澄清了预训练目标的性能差异,也为未来高效、稳健的文本表示学习提供了理论指导和实践方案。所有模型和代码已开源,期待推动自然语言处理的持续创新。
深度分析
研究背景
近年来,预训练模型在自然语言处理中的地位不断提升。BERT引领的MLM策略通过双向注意力机制实现了对上下文的深度理解,推动了文本分类、问答等任务的性能提升。与此同时,解码器架构如GPT在生成任务中表现出色,但在表示学习方面相对不足。近期,研究发现将解码器模型迁移为编码器(如通过微调或结构调整)也能获得优异表现,尤其是在大规模数据和模型条件下。不同预训练目标(MLM和CLM)在模型性能、数据效率和训练稳定性方面表现出差异,但缺乏系统性比较。本研究旨在填补这一空白,通过控制变量,深入分析两者的优劣,为预训练目标设计提供理论依据。
核心问题
核心问题在于,MLM作为双向预训练目标在文本表示中表现优异,但训练成本较高;而CLM在数据效率和训练稳定性方面表现优越,但在某些任务上性能略逊。现有研究多集中在模型规模扩大或目标微调,缺乏系统性比较,难以明确两者的本质差异。此外,如何结合两者优势,设计高效的预训练策略,也是亟待解决的问题。尤其是在资源有限或多任务环境中,找到既能保证性能,又能降低成本的方法尤为重要。
核心创新
本研究创新点主要包括:1)系统性比较MLM与CLM在相同模型和数据条件下的表现差异,揭示二者的本质区别;2)提出了结合两者的两阶段预训练策略,先CLM后MLM,有效兼顾数据效率和表示质量;3)验证该策略在不同模型规模和任务上的优越性,特别是在资源有限的情况下表现出显著优势。此策略突破了传统单一目标预训练的局限,为多目标、多阶段预训练提供了新思路。
方法详解
- �� 采用EuroBERT架构,模型尺寸涵盖210M、610M、1B参数。
- �� 使用FineWeb-Edu数据集,确保训练样本一致性。
- �� 实现三种预训练目标:MLM(随机遮蔽,比例20%-50%)、CLM(自回归预测)及其结合(CLM后MLM)
- �� 设计控制实验,比较不同目标在相同数据、模型规模下的性能差异。
- �� 采用WSD学习率调度,训练42,000步,确保充分学习。
- �� 进行多任务微调,评估分类、问答、信息检索任务,使用不同指标(准确率、F1、NDCG)衡量。
- �� 大规模实验验证不同训练策略(从零开始、持续预训练、两阶段)对性能的影响。
实验设计
- �� 实验数据来自多任务数据集,包括SST-2、MNLI、QQP、SQuAD、MS MARCO等。
- �� 比较MLM、CLM及其结合策略在不同模型参数(210M-1B)上的表现。
- �� 采用多次随机初始化和超参数调优,确保结果稳健。
- �� 重点分析训练稳定性、数据效率和微调性能差异。
- �� 通过控制遮蔽比例、训练步数,评估模型在不同资源预算下的表现。
结果分析
- �� MLM模型在所有任务中表现优异,问答和分类任务性能提升达3-5点F1或准确率,验证其在双向上下文建模中的优势。
- �� CLM模型在早期训练中表现更好,数据效率高,训练稳定性强,尤其在低资源环境中更具优势。
- �� 两阶段训练(CLM后MLM)在固定计算预算下实现最优性能,验证了目标互补的有效性,特别是在从预训练的CLM模型继续微调时效果明显优于纯MLM。
应用场景
- �� 该策略适用于需要高效文本表示的搜索引擎、问答系统和多任务学习场景。
- �� 资源有限的研究或工业环境中,可利用预训练的CLM模型作为起点,减少训练成本。
- �� 长远来看,有望推动多目标预训练模型的标准化,降低大规模模型训练门槛,促进多语种、多任务的应用。
局限与展望
- �� 实验主要集中在英语和特定架构,泛化到多语言、多模型类型仍需验证。
- �� 大规模训练成本高,限制了更大模型和更复杂任务的探索。
- �� 对迁移学习和少样本微调的适应性尚未深入,未来需结合多任务学习优化预训练目标。
通俗解读 非专业人士也能看懂
想象你在一家工厂里,工人们需要学习如何组装不同的产品。有些工人只看说明书(MLM),他们会反复阅读每个部分,理解每个零件的关系,这样可以组装得更快、更准。而另一些工人只看生产线(CLM),他们按照顺序逐步操作,学会了流程,但可能对整体理解不够深。现在,最聪明的做法是先让工人按照流程熟悉整个生产线(CLM),然后再让他们反复看说明书(MLM),这样既能快速掌握流程,又能理解每个细节。研究发现,这样的两步走方法,不仅节省时间,还能让工人更稳当,不容易出错。这个比喻说明,结合不同学习方式,可以让机器学习模型变得更快、更聪明,也更可靠。
简单解释 像给14岁少年讲一样
想象你在学校学新技能,比如弹钢琴。有时候,你会先学弹奏的顺序(像CLM,按顺序练习),这样你能快速掌握流程,但可能不太懂每个音符的细节。然后,你会反复练习每个音符(像MLM,遮蔽部分练习),这样可以理解每个音符的细微差别。研究发现,先按顺序学习(CLM)能让你更快入门,节省时间;之后再反复练习细节(MLM),可以让你弹得更好、更稳。这两步结合,比只做其中一件事效果都更好。对机器学习模型来说,也是一样的道理。先用CLM让模型理解整体结构,再用MLM让模型掌握细节,这样可以更快、更好地学习语言。
原文摘要
Learning high-quality text representations is fundamental to a wide range of NLP tasks. While encoder pretraining has traditionally relied on Masked Language Modeling (MLM), recent evidence suggests that decoder models pretrained with Causal Language Modeling (CLM) can be effectively repurposed as encoders, often surpassing traditional encoders on text representation benchmarks. However, it remains unclear whether these gains reflect an inherent advantage of the CLM objective or arise from confounding factors such as model and data scale. In this paper, we address this question through a series of large-scale, carefully controlled pretraining ablations, training a total of 38 models ranging from 210 million to 1 billion parameters, and conducting over 15,000 fine-tuning and evaluation runs. We find that while training with MLM generally yields better performance across text representation tasks, CLM-trained models are more data-efficient and demonstrate improved fine-tuning stability. Building on these findings, we experimentally show that a biphasic training strategy that sequentially applies CLM and then MLM, achieves optimal performance under a fixed computational training budget. Moreover, we demonstrate that this strategy becomes more appealing when initializing from readily available pretrained CLM models, reducing the computational burden needed to train best-in-class encoder models. We release all project artifacts at https://hf.co/MLMvsCLM to foster further research.