Scaling Instruction-Finetuned Language Models

TL;DR

通过扩展任务数、模型规模和链式推理,显著提升Instruction-Finetuned模型性能。

cs.LG 🔴 高级 2022-10-21 55 次浏览
Hyung Won Chung Le Hou Shayne Longpre Barret Zoph Yi Tay William Fedus Yunxuan Li Xuezhi Wang Mostafa Dehghani Siddhartha Brahma Albert Webson Shixiang Shane Gu Zhuyun Dai Mirac Suzgun Xinyun Chen Aakanksha Chowdhery Alex Castro-Ros Marie Pellat Kevin Robinson Dasha Valter Sharan Narang Gaurav Mishra Adams Yu Vincent Zhao Yanping Huang Andrew Dai Hongkun Yu Slav Petrov Ed H. Chi Jeff Dean Jacob Devlin Adam Roberts Denny Zhou Quoc V. Le Jason Wei
自然语言处理 模型微调 多任务学习 链式推理 模型规模扩展

核心发现

方法论

本文采用多任务指令微调策略,结合1.8K任务集,涵盖多种任务类别。模型包括PaLM、T5及U-PaLM,规模从80M到540B参数。引入链式推理(CoT)数据,采用多阶段训练,结合自我一致性(SC)技术,提升推理能力。微调过程中使用Adafactor优化器,采用packing技术处理多样化输入,确保训练效率。通过在多个公开评测基准(如MMLU、BBH、TyDiQA、MGSM)上评估,验证模型的泛化能力。

关键结果

  • 540B Flan-PaLM在1.8K任务微调后,平均提升9.4%,在五次样本MMLU中达75.2%的最新SOTA。引入链式推理后,模型在复杂推理任务中的表现显著优于未引入CoT的版本,尤其在多语言和数学推理任务中表现优异。微调任务数量的增加(从89到1836)带来性能持续提升,表明多任务训练的有效性。
  • 在不同模型规模(8B、62B、540B)上,微调带来的性能提升均明显,最大提升达15.5%。引入链式推理数据后,模型在多项基准测试中表现优异,尤其在多语言和复杂推理任务中,展现出更强的泛化能力。
  • 此外,微调还显著改善模型在责任AI和偏见检测等方面的表现,增强模型的实用性和安全性。通过公开发布Flan-T5检查点,证明微调策略在较小模型上也能实现优异的少样本性能,甚至优于更大模型。

研究意义

本研究系统性验证了扩展任务规模、模型容量及引入链式推理对提升预训练模型泛化能力的作用,为未来大规模多任务指令微调提供理论基础和实践路径。其成果不仅推动了多任务学习在语言模型中的应用,也为模型在复杂推理、多语言环境中的表现提供了新思路。模型在多个公开基准中刷新了性能纪录,彰显其在教育、科研、工业等多个场景的潜力。

技术贡献

本文提出了结合大规模任务集、多模型尺度和链式推理的指令微调框架,创新性地将多任务学习与链式推理结合,显著提升模型推理和泛化能力。通过引入多样化任务和多阶段训练策略,有效缓解模型在复杂推理任务中的性能下降问题。采用Adafactor优化器和packing技术,提升训练效率,降低计算成本。公开的模型检查点在多个基准上实现了SOTA,验证了方法的有效性。

新颖性

首次系统性结合大规模任务集、多模型尺度和链式推理进行指令微调,显著提升模型在未见任务中的表现。不同于传统微调仅依赖少量示例或单一任务,本研究通过多任务、多模态和链式推理数据的融合,突破了模型推理能力的瓶颈,提供了新颖的训练策略和模型架构。

局限性

  • 尽管模型在多个任务上表现优异,但在极端少样本或特定偏见检测任务中仍存在不足,可能受限于微调任务的多样性和数据偏差。
  • 训练成本高昂,尤其在大模型(如540B参数)上,资源消耗巨大,限制了广泛应用的可行性。
  • 模型在某些特定领域(如深度推理或专业知识)仍表现不佳,需结合领域知识进行微调优化。

未来方向

未来将探索更高效的训练策略,降低大模型微调的计算成本。同时,结合强化学习和人类反馈,提升模型的安全性和责任性。进一步扩展任务多样性,增强模型在特定领域的适应能力,推动模型在实际应用中的落地。

AI 总览摘要

本研究围绕大规模指令微调展开,旨在提升预训练语言模型的泛化能力和推理水平。通过引入1.8K多任务指令集,结合多模型尺度,从80M到540B参数,系统性验证了任务规模和模型容量对性能的影响。实验结果显示,微调后模型在多个公开基准(如MMLU、BBH、TyDiQA、MGSM)中刷新了性能纪录,特别是在复杂推理和多语言任务中表现优异。引入链式推理(CoT)数据,显著增强模型的推理能力,模型在多项任务中实现了75.2%的最新SOTA,展现出强大的泛化能力。微调策略的核心在于多任务学习与链式推理的结合,采用Adafactor优化器和packing技术,确保训练效率。模型在责任AI和偏见检测方面也表现出改善,彰显其实用价值。公开发布的Flan-T5检查点证明了微调在较小模型上的优越性能,为未来低资源场景提供了可能。整体而言,本研究为大规模多任务指令微调提供了理论基础和实践路径,推动了语言模型在复杂推理、多语言环境中的应用发展。未来工作将关注训练效率提升和模型安全性,推动模型在实际场景中的广泛应用。

深度分析

研究背景

近年来,预训练语言模型如GPT、T5和PaLM在自然语言理解和生成方面取得突破,但其泛化能力仍受限于训练数据和任务多样性。多任务学习和指令微调成为提升模型适应性的关键手段。之前的研究(如Wei et al., 2021; Sanh et al., 2021)表明,增加任务数量和多样性有助于模型在未见任务上的表现,但规模扩展和推理能力提升仍面临挑战。链式推理(CoT)技术的引入,为模型复杂推理提供了新路径,但其效果依赖于训练数据的多样性和质量。本文在此基础上,结合大规模任务集和多模型尺度,探索指令微调的极限,为模型在多任务、多语言和推理任务中的应用提供新思路。

核心问题

当前预训练模型在特定推理、多语言和少样本任务中表现不足,主要原因在于训练数据有限、模型规模不够大以及缺乏系统化的推理训练策略。如何在保证训练效率的同时,显著提升模型的泛化和推理能力,成为关键难题。此外,模型在责任性和偏见检测方面的不足,也限制了其实际应用。解决这些问题需要在数据规模、模型容量和训练策略上进行创新。

核心创新

本研究提出了结合大规模任务集、多模型尺度和链式推理的指令微调框架。具体创新包括:1)扩展任务集至1.8K,涵盖多类别、多场景任务;2)引入链式推理(CoT)数据,增强模型推理能力;3)采用多阶段训练策略,结合自我一致性(SC)技术,提升推理准确性;4)在不同模型规模(80M到540B)上验证效果,确保方法的普适性。这些创新有效突破了传统微调在推理和泛化方面的瓶颈。

方法详解

  • �� 构建多任务指令集,融合Muffin、T0-SF、NIV2和CoT数据,确保任务多样性。• 采用多模型尺度(80M-540B参数)进行微调,验证规模效应。• 使用Adafactor优化器,结合packing技术,提升训练效率。• 设计多阶段训练流程,先在基础任务上微调,再引入链式推理数据,逐步增强推理能力。• 采用自我一致性(SC)技术,通过多样化推理路径提升推理准确率。• 在公开基准(如MMLU、BBH、TyDiQA、MGSM)上进行评估,确保模型的泛化能力。

实验设计

实验采用多模型、多任务微调策略,使用473个数据集,涵盖14类任务。模型在不同规模(8B、62B、540B)上训练,评估指标包括Few-shot准确率、链式推理表现和责任性指标。对比未微调模型和不同微调任务数量的模型,分析性能变化。引入链式推理数据后,模型在复杂推理任务中的表现显著提升。通过 ablation 研究验证多任务和链式推理的贡献,确保微调策略的有效性。

结果分析

微调后,540B模型在五次样本MMLU中达75.2%,比未微调模型提升超6个百分点。引入链式推理后,模型在多项推理任务中表现优异,尤其在多语言数学推理中,Bengali达69.6%。不同模型规模的性能提升均明显,最大达15.5%。多任务训练持续改善模型表现,验证了其有效性。模型在责任AI和偏见检测方面也取得改善,展现出更强的实用性和安全性。

应用场景

该方法适用于教育、科研和工业中的智能问答、推理辅助和多语言应用。模型可在少样本环境下快速适应新任务,提升自动化水平。未来,结合强化学习和人类反馈,有望实现更安全、更智能的应用场景。

局限与展望

模型训练成本高昂,尤其在大规模模型上,资源消耗巨大。部分专业或极端任务仍表现不足,需结合领域知识微调。未来需优化训练效率,降低门槛,提升模型的可持续性和公平性。

通俗解读 非专业人士也能看懂

想象一个工厂里有许多不同的生产线,每条线负责不同的产品。以前,工厂只会生产一种产品,效率有限。现在,工厂引入了更智能的机器人,能同时处理多种任务,还能自己思考怎么解决复杂问题。通过让机器人学习更多不同的任务,它们变得更聪明,能应对各种新挑战。就像工厂不断扩展生产线,模型也通过学习更多任务变得更强大,能在未见过的问题上表现得更好。这就像你学会了很多技能,遇到新问题也能自己想办法解决。

简单解释 像给14岁少年讲一样

想象你在学校学了很多不同的科目,比如数学、语文、科学。以前,你只会做老师教的题,但现在,你的老师让你试试自己想办法解决新问题。你发现,学得越多,遇到新题时就越能自己想出答案。科学家们也在让电脑学习很多不同的任务,比如回答问题、翻译语言、解决数学题。通过让电脑学习很多任务,它变得更聪明,能自己思考复杂的问题,就像你在学校学会了很多技能一样。

术语表

Instruction-Finetuning (指令微调)

一种通过在多任务指令数据上微调预训练模型,增强其理解和执行新任务能力的方法。技术上结合多任务学习和任务指令模板。

用于提升模型在未见任务上的泛化能力。

Chain-of-Thought (链式推理)

引导模型逐步推导答案的技术,通过提供推理路径,增强模型解决复杂问题的能力。包括显式推理步骤和自我一致性机制。

在模型推理任务中,提升准确率和推理深度。

Self-Consistency (自我一致性)

一种通过多次采样推理路径,选取多数推理结果作为最终答案的方法,以提高推理的稳定性和准确性。

结合链式推理,优化模型推理表现。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步缩减大模型微调的计算成本,尤其在超大参数规模下的效率优化尚未充分解决。
  • 2 链式推理在极端复杂任务中的表现限制,以及如何设计更有效的推理路径生成机制。

原文摘要

Finetuning language models on a collection of datasets phrased as instructions has been shown to improve model performance and generalization to unseen tasks. In this paper we explore instruction finetuning with a particular focus on (1) scaling the number of tasks, (2) scaling the model size, and (3) finetuning on chain-of-thought data. We find that instruction finetuning with the above aspects dramatically improves performance on a variety of model classes (PaLM, T5, U-PaLM), prompting setups (zero-shot, few-shot, CoT), and evaluation benchmarks (MMLU, BBH, TyDiQA, MGSM, open-ended generation). For instance, Flan-PaLM 540B instruction-finetuned on 1.8K tasks outperforms PALM 540B by a large margin (+9.4% on average). Flan-PaLM 540B achieves state-of-the-art performance on several benchmarks, such as 75.2% on five-shot MMLU. We also publicly release Flan-T5 checkpoints, which achieve strong few-shot performance even compared to much larger models, such as PaLM 62B. Overall, instruction finetuning is a general method for improving the performance and usability of pretrained language models.

cs.LG cs.CL