Least-to-Most Prompting Enables Complex Reasoning in Large Language Models

TL;DR

提出“由易到难”提示策略,结合问题分解与逐步求解,显著提升大模型复杂推理能力。

cs.AI 🔴 高级 2022-05-21 34 次浏览
Denny Zhou Nathanael Schärli Le Hou Jason Wei Nathan Scales Xuezhi Wang Dale Schuurmans Claire Cui Olivier Bousquet Quoc Le Ed Chi
自然语言推理 提示工程 模型泛化 多步骤推理 数学与符号推理

核心发现

方法论

该方法通过两阶段提示实现:第一阶段利用示例演示复杂问题的分解,第二阶段逐步解决子问题。采用few-shot提示,无需模型微调,结合问题拆解与逐步求解,显著增强模型在符号操作、组合泛化和数学推理中的表现。实验证明,使用GPT-3 code-davinci-002模型,结合least-to-most提示,在SCAN等基准上达99%以上的准确率,远超链式推理的16%。

关键结果

  • 在符号操作任务中,least-to-most提示实现对长列表的长度泛化,准确率达100%,而链式推理仅达31.8%。
  • 在SCAN组合泛化任务中,least-to-most在所有拆分(包括长度拆分)上达99.7%的准确率,仅用14个示例,远超链式推理的16%。
  • 在数学推理任务GSM8K和DROP中,least-to-most提升模型在多步推理中的表现,尤其在需要五步以上的复杂问题上,准确率提升至62.4%,明显优于链式推理的39%。

研究意义

该策略突破了模型在解决高难度任务时的泛化瓶颈,尤其在无需训练的情况下实现对长序列和复杂逻辑的高准确率。对自然语言理解、符号推理和数学推理等领域具有深远影响,为未来构建更具通用性和可解释性的AI系统提供新思路。

技术贡献

提出“由易到难”提示框架,结合问题分解与逐步求解,创新性地实现无需微调的复杂推理能力提升。该方法突破了传统链式推理在泛化能力上的限制,结合few-shot提示实现高效问题拆解与解决,提供了新的模型推理策略和理论基础。

新颖性

首次系统性将教育心理学中的“由易到难”策略引入大规模语言模型提示设计,结合问题分解与逐步求解,显著超越链式推理在长序列和复杂任务中的表现,展现出优异的泛化能力。

局限性

  • 在极长或极复杂的问题中,模型仍存在拆解错误和递归失败的情况,主要因提示设计不足或模型理解偏差。
  • 该方法对提示示例的质量和数量敏感,示例不足或不合理会影响拆解效果。
  • 在某些特定任务(如深层逻辑推理)中,效果有限,仍需结合其他技术提升性能。

未来方向

未来将探索自动化示例生成与优化,结合多模态信息增强问题拆解能力,扩展到更复杂的推理场景。同时,结合微调与提示策略,提升模型在特定任务中的表现与稳定性。

AI 总览摘要

近年来,深度学习在自然语言处理中的突破极大推动了AI的发展,但模型在复杂推理任务中的泛化能力仍有限。链式推理(Chain-of-Thought)提示虽取得一定成功,却在面对超出示例难度的任务时表现不佳。为此,本文提出“由易到难”提示(least-to-most prompting)策略,借鉴教育心理学中的渐进式学习思想,将复杂问题拆解成一系列简单子问题,逐步解决。该方法通过两阶段提示:首先示范如何拆解问题,其次逐步解答子问题,充分利用模型已有知识,无需微调。实验证明,采用GPT-3 code-davinci-002模型,在符号操作、组合泛化和数学推理等任务中,显著优于链式推理。例如,在SCAN任务中,least-to-most仅用14个示例便达99%以上准确率,而链式推理仅16%。在数学推理任务GSM8K和DROP中,也实现了准确率的明显提升,尤其在多步骤问题上表现优异。这一策略突破了模型在长序列和复杂逻辑推理中的泛化瓶颈,为自然语言理解和符号推理提供了新路径。未来,结合自动示例生成和多模态信息,将进一步扩展其应用范围,推动AI向更强的通用推理能力迈进。

深度分析

研究背景

深度学习在自然语言理解中的应用不断深化,链式推理(Chain-of-Thought)提示成为提升模型推理能力的重要手段。然而,链式推理在泛化到超出示例难度的任务时表现有限,尤其在符号操作、组合泛化和数学推理中存在明显瓶颈。此前的研究多依赖复杂模型结构或大量训练数据,限制了模型的灵活性和可解释性。近年来,教育心理学中的渐进式学习策略被提出用于辅助人类学习复杂技能,显示出良好的泛化能力。将此思想引入大模型提示设计,有望突破现有限制,提升模型在高难度任务中的表现。

核心问题

当前大模型在面对超出训练示例难度的任务时,表现出明显的泛化不足。链式推理虽能在简单任务中取得较好效果,但在长序列或复杂逻辑推理中,准确率迅速下降。如何设计一种无需微调、能有效实现由易到难推理的提示策略,成为提升模型泛化能力的关键。特别是在符号操作、组合泛化和数学推理等领域,模型的推理能力亟待突破。

核心创新

提出“由易到难”提示策略,结合问题拆解与逐步求解两阶段机制,模仿人类学习过程。创新点在于:1)利用few-shot示例演示问题拆解过程,2)逐步解决子问题,3)无需模型微调即可实现复杂推理。该方法区别于传统链式推理,强调问题的结构化拆解与逐步引导,极大增强模型在长序列和高难度任务中的泛化能力。

方法详解

  • �� 阶段一:问题拆解。通过示例演示如何将复杂问题拆解为一系列简单子问题,模型在提示中学习拆解规则。• 阶段二:逐步求解。模型根据拆解规则,依次解答子问题,利用前一子问题的答案作为下一步输入。• 提示设计:结合示例和目标问题,构建两阶段提示,确保模型理解拆解逻辑。• 无需微调:整个过程仅通过few-shot提示实现,充分利用模型已有知识。• 结合链式推理或自我一致性等技术,进一步提升推理效果。

实验设计

在符号操作(如末字拼接)、组合泛化(SCAN任务)和数学推理(GSM8K、DROP)中,采用GPT-3模型进行评估。对比链式推理和标准few-shot提示,观察不同任务中的准确率变化。设置不同任务难度(如列表长度、任务复杂度)进行测试,验证方法的泛化能力。实验中使用多组示例,分析提示设计对性能的影响,进行消融研究以优化策略。

结果分析

在符号任务中,least-to-most实现100%的长度泛化能力,链式推理仅达31.8%。在SCAN任务中,least-to-most在所有拆分(包括长度拆分)上达99.7%的准确率,远超链式推理的16%。在GSM8K和DROP中,模型在多步骤推理中的准确率分别提升至62.4%和82.4%,显著优于链式推理。提示示例的设计和拆解策略对性能影响巨大,验证了方法的有效性和泛化能力。

应用场景

该策略适用于需要多步骤推理的自然语言理解、符号推理和数学问题解决场景。可用于智能问答、自动化推理系统和教育辅导工具,尤其在缺乏大量训练数据或模型微调受限的情况下表现优异。未来结合多模态信息,有望扩展到更复杂的推理任务和实际应用中。

局限与展望

尽管效果显著,但在极长或极复杂问题中仍存在拆解错误和递归失败的风险。提示设计对示例质量敏感,示例不足或不合理会影响性能。此外,方法在某些深层逻辑推理任务中表现有限,未来需结合模型微调和多模态信息以提升鲁棒性。

通俗解读 非专业人士也能看懂

想象你在厨房做菜,遇到一道复杂的菜谱。直接一次性完成所有步骤很难,但如果你把菜谱拆成几个简单的小步骤,比如先切菜、再炒菜、最后调味,每一步都做得简单明了。这样,即使菜谱很复杂,你也能一步步完成。大模型也是这样,通过把复杂的问题拆成一系列简单的小问题,逐个解决,就能得到最终答案。这就像你学做菜一样,从简单开始,慢慢变得越来越擅长,最后做出美味佳肴。

简单解释 像给14岁少年讲一样

假设你要解一个很难的数学题,直接想一想可能会觉得很难,但如果你把题目拆成几个小问题,比如:1)这个问题需要哪些信息?2)每个信息可以帮我做什么?3)我可以一步步解决这些小问题,最后得到答案。大模型也是这样,它会先帮你把复杂的问题拆成几个简单的部分,然后逐个解决。就像拼积木一样,把大问题拆成很多小块,拼在一起就能完成大任务。这种方法让模型变得更聪明,能解决比示例更难的问题,就像你学会了用这种拆解的方法,面对任何难题都能迎刃而解!

原文摘要

Chain-of-thought prompting has demonstrated remarkable performance on various natural language reasoning tasks. However, it tends to perform poorly on tasks which requires solving problems harder than the exemplars shown in the prompts. To overcome this challenge of easy-to-hard generalization, we propose a novel prompting strategy, least-to-most prompting. The key idea in this strategy is to break down a complex problem into a series of simpler subproblems and then solve them in sequence. Solving each subproblem is facilitated by the answers to previously solved subproblems. Our experimental results on tasks related to symbolic manipulation, compositional generalization, and math reasoning reveal that least-to-most prompting is capable of generalizing to more difficult problems than those seen in the prompts. A notable finding is that when the GPT-3 code-davinci-002 model is used with least-to-most prompting, it can solve the compositional generalization benchmark SCAN in any split (including length split) with an accuracy of at least 99% using just 14 exemplars, compared to only 16% accuracy with chain-of-thought prompting. This is particularly noteworthy because neural-symbolic models in the literature that specialize in solving SCAN are trained on the entire training set containing over 15,000 examples. We have included prompts for all the tasks in the Appendix.

cs.AI cs.CL