核心发现
方法论
论文将复杂问题求解拆为多步推理、领域知识整合和结果验证三环节。方法谱系包括Chain-of-Thought(CoT)、多路径推理与推理扩展,知识侧包括RAG、GraphRAG、知识图谱和人机协作,验证侧包括LLM-as-a-judge、符号工具及实验验证。
关键结果
- 论文是综述而非提出新模型,因此没有在GSM8K、MATH、HumanEval等数据集上报告统一准确率,也没有给出百分比提升。作者总结已有研究:增加CoT路径通常提高找到正确答案的概率,但搜索空间和计算成本随步骤增加而上升。
- GPT-o1与DeepSeek-R1被作为推理扩展的代表性系统;RAG、GraphRAG和知识图谱则被指出适合补充科学发现、定理证明及数据科学所需的长尾知识。论文未进行这些系统间的同条件基准比较。
- 验证器既用于训练数据筛选,也用于推理时从多个候选解中选优。候选验证可采用LLM评审、符号推理工具或真实实验;但开放式科学研究和数据挖掘缺乏唯一标准答案,验证仍是瓶颈。
研究意义
论文将“会推理”与“能可靠解决现实问题”区分开来。它指出,数学竞赛和竞赛编程因目标明确、答案易验证,最适合当前推理模型;软件工程、数据科学和科学研究则需要代码库理解、数据分布判断、专业知识及多层评估。该框架为研究者设计更完整的智能体系统、为产业界评估LLM可靠性提供了统一语言。
技术贡献
核心技术贡献不是新算法,而是问题结构化与方法归纳。论文形式化定义问题Π(X,Y,P)、目标集合G={Y∈Y|P(Y;X)}及可行轨迹X→O1→…→Oκ→Y,并以算法五元组A=(X,Y,O,δ,σ0)区分人类认知驱动和计算机辅助求解。该抽象把规划、检索、工具调用和验证置于同一状态转移视角。
新颖性
相较只讨论CoT或推理模型的综述,本文把多步推理、知识增强和结果验证作为现实复杂求解的共同必要条件,并覆盖软件工程、数学、数据科学和科学研究。新意主要在跨领域整合与形式化框架,而非提出新的训练目标、数据集或性能保证。
局限性
- 本文没有统一实验、数据集、指标或元分析,因此无法量化RAG、GraphRAG、CoT和不同验证器的相对收益。
- 部分书目信息存在明显模板或版本不一致,例如正文显示2025年arXiv版本,但引用页出现2018年JACM出版信息;读者应以arXiv:2505.03418v1为准。
未来方向
未来应建立跨领域、可复现的复杂任务基准,分别评估轨迹正确性、知识忠实性、工具调用、成本和最终效用。重要方向包括可验证的长程规划、面向长尾知识的检索与记忆、形式化定理证明、代码执行和实验闭环,以及人机协作下对开放式科学目标的持续评估。
AI 总览摘要
复杂问题并不只是把一个问题回答得更长,而是要在多个中间状态之间作出正确选择。论文将其形式化为从输入X经由中间状态O1…Oκ到满足谓词P(Y;X)的结果Y的可行轨迹。现实任务还常缺少唯一答案,因此比GSM8K式数学题更难评估。
作者综述的核心路线是三者协同:Chain-of-Thought用于展开多步计划;RAG、GraphRAG和知识图谱补足LLM难以稳定掌握的长尾领域知识;LLM-as-a-judge、符号推理工具和真实实验负责检查候选答案。CoT的推理扩展规律表明,多条路径可增加发现正确解的机会,但也带来指数增长的搜索空间与成本。GPT-o1和DeepSeek-R1展示了该方向潜力。
本文没有提出新模型,也没有报告统一数据集上的准确率或消融结果。它的价值在于提醒研究者:可靠系统必须把规划、检索、工具调用和验证组成闭环。软件工程要理解整个代码库,数据科学要判断数据分布,数学证明要保证形式严谨,科学研究则需要人类共同定义目标。未来关键不只是“更会思考”,而是让每一步都可追溯、可检验、可复现。
深度分析
研究背景
LLM已从文本生成器发展为可规划、写代码并调用外部工具的求解器。CoT、Self-Consistency、程序辅助推理以及GPT-o1、DeepSeek-R1推动了数学与竞赛编程进展。然而这些任务目标清晰、答案易验证;软件工程、数据建模和科学研究涉及长尾知识、开放目标与多种可接受方案,现有综述往往只强调推理而忽略知识和验证。
核心问题
论文关注如何获得满足目标谓词的完整解轨迹,而非仅生成最终文本。难点包括多步搜索空间随步骤增长、早期错误传播、LLM缺乏长尾知识,以及开放任务没有可靠标准答案。数据科学中同一数据集可对应多种模型,科学研究更难预先定义成功标准。
核心创新
- ��统一三要素:多步推理、领域知识、结果验证。
- ��统一两种范式:LLM直接求解,或由LLM拆解任务并让计算机执行计算。
- ��形式化问题、轨迹和算法状态转移。
- ��跨四域比较需求:代码库与效率、数学证明与数据稀缺、数据科学与分布不确定性、科学研究与人机协作。
方法详解
- ��规划:用CoT生成步骤;通过多路径采样利用推理扩展,并由验证器选取候选。
- ��知识:用RAG检索文档,用GraphRAG或知识图谱组织实体关系,也可向人类专家询问。
- ��执行:让LLM生成并运行代码,或调用搜索、计算和专业软件。
- ��验证:训练阶段筛选合成推理数据;推理阶段使用LLM评审、符号工具或实验系统检查过程与结果。
- ��闭环:根据反馈修正计划、检索内容和中间状态。
实验设计
本文为28页综述,主要进行概念分析与文献归纳,不是新算法实验论文。文中未给出统一实验协议、超参数、训练集、测试集或消融表,也未报告GSM8K、MATH、HumanEval、SWE-bench等数据集上的新数值。因此,GPT-o1、DeepSeek-R1及RAG等只能作为代表性文献案例,不能视为本文的实验基线。
结果分析
最明确的结论是方向性而非数值性:更多CoT路径通常提升正确解发现概率,但成本增加;外部知识对科学发现、数学证明和数据科学尤其重要;验证器是训练和推理的共同基础。可验证任务最容易受益,开放式任务仍受目标定义和评价缺失限制。
应用场景
软件工程可用于代码生成、调试、架构和仓库级修改,但需测试、静态分析及效率评估。数据科学可辅助预处理、特征工程、模型选择和可视化,但必须检查数据分布。数学可结合定理库与形式验证。科研系统可检索文献、提出假设、设计实验,并由研究者保留最终判断。
局限与展望
由于缺少统一基准,论文不能回答哪种检索器、推理策略或验证器最优。LLM可能检索到错误或过时知识,也可能生成看似合理但不可执行的计划;验证器自身同样会犯错。长程CoT、多次工具调用和实验闭环成本高。后续需要跨领域基准、可追溯证据、形式化验证、成本—性能分析及更强的人机协作。
通俗解读 非专业人士也能看懂
把LLM解决复杂问题想成一个大型厨房。顾客先提出目标,例如做一道适合特定人群的菜;厨师不能只凭灵感把一大盘成品端上来,而要先列步骤:了解食材、处理食材、选择火候、烹饪并试味。CoT就像这份步骤清单,帮助厨师不漏掉关键环节。
但厨师不可能记住世界上所有食谱。RAG和GraphRAG像打开可靠的菜谱库:先查资料,再把相关内容带到厨房;知识图谱则把“食材—做法—禁忌”连成网络。需要复杂计算时,LLM还可以让电脑或专业设备代劳。
最后必须试吃。LLM评审像另一位厨师检查味道,符号工具像精确的秤,真实实验则像让顾客实际品尝。问题是,数学题常有标准答案,科研和数据分析却可能有多道好菜。因此真正可靠的系统,不是最会说的厨师,而是会计划、会查证、会使用工具,并愿意根据反馈返工的团队。
简单解释 像给14岁少年讲一样
想象你在玩一款超难的开放世界游戏。普通问答像告诉你“宝箱在山顶”;复杂求解则要求你规划路线、收集钥匙、避开陷阱、打败守卫,还要确认拿到的东西是真的宝藏。LLM像一个很聪明的队友,能提出路线,也能写小程序帮你计算,但它偶尔会自信地把死路说成捷径。
Chain-of-Thought就像队友把行动拆成“先找地图,再拿钥匙,最后开门”。如果只试一条路线,可能刚开始走错;多试几条路线通常更容易成功,不过会消耗更多时间和算力。GPT-o1和DeepSeek-R1代表了让模型投入更多推理资源的方向。
如果游戏更新了地图,队友的旧记忆就不够用了。这时RAG像实时查攻略,GraphRAG像把人物、地点和任务关系画成地图。遇到计算任务,还可以让电脑执行代码。
最重要的是验收:让另一个队友检查答案,用规则工具核对,或真的运行程序。数学题容易判定对错;科学研究像探索没有攻略的新地图,目标本身都要和人类一起决定。所以未来的AI不只是“聪明”,还要能证明自己没有走错路!
术语表
Chain-of-Thought(思维链)
把复杂答案拆成连续中间步骤的推理方式。它扩大了模型搜索路径,但也可能传播早期错误。
论文将其视为多步推理的主要技术。
Retrieval-Augmented Generation(检索增强生成)
先从外部文档检索相关信息,再把证据提供给模型生成答案。它用于弥补模型知识过时或缺失。
用于科学发现、定理证明和数据科学。
GraphRAG(图检索增强生成)
利用知识图结构组织和检索实体、关系及社区信息。相比普通检索,更适合关联性强的知识。
论文将其列为领域知识增强方法。
LLM-as-a-judge(大模型评审)
让一个LLM依据标准评价另一个模型的答案或推理轨迹。它灵活但可能继承模型偏差。
属于推理阶段的验证器。
Verifier(验证器)
检查候选解、数据或中间步骤是否满足正确性条件的组件。它可由模型、符号程序或实验系统实现。
训练数据筛选和多候选选择都需要验证器。
Solution trace(解轨迹)
从输入状态经多个中间状态到目标结果的完整过程。论文以X→O1→…→Oκ→Y形式表示。
是其复杂问题形式化定义的核心。
开放问题 这项研究留下的未解疑问
- 1 如何在数学、代码、数据科学和科研任务间统一衡量轨迹正确性、证据忠实性、成本与实际效用,论文尚未给出可复现答案。
- 2 当验证器、检索器和LLM同时出错时,系统如何发现错误并恢复,尤其是没有唯一答案的科研任务,仍缺乏可靠机制。
应用场景
近期应用
仓库级代码助手
软件团队可将LLM连接代码库、文档、测试和静态分析工具,用RAG理解项目背景,用CoT规划修改,再运行测试验证结果。前提是权限隔离、沙箱执行和人工代码审查。
可审计的数据分析助手
分析师可让系统读取数据字典和历史方案,自动提出预处理、特征工程及模型候选,并执行实验。每一步应保存代码、数据版本、指标和证据,避免把流畅解释误当成有效模型。
远期愿景
人机协作科研代理
未来系统可持续检索论文、整理知识图谱、提出假设、生成实验计划并分析结果。真正落地需要可重复实验、来源追踪、安全约束,以及研究者对目标和结论的最终控制。
原文摘要
Problem-solving has been a fundamental driver of human progress in numerous domains. With advancements in artificial intelligence, Large Language Models (LLMs) have emerged as powerful tools capable of tackling complex problems across diverse domains. Unlike traditional computational systems, LLMs combine raw computational power with an approximation of human reasoning, allowing them to generate solutions, make inferences, and even leverage external computational tools. However, applying LLMs to real-world problem-solving presents significant challenges, including multi-step reasoning, domain knowledge integration, and result verification. This survey explores the capabilities and limitations of LLMs in complex problem-solving, examining techniques including Chain-of-Thought (CoT) reasoning, knowledge augmentation, and various LLM-based and tool-based verification techniques. Additionally, we highlight domain-specific challenges in various domains, such as software engineering, mathematical reasoning and proving, data analysis and modeling, and scientific research. The paper further discusses the fundamental limitations of the current LLM solutions and the future directions of LLM-based complex problems solving from the perspective of multi-step reasoning, domain knowledge integration and result verification.