START: Self-taught Reasoner with Tools

TL;DR

START通过工具整合提升推理能力,在GPQA上达到63.6%的准确率。

cs.CL 🔴 高级 2025-03-07 36 次浏览
Chengpeng Li Mingfeng Xue Zhenru Zhang Jiaxi Yang Beichen Zhang Xiang Wang Bowen Yu Binyuan Hui Junyang Lin Dayiheng Liu
大模型 推理 工具整合 代码执行 自我学习

核心发现

方法论

START采用自我学习框架,通过Hint-infer和Hint-RFT两种技术,整合外部工具以提升推理能力。Hint-infer通过在推理过程中插入提示,激发模型使用工具的能力,而Hint-RFT则结合Hint-infer和拒绝采样微调,优化推理路径并进行模型微调。

关键结果

  • 在GPQA上,START的准确率达到63.6%,显著优于基础模型QwQ-32B-Preview。
  • 在AMC23和AIME24数学基准测试中,START分别取得95.0%和66.7%的准确率,超越现有开源模型。
  • 在LiveCodeBench代码基准测试中,START的准确率为47.3%,比QwQ-32B-Preview提高了5.9%。

研究意义

START通过整合外部工具和自我学习框架,显著提升了大模型在复杂推理任务中的性能。这一创新解决了长链推理模型在面对复杂计算时产生幻觉的问题,为学术界和工业界提供了更可靠的推理解决方案。

技术贡献

START引入了工具整合的长链推理模型,提供了新的理论保证和工程可能性。与现有方法相比,START能够在推理过程中调用外部工具进行代码执行和自我调试。

新颖性

START首次将工具整合到长链推理中,通过Hint-infer和Hint-RFT技术,显著提升了模型的推理能力,与现有方法相比具有独特的创新性。

局限性

  • 虽然START在多个基准测试中表现优异,但其仅限于Python解释器的整合,未探索其他工具的潜力。
  • 提示设计可能会干扰模型的原始推理流程,影响其自然性。

未来方向

未来研究可以探索整合更多类型的工具,如搜索引擎和专用库,以进一步提升模型的推理能力和适用范围。

AI 总览摘要

START: Self-taught Reasoner with Tools是一个创新的工具整合长链推理模型,通过自我学习框架显著提升了推理能力。现有的大型推理模型在复杂任务中表现出色,但在面对复杂计算时常常产生幻觉。START通过整合外部工具,特别是Python解释器,解决了这一问题。实验结果表明,START在多个基准测试中表现优异,尤其是在科学QA和数学推理任务中。尽管如此,START仍有局限性,如仅限于Python工具的整合,未来研究可以探索更多工具的整合以进一步提升性能。

深度分析

研究背景

大型语言模型在自然语言处理领域表现出色,但在复杂推理任务中仍面临挑战。长链推理方法通过多步中间推理提升了模型的推理能力,但在复杂计算时容易产生幻觉。工具整合推理方法通过调用外部工具有效解决了这一问题。

核心问题

现有长链推理模型在复杂计算任务中常常产生幻觉,影响其推理准确性。如何有效整合外部工具以提升模型的推理能力是一个亟待解决的问题。

核心创新

START通过Hint-infer和Hint-RFT技术整合外部工具,显著提升了模型的推理能力。Hint-infer通过插入提示激发模型使用工具的能力,而Hint-RFT则结合拒绝采样微调优化推理路径。

方法详解

  • �� Hint-infer: 在推理过程中插入提示以激发工具使用能力。

  • �� Hint-RFT: 结合Hint-infer和拒绝采样微调优化模型。

  • �� 工具整合: 通过Python解释器进行代码执行和自我调试。

实验设计

实验设计包括多个基准测试,如GPQA、AMC23、AIME24和LiveCodeBench。使用QwQ-32B-Preview作为基础模型进行微调,并与现有开源模型进行比较。

结果分析

在GPQA上,START的准确率达到63.6%,显著优于QwQ-32B-Preview。在数学基准测试中,START取得了95.0%和66.7%的准确率,超越现有开源模型。

应用场景

START可用于复杂科学推理和数学问题解决,尤其适用于需要外部工具支持的任务,如代码执行和自我调试。

局限与展望

START仅限于Python工具的整合,未探索其他工具的潜力。提示设计可能会干扰模型的原始推理流程,影响其自然性。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。现有的长链推理模型就像一个厨师,他有很多食材和工具,但有时会忘记使用一些重要的工具,比如计时器或温度计,这导致菜肴不够完美。START就像一个聪明的助手,他会在关键时刻提醒厨师使用这些工具,确保每道菜都能完美呈现。通过这种方式,START帮助厨师更好地完成复杂的烹饪任务。

简单解释 像给14岁少年讲一样

嘿,小伙伴!想象一下你在玩一个超级复杂的游戏,里面有很多谜题要解。现有的游戏助手有时候会给出错误的提示,让你卡关。START就像一个超级聪明的游戏助手,他会在你需要的时候给你正确的提示,帮助你顺利通关。这样你就能轻松解决游戏中的难题,成为游戏高手!

术语表

长链推理 (Long Chain-of-Thought)

一种推理方法,通过多步中间推理提升模型能力。

用于分解复杂问题以提高推理准确性。

工具整合推理 (Tool-integrated Reasoning)

通过调用外部工具提升模型推理能力。

解决长链推理模型在复杂计算中产生幻觉的问题。

Hint-infer

通过插入提示激发模型使用工具的能力。

在推理过程中插入提示以提升工具使用能力。

Hint-RFT

结合Hint-infer和拒绝采样微调优化模型。

通过优化推理路径提升模型性能。

Python解释器

一种工具,用于执行Python代码。

用于代码执行和自我调试以提升推理能力。

开放问题 这项研究留下的未解疑问

  • 1 如何整合更多类型的工具以提升模型性能?
  • 2 提示设计如何影响模型的原始推理流程?

应用场景

近期应用

科学推理

用于解决复杂科学问题,提升推理准确性。

数学问题解决

通过工具整合提升数学推理能力。

远期愿景

通用推理模型

整合多种工具以创建更强大的通用推理模型。

原文摘要

Large reasoning models (LRMs) like OpenAI-o1 and DeepSeek-R1 have demonstrated remarkable capabilities in complex reasoning tasks through the utilization of long Chain-of-thought (CoT). However, these models often suffer from hallucinations and inefficiencies due to their reliance solely on internal reasoning processes. In this paper, we introduce START (Self-Taught Reasoner with Tools), a novel tool-integrated long CoT reasoning LLM that significantly enhances reasoning capabilities by leveraging external tools. Through code execution, START is capable of performing complex computations, self-checking, exploring diverse methods, and self-debugging, thereby addressing the limitations of LRMs. The core innovation of START lies in its self-learning framework, which comprises two key techniques: 1) Hint-infer: We demonstrate that inserting artificially designed hints (e.g., ``Wait, maybe using Python here is a good idea.'') during the inference process of a LRM effectively stimulates its ability to utilize external tools without the need for any demonstration data. Hint-infer can also serve as a simple and effective sequential test-time scaling method; 2) Hint Rejection Sampling Fine-Tuning (Hint-RFT): Hint-RFT combines Hint-infer and RFT by scoring, filtering, and modifying the reasoning trajectories with tool invocation generated by a LRM via Hint-infer, followed by fine-tuning the LRM. Through this framework, we have fine-tuned the QwQ-32B model to achieve START. On PhD-level science QA (GPQA), competition-level math benchmarks (AMC23, AIME24, AIME25), and the competition-level code benchmark (LiveCodeBench), START achieves accuracy rates of 63.6%, 95.0%, 66.7%, 47.1%, and 47.3%, respectively. It significantly outperforms the base QwQ-32B and achieves performance comparable to the state-of-the-art open-weight model R1-Distill-Qwen-32B and the proprietary model o1-Preview.

cs.CL