Improving reasoning at inference time via uncertainty minimisation

TL;DR

通过不确定性最小化方法提高推理性能,在MATH500和GSM8K上表现优异。

cs.AI 🔴 高级 2026-03-07 2 次浏览
Nicolas Legrand Kenneth Enevoldsen Márton Kardos Kristoffer Nielbo
不确定性最小化 推理 大语言模型 自信度 跨语言

核心发现

方法论

该方法将推理过程视为不确定性最小化,操作在思维层面而非单个词元。每个推理步骤选择最大化模型自信度的延续。自信度由模型内部预测分布计算。此方法在少量样本下显著提升性能,仅依赖模型内部信号,适用于开放性问题。

关键结果

  • 在MATH500和GSM8K数据集上,思维层面自信度最大化方法在相同词元预算下,性能优于贪婪解码,并与自一致性方法相当或更好。
  • 跨语言评估表明,该方法在低资源语言中表现稳定。
  • 自信度动态分析显示,正确推理轨迹早期趋于稳定,早期决策与最终准确性相关。

研究意义

该研究通过不确定性最小化方法,显著提高了大语言模型在推理任务中的性能,尤其是在数学和编程等复杂任务中。此方法减少了对外部评估器的依赖,降低了计算成本,并在多语言环境中表现出色,具有广泛的应用潜力。

技术贡献

技术贡献在于提出了一种基于思维层面自信度的推理方法,避免了传统方法在词元层面可能出现的噪声和误导。该方法无需外部模型,完全依赖模型内部信号,提供了一种高效的推理时间扩展方法。

新颖性

该方法首次将不确定性最小化应用于推理过程的思维层面,区别于以往在词元或全生成层面的应用。通过在推理早期进行自信度最大化,显著提升了推理准确性。

局限性

  • 在某些边缘情况下,不确定性最小化可能失效,尤其是模型内部思维连接不明确时。
  • 该方法在低资源语言中表现良好,但在极端低资源环境下的表现仍需验证。

未来方向

未来研究可探索如何在推理过程中动态分配计算资源,进一步提高不确定性最小化方法的效率。此外,研究如何在更广泛的语言和任务中应用该方法也是一个重要方向。

AI 总览摘要

大语言模型在多步骤推理任务中表现出色,但现有推理时间扩展方法计算成本高。本文提出了一种基于不确定性最小化的推理方法,操作在思维层面而非单个词元。实验表明,该方法在MATH500和GSM8K数据集上显著提升了推理性能,且在低资源语言中表现稳定。通过分析自信度动态,研究发现正确推理轨迹早期趋于稳定,表明早期决策与最终准确性相关。该方法无需外部评估器,降低了计算成本,具有广泛的应用潜力。未来研究可探索如何在推理过程中动态分配计算资源,进一步提高方法的效率。

深度分析

研究背景

大语言模型在推理任务中取得了显著进展,尤其是在数学和编程等复杂任务中。然而,现有推理时间扩展方法往往依赖于大量采样或外部评估器,计算成本高。近年来,研究者们开始探索如何利用模型内部信号来指导生成过程,其中不确定性最小化显示出较强的效果。

核心问题

现有推理时间扩展方法计算成本高,且在词元层面操作时可能出现噪声和误导。如何在不依赖外部评估器的情况下,提高推理性能是一个重要挑战。

核心创新

本文提出了一种基于不确定性最小化的推理方法,操作在思维层面而非单个词元。通过在每个推理步骤选择最大化模型自信度的延续,该方法显著提升了推理性能。与传统方法相比,该方法无需外部评估器,计算成本低。

方法详解

  • �� 将推理过程视为不确定性最小化,操作在思维层面。 • 每个推理步骤选择最大化模型自信度的延续。 • 自信度由模型内部预测分布计算。 • 该方法适用于开放性问题,无需外部评估器。

实验设计

实验在MATH500和GSM8K数据集上进行,涵盖多个模型大小。使用思维层面自信度最大化方法,与贪婪解码和自一致性方法进行对比,评估其在相同词元预算下的性能。

结果分析

实验结果表明,思维层面自信度最大化方法在相同词元预算下,性能优于贪婪解码,并与自一致性方法相当或更好。跨语言评估表明,该方法在低资源语言中表现稳定。

应用场景

该方法适用于需要高效推理的任务,如数学和编程。由于无需外部评估器,计算成本低,适合在资源有限的环境中应用。

局限与展望

尽管该方法在多语言环境中表现出色,但在极端低资源环境下的表现仍需验证。此外,在某些边缘情况下,不确定性最小化可能失效,尤其是模型内部思维连接不明确时。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,手里有一堆食材(数据),你需要做出一道美味的菜肴(答案)。传统的方法是每次只加一种调料(词元),尝试后再决定下一步,但这可能导致味道不佳。我们的新方法就像是有一个经验丰富的厨师(模型自信度)在指导你,每一步都能选择最佳的调料组合,让菜肴更快更好地完成。

简单解释 像给14岁少年讲一样

想象你在玩一个解谜游戏,每次你都要选择下一步行动。传统的方法就像是每次只看一个选项,然后慢慢试错。而我们的新方法就像是有一个聪明的助手,他能告诉你哪个选项最有可能是对的,这样你就能更快地解开谜题!是不是很酷?

术语表

不确定性最小化

通过选择最大化模型自信度的延续来减少不确定性。

在推理过程中用于选择最佳的推理步骤。

自信度

模型对其预测的置信程度,通常通过内部预测分布计算。

用于评估每个推理步骤的可靠性。

思维层面

推理过程中产生的中间步骤,代表概念性子单元。

用于捕捉推理过程中的关键步骤。

MATH500

一个包含高难度数学问题的数据集,用于评估推理能力。

实验中用于测试模型的推理性能。

GSM8K

一个包含数学和编程问题的数据集,用于评估推理能力。

实验中用于测试模型的推理性能。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端低资源环境中有效应用不确定性最小化方法?
  • 2 模型内部思维连接不明确时,不确定性最小化方法的有效性如何保障?

应用场景

近期应用

数学推理

该方法可用于提高数学问题的解题效率,尤其是在资源有限的环境中。

远期愿景

跨语言推理

该方法在多语言环境中表现出色,未来可用于开发更通用的推理系统。

原文摘要

Large language models (LLMs) now exhibit strong multi-step reasoning abilities, but existing inference-time scaling methods remain computationally expensive, often relying on extensive sampling or external evaluators. We propose a principled strategy that frames reasoning as uncertainty minimisation and operates at the level of individual thoughts rather than tokens. Our method selects, at each reasoning step, the continuation that maximizes the model's self-certainty, a metric computed from its internal predictive distribution. This approach achieves significant improvement with a small number of samples, relies exclusively on model-internal signals, and applies to open-ended questions as opposed to methods like majority voting. Experiments on MATH500 and GSM8K across multiple model sizes demonstrate that thought-level self-certainty maximization consistently outperforms greedy decoding and matches or exceeds self-consistency under comparable token budgets. Cross-linguistic evaluations further indicate that the method transfers robustly beyond high-resource languages. Furthermore, analysis of self-certainty dynamics reveals that correct reasoning trajectories converge early to stable paths, suggesting that early decisions, likely associated with the planning of the reasoning process, are predictive of final accuracy. Building on this result, we show that self-certainty maximisation applied to the early steps can explain most of the performance gain and provide a simple yet efficient inference-time scaling method.

cs.AI