核心发现
方法论
本文提出的FoT方法基于无训练的词汇信号,利用模型生成文本中的犹豫标记(如“等等”、“实际上”、“或许”)识别低效轨迹。通过在推理过程中在多个检查点应用早期投票和路径修剪,动态剔除表现出过度犹豫的轨迹,从而在保持多样性和准确率的同时显著降低注意力FLOPs。该方法在六个不同的LRMs模型上,覆盖115K推理轨迹,验证了其在不同架构和任务中的迁移能力。
关键结果
- FoT在保持SC@32准确率的同时,减少了28.8%的注意力FLOPs,且在线推理时间缩短37.6%。在六个模型、四个数学推理基准(AIME24/25、AMC23、MATH500)中,FoT均实现了与全模型相当的准确率,且能有效剔除长尾的无用轨迹,显著节省计算资源。
- 在115K轨迹分析中,犹豫标记密度在错误轨迹中明显更高,FoT利用这一特征在不需额外训练的情况下实现路径修剪,普适性强,跨模型和任务迁移效果优异。
- FoT在复杂推理任务中优于传统多样性采样方法(如SC@k),特别是在难题和模型差异较大的场景中,表现出更强的鲁棒性和节省能力。
研究意义
该研究解决了大规模推理模型中因长尾无效轨迹带来的高昂计算成本问题,为多样性推断提供了高效、可迁移的解决方案。通过无需训练的路径信号,FoT实现了在保持模型性能的同时大幅度降低推理成本,推动了大模型在实际应用中的普及。其方法的普适性和高效性,为未来大规模推理系统的设计提供了新思路,具有重要的学术和工业价值。
技术贡献
本文提出的FoT算法创新性在于利用无训练的词汇信号识别低效轨迹,结合多阶段路径修剪机制,有效平衡推理准确性与计算效率。该方法在多模型、多任务环境中实现了无缝迁移,显著降低了注意力FLOPs(56.1%)和时间(37.6%),同时保持了多样性和准确率。不同于传统的采样优化或模型剪枝,FoT在推理时动态剔除无用轨迹,突破了单一轨迹优化的限制,提供了新的多样性管理思路。
新颖性
FoT首次提出基于词汇级犹豫标记的路径修剪策略,无需训练或额外模型,直接在推理阶段实现轨迹筛选。其利用模型生成文本中的自然信号,结合多阶段检查点机制,有效抑制长尾无效轨迹,提升推理效率。这一方法区别于以往依赖外部模型或复杂相似性检测的多轨道优化技术,展现出极高的实用性和迁移性。
局限性
- FoT依赖犹豫标记的统计特性,可能在某些任务或模型中表现不佳,特别是犹豫表达较少或语境不同的场景。
- 路径修剪可能误伤部分潜在正确轨迹,导致少数情况下准确率略有下降,需进一步优化阈值策略。
- 该方法在极端长文本或复杂推理中,仍存在一定的计算开销,未来需结合更智能的修剪策略以提升效率。
未来方向
未来可结合学习型信号增强路径修剪的鲁棒性,探索多模态或跨域场景的迁移能力。此外,结合强化学习或自监督机制,优化路径修剪的动态策略,进一步提升推理效率与准确性。还可扩展至生成式对话、代码生成等多任务环境,推动大模型在实际应用中的广泛部署。
AI 总览摘要
大规模推理模型(LRMs)在复杂问题解决中展现出强大能力,但其长尾无效轨迹带来的高昂计算成本成为瓶颈。传统多样性采样方法如自洽(SC@k)虽能提升准确率,但每个轨迹都需完整运行,导致大量无用计算。本文提出的Funnel of Thoughts(FoT)方法,通过利用模型生成文本中的犹豫标记,动态在推理过程中提前剔除表现出无效行为的轨迹,从而在保持多样性和准确率的基础上,显著降低了28.8%的注意力FLOPs和37.6%的推理时间。实验在六个不同架构、四个数学推理基准上验证了其有效性,结果显示FoT在不牺牲性能的前提下,极大提升了推理效率。这一方法的核心在于无需额外训练或模型调整,利用自然生成文本中的词汇信号实现路径筛选,具有极强的迁移性和实用价值。未来,FoT有望结合学习信号和多模态信息,进一步优化推理过程,推动大模型在实际场景中的广泛应用。尽管如此,路径修剪仍需在极端复杂任务中权衡效率与精度,未来工作将聚焦于增强信号鲁棒性和扩展应用范围。
深度分析
研究背景
近年来,大规模推理模型(LRMs)如GPT-4、PaLM等在自然语言理解和推理任务中取得突破,推动了多样性推断的发展。早期工作如自洽(SC@k)和自适应停止(Adaptive Consistency)旨在提升推理准确率,但面临高昂的计算成本,特别是在长文本生成中。研究发现,模型生成的轨迹中存在大量重复、无效或无用的长尾行为,导致资源浪费。为解决这一问题,学界开始探索路径修剪、信号识别等技术,以期在保证性能的同时降低推理成本。
核心问题
现有多样性推断方法虽能提升准确率,但在实际部署中因每个轨迹都需完整运行,导致极高的计算开销,尤其是在长文本生成任务中。长尾无效轨迹占据大量资源,却对最终答案贡献有限,严重制约了大模型的应用普及。如何在保证多样性和准确率的基础上,有效识别并提前剔除低效轨迹,成为关键技术难题。传统方法依赖外部模型或复杂相似性检测,增加了系统复杂度和部署难度。本文旨在通过无训练的词汇信号,实现推理时的路径筛选,降低成本。
核心创新
FoT的核心创新在于利用模型生成文本中的犹豫标记(如“等等”、“实际上”、“或许”)作为低成本的路径质量指标,无需额外训练或模型调整。它在多个检查点应用早期投票,将已生成答案的轨迹存入投票池,同时对未完成轨迹进行路径修剪,剔除犹豫密度高的轨迹。该机制通过多阶段筛选,有效抑制长尾无效轨迹,显著减少注意力FLOPs(56.1%)和推理时间(37.6%),同时保持多样性和准确率。方法设计简洁,易于集成到现有推理管线中,具有良好的迁移性。
方法详解
- �� 在推理过程中,初始化k个平行轨迹池。
- �� 在预设的多个检查点(t1, t2, ..., tm)进行路径评估。
- �� 在每个检查点,首先执行早期投票,将已生成答案的轨迹存入投票池,确保答案早期确定。
- �� 对未完成轨迹计算犹豫标记密度(如“等等”、“或许”出现频率),作为低效轨迹的识别指标。
- �� 根据犹豫密度,将轨迹按升序排序,保留最低密度的比例(如80%),剔除高密度轨迹。
- �� 只对剩余轨迹继续生成,直至最终投票。
- �� 最终通过投票池中的答案确定最终输出。
- �� 该流程在推理时无需训练,路径修剪由文本内容直接驱动,极大降低了计算负担。
实验设计
采用六个不同架构模型(如DeepSeek、Qwen、Skywork、Phi-4)在AIME24/25、AMC23、MATH500等数学推理任务上进行评估。每个任务生成32个轨迹,共计115K轨迹,验证FoT在保持SC@32准确率的同时,显著降低注意力FLOPs。对比基线包括SC@32、Adaptive Consistency和Slim-SC,分析不同场景下的性能表现。超参数如检查点位置和路径保留比例通过网格搜索优化。实验还涵盖跨模型迁移和跨任务泛化,验证FoT的普适性。
结果分析
FoT在六个模型、四个基准上,平均实现28.8%的注意力FLOPs节省,准确率与SC@32基本持平。特别是在难题(如AIME24/25)中,FoT能有效剔除长尾无效轨迹,减少资源浪费。路径分析显示,错误轨迹中犹豫标记密度显著高于正确轨迹,FoT利用此特征实现路径修剪。实验还验证了FoT在不同模型和任务中的迁移能力,表现出极强的适应性和稳定性。
应用场景
该方法可广泛应用于需要高效推理的场景,如智能问答、自动化推理、代码生成和对话系统。只需在推理流程中加入路径修剪机制,无需额外训练或模型调整,即可显著降低计算成本,提升部署效率。未来还可结合多模态信息,拓展到视觉推理或跨域任务,推动大模型的实际应用普及。
局限与展望
FoT依赖犹豫标记的统计特性,在某些任务或模型中可能表现不佳,尤其是犹豫表达不明显或语境不同的场景。路径修剪可能误伤部分正确轨迹,导致少数性能下降。此外,在极端复杂或超长文本任务中,仍存在一定的计算开销,未来需结合更智能的修剪策略和多模态信号以提升鲁棒性。
通俗解读 非专业人士也能看懂
想象你在做一道复杂的数学题,开始时你会尝试多种解法,逐步接近答案。有些解法很快就能得出答案,有些则会陷入反复验证甚至迷失方向。FoT就像一个聪明的助手,它会观察你在解题过程中是否犹豫(比如说“等等”、“其实”),当发现你一直在犹豫或反复试错时,它会建议你放弃那些迷路的解法,集中精力在更有希望的方案上。这样一来,你既能保证找到正确答案,又不用浪费太多时间和精力。这个助手不用你事先教它规则,只是通过观察你说话的词,就能帮你节省很多时间。这就像在厨房里,厨师根据菜肴的味道判断是否继续调味,FoT也是根据文本中的“味道”——犹豫词——来决定是否继续某个推理路径。它让大模型变得更聪明、更快,既节省资源,又保证了结果的质量。
简单解释 像给14岁少年讲一样
想象你在玩一个超级复杂的游戏,你要做很多决定。有时候你很快就知道下一步怎么走,但有时候你会犹豫很久,不知道该不该继续。有个聪明的朋友会观察你犹豫的程度,如果你一直在说“嗯,也许”、“等等”,他会建议你放弃那些犹豫不决的想法,专注于那些已经很有把握的路线。这样,你就能更快找到正确的答案,也不用浪费太多时间在那些迷路的想法上。FoT就像这个朋友,它不用你告诉他怎么做,只是通过你说的话里的“犹豫词”来判断哪些想法没用,然后帮你提前停止那些无用的路径。这样一来,整个游戏变得更快、更省力,还能保证你最终赢得比赛。它让大模型像个聪明的玩家,知道什么时候该坚持,什么时候该放弃,既节省时间,又能赢得胜利。
术语表
犹豫标记 (Hesitation Markers)
在文本中表现出犹豫或反复的词汇,如“等等”、“其实”、“或许”。技术上为模型生成文本中的词汇信号,用于识别低效轨迹。
论文中用来区分有效与无效推理路径的关键指标。
路径修剪 (Rollout Pruning)
在推理过程中提前停止表现出无效行为的轨迹,节省计算资源。技术上结合犹豫密度指标动态筛选轨迹。
FoT的核心机制,用于降低推理成本。
自洽(Self-Consistency, SC@k)
采样k个推理路径,通过多数投票确定答案的策略。技术上是多轨迹集成方法,用于提升推理准确率。
作为FoT的基线方法。
注意力FLOPs
衡量模型在推理中注意力机制的计算量,随序列长度平方增长。技术指标反映推理成本。
用以评估FoT在节省计算方面的效果。
开放问题 这项研究留下的未解疑问
- 1 如何进一步提升犹豫信号在不同任务中的鲁棒性,尤其在非数学推理或语境变化大的场景中。当前方法主要依赖文本中的词汇信号,未来需结合语义或上下文信息增强识别能力。
- 2 路径修剪可能误伤潜在正确轨迹,如何设计更智能的修剪策略以最大化准确率和效率的平衡,是未来研究方向。
原文摘要
Large Reasoning Models produce diverse, sometimes inconsistent answers across repeated queries on the same problem, so multi-sample inference is a prerequisite for reliable deployment. Majority voting at k rollouts is the standard solution and the de facto accuracy target for this regime, but it is prohibitively expensive at the scale LRMs require. We introduce Funnel of Thoughts (FoT), an inference-time method that preserves the full 32-trajectory voted accuracy while halving its attention FLOPs, a 28.8% reduction in full-model inference cost. Across 115K reasoning trajectories from six LRMs, we find that unproductive trajectories often reveal themselves through repeated hesitation markers such as "Wait", "Actually", and "perhaps." These trajectories are less likely to reach the correct answer and consume disproportionate attention FLOPs, degenerating into no-answer loops in the worst case. Built on this training-free lexical signal, FoT identifies the vocabulary that captures these pathological patterns and prunes affected trajectories before completion, reducing online generation attention FLOPs by 56.1% and wall time by 37.6% without any additional model inference; the same signal transfers without retuning across held-out architectures and out-of-domain tasks.