Answer Probing-Guided Search for Diverse Solution Exploration of LLMs

TL;DR

提出了答案探测引导的树搜索(APTS),在三个推理任务上提高了解决方案的多样性。

cs.AI 🔴 高级 2026-08-31 2 次浏览
Yi Fang Que Shen Chengpeng Li Boyi Deng Wei Shi Wenjie Wang Fuli Feng Fengli Xu Dayiheng Liu
大语言模型 多样性 树搜索 答案探测 推理任务

核心发现

方法论

该研究提出了一种名为答案探测引导的树搜索(APTS)的方法,通过在推理路径的中间步骤进行答案探测,利用探测答案的隐藏状态相似性和困惑度来指导搜索过程,从而提高解决方案的多样性。

关键结果

  • 在三个推理任务上,APTS方法在覆盖率(Cov@16)上比重复采样提高了7%,在化学合成任务中NCircle@16提升了0.47。
  • 在代码测试生成任务中,APTS在行覆盖率和分支覆盖率上分别提高了5%。
  • APTS在不显著降低准确率的情况下显著提高了解决方案的多样性。

研究意义

该研究在学术界和工业界具有重要意义,解决了大语言模型在推理过程中收敛于单一高置信度路径的问题,促进了多样性解决方案的生成,尤其在代码测试生成和药物发现等领域具有广泛应用潜力。

技术贡献

技术贡献包括提出了一种新的答案探测方法,通过探测中间推理路径的潜在答案,提供了更有效的路径区分信号,并将其应用于树搜索算法中以提高解决方案的多样性。

新颖性

该方法首次利用答案探测来指导树搜索,区别于传统的语义嵌入方法,能够更有效地区分不同的推理路径,具有显著的新颖性。

局限性

  • APTS在计算复杂度上有所增加,尤其是在处理大规模数据集时。
  • 该方法对探测答案的提示词敏感,可能影响结果的稳定性。

未来方向

未来工作可以探索在更多任务和模型上应用APTS,并优化其计算效率。此外,还可以研究如何自动化选择最优的探测答案提示词。

AI 总览摘要

大语言模型在推理过程中往往倾向于收敛于单一的高置信度路径,这限制了多样性解决方案的生成。现有方法通过语义嵌入来指导树状搜索,但容易被语言和风格相似性混淆。为了解决这一问题,研究者提出了答案探测引导的树搜索(APTS),通过探测中间推理路径的潜在答案,利用其隐藏状态相似性和困惑度来指导搜索过程。

在三个推理任务上,APTS方法显著提高了解决方案的多样性,尤其在代码测试生成和化学合成任务中表现出色。实验结果表明,APTS在不显著降低准确率的情况下,能够有效提高解决方案的多样性。

该研究为大语言模型在多样性解决方案生成方面提供了新的思路,具有重要的学术和应用价值。未来工作可以进一步优化APTS的计算效率,并探索其在更多任务和模型上的应用潜力。

深度分析

研究背景

大语言模型在生成多样性解决方案方面面临挑战,现有方法主要依赖语义嵌入来指导树状搜索,但容易被语言和风格相似性混淆。研究者提出了一种新的方法,利用答案探测来提高解决方案的多样性。

核心问题

大语言模型在推理过程中往往收敛于单一高置信度路径,限制了多样性解决方案的生成。这一问题在代码测试生成和药物发现等领域尤为突出。

核心创新

提出了答案探测引导的树搜索(APTS),通过探测中间推理路径的潜在答案,利用其隐藏状态相似性和困惑度来指导搜索过程,提高了解决方案的多样性。

方法详解

  • �� 在推理路径的中间步骤进行答案探测
  • �� 利用探测答案的隐藏状态相似性来区分不同的路径
  • �� 通过困惑度来评估路径的质量
  • �� 在树搜索过程中选择高质量且多样的路径进行扩展

实验设计

实验在三个推理任务上进行,包括数学、化学和代码测试生成。使用Qwen3-8B和GPT-OSS-120B模型,评估指标包括准确率、解决方案覆盖率和化学空间覆盖率。

结果分析

APTS在三个任务上均显著提高了解决方案的多样性,尤其在化学合成任务中NCircle@16提升了0.47。在代码测试生成任务中,行覆盖率和分支覆盖率分别提高了5%。

应用场景

APTS在代码测试生成和药物发现等领域具有广泛应用潜力,可以帮助生成多样性更高的测试用例和化学结构。

局限与展望

APTS在计算复杂度上有所增加,尤其在处理大规模数据集时。此外,该方法对探测答案的提示词敏感,可能影响结果的稳定性。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,通常你只会做一道你最擅长的菜,但如果你能尝试不同的食材和做法,你就能做出更多样化的菜肴。APTS就像是一个指导你尝试不同做法的助手,通过探测你在做菜过程中的每一步,帮助你找到更多样化的菜谱。

简单解释 像给14岁少年讲一样

想象你在玩一个解谜游戏,通常你会找到一个最简单的解法,但如果有一个助手能帮你探索不同的解法,你就能找到更多有趣的解决方案。APTS就是这样的助手,它通过探测你在解谜过程中的每一步,帮助你找到更多样化的解法!

术语表

大语言模型 (LLM)

一种能够生成和理解自然语言的大规模神经网络模型。

用于生成多样性解决方案的基础模型。

答案探测

通过探测推理路径的潜在答案来指导搜索过程的方法。

用于提高解决方案多样性的核心技术。

树搜索

一种通过构建和探索树结构来寻找最优解决方案的算法。

用于探索多样性解决方案的搜索方法。

困惑度 (PPL)

衡量模型生成文本的置信度的指标,值越低表示置信度越高。

用于评估推理路径质量的指标。

语义嵌入

将文本转换为向量表示以捕捉其语义信息的方法。

用于指导传统树搜索的技术。

开放问题 这项研究留下的未解疑问

  • 1 如何在大规模数据集上提高APTS的计算效率仍需进一步研究。
  • 2 自动化选择最优的探测答案提示词的方法尚未解决。

应用场景

近期应用

代码测试生成

APTS可以用于生成多样化的代码测试用例,提高软件测试的覆盖率和有效性。

远期愿景

药物发现

通过生成多样化的化学结构,APTS可以帮助发现新的药物分子,推动药物研发进程。

原文摘要

Generating multiple diverse and high-quality solutions is valuable for many applications, such as code-test generation and drug discovery. However, Large Language Models (LLMs) tend to converge on a single high-confidence solution during inference, limiting exploration of alternative valid solution paths. Existing test-time methods promote diversity through tree-like search and prune semantically similar branches using response-level semantic embeddings. However, we find that such embeddings are easily confounded by linguistic and stylistic similarities, making it difficult to distinguish genuinely distinct solution paths. To address this, we introduce Answer Probing, which probes the potential answer an LLM would reach from an intermediate reasoning path. We demonstrate that the hidden states of probed answers more effectively differentiate distinct solution paths than semantic embeddings, and the perplexity of probed answers serves as a practical proxy for reasoning correctness. Based on these findings, we propose Answer Probing-Guided Tree Search (APTS), which guides the tree search by the probed answers' hidden state similarity and perplexity. Experiments on three reasoning tasks across two LLMs show that APTS consistently enhances solution diversity, demonstrating its effectiveness and robustness.

cs.AI