Entropy-Gated Latent Recursion

TL;DR

提出Entropy-Gated Latent Recursion(EGLR),通过层跨度L实现推理多样性,显著提升模型推理性能。

cs.LG 🔴 高级 2026-06-15 57 次浏览
Soham Bhattacharjee Dushyant Singh Chauhan Salem Lahlou Martin Takac Nils Lukas
自然语言处理 推理增强 推理推断 模型解释性 推理多样性

核心发现

方法论

本文提出基于层跨度L的确定性推理轴,结合熵门控机制在高不确定性位置递归重用模型顶部L层,形成L×T笛卡尔采样空间。无需训练,利用最大K次迭代直至分布收敛,结合温度T采样,显著扩展推理轨迹多样性。实验证明在8个指令调优模型和6个数学推理基准上,L轴与温度轴互补,提升整体性能。

关键结果

  • 在Qwen2.5-3B-Instruct模型的MATH-500任务中,L×T联合oracle达91.6%,比仅用温度的83.4%提升8.2个百分点,比仅用层跨度的81.2%提升10.4个百分点,验证两轴互补性。
  • 在多模型、多任务场景中,EGLR-SC自我一致性集成在44/48个模型-任务单元中优于贪心解法,且在FLOP匹配的束搜索中表现优越。
  • 不同L值对应不同推理路径,实验显示无单一L值占优,L轴提供丰富多样的推理轨迹,且结合温度采样后效果更佳。

研究意义

该方法突破了传统单一随机采样的局限,提供一种无训练、低成本的推理多样性增强策略。通过引入确定性层跨度轴,显著提升模型在数学推理、问答等复杂任务中的表现,为推理推断提供新思路,推动推理能力的边界扩展,具有重要理论和应用价值。

技术贡献

本文首次提出基于层跨度L的确定性推理轴,结合熵门控机制实现无需训练的递归重用。创新在于将推理多样性从随机噪声转向结构性变化,扩展了推理轨迹空间,结合温度采样形成L×T笛卡尔空间,为后续自我一致性、多样性集成提供丰富候选路径,推动推理增强技术的发展。

新颖性

本研究首次系统性引入层跨度L作为推理多样性轴,区别于传统的随机采样和训练依赖的递归方法。通过熵门控机制实现无训练递归,结合温度采样形成结构化、多维的推理轨迹空间,显著提升模型推理能力,开启推理推断新方向。

局限性

  • L轴的选择对不同任务和模型敏感,需调优参数以达到最佳效果,存在一定调参成本。
  • 递归迭代最多K次,可能在某些复杂任务中未充分探索所有潜在路径,影响最大潜能发挥。
  • 方法在极端高不确定性场景下可能受限,未来需结合外部知识或反馈机制进一步优化。

未来方向

未来将探索自适应动态调节L值的机制,结合外部知识或反馈信号提升推理路径的多样性与准确性。此外,将该方法应用于更广泛的任务场景,如对话系统、推理推断和多模态融合,推动推理能力的普适性和鲁棒性提升。

AI 总览摘要

在当今自然语言处理领域,模型推理能力的提升成为核心目标。传统方法主要依赖随机采样(如温度T)引入轨迹多样性,但其本质为噪声驱动,存在局限性。本文提出Entropy-Gated Latent Recursion(EGLR),通过引入层跨度L作为全确定性推理轴,结合熵门控机制在高不确定性位置递归重用模型顶部L层,形成L×T的笛卡尔采样空间。无需训练,最多迭代K次,直到分布收敛,极大丰富推理轨迹。实验证明在8个指令调优模型和6个数学推理基准上,L轴与温度轴互补,显著提升性能。例如,在Qwen2.5-3B-Instruct模型的MATH-500任务中,L×T联合oracle达91.6%,比单一温度提升8.2个百分点,验证了两轴的互补性。该方法不仅在数学推理任务中表现优异,还在多模型、多任务场景中优于传统的贪心和束搜索,展示了其广泛应用潜力。通过丰富的推理候选路径,EGLR为自我一致性、多样性集成和强化学习等下游任务提供了强大支持,推动推理能力的边界扩展。未来,研究将聚焦于动态调节L值、结合外部知识和反馈机制,进一步提升推理的鲁棒性和适应性,为人工智能推理技术带来新的突破。

深度分析

研究背景

近年来,随着大规模预训练模型的兴起,推理能力成为衡量模型智能水平的重要指标。早期方法如自我一致性(Wang et al., 2023)和束搜索(Cobbe et al., 2021)通过引入随机性提升答案多样性,但受限于噪声本质,难以实现结构性多样性。递归推理(Giannou et al., 2023; Hao et al., 2024)引入模型内部循环机制,但需额外训练。Li et al. (2026)提出的熵门控扩展在于选择性扩展高不确定性位置,但仍依赖外部验证。本文突破传统,提出无训练的确定性递归机制,结合推理路径的结构性变化,开启推理多样性新路径。

核心问题

现有推理增强方法多依赖随机噪声,导致推理路径缺乏结构性多样性,限制模型在复杂推理任务中的表现。如何在不增加训练成本的前提下,获得多样化且具有结构性的推理轨迹,成为亟待解决的问题。单一的随机采样难以覆盖所有潜在推理路径,且在高不确定性场景下表现不佳。引入确定性、多维的推理轴成为突破口,但如何实现、验证其有效性仍未被充分探索。

核心创新

核心创新包括:1)引入层跨度L作为全确定性推理轴,区别于传统随机采样,提供结构性多样性;2)结合熵门控机制,在高不确定性位置递归重用模型顶部L层,避免训练成本;3)形成L×T笛卡尔采样空间,显著扩展推理轨迹多样性;4)无需训练,利用最大K次迭代实现分布收敛,兼具效率与效果。这些创新突破了模型推理多样性的局限,为后续集成和优化提供了丰富候选路径。

方法详解

  • �� 采用预训练Transformer模型,定义层 residual 状态和输出机制。
  • �� 利用输入上下文,逐层生成隐藏状态,计算下一词概率。
  • �� 在推理过程中,利用熵门控机制检测高不确定性位置(H(pt) > τH),触发递归重用顶L层。
  • �� 递归操作包括:对高不确定性位置,最多K次迭代,融合前后状态,调整分布。
  • �� 通过不同L值产生不同推理路径,形成结构化的推理轨迹空间。
  • �� 结合温度T采样,形成L×T笛卡尔空间,丰富推理候选。
  • �� 利用自我一致性(EGLR-SC)对多路径进行投票集成,提升答案准确率。

实验设计

在8个指令调优模型和6个数学推理基准上,采用准确率、oracle覆盖率和路径多样性指标进行评估。对比贪心、束搜索和单一温度采样,验证L轴的有效性。参数调优包括:最大递归次数Kmax=3,熵门阈值τH自动调节。通过不同L值的消融实验,分析模型在不同任务中的适应性。结果显示,L轴与温度轴互补,联合oracle提升显著,验证方法的普适性和有效性。

结果分析

实验证明,L×T联合oracle在数学推理任务中达91.6%,比单一温度提升8.2个百分点,且优于层跨度单轴(81.2%)。在多模型、多任务场景中,EGLR-SC自我一致性集成在44/48个单元中优于贪心,且在FLOP匹配的束搜索中表现更优。不同L值对应不同推理路径,验证了多样性来源的结构性优势。该方法在数学推理、问答等复杂任务中表现出强大潜力。

应用场景

该方法适用于需要高推理准确率的应用场景,如数学题解、科学问答、法律推理等。通过丰富候选路径,提升模型在复杂推理中的表现,适合集成到自动推理系统、教育辅导和智能问答平台中。未来可结合外部知识库和反馈机制,进一步增强推理鲁棒性和泛化能力。

局限与展望

L轴参数敏感,需调优以适应不同任务,增加调参复杂度。递归最多K次,可能未充分探索所有潜在路径,影响最大潜能。在极端高不确定性场景下,递归效果受限,未来需结合外部知识和反馈机制优化。模型计算成本略高于传统方法,但通过合理参数调节可控。

通俗解读 非专业人士也能看懂

想象你在厨房做菜,传统做法是按照食谱一步步操作,结果可能会有些偏差。现在,你发现有一种新方法:在关键步骤上多试几次,每次都用不同的调料组合,但不需要重新学做菜,只是在原有基础上多试几次。这就像在模型推理中,传统方法只用一种方式(随机噪声)产生答案,而新方法在关键点上用不同的“调料”——不同的层跨度L,反复递归,得到多种不同的推理路径。这些路径都来自同一锅“菜”,但每次都用不同的“调料”调整味道,最后合成一份更好吃的菜。这种方式既节省成本,又能做出更丰富、更可靠的菜肴。

简单解释 像给14岁少年讲一样

想象你在玩拼图游戏,通常你只试一种拼法,看看能不能拼成功。但如果你能在关键的拼块上多试几次,用不同的拼法,然后把所有成功的拼法都结合起来,结果就会更好。这就像模型在推理时,只用一种方法(随机采样)得到答案,而这次我们用一种新办法——在某些关键位置多次递归,用不同的“拼法”拼出多种路径,然后选出最靠谱的答案。这个新办法不需要额外学习,只是在原有模型上多试几次,效果就大大提升。就像拼图游戏一样,试多几次,总能拼出更完整、更漂亮的图案。

术语表

Entropy-Gated Latent Recursion(EGLR)

一种基于模型输出熵的门控机制,通过递归重用模型顶部L层,在高不确定性位置产生多样推理路径,无需训练。

论文提出的核心方法,用于增强推理路径多样性。

Layer span L(层跨度L)

指在推理过程中,递归重用模型的顶部L层,形成结构化的推理路径,提供确定性多样性轴。

作为新引入的推理轴,用于生成不同的推理轨迹。

笛卡尔采样空间(Cartesian sampling space)

由层跨度L和温度T两个维度组成的推理路径集合,扩展了模型推理的多样性。

实现多路径融合和集成的基础。

自我一致性(Self-Consistency)

通过多次采样,选取多数答案作为最终输出的方法,提升推理准确性。

作为对比基线,结合多路径投票。

熵门控机制(Entropy-Gated Mechanism)

利用输出概率的熵值作为门控信号,选择高不确定性位置进行递归重用。

核心技术之一,用于控制递归触发。

开放问题 这项研究留下的未解疑问

  • 1 如何动态调节L值以适应不同任务复杂度,提升推理效率和效果仍未充分解决。
  • 2 在极端高不确定性场景下,递归机制的稳定性和效果有待验证。
  • 3 未来需结合外部知识和反馈机制,优化递归策略,增强鲁棒性。

应用场景

近期应用

数学题解与科学问答

利用L×T推理路径丰富模型候选答案,提升复杂问题的解答准确率,适用于教育、科研等领域。

自动推理系统

在智能助手和自动推理平台中集成多路径推理,提高系统的可靠性和解释性。

远期愿景

多模态推理与跨领域应用

结合视觉、语音等多模态信息,扩展推理路径多样性,推动AI在复杂场景中的应用。

原文摘要

Inference-time scaling has become the dominant lever for improving language-model reasoning, but existing methods derive rollout diversity from a single source: stochastic token-level sampling. We argue that this single-axis sampling space is fundamentally limiting, and identify a second, fully deterministic and complementary axis: the layer span $L$ at which a frozen model's top decoder layers are recursively re-applied at high-uncertainty tokens. Different choices of $L$ produce distinct rollouts that solve different subsets of problems, with no stochasticity. We instantiate this axis through Entropy-Gated Latent Recursion (EGLR), a training-free decoding procedure that re-applies the top-$L$ layers for at most $K_{\max}$ iterations until the next-token distribution converges. Combined with $T$ temperature samples, EGLR turns a single-axis stochastic rollout pool into an $L\times T$ Cartesian sampling space at almost the same per-rollout cost. We characterize this space across $8$ instruction-tuned models and $6$ math reasoning benchmarks, and show that the $L$-axis is genuinely complementary to temperature: on MATH-500 with Qwen2.5-3B-Instruct, the joint $L\times T$ oracle reaches $91.6\%$, $+8.2$ percentage points beyond the temperature-only oracle ($83.4\%$) and $+10.4$ points beyond the layer-only oracle ($81.2\%$), confirming that the two axes capture genuinely complementary problems. The expanded rollout pool provides richer per-prompt candidates for any downstream procedure that consumes rollouts, including self-consistency, best-of-$N$ with verifiers, and group-relative RL training (GRPO), opening a new direction for inference-time scaling that does not rely on stochastic noise.

cs.LG cs.AI