TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents

TL;DR

TRACE通过信用估算实现长序列多轮代理的逐轮奖励分配,无需额外训练Critic,显著提升工具使用能力。

cs.LG 🔴 高级 2026-07-16 55 次浏览
Leitian Tao Baolin Peng Wenlin Yao Tao Ge Hao Cheng Mike Hang Wang Jianfeng Gao Sharon Li
强化学习 信用分配 长序列任务 奖励机制 深度学习

核心发现

方法论

TRACE利用冻结的参考模型,将每个工具调用边界的状态转移转化为对答案的对数概率比值,作为状态值指标。通过时间差分(TD)方法计算连续状态值的变化,作为逐轮奖励。无需训练Critic或过程标签,利用模型的对数概率变化实现密集奖励分配。该方法在长序列搜索任务中显著优于传统仅依赖终点奖励的策略,提升模型工具使用能力。核心机制包括:• 利用冻结模型评估前缀答案的对数概率,• 转换为对数比值状态值,• 通过TD变化计算逐轮奖励。实验中在复杂搜索任务中,纯RL训练下,Qwen3-4B模型奖励从7.2提升至35.6,Qwen3-30B-A3B从8.4提升至42.6。

关键结果

  • 在长序列搜索任务中,TRACE显著提高模型的工具调用效率,Qwen3-4B模型在BrowseComp-Plus基准中的得分从7.2跃升至35.6,提升近5倍;Qwen3-30B-A3B从8.4到42.6,效果优于多种基线方法。
  • 无需冷启动微调或训练过程标签,纯RL训练即可实现性能飞跃,训练曲线提前改善,收敛更快。
  • 迁移能力强,训练所得搜索行为在开放网络任务中表现优异,显示出良好的泛化性和实用潜力。

研究意义

该研究突破了长序列多轮任务中奖励稀疏和高方差的问题,为强化学习在复杂工具交互任务中的应用提供了新思路。通过密集奖励分配机制,有望推动自主代理在web搜索、编程辅助等领域的性能提升,减少对昂贵监督信号的依赖,增强模型的探索与利用能力。此方法简洁高效,兼容多模型规模,具有广泛的实用价值和理论意义。

技术贡献

提出基于冻结参考模型的逐轮奖励估算框架,避免训练Critic或过程标签,利用对数概率比值作为状态值指标。引入一阶TD变化实现密集奖励,且该变化在多次工具调用中具备端点望远镜特性,减少冗余奖励干扰。结合终点奖励,优化长序列任务中的信用分配,显著提升模型工具使用能力。该方法在无需额外训练Critic的情况下,提供了稳定的奖励信号,增强了RL训练的效率和效果。

新颖性

首次将冻结模型的对数概率比值作为状态值,结合时间差分方法实现长序列奖励密集分配,突破了传统仅用终点奖励的限制。区别于现有的过程监督或训练Critic的方法,TRACE无需额外标签或模型训练,简洁高效,具有创新性。其端点望远镜特性确保奖励的端点一致性,提供更精细的行为指导。

局限性

  • 该方法依赖于冻结参考模型的稳定性,模型偏差可能影响奖励估算。
  • 在极端复杂或偏离训练分布的任务中,奖励信号可能不足以引导学习。
  • 计算成本较高,尤其在大规模模型和长序列中,模型前向推理频繁,影响训练效率。

未来方向

未来可结合动态调整参考模型策略,增强奖励的鲁棒性;探索多模态、多任务场景中的奖励分配机制;结合模仿学习或监督信号,进一步提升长序列任务的学习效率。

AI 总览摘要

随着大规模语言模型在多轮任务中的应用逐渐普及,如何有效解决长序列中的奖励稀疏与高方差问题成为关键挑战。传统方法多依赖终点奖励,难以提供细粒度的行为指导,限制了模型在复杂任务中的表现。本文提出TRACE,一种基于信用估算的逐轮奖励分配机制,通过利用冻结参考模型在工具调用边界的状态评估,结合时间差分(TD)方法,计算每个工具调用对答案预测的贡献。该机制无需训练Critic或过程标签,极大简化了奖励设计流程。实验证明,纯RL训练下,Qwen3-4B模型在深度搜索任务中的得分从7.2提升至35.6,Qwen3-30B-A3B从8.4到42.6,效果优于多种基线。训练曲线提前改善,收敛更快,且迁移到开放网络任务中表现优异,显示出强大的泛化能力。这一创新为长序列任务中的强化学习提供了新思路,有望推动自主代理在Web搜索、编程辅助等领域的广泛应用。未来,结合动态参考模型和多模态场景,将进一步提升方法的鲁棒性和适应性。

深度分析

研究背景

近年来,深度学习推动大规模语言模型(如GPT、BERT)在自然语言理解和生成中取得突破。强化学习(RL)结合奖励机制,增强模型自主探索能力,尤其在多轮交互任务中表现突出。早期工作如ReAct结合推理与行动,提升任务复杂度处理能力。随后,基于奖励信号的微调(如RLHF)改善模型表现,但仍面临奖励稀疏、方差大等问题。传统方法多依赖终点奖励,难以捕捉中间行为价值。过程监督和奖励模型虽提供细粒度反馈,但训练成本高,易偏离目标。长序列任务中的奖励稀疏性限制了模型探索效率,亟需更密集、稳定的奖励信号。

核心问题

长序列多轮任务中,奖励信号极度稀疏,导致模型难以学习有效的工具调用策略。终点奖励无法区分中间有用行为与无关操作,增加梯度方差,降低训练效率。传统奖励机制缺乏对中间行为的细粒度反馈,限制模型在复杂环境中的表现。如何在无需额外标签或Critic训练的情况下,提供密集且可靠的逐轮奖励,成为核心难题。这不仅关系到模型的探索能力,也影响到实际应用中的效率和效果。

核心创新

本研究提出TRACE,利用冻结的参考模型在工具调用边界评估答案的对数概率,转换为状态值指标。通过TD变化,动态计算每轮对答案预测的贡献,形成密集奖励信号。核心创新在于:• 采用模型的对数概率比值作为状态值,• 利用端点望远镜特性,避免冗余奖励,• 结合终点奖励,确保任务成功导向。该机制无需训练Critic或过程标签,简洁高效,显著改善长序列任务中的奖励分配问题,提升模型工具调用能力。

方法详解

  • �� 将长序列轨迹在工具调用边界拆分为前缀状态。• 使用冻结模型评估每个前缀的答案对数概率,得到对数概率值。• 转换为对数比值状态值,反映答案预测的接近程度。• 计算连续状态值的TD变化,作为逐轮奖励。• 结合终点奖励,确保任务成功导向。• 训练过程中,利用该奖励信号优化策略,提升工具调用效率。

实验设计

在深度搜索任务中,使用OpenResearcher数据集生成多文档检索场景,训练Qwen3-4B和30B模型。对比多种基线(如GRPO、GSPO),评估指标包括BrowseComp-Plus、GAIA等基准的得分。超参数包括:K=3,γ=0.8,奖励融合系数αout=1.0,αturn=0.2。采用纯RL训练,无微调或监督标签。通过 ablation 研究验证TD奖励的效果,分析奖励端点望远镜特性。

结果分析

TRACE在长序列任务中表现优异,Qwen3-4B模型得分从7.2提升至35.6,30B模型从8.4到42.6,超越多种对比方法。训练曲线提前改善,收敛速度加快,迁移到开放网络任务中表现稳定,验证了奖励机制的泛化能力。实验还显示,奖励的端点望远镜特性有效抑制冗余奖励干扰,增强学习效率。

应用场景

该方法适用于Web搜索、自动化问答、编程辅助等多轮交互场景。只需模型能进行多轮工具调用,配合冻结参考模型,即可实现高效学习。未来可结合多模态信息,扩展到视频、图像等多模态任务,推动自主代理的智能化发展。

局限与展望

依赖冻结模型的稳定性,偏差可能影响奖励准确性。在极端复杂或偏离训练分布的任务中,奖励信号可能不足。计算成本较高,尤其在大模型和长序列中,频繁推理影响效率。未来需优化模型推理效率和奖励鲁棒性。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,每次放调料、翻炒都像模型的每一步操作。有时候你会觉得某一步特别重要,比如加盐,能让菜变得更好。TRACE就像是一个聪明的助手,它会在你每次调料后,偷偷告诉你这一步是不是让菜变得更美味。它不用你告诉它“你做得好”或“做错了”,而是通过观察你每一步的变化,自己判断哪一步帮了大忙,哪一步没用。这样,你就能知道哪些动作真正让菜变得更好,而不用等到最后尝一口才知道结果。这个方法让你在做菜时,能更快学会哪些步骤最重要,做出更美味的菜。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,你要不停做出各种动作,比如跳跃、躲避、攻击。每次你做完动作后,游戏会告诉你得分,但这个得分只在最后告诉你你赢了还是输了。可是,你其实想知道每个动作是不是帮你赢得了比赛。TRACE就像是一个聪明的教练,它会在你每次动作后,偷偷告诉你这个动作是不是让你离胜利更近了。它不用看整个比赛的最终结果,也不用你告诉它哪个动作好,只靠观察每次动作后得分的变化,就能知道哪些动作最有效。这样,你就能更快学会怎么打这个游戏,变得更厉害。

原文摘要

Multi-turn agents solve complex tasks through extended sequences of tool interactions before producing a final answer, making credit assignment a fundamental challenge during post-training. Outcome rewards provide reliable supervision for short-horizon reasoning, but become sparse and high-variance as trajectories grow to tens or hundreds of tool calls. They can also be misleading: a failed rollout may contain many useful actions that move the agent closer to the goal, yet outcome-only training assigns them the same negative advantage as the eventual mistake. We propose TRACE (Turn-level Reward Assignment via Credit Estimation), a dense credit-assignment method for agentic reinforcement learning. TRACE represents rollouts as state transitions at tool-call boundaries, obtains gold-answer log-probabilities from a frozen reference model, transforms them into log-ratio state values, and derives per-action rewards as Temporal-Difference changes in those values. This requires no additional critic or process-label training, and its one-step log-ratio TD component telescopes across redundant tool calls. On long-horizon complex search, TRACE substantially improves base-model tool-use ability using pure RL, without a cold-start supervised fine-tuning stage, an agentic mid-training stage, or training on live-web data. On the closed-web BrowseComp-Plus benchmark, it raises Qwen3-4B from $7.2$ to $35.6$ and Qwen3-30B-A3B from $8.4$ to $42.6$. The learned search behavior also transfers to open-web benchmarks, and the learning curves show earlier improvement and faster convergence during RL training.

cs.LG