Critical-State RL: Diagnosing Trainable States for Multi-Turn Tool Use

TL;DR

Critical-State RL通过诊断多轮工具使用中的可训练状态提升任务成功率,缺失功能任务提高约14个百分点。

cs.LG 🔴 高级 2026-09-22 5 次浏览
Zixiang Chen Wenting Zhao Zhepeng Cen Akshara Prabhakar Jielin Qiu Jianguo Zhang Zhiwei Liu Tulika Manoj Awalgaonkar Liangwei Yang Shelby Heinecke Silvio Savarese Huan Wang
强化学习 多轮交互 工具使用 状态诊断 上下文训练

核心发现

方法论

Critical-State RL通过嵌套采样分离动作依赖的奖励变化与后续噪声,使用上下文赌博机训练优化策略。该方法在多轮交互中识别可训练状态,评估每个奖励是否捕捉了动作对任务成功的影响,并判断是否能超越参考策略。

关键结果

  • 在Berkeley Function Calling Leaderboard (BFCL) v4上,缺失功能任务的诊断选择工具可用后的响应进行训练,性能提高约14个百分点。
  • 缺失参数任务中,选择在参数提供前的响应进行训练,性能提高约3.8个百分点。
  • 训练替代响应未能改善性能,甚至可能恶化。

研究意义

该研究通过识别多轮交互中的关键状态,解决了奖励变化无法揭示哪些调用需要训练的问题。它为多轮工具使用中的状态选择提供了新的思路,具有重要的学术和工业价值,尤其是在复杂任务的优化中。

技术贡献

提出了一种无需训练的诊断方法,通过分离动作依赖的奖励变化与后续噪声,指导局部训练。该方法与现有状态选择方法相比,提供了新的理论保证和工程可能性。

新颖性

首次在多轮交互中通过嵌套采样分离奖励变化与噪声,诊断可训练状态。这一创新与现有的状态选择方法相比,提供了新的视角和工具。

局限性

  • 在某些情况下,诊断可能无法准确识别所有关键状态,尤其是在复杂的任务环境中。
  • 该方法的计算成本可能较高,尤其是在大规模数据集上。
  • 需要进一步研究以验证在不同任务和模型上的普适性。

未来方向

未来工作可以探索该方法在更多任务和模型上的应用,尤其是在实时系统中的表现。此外,研究如何降低计算成本也是一个重要方向。

AI 总览摘要

多轮工具使用中的失败往往取决于单个模型调用,但仅靠奖励变化无法揭示哪些调用需要训练。Critical-State RL通过识别多轮交互中的可训练状态,解决了这一问题。该方法使用嵌套采样分离动作依赖的奖励变化与后续噪声,并在选定状态下使用上下文赌博机训练优化策略。

在Berkeley Function Calling Leaderboard (BFCL) v4的实验中,Critical-State RL在缺失功能任务中选择工具可用后的响应进行训练,性能提高约14个百分点。在缺失参数任务中,选择在参数提供前的响应进行训练,性能提高约3.8个百分点。训练替代响应未能改善性能,甚至可能恶化。

该研究为多轮工具使用中的状态选择提供了新的思路,具有重要的学术和工业价值。未来工作可以探索该方法在更多任务和模型上的应用,尤其是在实时系统中的表现。此外,研究如何降低计算成本也是一个重要方向。

深度分析

研究背景

多轮工具使用涉及一系列模型决策,但轨迹级别的奖励无法识别哪些决策需要训练。现有研究主要关注回合级别的信用分配和局部训练的状态选择,但这些方法未能解决奖励变化无法揭示哪些调用需要训练的问题。

核心问题

多轮工具使用中的失败往往取决于单个模型调用,但仅靠奖励变化无法揭示哪些调用需要训练。这一问题的关键在于如何识别出对任务成功有显著影响的状态。

核心创新

Critical-State RL通过嵌套采样分离动作依赖的奖励变化与后续噪声,诊断可训练状态。这一创新使得在多轮交互中能够更准确地识别需要训练的状态。

方法详解

  • �� 任务定义候选调用和局部奖励。
  • �� 使用嵌套采样分离动作依赖的奖励变化与后续噪声。
  • �� 通过上下文赌博机训练优化策略。
  • �� 在选定状态下进行局部训练。

实验设计

在Berkeley Function Calling Leaderboard (BFCL) v4上进行实验,比较诊断选择状态与替代状态的训练效果。使用缺失功能和缺失参数任务进行测试,记录性能变化。

结果分析

在缺失功能任务中,选择工具可用后的响应进行训练,性能提高约14个百分点。在缺失参数任务中,选择在参数提供前的响应进行训练,性能提高约3.8个百分点。

应用场景

该方法可用于多轮工具使用中的状态选择,尤其是在需要优化复杂任务的情况下。它可以帮助识别对任务成功有显著影响的状态,从而提高模型性能。

局限与展望

该方法在某些情况下可能无法准确识别所有关键状态,尤其是在复杂的任务环境中。此外,计算成本可能较高,尤其是在大规模数据集上。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你需要在正确的时间使用正确的工具,比如在煮沸之前不要放盐。Critical-State RL就像是一个聪明的助手,它会告诉你什么时候该用哪个工具,以确保你的菜肴成功。它通过观察每一步的效果,来判断哪一步最需要改进,就像在做饭时确保每个步骤都完美无缺。

简单解释 像给14岁少年讲一样

想象你在玩一个需要用工具解决问题的游戏。有时候,你需要在正确的时间使用正确的工具。Critical-State RL就像是游戏中的一个提示系统,它会告诉你什么时候该用哪个工具,以确保你能顺利过关。它会观察你的每一步操作,然后告诉你哪一步需要改进,就像在游戏中确保每个步骤都完美无缺。

术语表

Critical-State RL (关键状态强化学习)

一种用于识别多轮交互中可训练状态的方法,通过嵌套采样分离动作依赖的奖励变化与后续噪声。

用于诊断多轮工具使用中的可训练状态。

Nested Sampling (嵌套采样)

一种用于分离动作依赖的奖励变化与后续噪声的技术。

用于Critical-State RL中识别可训练状态。

Contextual-Bandit Training (上下文赌博机训练)

一种用于在选定状态下优化策略的训练方法。

用于Critical-State RL中优化策略。

Berkeley Function Calling Leaderboard (BFCL)

一个用于评估多轮工具使用任务的基准数据集。

用于验证Critical-State RL的有效性。

Action-dependent Reward Variation (动作依赖的奖励变化)

指奖励变化中由当前动作引起的部分。

用于Critical-State RL中分离奖励变化。

开放问题 这项研究留下的未解疑问

  • 1 如何在复杂任务环境中更准确地识别关键状态仍需进一步研究。
  • 2 降低计算成本以便在大规模数据集上应用是一个重要方向。
  • 3 探索该方法在实时系统中的表现仍需进一步验证。

应用场景

近期应用

多轮工具使用优化

帮助识别对任务成功有显著影响的状态,提高模型性能。

远期愿景

实时系统应用

探索该方法在实时系统中的表现,尤其是在复杂任务环境中的应用。

原文摘要

Multi-turn tool-use failures can hinge on a single model call, yet reward variation alone does not reveal which call would benefit from training. When rewards depend on later interactions, their variation can reflect downstream randomness rather than differences between the current actions. We introduce Critical-State RL to identify trainable states in multi-turn interactions. Given task-defined candidate calls and local rewards, the method assesses whether each reward captures the action's effect on task success and whether improvement over a reference policy is possible. It then uses nested sampling to separate action-dependent reward variation from continuation noise and optimizes the policy at the selected states using contextual-bandit training. Experiments on the Berkeley Function Calling Leaderboard (BFCL) v4 compare training at diagnostic-selected states with training at alternative states. For missing-function tasks, the diagnostic selects the response after the tool becomes available; for missing-argument tasks, it selects the response before the missing argument is supplied. Training the selected responses improves performance, including about 14 percentage points on the missing-function task, while training the alternatives leaves performance flat or worse. We further apply the recipe across models and tasks, including logged repeat-call avoidance and memory management.

cs.LG cs.CL