SlimSearcher: Training Efficiency-Aware Web Agents via Adaptive Reward Gating

TL;DR

SlimSearcher通过自适应奖励门控提高训练效率,工具调用减少17%-58%。

cs.LG 🔴 高级 2026-06-05 44 次浏览
Zequn Xie Junjie Wang Dan Yang Jie Feng Yue Shen Jian Wang Jinjie Gu
效率优化 深度学习 强化学习 信息检索 奖励机制

核心发现

方法论

SlimSearcher框架结合监督微调和强化学习,通过自适应奖励门控机制优化工具和令牌效率。首先在SFT阶段进行帕累托高效过滤,提取成功且经济的轨迹。然后在RL阶段通过动态奖励机制评估相对效率,避免绝对惩罚的偏短倾向。

关键结果

  • SlimSearcher在GAIA、BrowseComp和XBenchDeepSearch上减少工具调用17%-58%,同时保持或提高准确率。
  • 在GAIA数据集上,工具调用轮次减少48.4%,准确率提高到70%。
  • 在BrowseComp数据集上,工具调用轮次从63.70减少到47.63,准确率提高到0.447。

研究意义

SlimSearcher通过优化效率和准确性之间的帕累托前沿,解决了现有深度研究代理在复杂信息检索任务中的计算成本问题。该方法不仅提高了模型的搜索效率,还减少了不必要的工具调用和令牌消耗。

技术贡献

SlimSearcher提出了自适应效率锚定机制,通过动态奖励结构优化工具和令牌使用,显著减少了计算资源的浪费。与现有方法相比,该框架在效率和准确性之间取得了更好的平衡。

新颖性

SlimSearcher首次将效率优化整合到整个训练管道中,通过自适应奖励门控避免了奖励黑客问题,确保模型在保持任务准确性的同时减少计算冗余。

局限性

  • 在某些复杂任务中,模型可能仍然依赖外部工具,导致效率下降。
  • 自适应奖励机制的参数设置可能影响模型的稳定性。
  • 在极端长时间任务中,效率优化效果可能有限。

未来方向

未来工作可以探索更多的动态奖励结构和自适应参数设置,以进一步提高模型的效率和稳定性。

AI 总览摘要

SlimSearcher是一种新型框架,通过自适应奖励门控提高深度研究代理的训练效率。现有模型在复杂信息检索任务中表现出色,但计算成本高昂。SlimSearcher通过监督微调和强化学习结合的方式,优化工具和令牌效率,减少不必要的调用和消耗。

在实验中,SlimSearcher在多个长时间基准测试上表现出色,工具调用轮次减少17%-58%,同时保持或提高了准确率。该方法通过动态奖励机制评估相对效率,避免了绝对惩罚的偏短倾向,确保了任务的准确性。

虽然SlimSearcher在效率优化方面取得了显著进展,但在某些复杂任务中仍然存在依赖外部工具的问题。未来的研究可以探索更多的动态奖励结构和自适应参数设置,以进一步提高模型的效率和稳定性。

深度分析

研究背景

近年来,深度学习模型在信息检索任务中取得了显著进展,但其计算成本仍然是一个重要问题。现有方法通常采用暴力策略,依赖外部工具进行冗余的推理和验证,导致资源浪费。SlimSearcher旨在通过优化效率和准确性之间的帕累托前沿,解决这一问题。

核心问题

深度研究代理在复杂信息检索任务中表现出色,但其计算成本高昂。现有模型通常依赖外部工具进行冗余的推理和验证,导致资源浪费。如何在保持任务准确性的同时优化计算效率,是一个重要且困难的问题。

核心创新

SlimSearcher提出了一种结合监督微调和强化学习的框架,通过自适应奖励门控机制优化工具和令牌效率。与现有方法不同,该框架通过动态奖励结构评估相对效率,避免了绝对惩罚的偏短倾向。

方法详解

  • �� 在SFT阶段进行帕累托高效过滤,提取成功且经济的轨迹。
  • �� 在RL阶段通过自适应奖励门控机制评估相对工具和令牌效率。
  • �� 通过严格的正确性门控避免奖励黑客问题,确保任务的准确性。

实验设计

实验在GAIA、BrowseComp和XBenchDeepSearch等长时间基准测试上进行。我们使用多维度框架评估任务成功率、工具调用轮次和令牌消耗。与现有方法相比,SlimSearcher在效率和准确性之间取得了更好的平衡。

结果分析

SlimSearcher在多个基准测试上减少工具调用17%-58%,同时保持或提高了准确率。在GAIA数据集上,工具调用轮次减少48.4%,准确率提高到70%。在BrowseComp数据集上,工具调用轮次从63.70减少到47.63,准确率提高到0.447。

应用场景

SlimSearcher可用于优化复杂信息检索任务中的计算效率,减少不必要的工具调用和令牌消耗。它可以应用于商业搜索引擎和开放源代码代理,提高系统的适应性和效率。

局限与展望

虽然SlimSearcher在效率优化方面取得了显著进展,但在某些复杂任务中仍然存在依赖外部工具的问题。自适应奖励机制的参数设置可能影响模型的稳定性。在极端长时间任务中,效率优化效果可能有限。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你可以选择使用大量的工具来准备食材,比如切菜机、搅拌器等,但这可能会浪费时间和资源。SlimSearcher就像一个聪明的厨师,它知道什么时候使用工具,什么时候依靠自己的技能。它通过优化工具使用和减少不必要的步骤,确保你能快速高效地完成美味佳肴。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你需要找到隐藏的宝藏。你可以选择使用各种工具来帮助你,比如地图、指南针等,但这可能会浪费时间。SlimSearcher就像一个聪明的玩家,它知道什么时候使用工具,什么时候依靠自己的直觉。它通过优化工具使用和减少不必要的步骤,帮助你快速找到宝藏!

术语表

帕累托前沿 (Pareto Frontier)

在优化问题中,帕累托前沿表示效率和准确性之间的最佳平衡点。

SlimSearcher通过优化帕累托前沿提高训练效率。

自适应奖励门控 (Adaptive Reward Gating)

一种动态奖励机制,用于评估工具和令牌效率。

在RL阶段使用自适应奖励门控优化效率。

监督微调 (Supervised Fine-Tuning)

通过过滤轨迹提高模型的效率意识。

SlimSearcher在SFT阶段进行帕累托高效过滤。

工具调用轮次 (Tool-Call Rounds)

模型在任务中调用外部工具的平均次数。

SlimSearcher减少工具调用轮次,提高效率。

令牌消耗 (Token Consumption)

模型在任务中生成的平均令牌数量。

SlimSearcher优化令牌消耗,减少计算冗余。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端长时间任务中进一步优化效率?
  • 2 自适应奖励机制的参数设置如何影响模型稳定性?

应用场景

近期应用

商业搜索引擎

SlimSearcher可用于优化搜索引擎的计算效率,减少不必要的工具调用和令牌消耗。

远期愿景

开放源代码代理

SlimSearcher可应用于开放源代码代理,提高系统的适应性和效率。

原文摘要

Deep research agents have demonstrated remarkable capabilities in complex information-seeking tasks, yet this power comes at a steep computational cost. Driven by accuracy-focused training paradigms, current models adopt brute-force strategies characterized by blind tool dependency and performative reasoning-generating long, redundant trajectories that are far from necessary for resolving these tasks, leading to wasteful tool calls and excessive token consumption. To overcome this efficiency trap, we propose SlimSearcher, a principled framework that pushes the Pareto frontier between accuracy and computational cost across both Supervised Fine-Tuning (SFT) and Reinforcement Learning (RL). In the SFT stage, SlimSearcher employs Pareto-efficient filtration to distill trajectories that are both successful and economical, guiding the model toward inherently efficiency-aware search behaviors. During RL, we introduce Adaptive Reward Gating, a dynamic reward-shaping mechanism that evaluates relative tool and token efficiency within a sampled cohort. By cascading these adaptive efficiency metrics with a strict correctness gate, our approach effectively avoids the brevity bias associated with absolute penalties and mitigates reward hacking. Extensive experiments on long-horizon benchmarks, including GAIA, BrowseComp, and XBenchDeepSearch, demonstrate that SlimSearcher reduces average tool-call rounds by 17%-58% while maintaining or improving accuracy.

cs.LG cs.AI