核心发现
方法论
SlimSearcher框架结合监督微调和强化学习,通过自适应奖励门控机制优化工具和令牌效率。首先在SFT阶段进行帕累托高效过滤,提取成功且经济的轨迹。然后在RL阶段通过动态奖励机制评估相对效率,避免绝对惩罚的偏短倾向。
关键结果
- SlimSearcher在GAIA、BrowseComp和XBenchDeepSearch上减少工具调用17%-58%,同时保持或提高准确率。
- 在GAIA数据集上,工具调用轮次减少48.4%,准确率提高到70%。
- 在BrowseComp数据集上,工具调用轮次从63.70减少到47.63,准确率提高到0.447。
研究意义
SlimSearcher通过优化效率和准确性之间的帕累托前沿,解决了现有深度研究代理在复杂信息检索任务中的计算成本问题。该方法不仅提高了模型的搜索效率,还减少了不必要的工具调用和令牌消耗。
技术贡献
SlimSearcher提出了自适应效率锚定机制,通过动态奖励结构优化工具和令牌使用,显著减少了计算资源的浪费。与现有方法相比,该框架在效率和准确性之间取得了更好的平衡。
新颖性
SlimSearcher首次将效率优化整合到整个训练管道中,通过自适应奖励门控避免了奖励黑客问题,确保模型在保持任务准确性的同时减少计算冗余。
局限性
- 在某些复杂任务中,模型可能仍然依赖外部工具,导致效率下降。
- 自适应奖励机制的参数设置可能影响模型的稳定性。
- 在极端长时间任务中,效率优化效果可能有限。
未来方向
未来工作可以探索更多的动态奖励结构和自适应参数设置,以进一步提高模型的效率和稳定性。
AI 总览摘要
SlimSearcher是一种新型框架,通过自适应奖励门控提高深度研究代理的训练效率。现有模型在复杂信息检索任务中表现出色,但计算成本高昂。SlimSearcher通过监督微调和强化学习结合的方式,优化工具和令牌效率,减少不必要的调用和消耗。
在实验中,SlimSearcher在多个长时间基准测试上表现出色,工具调用轮次减少17%-58%,同时保持或提高了准确率。该方法通过动态奖励机制评估相对效率,避免了绝对惩罚的偏短倾向,确保了任务的准确性。
虽然SlimSearcher在效率优化方面取得了显著进展,但在某些复杂任务中仍然存在依赖外部工具的问题。未来的研究可以探索更多的动态奖励结构和自适应参数设置,以进一步提高模型的效率和稳定性。
深度分析
研究背景
近年来,深度学习模型在信息检索任务中取得了显著进展,但其计算成本仍然是一个重要问题。现有方法通常采用暴力策略,依赖外部工具进行冗余的推理和验证,导致资源浪费。SlimSearcher旨在通过优化效率和准确性之间的帕累托前沿,解决这一问题。
核心问题
深度研究代理在复杂信息检索任务中表现出色,但其计算成本高昂。现有模型通常依赖外部工具进行冗余的推理和验证,导致资源浪费。如何在保持任务准确性的同时优化计算效率,是一个重要且困难的问题。
核心创新
SlimSearcher提出了一种结合监督微调和强化学习的框架,通过自适应奖励门控机制优化工具和令牌效率。与现有方法不同,该框架通过动态奖励结构评估相对效率,避免了绝对惩罚的偏短倾向。
方法详解
- �� 在SFT阶段进行帕累托高效过滤,提取成功且经济的轨迹。
- �� 在RL阶段通过自适应奖励门控机制评估相对工具和令牌效率。
- �� 通过严格的正确性门控避免奖励黑客问题,确保任务的准确性。
实验设计
实验在GAIA、BrowseComp和XBenchDeepSearch等长时间基准测试上进行。我们使用多维度框架评估任务成功率、工具调用轮次和令牌消耗。与现有方法相比,SlimSearcher在效率和准确性之间取得了更好的平衡。
结果分析
SlimSearcher在多个基准测试上减少工具调用17%-58%,同时保持或提高了准确率。在GAIA数据集上,工具调用轮次减少48.4%,准确率提高到70%。在BrowseComp数据集上,工具调用轮次从63.70减少到47.63,准确率提高到0.447。
应用场景
SlimSearcher可用于优化复杂信息检索任务中的计算效率,减少不必要的工具调用和令牌消耗。它可以应用于商业搜索引擎和开放源代码代理,提高系统的适应性和效率。
局限与展望
虽然SlimSearcher在效率优化方面取得了显著进展,但在某些复杂任务中仍然存在依赖外部工具的问题。自适应奖励机制的参数设置可能影响模型的稳定性。在极端长时间任务中,效率优化效果可能有限。
通俗解读 非专业人士也能看懂
想象你在厨房里做饭。你可以选择使用大量的工具来准备食材,比如切菜机、搅拌器等,但这可能会浪费时间和资源。SlimSearcher就像一个聪明的厨师,它知道什么时候使用工具,什么时候依靠自己的技能。它通过优化工具使用和减少不必要的步骤,确保你能快速高效地完成美味佳肴。
简单解释 像给14岁少年讲一样
想象你在玩一个游戏,你需要找到隐藏的宝藏。你可以选择使用各种工具来帮助你,比如地图、指南针等,但这可能会浪费时间。SlimSearcher就像一个聪明的玩家,它知道什么时候使用工具,什么时候依靠自己的直觉。它通过优化工具使用和减少不必要的步骤,帮助你快速找到宝藏!
术语表
帕累托前沿 (Pareto Frontier)
在优化问题中,帕累托前沿表示效率和准确性之间的最佳平衡点。
SlimSearcher通过优化帕累托前沿提高训练效率。
自适应奖励门控 (Adaptive Reward Gating)
一种动态奖励机制,用于评估工具和令牌效率。
在RL阶段使用自适应奖励门控优化效率。
监督微调 (Supervised Fine-Tuning)
通过过滤轨迹提高模型的效率意识。
SlimSearcher在SFT阶段进行帕累托高效过滤。
工具调用轮次 (Tool-Call Rounds)
模型在任务中调用外部工具的平均次数。
SlimSearcher减少工具调用轮次,提高效率。
令牌消耗 (Token Consumption)
模型在任务中生成的平均令牌数量。
SlimSearcher优化令牌消耗,减少计算冗余。
开放问题 这项研究留下的未解疑问
- 1 如何在极端长时间任务中进一步优化效率?
- 2 自适应奖励机制的参数设置如何影响模型稳定性?
应用场景
近期应用
商业搜索引擎
SlimSearcher可用于优化搜索引擎的计算效率,减少不必要的工具调用和令牌消耗。
远期愿景
开放源代码代理
SlimSearcher可应用于开放源代码代理,提高系统的适应性和效率。
原文摘要
Deep research agents have demonstrated remarkable capabilities in complex information-seeking tasks, yet this power comes at a steep computational cost. Driven by accuracy-focused training paradigms, current models adopt brute-force strategies characterized by blind tool dependency and performative reasoning-generating long, redundant trajectories that are far from necessary for resolving these tasks, leading to wasteful tool calls and excessive token consumption. To overcome this efficiency trap, we propose SlimSearcher, a principled framework that pushes the Pareto frontier between accuracy and computational cost across both Supervised Fine-Tuning (SFT) and Reinforcement Learning (RL). In the SFT stage, SlimSearcher employs Pareto-efficient filtration to distill trajectories that are both successful and economical, guiding the model toward inherently efficiency-aware search behaviors. During RL, we introduce Adaptive Reward Gating, a dynamic reward-shaping mechanism that evaluates relative tool and token efficiency within a sampled cohort. By cascading these adaptive efficiency metrics with a strict correctness gate, our approach effectively avoids the brevity bias associated with absolute penalties and mitigates reward hacking. Extensive experiments on long-horizon benchmarks, including GAIA, BrowseComp, and XBenchDeepSearch, demonstrate that SlimSearcher reduces average tool-call rounds by 17%-58% while maintaining or improving accuracy.