DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment
DeepSearch-Evolve在DeepSearch-World中实现自蒸馏,HotpotQA上达到93.4%。
核心发现
方法论
DeepSearch-Evolve是一个自蒸馏框架,利用DeepSearch-World环境进行训练。该环境提供420K多跳问答任务,通过实体级随机游走构建,支持进度验证、反思和失败恢复等关键认知行为。框架通过生成轨迹、过滤、数据混合和微调来迭代训练更强的代理。
关键结果
- DeepSearch-World-9B在HotpotQA上达到93.4%,在BrowseComp上达到31.2%,在GAIA上达到61.5%,显示出与开源代理竞争的性能。
- 在BrowseComp-ZH上,DeepSearch-World-9B取得了36.4%的成绩,相较于基线提升显著。
- 通过轨迹过滤和ReAct转换,模型在工具使用和实体命中率上表现出色。
研究意义
该研究展示了可验证环境如何支持长时间跨度的网络代理的可扩展自我进化。通过自蒸馏框架,代理能够从自身的工具使用经验中学习,而不依赖于更强模型的蒸馏。这为未来研究提供了一个新的方向,特别是在需要长时间交互的任务中。
技术贡献
DeepSearch-Evolve提供了一种新的自蒸馏方法,通过可验证的工具使用经验来训练代理。与现有方法相比,该框架不依赖于稀疏奖励或不可靠的密集监督,而是通过可控的过程级监督来实现代理的自我改进。
新颖性
这是首次在可验证环境中实现自蒸馏,利用环境的确定性来提供过程级监督。与现有方法相比,DeepSearch-Evolve不依赖于外部合成管道或更强模型的蒸馏。
局限性
- 当前环境基于维基百科,限制了覆盖范围和领域多样性。
- 更新规则依赖于自蒸馏,可能限制了泛化能力。
- 如何在RL训练中注入更高层次的能力仍未解决。
未来方向
未来可以扩展到更广泛的知识源,以提高泛化能力。此外,结合RL风格的更新可能进一步提高模型的灵活性和泛化能力。
AI 总览摘要
在深度搜索领域,训练能够自主改进的工具使用代理仍然是一个挑战。现有方法要么依赖于固定的教师蒸馏轨迹,要么依赖于稀疏奖励的强化学习,无法提供足够的监督。DeepSearch-Evolve框架在可验证的DeepSearch-World环境中实现了自蒸馏,提供了一个新的解决方案。
DeepSearch-World是一个确定性和可验证的环境,包含420K多跳问答任务,支持关键的认知行为,如进度验证、反思和失败恢复。通过生成轨迹、过滤、数据混合和微调,DeepSearch-Evolve能够迭代训练更强的代理,达到与开源代理竞争的性能。
实验结果显示,DeepSearch-World-9B在多个基准测试中表现优异,如HotpotQA上达到93.4%。这表明可验证环境能够支持长时间跨度的网络代理的可扩展自我进化。未来的研究可以探索更广泛的知识源和结合RL风格的更新,以进一步提高模型的泛化能力和灵活性。
深度分析
研究背景
近年来,大型语言模型的进步使得代理能够超越被动的文本生成,计划多步骤任务、制定搜索查询、阅读文档、浏览网页,并通过工具使用和迭代推理来改进答案。然而,使这些代理能够从自身交互中自主改进仍然是实现可扩展自我进化代理的关键挑战。
核心问题
现有方法要么依赖于固定的教师蒸馏轨迹,要么依赖于稀疏奖励的强化学习,无法提供足够的监督。长时间跨度的代理需要一个可验证的环境,以揭示中间工具使用决策的过程级监督。
核心创新
DeepSearch-Evolve框架通过在可验证的DeepSearch-World环境中实现自蒸馏,提供了一个新的解决方案。该环境提供420K多跳问答任务,支持关键的认知行为,如进度验证、反思和失败恢复。
方法详解
- �� DeepSearch-World环境提供确定性和可验证的工具使用经验。
- �� DeepSearch-Evolve框架通过生成轨迹、过滤、数据混合和微调来迭代训练代理。
- �� 通过过程级监督,代理能够从自身的工具使用经验中学习。
实验设计
实验在多个基准测试上进行,包括BrowseComp、GAIA和HotpotQA。使用420K多跳问答任务进行训练,并在验证集上进行性能评估。
结果分析
DeepSearch-World-9B在HotpotQA上达到93.4%,在BrowseComp上达到31.2%,在GAIA上达到61.5%,显示出与开源代理竞争的性能。
应用场景
该框架可以直接应用于需要长时间交互的任务,如复杂的问答系统和信息检索系统,具有广泛的行业影响。
局限与展望
当前环境基于维基百科,限制了覆盖范围和领域多样性。更新规则依赖于自蒸馏,可能限制了泛化能力。未来可以扩展到更广泛的知识源。
通俗解读 非专业人士也能看懂
想象你在一个图书馆里,有一个机器人助手帮助你找到答案。这个机器人可以自己学习,不断改进。DeepSearch-Evolve就像这个机器人助手,它在一个虚拟的、可验证的环境中进行训练,就像在一个安全的图书馆里。通过不断尝试和学习,它可以在没有老师的情况下变得更聪明。这个过程就像是机器人在图书馆里找到书籍、阅读和总结信息,然后在下次做得更好。
简单解释 像给14岁少年讲一样
嘿,想象一下你在玩一个游戏,游戏里有个超级聪明的助手,它能帮你找到所有答案!这个助手能自己学习,不断变得更聪明。DeepSearch-Evolve就是这样一个助手,它在一个虚拟世界里训练自己,就像在一个安全的游戏环境中。它能从自己的尝试中学习,不断改进,就像你在游戏中不断升级一样。是不是很酷?
术语表
Self-Distillation (自蒸馏)
一种训练方法,模型从自身生成的数据中学习,而不是依赖于外部教师模型。
在DeepSearch-Evolve中,代理通过自蒸馏从自身的工具使用经验中学习。
Verifiable Environment (可验证环境)
一个能够提供确定性和可验证反馈的训练环境。
DeepSearch-World是一个可验证环境,支持代理的自我进化。
Multi-hop QA (多跳问答)
需要通过多个步骤推理来回答的问题。
DeepSearch-World包含420K多跳问答任务,用于训练代理。
ReAct (反应格式)
一种用于训练代理的标准格式,包含计划、记忆和错误恢复等信息。
在DeepSearch-Evolve中,轨迹被转换为ReAct格式以进行训练。
Trajectory Filtering (轨迹过滤)
一种选择高质量训练数据的方法,通过过滤掉不符合标准的轨迹。
DeepSearch-Evolve通过轨迹过滤来提高训练数据的质量。
开放问题 这项研究留下的未解疑问
- 1 如何在更广泛的知识源上扩展可验证环境,以提高泛化能力。
- 2 如何在RL训练中注入更高层次的能力,如计划和错误恢复。
应用场景
近期应用
复杂问答系统
DeepSearch-Evolve可以用于训练能够处理复杂问答任务的系统,提供更准确的答案。
远期愿景
自动化信息检索
该技术可以在未来应用于自动化信息检索系统,提高信息获取的效率和准确性。
原文摘要
Training tool-use agents to improve from their own experience remains challenging, as supervised fine-tuning relies on fixed teacher-distilled trajectories, while sparse-reward reinforcement learning provides weak supervision for long-horizon interactions. We present DeepSearch-Evolve, a self-distillation framework for web agents built on DeepSearch-World, a deterministic and verifiable environment with reproducible search and page-reading tools. DeepSearch-World contains 420K multi-hop QA tasks constructed from entity-level random walks and supports key agentic cognitive behaviors useful for self-evolving, including progress verification, grounded reflection, and failure recovery. DeepSearch-Evolve iteratively performs trajectory generation, filtering, data mixing, and fine-tuning to train stronger agents. Without distillation from more capable models, DeepSearch-World-9B achieves competitive performance compared with open-source agents, reaching 31.2% on BrowseComp, 61.5% on GAIA, and 93.4% on HotpotQA, showing that verifiable environments enable scalable self-evolution for long-horizon web agents. We will release the environment, 420K training pool, validation set, model, and code to facilitate future research on self-improving deep search agents.