SearchMaster: Grounded and Regulated Self-Play for Search Agents

TL;DR

SearchMaster通过自我博弈提升搜索代理的准确率,从38.19%提高到51.52%。

cs.AI 🔴 高级 2026-08-03 31 次浏览
Wentao Tan Qiong Cao Jiaqi Wang Nan Duan
自我博弈 搜索代理 多跳检索 深度学习 强化学习

核心发现

方法论

SearchMaster采用自我博弈框架,通过生成、解决和验证搜索任务来训练单个LLM。其核心机制包括证据链生成器(ECG)、搜索深度奖励(SDR)和过度打开惩罚(OOP),分别用于减少伪多跳问题、通过搜索深度评估任务难度以及限制文档打开次数。

关键结果

  • 在BrowseComp-Plus基准上,SearchMaster将Qwen3.5-9B模型的准确率从30.12%提升到60.24%,显著超过其他开源和专有模型。
  • 在六个深度搜索基准上,平均准确率从38.19%提升到51.52%。
  • 消融研究表明,ECG、SDR和OOP机制均对性能提升有贡献。

研究意义

SearchMaster展示了无需人工标注数据或专家演示的情况下,通过自我博弈生成高质量搜索数据的潜力。该方法在学术界和工业界具有重要意义,尤其是在减少数据获取成本和提高搜索代理性能方面。

技术贡献

SearchMaster通过引入证据链生成、搜索深度奖励和过度打开惩罚,解决了自我博弈中的伪多跳问题和工具使用不当的问题,为搜索代理的训练提供了新的技术路径。

新颖性

SearchMaster首次将证据链生成与搜索深度奖励结合,用于搜索代理的自我博弈训练,显著提升了多跳检索任务的质量和难度。

局限性

  • 该方法在某些情况下可能生成过于复杂的任务,导致模型无法有效解决。
  • 搜索深度奖励可能导致过度复杂的搜索路径。

未来方向

未来工作可以探索如何在更大规模的搜索环境中应用SearchMaster,并结合更多的外部知识库以提升模型的泛化能力。

AI 总览摘要

SearchMaster是一种创新的自我博弈框架,用于训练大型语言模型(LLM)作为搜索代理。传统的搜索代理训练依赖于人工标注的数据或专家演示,而SearchMaster通过自我生成、解决和验证任务,减少了对外部数据的依赖。

该方法的核心在于三个机制:证据链生成器(ECG)用于减少伪多跳问题,搜索深度奖励(SDR)通过搜索深度评估任务难度,过度打开惩罚(OOP)限制文档打开次数。这些机制共同作用,确保生成的任务具有挑战性且真实。

实验结果表明,SearchMaster在多个基准上显著提升了模型的准确率,尤其是在BrowseComp-Plus上,准确率提升了30.1个百分点。这表明,通过自我博弈生成的高质量数据可以有效提高搜索代理的性能,而无需依赖人工标注或专家指导。

深度分析

研究背景

近年来,基于大型语言模型(LLM)的搜索代理在知识密集型问答中表现出色。然而,这些模型通常依赖于人工标注的数据或专家演示来进行训练,获取这些数据的成本高昂且耗时。SearchMaster通过自我博弈框架,旨在解决这一问题。

核心问题

训练高效的搜索代理需要高质量的搜索数据,这些数据需要真实的多跳检索任务和有效的搜索工具使用。然而,现有方法依赖于人工标注或专家演示,难以大规模获取。

核心创新

SearchMaster的核心创新在于其自我博弈框架,包括:

  • �� 证据链生成器(ECG):减少伪多跳问题。
  • �� 搜索深度奖励(SDR):通过搜索深度评估任务难度。
  • �� 过度打开惩罚(OOP):限制文档打开次数。

方法详解

SearchMaster的训练过程包括以下步骤:

  • �� 证据链生成器(ECG)生成任务,确保问题需要跨文档证据。
  • �� 搜索深度奖励(SDR)根据成功搜索的深度评估任务难度。
  • �� 过度打开惩罚(OOP)限制文档打开次数,避免浅层浏览。
  • �� 使用GRPO优化验证的提议者和求解者的回滚。

实验设计

实验在六个深度搜索基准上进行,包括BrowseComp-Plus和其他在线搜索基准。使用Qwen3.5-9B作为基础模型,评估了SearchMaster在不同数据集上的性能提升。

结果分析

SearchMaster在BrowseComp-Plus基准上将准确率从30.12%提升到60.24%,在其他五个在线搜索基准上也表现出色,显示了其在不同环境下的泛化能力。

应用场景

SearchMaster可用于训练无需人工标注数据的搜索代理,适用于需要高效信息检索的领域,如法律、医学和学术研究。

局限与展望

尽管SearchMaster在多个基准上表现出色,但在某些复杂任务上仍可能表现不佳。此外,过度依赖搜索深度奖励可能导致搜索路径过于复杂。

通俗解读 非专业人士也能看懂

想象你在一个图书馆中寻找一本特定的书。你需要从不同的书架上找到相关的书籍信息,然后将这些信息组合起来找到你要的书。这就像SearchMaster的工作方式:它生成任务,找到不同文档中的信息,并将这些信息组合起来以回答问题。通过这种方式,它可以在不依赖人工帮助的情况下提高搜索效率。

简单解释 像给14岁少年讲一样

嘿,小伙伴!想象一下你在玩一个寻宝游戏。你需要找到不同的线索,这些线索藏在不同的地方。每找到一个线索,你就离宝藏更近一步!SearchMaster就像你的寻宝助手,它会帮你找到所有的线索,然后告诉你宝藏在哪里。是不是很酷?

术语表

自我博弈 (Self-Play)

一种让模型自我生成任务并从中学习的方法。

用于训练搜索代理以减少对外部数据的依赖。

证据链生成器 (Evidence-Chain Generator)

生成需要跨文档证据的问题的机制。

用于减少伪多跳问题。

搜索深度奖励 (Search-Depth Reward)

通过搜索深度评估任务难度的机制。

用于确保任务具有挑战性。

过度打开惩罚 (Over-Opening Penalty)

限制文档打开次数的机制。

用于避免浅层浏览。

GRPO

一种用于优化模型训练的策略。

用于优化验证的提议者和求解者的回滚。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模的搜索环境中应用SearchMaster仍需探索。
  • 2 结合更多外部知识库以提升模型的泛化能力是未来的研究方向。

应用场景

近期应用

法律信息检索

SearchMaster可用于法律领域的信息检索,帮助律师快速找到相关案例和法律条文。

远期愿景

医学研究

在医学研究中,SearchMaster可以帮助研究人员快速检索相关文献和研究成果,推动医学进步。

原文摘要

Training LLM-based search agents requires high-quality search data: tasks that demand genuine multi-hop retrieval and trajectories that use search tools effectively. Existing pipelines often depend on human-written tasks, expert demonstrations, or stronger teacher models. We present SearchMaster, a self-play framework that trains a single LLM from search tasks it generates, solves, and verifies in a local search environment. The key challenge is that self-generated tasks and rollouts can yield misleading signals: pseudo multi-hop questions, success-rate difficulty estimates that ignore search depth, and rollouts with excessive opening but little targeted evidence acquisition. SearchMaster addresses these failure modes with three controls. An Evidence-Chain Generator (ECG) grounds task generation in explicit cross-document evidence chains to reduce pseudo multi-hop questions. A Search-Depth Reward (SDR) scores task difficulty by the search depth of successful rollouts rather than success rate alone, keeping retained tasks search-intensive. An Over-Opening Penalty (OOP) regulates tool use by discouraging excessive document opening, avoiding long but shallow browsing. Verified Proposer and Solver rollouts are then jointly optimized with GRPO. Across six deep-search benchmarks, SearchMaster improves a Qwen3.5-9B backbone from 38.19% to 51.52% average accuracy, with a 30.1-point gain on BrowseComp-Plus. These results show that grounded and regulated self-play can provide effective search-agent training data without human-labeled QA pairs or expert demonstrations. The code is available at https://github.com/WentaoTan/SearchMaster.

cs.AI