SearchArt: Training Long-Horizon Search Agent with Scalable Synthetic and Verified Task
SearchArt利用验证驱动的合成与多阶段微调,提升长远搜索策略,参数27B,达74.39分。
核心发现
方法论
SearchArt通过Web增强的知识扩展、结构复杂的任务合成及难度排名,构建大规模长远搜索任务数据。采用基于验证的多阶段筛选,确保数据质量。结合监督微调与强化学习优化策略,训练具有自适应搜索规划和复杂推理能力的智能体。核心算法包括Web知识图谱构建、复杂关系采样及多层验证机制。模型参数为27B,显著优于同规模模型在深度搜索与研究任务中的表现。
关键结果
- 在BrowseComp-ZH得分74.39,BrowseComp70.06,Deepresearch-bench52.55,超越多数闭源前沿模型(如Gemini 3.1 Pro 85.9、GPT 5.5 84.4),显示出强大的长远推理和信息整合能力。
- 通过验证驱动的合成策略,有效提升中间推理行为的可靠性,模型在多任务环境中表现出更高的稳定性与效率。
- 多阶段微调结合强化学习,使模型在复杂搜索场景中展现出更优的策略适应性和 Evidence 聚合能力,显著改善长链推理的准确性。
研究意义
本研究突破了长远搜索任务数据稀缺的瓶颈,提出了可扩展的合成与验证框架,为自主信息检索和科学研究提供了新范式。其在模型规模有限的条件下,达到了与大型闭源模型相媲美甚至超越的性能,推动了AI自主搜索与推理技术的前沿发展。该方法有望在学术科研、智能问答、自动化决策等领域实现广泛应用,解决传统方法在复杂、多源、多步骤推理中的局限。
技术贡献
引入验证驱动的任务合成机制,结合Web知识图谱扩展、复杂关系采样和多阶段筛选,显著提升长远任务数据的质量和多样性。创新性地将监督微调与强化学习结合,优化搜索策略,增强模型的适应性和推理能力。提出的多层验证流程确保中间推理的可靠性,减少噪声和偏差,为大规模长远任务训练提供了技术保障。这些贡献推动了自主搜索智能体的研究边界,为未来模型的可解释性和可靠性奠定基础。
新颖性
首次系统性结合验证驱动的合成策略与多阶段筛选机制,解决了长远搜索任务中数据质量不足和推理不可靠的问题。不同于传统仅优化最终答案的训练方式,SearchArt强调中间推理的质量,创新性地引入多层验证流程,确保中间行为的合理性。这一方法在模型参数规模有限的情况下,仍实现了超越现有前沿模型的性能,具有重要的技术突破意义。
局限性
- 依赖大规模Web知识图谱的构建,可能受到网页信息质量和更新频率的限制,影响任务的多样性和真实性。
- 验证机制虽有效提升数据质量,但在极端复杂或偏离常识的任务中仍可能出现误判,影响模型的泛化能力。
- 训练过程复杂,计算成本高,模型在极端长远推理场景中的表现仍有待验证。
未来方向
未来将探索更高效的知识扩展与验证算法,降低训练成本,提升模型在极端复杂任务中的表现。计划引入多模态信息与知识图谱动态更新机制,增强模型的知识适应性。同时,将结合元学习与自监督技术,进一步提升模型的推理深度与泛化能力,推动自主搜索智能体的实际应用落地。
AI 总览摘要
随着大规模语言模型(LLMs)的快速发展,搜索智能体在信息检索和推理任务中展现出巨大潜力。传统方法受限于数据稀缺、推理中间行为难以评估,难以应对长远、多源、多步骤的复杂任务。SearchArt提出了一套创新框架,通过合成驱动的任务生成与多层验证机制,显著提升长远搜索策略的质量与效率。
该方法结合Web知识图谱扩展、复杂关系采样和多阶段筛选,构建了大规模、多样化的长远搜索任务数据集。模型在监督微调基础上,融入强化学习优化策略,实现了自适应搜索规划、证据聚合和复杂推理能力的提升。实验结果显示,参数仅27B的模型在多个深度搜索和研究基准中表现优异,得分达74.39(BrowseComp-ZH)、70.06(BrowseComp)和52.55(Deepresearch-bench),超越多数闭源前沿模型。
这一研究突破了长远任务数据的瓶颈,为自主信息检索和科学探索提供了新范式。未来,结合多模态知识和动态验证机制,有望推动智能搜索系统在学术、科研、决策等领域的广泛应用,开启AI自主推理的新纪元。
深度分析
研究背景
近年来,LLMs在自然语言理解和生成方面取得突破,代表性模型如GPT系列、BERT、T5等推动了智能问答和信息检索的发展。早期工作多依赖静态知识库或有限的检索策略,难以应对长链、多源信息融合的复杂任务。近年来,研究者开始探索多轮推理、工具使用和自主搜索策略,如ReAct、Toolformer等,旨在提升模型的推理深度和自主性。然而,长远搜索任务仍受数据不足、验证困难和策略不稳定的限制,亟需新的数据合成和验证机制以突破瓶颈。
核心问题
当前长远搜索智能体面临的核心问题是缺乏高质量、多样化的训练数据,难以评估中间推理行为的可靠性,导致模型在复杂任务中表现不稳定。传统数据集多偏重最终答案的正确性,忽视中间推理路径的合理性。此外,缺乏有效的验证机制,容易引入噪声和偏差,限制模型的推理深度和策略适应性。这些问题阻碍了自主搜索智能体在科学研究、决策支持等领域的广泛应用。
核心创新
本研究的核心创新包括:1)提出验证驱动的合成框架,结合Web知识图谱扩展和复杂关系采样,生成高质量长远任务数据;2)引入多层验证流程,确保中间推理的可靠性,减少噪声干扰;3)结合监督微调与强化学习,优化搜索策略,提升模型的适应性和推理深度。这些创新突破了以往仅关注最终答案的训练方式,为长远搜索任务提供了系统性解决方案。
方法详解
- �� 任务合成:利用Web增强的知识扩展,采样低度曝光、结构丰富、领域均衡的种子实体,构建大规模知识图谱。• 复杂关系采样:从知识图谱中采样子图,控制结构复杂度和证据分散度,生成多样化任务。• 任务验证:多层筛选,包括QA一致性验证、路径可靠性评估和证据相关性检测,确保数据质量。• 微调与强化:先进行监督微调,后结合强化学习优化策略,训练模型具备长链推理和自适应搜索能力。
实验设计
在多个公开深度搜索和研究基准(如BrowseComp、Deepresearch-bench)上评估,模型参数为27B。采用指标包括任务完成率、准确率和推理路径合理性。对比基线模型如GPT-4、Gemini 3.1 Pro,结果显示SearchArt显著优于对比模型,尤其在长链推理和证据整合方面表现优异。还进行了消融实验,验证验证机制和知识扩展的贡献。
结果分析
模型在所有测试集上均取得优异成绩,尤其在长链推理任务中表现出色。得分达74.39(BrowseComp-ZH)、70.06(BrowseComp)、52.55(Deepresearch-bench),超越多数现有模型。验证机制有效提升中间推理的可靠性,模型在复杂多源信息融合中表现出更高的稳定性。微调和强化学习的结合显著改善模型的策略适应性和证据聚合能力。
应用场景
该方法适用于科学研究、法律分析、技术调研等需要长链推理和多源信息整合的场景。模型可作为自主科研助手或智能问答系统,支持复杂问题的深度探索。未来结合多模态信息,将扩展其在医学、工程等领域的应用潜力。
局限与展望
依赖Web知识图谱的质量和更新频率,可能影响任务多样性和真实性。验证机制在极端复杂或偏离常识的任务中仍存在误判风险。训练成本较高,模型在极端长远推理中的表现尚需验证。未来需优化知识扩展和验证效率,降低成本。
通俗解读 非专业人士也能看懂
想象你在一家大型工厂工作,工厂里有许多不同的机器和流程。每个任务就像是让工厂完成一项复杂的生产线,比如制造一辆汽车。为了完成这项任务,你需要不断查找不同的零件、工具和操作步骤。传统的方法就像是只知道最终组装完毕,但不知道每个步骤怎么做,也不知道每个零件在哪。SearchArt就像是给工厂配备了智能助手,它可以自己查资料、找到需要的零件、验证每个步骤是否正确,确保每个环节都合理。这个助手会不断学习,变得越来越聪明,能应对各种复杂的生产任务,保证每一步都可靠,最终让工厂高效、准确地完成目标。这种方式比以前只靠人工经验要可靠得多,也能处理更复杂的任务。
简单解释 像给14岁少年讲一样
想象你在学校里做一个超级难的科学项目,你需要查很多资料、做实验,还要确保每一步都正确。以前,你可能需要花很多时间去翻书、问老师,但有了这个新方法,就像有个聪明的朋友帮你查资料、整理信息,还会告诉你哪些步骤最重要。这个朋友会自己找网页上的资料,验证信息的正确性,确保你做的每个步骤都靠谱。它还能帮你规划整个项目,让你一步步完成得更快更好。虽然这个朋友很聪明,但它还在学习阶段,有时候也会出错,需要你帮忙检查。未来,它会变得更聪明,帮你解决更复杂的问题,就像一个超级助手一样,让学习变得更轻松、更有趣!
原文摘要
Recent advances in large language models (LLMs) have enabled search agents to autonomously tackle complex tasks across extended search and reasoning horizons. However, training effective search agents remains challenging due to the lack of scalable and long-horizon tasks, and the difficulty of evaluating and correcting intermediate reasoning and tool-use behaviors. We introduce SearchArt, a scalable framework for training long-horizon search agents through verification-driven task synthesis and a multi-stage post-training pipeline. SearchArt constructs large-scale datasets for complex search-, research- and user-oriented tasks by synthesizing diverse information-seeking QA pairs and corresponding search trajectories from web documents and automatically generated evidence graphs. To ensure the reliability of the synthesized data, we design a verification pipeline that jointly evaluates QA consistency, trajectory quality, and the relevance of retrieved evidence. The verified trajectories are subsequently used in a multi-stage training process comprising supervised fine-tuning and reinforcement learning-based policy optimization. Search agents trained with SearchArt exhibit adaptive search planning, iterative evidence aggregation, and complex reasoning over extended interaction horizons. Experimental results demonstrate that, with only (Qwen3.5-) 27B parameters, SearchArt scores 74.39 on BrowseComp-ZH, 70.06 on BrowseComp, and 52.55 on Deepresearch-bench, matching or surpassing frontier closed-source agents on both deepsearch and deepresearch benchmarks.