InfoSeeker: A Scalable Hierarchical Parallel Agent Framework for Web Information Seeking

TL;DR

InfoSeeker以Host–Manager–Worker层级并行架构,在WideSearch达8.38%成功率并提速3–5倍。

cs.AI 🟡 进阶级 2026-04-03 23 次浏览
Ka Yiu Lee Yuxuan Huang Zhiyuan He Huichi Zhou Weilin Luo Kun Shao Meng Fang Jun Wang
智能体搜索 层级架构 并行执行 网页信息合成 近可分解性

核心发现

方法论

InfoSeeker依据Simon的近可分解性,将系统划分为战略Host、领域Manager和工具Worker。Host生成高层步骤;Manager通过Decomp拆分子任务、并行调度Worker,并用Reflect验证、用Aggr汇总;Worker通过MCP执行搜索、浏览、代码和文件操作。只有步骤级摘要返回Host,形成MapReduce式闭环。

关键结果

  • 在WideSearch-en上,InfoSeeker取得8.38% Avg@4成功率和9.50% Max@4,超过最强多智能体基线OpenAI o3-high的5.10% Avg@4;Row-level F1为50.13%,Item-level F1为70.27%。
  • 在289题、11领域的BrowseComp-zh上,InfoSeeker准确率达52.9%,高于OpenAI DeepResearch的42.9%和BrowseMaster的46.5%,显示其能处理中文网页、多跳检索及跨页面证据对齐。
  • 效率实验中,WideSearch相对OpenAI和Gemini Deep Research分别快3.3倍和2.6倍;20个样本中,Worker由1增至17个使延迟从911秒降至162秒,约提速5.7倍。

研究意义

论文把智能体搜索的重点从单纯增加推理深度扩展到大规模证据合成。它针对上下文饱和、早期错误累积和串行延迟三个长期瓶颈,提供了可扩展的组织原则。对研究界而言,结果说明结构化分工可能比无限扩大上下文更关键;对产业而言,异构模型与并行工具调用可在控制成本的同时支持深度研究。

技术贡献

核心贡献是把近可分解系统原则落实为可运行的三层协议:Host仅维护(Q,t,y)步骤—响应状态,Manager封装分解、反思和聚合,Worker保留完整工具轨迹。算法1结合动态重规划、MCP上下文隔离与MapReduce调度,使推理深度和执行宽度独立扩展,并支持Search Manager与Browser Manager在受阻时协同升级。

新颖性

相较ReAct式MiroThinker、WebSailor及静态DAG并行方法,InfoSeeker并非只并行模型调用,而是在工作流层进行动态分解、验证、重试和摘要。其新意在于以层级上下文隔离同时解决质量与延迟问题;论文未声称提出全新的搜索工具或基础模型。

局限性

  • 系统依赖gpt-5.1、gpt-5-mini及Firecrawl、Playwright等外部API;工具不可用、反爬或CAPTCHA会改变性能,且公开实验未充分展示不同模型和并发预算下的稳健性。
  • 并行Worker增加调用量与协调复杂度,WideSearch平均成本约2美元、BrowseComp-zh约1美元;弱耦合假设失效时,错误摘要可能遮蔽关键证据。

未来方向

后续可研究自适应并发预算、跨Manager资源分配、摘要可信度校验和更强的证据溯源。还应开展系统消融、不同语言网页测试、工具失败率分析及成本—准确率曲线研究,以验证框架在真实生产环境中的稳定性。

AI 总览摘要

网页搜索正从回答一个问题转向汇总数十个来源中的完整证据。传统深度研究智能体依赖长串ReAct循环,容易出现上下文塞满、早期错误扩散和等待时间过长。InfoSeeker将这一任务视为“宽度”问题,而非单纯增加推理深度。

系统由Host、多个领域Manager和并行Worker组成。Host负责全局计划,Manager拆分、验证并汇总任务,Worker通过MCP调用搜索、浏览器、Python和文件系统工具。类似总指挥只看阶段报告,Host不接触底层轨迹,从而保持上下文紧凑;MapReduce式并行则让独立检索同时进行。

实验显示,InfoSeeker在WideSearch-en达到8.38% Avg@4成功率、70.27% Item F1,在BrowseComp-zh达到52.9%准确率。相较商业深度研究系统,其速度约快2.6–4.6倍;Worker从1增至17个时延迟从911秒降至162秒。该框架证明,合理的组织结构可以同时改善网页研究的完整性、速度与可扩展性,但API依赖、成本和摘要失真仍需解决。

深度分析

研究背景

Agentic search已从WebGPT、ReAct和RAG发展到GPT-Researcher、Open Deep Search及商业Deep Research。既有工作擅长多跳推理,却常以串行循环处理任务。WideSearch暴露出另一类需求:从大量异构网页发现实体、核验属性并填满表格,因此需要高覆盖率、上下文管理和低延迟。

核心问题

当任务要求汇总数十页网页时,单智能体会迅速耗尽上下文;串行ReAct会把早期检索错误带入后续步骤;固定流程又难以处理网页阻塞或证据缺口。核心问题是如何在保持全局规划和事实核验的同时,并行扩大执行宽度。

核心创新

  • ��层级隔离:Host只接收步骤级结果,避免底层轨迹污染全局上下文。•Manager自治:按领域完成Decomp、Reflect和Aggr,可针对搜索或浏览采用不同策略。•工作流并行:弱耦合子任务通过Worker池并发执行,而非仅并行token。•动态协作:搜索受阻时,Host可将任务升级给Browser Manager。

方法详解

  • ��Host输入Q,维护Ĉt=(Q,q0,y0,…,qt−1,yt−1),生成(qt,Manager)。
  • ��Manager将qt拆成{qk_t},并发派给Worker。
  • ��Worker通过MCP执行多轮工具调用,返回局部结果而非全部轨迹。
  • ��Reflect判断accept或revise,必要时重写子任务。
  • ��Aggr汇总为yt,Host更新状态并继续规划。
  • ��串行理论时间为Tseq=ΣΔ(qk),并行时间近似Tpar=max Δ(qk),受调度开销限制。

实验设计

WideSearch-en要求跨数十来源完成结构化表格,使用Success Rate、Row F1、Item F1及Avg@4/Max@4。BrowseComp-zh含289道、11领域中文网页问题,使用最终Accuracy。基线包括OpenAI o3-high、Claude Sonnet 4、Gemini Deep Research、OpenAI DeepResearch、WebSailor和BrowseMaster。Host/Manager使用gpt-5.1,Worker使用gpt-5-mini;工具包括Firecrawl、Playwright、Python和Filesystem。

结果分析

InfoSeeker在WideSearch达到8.38% Avg@4和9.50% Max@4,Row F1为50.13%、Item F1为70.27%,均领先表中基线。在BrowseComp-zh中以52.9%超过BrowseMaster的46.5%和OpenAI DeepResearch的42.9%。速度上,WideSearch相对OpenAI/Gemini快3.3/2.6倍;中文基准快3.9/4.6倍。

应用场景

适用于市场情报、产品比价、学术综述、政策监测和跨语言事实核查。部署时需要可访问的搜索与浏览工具、并发额度、证据存储及领域Manager;对企业而言,gpt-5.1规划与gpt-5-mini执行的异构配置可平衡质量和成本。

局限与展望

框架假设任务可被弱耦合拆分;实体发现、属性核验或因果推理若高度依赖共享状态,并行收益会下降。外部API、反爬、CAPTCHA和中文网页结构也可能造成失败。论文报告了总体性能和Worker规模实验,但缺少完整消融、错误类型、并发成本曲线与长期在线稳定性评估。

通俗解读 非专业人士也能看懂

把InfoSeeker想成一家大型餐厅。顾客提出“找出所有符合条件的餐厅,并查清菜系和地址”。主厨Host先决定今天要完成哪些大步骤,但不亲自翻阅每张菜单;领班Manager负责一个区域,例如网上搜索或打开网页,把大任务切成许多小单。多个Worker像同时工作的厨师,分别查不同网站、核对不同字段。

每位厨师只把整理好的结果交给领班,不把厨房里所有过程都堆到主厨桌上。领班会检查缺失和矛盾,必要时重新派单,最后交给主厨一份短而可靠的报告。这样,主厨不会被纸张淹没,也不会因为一位厨师早期写错而让全餐厅停摆。

如果一个网站打不开,领班可以换成更适合处理复杂页面的人。许多小任务同时进行,因此等待时间主要取决于最慢的一组工作,而不是所有任务时间相加。论文中,17名Worker把平均延迟从911秒降到162秒。代价是需要更多“厨师”、网络工具和协调成本。

简单解释 像给14岁少年讲一样

想象你要做一份超大型“全网调查作业”:找出所有符合条件的餐厅,再查每家的菜系和地址。一个人当然能做,但网页太多,笔记本会爆满;如果前面抄错一个名字,后面所有答案都可能跟着错,而且会慢得像排队打游戏。

InfoSeeker像一个聪明的班级小组。Host是组长,只负责决定下一步要查什么;Manager是小队长,把任务分给很多同学;Worker是实际搜索网页、打开页面和整理资料的人。每个同学只报告自己的结论,不把几十页乱七八糟的过程全塞给组长。

小队长还会检查:“这个地址是真的吗?有没有漏掉餐厅?”不对就重新分工。如果普通搜索打不开网页,就换浏览网页的小队。很多同学可以同时工作,所以速度大幅提高:论文中17个Worker只用162秒,而1个Worker要911秒!

不过人数不是越多越好。更多同学意味着更多花费,也可能有人把错误信息总结给别人。InfoSeeker真正聪明的地方,不只是“找更多人”,而是把谁负责计划、谁负责检查、谁负责执行分清楚,让大任务变得可管理。

术语表

Near-decomposability(近可分解性)

复杂系统可拆成相对自治的模块,模块内部频繁交互,模块之间主要交换高层摘要。它兼顾局部独立与全局协调。

InfoSeeker用它设计Host、Manager和Worker的边界。

Context isolation(上下文隔离)

限制不同层级可见的信息,避免无关轨迹占满上下文。它也减少局部错误向全局传播。

Host只接收(qt,yt)步骤—响应对。

MapReduce

先把任务映射为多个并行子任务,再把结果归约为统一输出。该模式适合大量弱耦合信息处理。

Manager并发调度Worker并聚合结果。

MCP

Model Context Protocol,用统一接口连接模型与外部工具。它支持搜索、浏览、代码和文件操作。

Worker通过MCP执行工具调用并保留轨迹。

Row-level / Item-level F1

Row F1衡量表格实体行的召回与准确;Item F1衡量已匹配实体内部属性的正确性。两者分别反映结构完整性和字段质量。

WideSearch用二者补充严格Success Rate。

开放问题 这项研究留下的未解疑问

  • 1 当子任务之间强依赖时,并行拆分是否会损害推理质量?需要按依赖图动态决定串行、并行或合并执行。
  • 2 摘要会不会隐藏反例或错误证据?未来需引入可验证引用、证据级一致性检查和不确定性估计。
  • 3 在API价格、并发限制和工具失败率变化时,最优Worker规模如何确定?目前实验仍缺少完整成本—准确率模型。

应用场景

近期应用

市场与产品情报

企业可用Search Manager并行收集竞品价格、规格、评价和渠道信息,再由Manager核验重复实体并输出结构化表格。前提是配置网页访问、证据存储和合规的并发额度。

跨语言事实核查

媒体或研究团队可用Browser Manager处理中文及混合语言网页,用多个Worker交叉检索来源、页面和档案,再由Host形成带证据的核查报告。

远期愿景

可扩展研究型智能体平台

未来可接入法律、医学、金融等专门Manager,使同一Host按需调用不同领域能力。若结合可靠引用和成本控制,它可能成为企业级深度研究基础设施。

原文摘要

Recent agentic search systems have made substantial progress by emphasising deep, multi-step reasoning. However, this focus often overlooks the challenges of wide-scale information synthesis, where agents must aggregate large volumes of heterogeneous evidence across many sources. As a result, most existing large language model agent systems face severe limitations in data-intensive settings, including context saturation, cascading error propagation, and high end-to-end latency. To address these challenges, we present \framework, a hierarchical framework based on principle of near-decomposability, containing a strategic \textit{Host}, multiple \textit{Managers} and parallel \textit{Workers}. By leveraging aggregation and reflection mechanisms at the Manager layer, our framework enforces strict context isolation to prevent saturation and error propagation. Simultaneously, the parallelism in worker layer accelerates the speed of overall task execution, mitigating the significant latency. Our evaluation on two complementary benchmarks demonstrates both efficiency ($ 3-5 \times$ speed-up) and effectiveness, achieving a $8.4\%$ success rate on WideSearch-en and $52.9\%$ accuracy on BrowseComp-zh. The code is released at https://github.com/agent-on-the-fly/InfoSeeker

cs.AI