LiveBrowseComp: Are Search Agents Searching, or Just Verifying What They Already Know?

TL;DR

LiveBrowseComp以335道近90天事实题揭示:搜索代理常在验证记忆,而非发现证据。

cs.AI 🟡 进阶级 2026-05-28 24 次浏览
HuiMing Fan Xiao Wang Zheng Chu Qianyu Wang Zhuoyao Wang Ming Liu Bing Qin XingYu
搜索代理 大语言模型 内在知识依赖 深度搜索 基准评测

核心发现

方法论

论文在BrowseComp、BrowseComp-ZH、HLE和GAIA上采用三项诊断:无工具闭卷测试、移除支持性证据的阻断搜索、以及查询轨迹溯源。阻断实验基于BrowseComp-Plus,用Qwen3-8B-Embedding建立密集索引,仅保留无关文档与困难负例;查询若其关键信息先出现在模型推理中则标为model-originated。

关键结果

  • 24个模型—数据集组合的闭卷pass@4为20.4–62.0,平均38.9;MiniMax M2.5在BrowseComp达44.5,Kimi-K2.6在BrowseComp-ZH达62.0,说明许多“搜索题”无需检索即可作答。
  • 阻断支持证据后,平均pass@4由26.1降至6.2,所有模型均低于闭卷基线;MiniMax M2.5由44.5降至8.0,Kimi-K2.6由25.5降至2.3,搜索反而伤害正确记忆。
  • 超过一半查询源自模型自身假设,后期超过60%;即使检索到支持性证据,使用率也仅为24.7%–32.2%,显示搜索循环主要由模型假设驱动。

研究意义

研究指出静态搜索基准混淆了两种能力:模型原本知道什么,以及模型能否通过网络发现未知事实。随着训练语料和后训练不断吸收旧题信息,基准难度会随时间下降,分数可能奖励“记忆后验证”。LiveBrowseComp通过时间新鲜度和长尾性抑制这一捷径,为搜索代理研究、模型选择和产业部署提供更接近真实信息检索的测量方式。

技术贡献

核心技术贡献不是新的搜索算法,而是可操作的因果诊断框架与基准构造机制。论文将工具作用分解为闭卷覆盖、证据必要性和查询来源三层,并利用BrowseComp-Plus的gold、evidence、irrelevant、hard-negative文档进行受控干预。LiveBrowseComp从GDELT、TMDB、RAWG、CVE/NVD、SportsDB和USGS采集时间戳事实,经过90天、长尾和答案稳定性过滤,再进行多轮人工验证。

新颖性

论文将“搜索是否真正驱动答案”从直觉问题转化为可测量的IKD诊断,并首次系统展示支持证据被移除后搜索可能低于闭卷表现。其新颖基准同时结合近期事实、低显著性、多跳推理和归档快照,区别于主要依赖静态知识的BrowseComp类评测。

局限性

  • LiveBrowseComp只有335题,分布受六个结构化来源及过滤规则影响,未必代表所有网页搜索任务。
  • model-originated查询依赖轨迹标注和“关键信息首次出现”判断,可能受推理文本不完整或模型隐藏思考影响。
  • 实验主要使用统一搜索脚手架和离线索引,不能完全反映实时搜索引擎的排序、抓取失败与网页变化。

未来方向

后续可扩大来源、语言和领域,建立持续更新而又可复现的时间版本;结合更严格的因果轨迹标注,评估代理何时从假设转向证据。还应研究证据校验、失败后策略切换、主动探索和引用可靠性,并制定同时报告内在覆盖率与搜索增益的标准指标。

AI 总览摘要

大语言模型搜索代理被期待能够浏览网页、整合证据并解决复杂问题,但高分未必意味着它们真正发现了信息。LiveBrowseComp的作者在BrowseComp等四个基准上进行三项诊断:移除工具、移除支持答案的文档,以及追踪查询来源。结果显示,代理经常先凭参数记忆形成假设,再把搜索当作确认渠道。

这一现象被称为内在知识依赖(IKD)。24个模型—基准组合的闭卷pass@4平均为38.9,最高达到62.0;MiniMax M2.5在BrowseComp无工具也有44.5分。更具冲击力的是,阻断支持性证据后平均成绩从26.1降至6.2,MiniMax M2.5由44.5降至8.0,Kimi-K2.6由25.5降至2.3。超过半数查询由模型自身假设产生,支持性证据被使用的比例只有24.7%–32.2%。

为测量超越记忆覆盖的搜索能力,论文提出LiveBrowseComp:335道人类编写的问题,答案依赖构建前90天内发布、且不具全球高知名度的事实,来源包括GDELT、TMDB、RAWG、CVE/NVD、SportsDB和USGS。所有评测模型闭卷准确率低于2%,搜索成绩较BrowseComp下降约25–40分;但人类在两套题上的解题率几乎相同,为30%和31%。因此,成绩下降主要揭示代理不会证据驱动地搜索,而不是题目本身不可解。该基准推动评测从“验证已知答案”转向“发现未知事实”。

深度分析

研究背景

搜索代理从TriviaQA、NaturalQuestions等单轮问答,发展到HotpotQA、BrowseComp、DeepSearchQA等多步网页任务。OpenAI Deep Research和Gemini Deep Research展示了产业潜力,但静态数据集中的事实会逐渐进入模型参数。于是高分同时包含记忆覆盖与检索能力,难以判断代理是否真正依赖网页证据。

核心问题

核心问题是工具调用是否产生了新的证据,还是仅验证模型先验。若模型已经知道答案,搜索可用于确认;若检索不到支持文档,可靠代理应保留不确定性或改变策略,但实验显示其常被困难负例带偏。传统最终分数无法分离这些机制。

核心创新

论文有两项创新。第一,提出IKD概念及三诊断:闭卷覆盖、证据阻断和轨迹溯源,将搜索贡献转化为可观察指标。第二,提出LiveBrowseComp,以近期、长尾、稳定事实构造335道多跳题,并用人工证据链、唯一性、难度和时间依赖性验证,降低参数记忆捷径。

方法详解

  • �� 闭卷:关闭全部工具,在BrowseComp、BrowseComp-ZH、HLE和GAIA上测pass@4。
  • �� 阻断搜索:用Qwen3-8B-Embedding建立BrowseComp-Plus索引,删除gold/evidence,仅保留irrelevant与hard-negative文档。
  • �� 轨迹分析:判断查询信息首次来自模型推理还是检索结果,并检查未来三轮是否使用支持性证据。
  • �� 基准构造:从GDELT、TMDB、RAWG、CVE/NVD、SportsDB、USGS提取事件,执行90天、长尾、答案稳定性过滤,再由独立验证者确认唯一答案和不可由旧信息替代。

实验设计

研究评估GLM-5.0/5.1、MiniMax M2.5、Kimi-K2.5/2.6和DeepSeek-V4-Pro等模型。统一搜索脚手架、采样预算、上下文限制和答案格式,减少系统差异。核心指标是pass@4、工具增益、阻断后跌幅、查询来源比例和证据使用率;人工实验比较BrowseComp与LiveBrowseComp的搜索难度和耗时。

结果分析

闭卷pass@4跨组合为20.4–62.0,平均38.9;阻断搜索平均由26.1降至6.2。MiniMax M2.5由44.5降至8.0,Kimi-K2.6由25.5降至2.3。查询中模型起源比例超过50%,后期超过60%;证据使用率仅24.7%–32.2%。LiveBrowseComp上所有模型闭卷准确率低于2%,搜索分数比BrowseComp低约25–40分,而人类解题率为30%对31%。

应用场景

模型开发者可用三诊断定位代理是不会检索、不会利用证据,还是被负例误导。企业在新闻监测、漏洞分析、市场研究和事实核查中,可采用近期长尾题测试系统是否真正发现新信息,并要求引用与答案建立可追溯证据链。

局限与展望

数据集规模、来源和英语设置仍有限;90天窗口能降低但不能绝对排除模型通过更新训练获得信息。离线密集检索也不等同于实时网络。未来需要更多语言、动态版本和真实搜索引擎实验,并研究能识别无效证据、主动改变查询方向、合理保留不确定性的代理策略。

通俗解读 非专业人士也能看懂

想象你让一名学生查资料回答难题。第一种考试,题目和答案在他以前的课本里;他先凭记忆猜出答案,再上网找一句话证明自己,于是看起来像“研究”得很好。第二种考试,老师把真正有用的网页拿走,只留下相似但错误的材料。如果学生仍会独立思考,他应承认找不到证据;但实验中的许多代理反而被错误材料带偏。

LiveBrowseComp像一套刚刚发生的新闻调查题。题目涉及最近90天才出现、又不太出名的电影、漏洞、比赛、地震和新闻事实。学生不能靠旧课本背答案,必须先找到线索,再把多个网页拼起来。研究发现,人类完成两类题目的难度相近,但模型在新题上明显失分。

这说明“会搜索”不只是会输入关键词,而是要能从网页学到新东西,并在原先猜错时改变路线。

简单解释 像给14岁少年讲一样

想象你在玩侦探游戏:题目问“这个新漏洞对应的软件是哪一年出问题的?”你不能只靠记忆,因为漏洞可能上个月才公开。真正厉害的玩家会找新闻、数据库和技术报告,把线索一条条连起来。

但很多AI更像“先猜答案,再搜证据”。在旧题库里,这招很有效,因为题目里的知识可能早就藏在训练材料中。研究者关掉搜索工具后,某些模型仍能答对很多题:MiniMax M2.5在BrowseComp有44.5分,Kimi-K2.6在中文BrowseComp有62.0分。

接着研究者保留搜索按钮,却删掉所有真正支持答案的网页。结果平均成绩从26.1跌到6.2;有些模型甚至比完全不搜索更差!因为它们会被相似但错误的网页骗走。超过一半搜索词来自AI自己脑中的猜测。

所以作者制作LiveBrowseComp,收集最近90天的新事实,共335题。所有模型闭卷都低于2%,说明它们不能靠背诵过关。这个基准真正考的是:你能不能找到不知道的东西、检查证据,并在第一想法不对时及时换方向。

术语表

Intrinsic Knowledge Dependence(内在知识依赖)

代理依赖模型参数中的既有知识形成答案假设,而不是由检索证据引导发现。搜索主要成为确认工具。

论文用该概念解释静态基准高分及阻断搜索时的性能崩溃。

Closed-book pass@4(闭卷四次通过率)

不提供工具、进行四次采样时至少一次答对的比例。它是内在知识覆盖率的保守代理。

用于比较模型在检索前已经具备多少基准相关知识。

Evidence-blocked search(证据阻断搜索)

保留搜索接口,但从索引删除支持正确答案的文档。检索结果只含无关文档和困难负例。

用于测试搜索在无法确认先验时是否仍能帮助代理。

Model-originated query(模型起源查询)

查询中的关键实体或信息首先出现在模型自身推理,而非此前检索结果。该指标反映搜索是否由内部假设驱动。

轨迹分析发现此类查询超过一半,后期超过60%。

LiveBrowseComp

包含335道人类编写、多跳、依赖近90天事实的问题集。它通过近期性和长尾性压低参数记忆覆盖。

论文提出它作为超越静态BrowseComp的深度搜索基准。

开放问题 这项研究留下的未解疑问

  • 1 如何可靠判断代理何时真正从证据更新了信念,而不是把新网页重新解释为原先猜测?现有推理轨迹可能不完整,仍需因果干预和更透明的状态记录。
  • 2 90天窗口能否长期抵抗模型持续更新?未来需要动态、可归档的时间版本,以及跨语言、跨搜索引擎的稳定评测。

应用场景

近期应用

搜索代理质量审计

模型开发团队可在BrowseComp与LiveBrowseComp上同时报告闭卷分数、阻断跌幅、查询来源和证据使用率,从而区分记忆能力与真正检索能力,并定位负例误导问题。

实时事实核查与漏洞检索

新闻、网络安全和研究情报团队可用近期长尾问题测试代理是否能找到新事实、交叉验证来源并保留不确定性,而不是用熟悉答案套解释。

远期愿景

动态搜索评测标准

未来基准可持续生成带时间戳的问题并保存网页快照,使模型排行榜不再主要反映训练语料覆盖,而能衡量证据发现、策略切换和引用可靠性。

原文摘要

Are LLM-based search agents genuinely searching, or using the web to verify what they already know? We study this question on BrowseComp with three diagnostics. Our analysis reveals Intrinsic Knowledge Dependence (IKD): even with tool access, agents often rely on intrinsic knowledge -- information encoded in the model before retrieval -- rather than on external evidence. Agents answer up to 44.5% of BrowseComp questions without tools, generate more than half of their search queries from internally produced hypotheses rather than retrieved leads, and perform worse than closed-book baselines when answer-supporting evidence is removed. These results suggest that static search benchmarks can reward memory-backed verification rather than evidence-driven discovery, conflating what agents already know with what they can find. We then introduce LiveBrowseComp, a deep-search benchmark designed to evaluate agents beyond intrinsic coverage. It contains 335 human-authored questions whose answers depend on facts published within the 90 days preceding benchmark construction, drawn from six updated sources and filtered to exclude globally salient events. On LiveBrowseComp, all evaluated agents fall below 2% closed-book accuracy, search-augmented scores drop by 25-40 points relative to BrowseComp, and prior model rankings no longer reliably predict performance. LiveBrowseComp is available at https://huggingface.co/datasets/Forival/LiveBrowseComp.

cs.AI