核心发现
方法论
本文构建了基于自动合成与验证的韩语宽度搜索基准Ko-WideSearch,涵盖228个任务,分为三难度层级。利用结构化参数(表宽和二维复合键)调节任务复杂度,确保跨页属性填充的全面性。采用单一归一化比较器保证格式稳定性,结合多源验证确保答案正确性。通过自动化流程生成金标准,设立多重验证门控,确保数据可信。评估多达20个Web代理,发现其在集体恢复集方面表现良好,但在逐行填充方面存在显著差距,尤其在开放文本单元。
关键结果
- 所有模型在集体恢复率(Item-F1)达92.8%,但在逐行填充(Row-F1)仅53.7%,表明模型能找到正确的成员但难以正确填写每个属性。硬度增加后,准确率逐步下降,最强模型的表格成功率仅19.3%。不同模型在填充标准答案(如日期、姓名)表现较好,但在自由文本回答中失败明显。
研究意义
该研究填补了宽度搜索在非英语语境下的评估空白,特别是韩语资料的结构化信息检索。推动Web代理在多源、多页、多结构化场景中的能力评估,为未来多模态、多源信息整合提供基准,有助于提升自动化信息采集与知识图谱构建的实用性与鲁棒性。
技术贡献
提出自动合成验证流程,确保大规模金标准的可信性。引入二维复合键与表宽调节机制,丰富任务难度层级。开发归一化比较器解决格式差异问题,创新性地结合多源验证提升答案正确性。实现跨页属性验证的自动化流程,显著降低构建成本,提升评估的可扩展性。
新颖性
首次在韩语环境中系统性引入宽度搜索基准,结合自动化合成与验证,突破了手工构建的局限。提出多源验证机制和结构参数调节,显著提升任务复杂度匹配能力,超越现有英语为主的宽度搜索评估体系。
局限性
- 模型在开放文本单元的回答准确性仍不足,尤其在多源信息整合时存在信息丢失或误差。
- 评估依赖静态网页快照,难以反映动态网页变化对模型的挑战。
- 高复杂度任务对计算资源要求较大,未来需优化流程以提升效率。
未来方向
未来将探索多模态信息融合,提升模型对多源、多格式数据的理解能力。引入动态网页环境,模拟真实场景中的信息变化。开发更高效的验证机制,降低构建成本,扩展任务规模,推动宽度搜索在实际应用中的落地。
AI 总览摘要
宽度搜索作为Web信息检索的核心能力,近年来逐渐受到关注。传统评测多集中于深度搜索,即通过多步约束找到单一答案,但在结构化信息的全面枚举方面,仍存在巨大空白。本文提出了Ko-WideSearch,一个基于自动合成与验证的韩语宽度搜索基准,旨在系统性评估Web代理在全集枚举任务中的能力。
该基准涵盖228个任务,分为易、中、难三级,调节表宽和二维复合键两个结构参数,模拟不同复杂度场景。通过自动化流程生成金标准,结合多源验证,确保答案的完整性和正确性。评估结果显示,尽管模型在集体成员识别方面表现优异(Item-F1达92.8%),但在逐行属性填充(Row-F1仅53.7%)方面仍存在明显差距,尤其在开放文本单元的回答中失败较多。
这一发现揭示了当前Web代理在结构化信息全面检索中的瓶颈,为未来模型在多源、多页、多结构环境中的能力提升提供了明确方向。该基准的设计不仅丰富了宽度搜索的评估体系,也为多模态、多源信息整合提供了重要参考。未来工作将聚焦于动态网页环境、多源信息融合,以及验证机制优化,以推动宽度搜索技术的实际应用落地。
深度分析
研究背景
随着Web信息量的爆炸式增长,结构化信息的自动检索成为关键。早期工作如BrowseComp、WideSearch等,主要关注深度搜索能力,强调多步推理和答案准确率。近年来,宽度搜索逐渐成为研究热点,旨在全面枚举某一实体的所有相关信息,提升信息完整性。韩语资料的特殊性使得相关评测稀缺,现有韩语基准多偏重理解任务,缺少结构化信息的全集枚举能力评估。本文基于此背景,提出了面向韩语环境的宽度搜索基准,填补了该领域空白。
核心问题
现有Web代理多擅长深度推理,难以实现对结构化信息的全面枚举,尤其是在多源、多页、多结构化场景中。韩语资料的特殊结构、术语和搜索习惯增加了信息检索的难度。缺乏系统化评估宽度搜索能力的基准,限制了模型的优化和发展。如何设计一个既能模拟真实复杂场景,又能保证评估可信度的基准,是当前亟待解决的问题。
核心创新
本文创新点包括:1)自动合成验证流程,确保大规模金标准的可信性;2)引入二维复合键和表宽调节,丰富任务难度层级;3)开发归一化比较器,解决格式差异带来的评分偏差;4)实现多源验证机制,确保答案的多源一致性。这些创新共同提升了宽度搜索在韩语环境下的评估能力,突破了传统手工构建的局限。
方法详解
- �� 任务定义:每个任务命名一个实体(如电视季、朝代、选举),要求列出全体成员及其属性。
- �� 自动合成:利用模型生成候选答案,结合多源网页数据,自动构建金标准表格。
- �� 验证流程:包括非记忆性验证(模型不能从记忆中复现答案)、完整性验证(重新枚举成员确认集是否完整)和多源验证(属性值跨页面验证)。
- �� 结构调节:通过调节表宽和二维复合键,生成不同难度层级。
- �� 比较器设计:采用类型感知的归一化比较,确保格式差异不影响评分。
- �� 评估:模型在限定搜索次数内输出表格,评分指标包括Item-F1、Row-F1和表格成功率。
实验设计
采用真实网页数据,涵盖190个韩语实体,16个类别,分三难度层级。评估20个Web代理模型,比较其在不同难度和结构参数下的表现。指标包括集体成员识别(Item-F1)、逐行填充(Row-F1)和整体表格正确率。实验还包括不同模型类型(专用、开源、前沿模型)对比,验证基准的区分能力和实用性。
结果分析
所有模型在成员识别方面表现优异(Item-F1达92.8%),但在逐行填充方面差距明显(Row-F1仅53.7%),表明模型能找到正确成员但难以正确填写全部属性。硬度增加后,准确率逐步下降,最强模型的完整表格成功率仅19.3%。自由文本单元的回答失败率较高,而标准答案(如日期、姓名)表现较好。这反映了模型在多源、多页、多结构化场景中的挑战。
应用场景
该基准可用于评估未来Web代理在多源信息整合、结构化数据全集枚举等方面的能力,推动知识图谱自动构建、智能问答系统的实用化。也可作为模型训练的目标任务,提升其在复杂环境下的表现。未来可结合多模态信息,增强模型对动态网页的适应性。
局限与展望
当前模型在开放文本单元的回答准确性不足,尤其在多源信息融合时存在信息丢失。评估基准依赖静态网页快照,不能反映网页动态变化。高复杂度任务对计算资源要求较大,未来需优化流程以提升效率。
通俗解读 非专业人士也能看懂
想象你在一家大型工厂里工作,工厂里有许多不同的机器,每台机器都负责生产不同的零件。你需要找到所有生产某种零件的机器,并且还要知道每台机器的工作时间、产量和负责人。这就像在网页上找信息,你要找到所有相关的网页(机器),并从不同页面收集完整的资料(零件信息)。有些信息在同一页面,有些在不同页面,你必须逐个访问,确保每个零件的所有细节都正确无误。这就像工厂里的检查员,要确保每台机器都在正常工作,所有零件都符合标准。这个过程需要你不断查找、核对和确认,才能确保信息完整、准确,就像宽度搜索一样,全面、细致地把所有信息都找出来。
简单解释 像给14岁少年讲一样
想象你在学校的图书馆里找资料,你想列出所有关于某个话题的书,比如关于“韩国的运动队”。你不仅要知道有哪些书,还要知道每本书的作者、出版年份、出版社和内容简介。有时候,这些信息散落在不同的书架上,你得走遍整个图书馆,把所有相关的书都找到,然后逐一核对信息是否正确。这个过程就像在网页上搜索信息,你要找到所有相关网页,收集每个网页上的资料,然后确保它们都正确无误。这个任务很难,因为信息分散、格式不同,还要保证没有遗漏。就像你要做一份完整的资料清单,确保每个细节都准确无误,才能算完成任务。
术语表
宽度搜索 (Breadth Search)
一种全面枚举结构化信息的方法,旨在从网页中提取所有相关数据,而非深度推理。技术上涉及多源、多页、多结构化数据的自动整合。
本文的核心评估任务,检验Web代理的全集枚举能力。
自动验证 (Automated Verification)
利用模型和规则自动检查生成数据的完整性和正确性,确保大规模金标准的可信性。
保证评估数据的质量和可信度。
二维复合键 (2D Composite Key)
由两个属性组成的联合主键,用于表示复杂的关系网格结构,提升任务难度。
调节任务结构复杂度的重要参数。
归一化比较器 (Normalization-aware Comparator)
一种考虑格式差异的比较工具,用于确保不同格式的答案能公平评分。
解决答案格式多样性带来的评分偏差。
多源验证 (Cross-source Verification)
从不同网页源头核实属性信息的一致性,确保答案的可靠性。
提升答案的真实性和完整性。
开放问题 这项研究留下的未解疑问
- 1 如何进一步提升模型在开放文本单元的回答准确率,特别是在多源信息融合场景中?
- 2 动态网页环境下信息检索的有效策略尚未充分研究。
原文摘要
Web-agent benchmarks overwhelmingly measure depth -- pinning one obscure answer behind a chain of constraints -- while breadth, exhaustively enumerating a closed set and filling each item's attributes, is barely evaluated, especially outside English. Breadth is also hard to build: certifying that a gold set is complete and every cell correct is far costlier than checking a single answer. I introduce \textsc{Ko-WideSearch}, a Korean breadth-search benchmark built by an automated synthesize-and-verify pipeline. Each task names a set-parent entity -- a TV season, a dynasty, a league, an administrative region, an election -- and asks for its full membership plus a per-item attribute table, graded by Item-, Column-, and Row-F1. It spans 228 tables over 190 entities and sixteen categories across three difficulty tiers, set by two structural knobs I dial independently -- table width and a 2-D composite key -- so cross-product membership climbs from 0\% to 100\% across the tiers. A single normalization-aware comparator is shared between gold construction and grading, so stable date and count columns are not over-dropped on formatting alone. Across twenty web agents, the failure is consistent: agents recover the set but not the rows (e.g.\ Item-F1 92.8 against Row-F1 53.7), accuracy falls steadily as the knobs harden, and neither more search nor more spend closes the gap. Broken down by cell, the hard part is finding the right value, not formatting it: open-ended free-text cells fail most, while cells with a standard answer such as a date or a name usually come out right.