MARCA: A Checklist-Based Benchmark for Multilingual Web Search
MARCA基于核对表评估多语种LLMs网页信息检索能力,涵盖52题,采用两框架,揭示模型性能差异。
核心发现
方法论
MARCA采用52个多实体问题,结合手工设计的核对表评估答案完整性与正确性。模型在基础框架(直接网页搜索)和调度框架(任务分解)两种设置下进行评测。每题多次执行,利用GPT-4判定答案质量,统计运行不确定性。模型性能差异显著,调度框架普遍提升覆盖率,英语到葡萄牙语的迁移表现不一。
关键结果
- 最高模型如Gemini-3-pro和GPT-5.2在Checklist准确率达0.90左右,最低Gemini-2.5-Flash-Lite仅0.26,表现差异巨大。
- 调度框架在多数模型中提升Checklist准确率,尤其是处理多实体信息的模型效果更明显,提升幅度在0.05到0.20之间。
- 英语与葡萄牙语表现存在较大差异,部分模型在葡语中性能下降超过5%,反映多语种检索能力的差异性。
研究意义
该研究填补了多语种网页信息检索评估的空白,特别是葡萄牙语场景。通过核对表细粒度评估,揭示模型在多实体、多网页信息整合中的不足,为多语种、多实体信息检索提供了标准化测试平台,推动多语种大模型的公平性与实用性提升。
技术贡献
提出结合核对表的多实体问答评估体系,设计两种交互框架(基础与调度),引入多次随机执行与不确定性分析。创新在于跨语言、多实体、多框架的综合评估,利用GPT-4作为判定工具,提供细粒度性能指标,为未来多语种、多任务大模型的优化提供数据基础。
新颖性
首次建立涵盖英语和葡萄牙语的网页检索基准,结合核对表与多框架评估,系统性分析模型在多实体、多语言环境中的表现差异,突破以往单一语言或单一任务的评估限制。
局限性
- 评估依赖GPT-4判定,可能存在偏差,且未考虑模型在实际应用中的响应速度与成本。
- 只涵盖52题,覆盖领域有限,未来需扩展多领域、多实体问题集。
- 调度框架虽提升性能,但复杂度增加,实际部署成本较高。
未来方向
未来将扩展题库规模,加入更多语种和复杂任务,优化调度策略以降低成本,结合用户反馈提升实用性。同时,研究模型在动态网页环境中的适应性与鲁棒性,推动多语种多实体信息检索的实际应用。
AI 总览摘要
随着大规模语言模型(LLMs)在信息获取中的应用日益广泛,评估其网页搜索与证据整合能力成为关键。现有评测多集中于英语,缺乏对多语种场景的系统性分析。本文提出MARCA(多语种网页搜索核对表基准),涵盖52个多实体问题,结合手工设计的核对表,细粒度衡量答案的完整性与正确性。
评测框架包括基础(直接网页搜索)和调度(任务分解)两种方式。模型在两框架下多次运行,利用GPT-4判定答案质量,统计不确定性。结果显示,模型性能差异巨大,最高达0.90,最低仅0.26,反映模型在多实体、多网页信息整合中的差异。调度框架普遍提升性能,尤其对复杂任务效果显著,但部分模型在多语种迁移中表现不稳定。
该研究不仅提供了标准化多语种网页检索评估工具,也揭示了多语种、多实体信息检索中的挑战,为未来多语种大模型优化提供数据基础。整体而言,MARCA推动多语种信息检索的公平性与实用性,为构建更智能、更可靠的多语种大模型奠定基础。
深度分析
研究背景
近年来,LLMs在自然语言处理领域取得突破,但其网页信息检索能力仍面临挑战。早期工作如WebGPT、BrowseComp等,主要集中在英语环境,缺乏多语种评估。多语种信息检索的复杂性在于不同语言的网页内容差异、查询表达方式差异,以及多实体信息的整合难度。现有多语种资源如mMARCO、MIRACL,主要评估段落检索,缺少端到端网页交互能力测试。随着多语种应用需求增加,亟需系统性评估模型在实际网页环境中的表现。
核心问题
核心问题在于,现有评测工具多为静态或单一任务,难以反映模型在真实多实体、多网页环境中的能力。多语种网页检索涉及跨语言理解、动态网页内容处理、实体识别与关联等多重难题,模型在多实体识别、信息验证、内容整合方面表现不一。缺乏统一标准衡量模型在多语种、多实体场景中的性能,限制了模型优化与实际应用推广。
核心创新
本研究创新点在于:1)提出结合核对表的多实体问答评估体系,细粒度衡量答案的完整性与正确性;2)设计两种交互框架(基础与调度),模拟不同场景下模型的网页交互能力;3)引入多次随机执行与不确定性分析,增强评估的稳健性。此体系首次覆盖英语与葡萄牙语,结合手工设计与动态检索,系统性分析多语种、多实体信息整合能力,为多语种网页搜索提供新标准。
方法详解
- �� 构建52个多实体问题,涵盖多个主题领域,配以手工设计的核对表,明确每个答案应包含的实体与属性。
- �� 设计两种评估框架:基础(模型直接调用网页搜索和爬取工具)和调度(模型作为调度者,分解任务委托子代理执行)。
- �� 每题多次随机执行(3次),利用GPT-4判定答案的正确性与完整性,统计运行不确定性。
- �� 采用核对表指标(满足度)作为性能衡量标准,结合平均值与标准差,分析模型表现差异。
- �� 比较不同语言(英语、葡萄牙语)下模型的性能变化,评估多语种迁移能力。
实验设计
实验在自建的52题数据集上进行,涵盖9个主题领域,使用多种模型(如GPT-4、Gemini-3、Qwen-3等)在两框架下评估。指标为核对表准确率,统计多次运行的平均值与标准差。通过调度框架,观察任务分解对性能的影响。还分析了不同语言间的表现差异,评估模型在多语种环境中的适应性。实验还包括成本-性能关系分析,为实际应用提供参考。
结果分析
模型性能差异显著,最高达0.90,最低仅0.26。调度框架普遍提升模型表现,尤其是复杂多实体任务。多语种迁移表现不一,部分模型在葡语中性能下降超过5%。调度框架对部分模型提升明显,但对表现已优异的模型影响有限。成本与性能呈正相关,性能提升伴随计算成本增加。整体结果验证了调度策略在多实体信息整合中的有效性。
应用场景
该基准可应用于多语种大模型的开发与调优,特别适合需要多实体、多网页信息整合的场景,如智能问答、搜索引擎优化、跨语言内容管理。企业可借助此工具评估模型在实际网页环境中的表现,指导模型改进。未来,结合动态网页内容与用户交互,推动多语种智能信息服务的落地。
局限与展望
评估依赖GPT-4判定,可能存在偏差,且未考虑模型在实际应用中的响应速度与成本。题库规模有限,覆盖面不足,未来需扩展多领域、多实体问题集。调度框架复杂度高,实际部署成本较大,需优化任务分解策略。模型在动态网页环境中的适应性仍需验证,未来需考虑实时性与鲁棒性。
通俗解读 非专业人士也能看懂
想象你在一个大厨房里准备一顿丰富的饭菜。每道菜都需要不同的食材和步骤。大模型就像厨师,要从各种网页(食材来源)中找到正确的材料(信息),然后按照食谱(核对表)确保每个菜都做得完整。基础方法就像厨师自己去买菜、做饭,而调度方法则像有助手帮忙分工合作,厨房变得更高效。这个研究就是在测试厨师和助手谁能最快、最准地准备出一桌美味佳肴,特别是在不同国家的厨房(语言)里。
简单解释 像给14岁少年讲一样
想象你在学校里做一个关于电影的报告。你需要找到很多不同的电影获奖者信息,然后整理成一份完整的报告。大模型就像一个超级聪明的学生,可以在网上搜索、阅读网页,然后把所有信息整理出来。基础方法就像他自己一个人查资料,花很多时间;调度方法就像他请朋友帮忙查不同的部分,这样效率更高。这个研究就是在测试哪个方法能帮这个“学生”更快、更准确地完成任务。不同语言(英语、葡萄牙语)就像用不同的语言交流,有的学生在用英语时表现很好,但用葡萄牙语时就会遇到困难。
术语表
Checklist 核对表
一份详细列出答案应包含的实体和属性,用于评估答案的完整性和正确性。技术上是结构化的评分标准。
在论文中用于对模型生成的答案进行细粒度评估。
Web_search 网页搜索
调用搜索引擎获取网页结果的过程,模型通过关键词检索相关网页信息。
基础框架中模型直接使用的工具。
调度框架 Orchestrator
模型作为调度者,将复杂问题拆分成子问题,委托子代理执行网页检索任务。
评估中用于提升多实体信息整合能力。
多实体问题 Multi-entity questions
涉及多个对象或实体的查询,要求模型同时识别、检索并关联多条信息。
评估模型多网页、多实体信息整合能力的核心任务。
Checklist准确率
模型答案满足核对表所有要求的比例,用于衡量答案的完整性和正确性。
作为模型性能的主要指标。
开放问题 这项研究留下的未解疑问
- 1 如何进一步提升多语种模型在复杂网页环境中的鲁棒性,尤其是在低资源语言中。
- 2 调度框架在大规模实际应用中的效率优化策略尚未充分研究。
- 3 多实体信息整合的深层次机制及其在动态网页中的表现仍需探索。
应用场景
近期应用
多语种智能问答系统
企业和公共服务机构可利用MARCA评估多语种大模型在网页信息检索中的表现,优化多语环境下的问答系统,提升用户体验。
模型调优与比较
研究人员可以借助该基准对不同模型进行性能比较,指导模型改进方向,特别是在多实体、多网页场景中的表现优化。
远期愿景
跨语言信息整合平台
未来可发展为多语种跨网页信息整合平台,实现全球范围内的多语言、多实体信息自动整理与分析,推动智能内容管理。
原文摘要
Large language models (LLMs) are increasingly used as sources of information, yet their reliability depends on the ability to search the web, select relevant evidence, and synthesize complete answers. While recent benchmarks evaluate web-browsing and agentic tool use, multilingual settings, and Portuguese in particular, remain underexplored. We present \textsc{MARCA}, a bilingual (English and Portuguese) benchmark for evaluating LLMs on web-based information seeking. \textsc{MARCA} consists of 52 manually authored multi-entity questions, paired with manually validated checklist-style rubrics that explicitly measure answer completeness and correctness. We evaluate 14 models under two interaction settings: a Basic framework with direct web search and scraping, and an Orchestrator framework that enables task decomposition via delegated subagents. To capture stochasticity, each question is executed multiple times and performance is reported with run-level uncertainty. Across models, we observe large performance differences, find that orchestration often improves coverage, and identify substantial variability in how models transfer from English to Portuguese. The benchmark is available at https://github.com/maritaca-ai/MARCA