Evaluating Verifiability in Generative Search Engines

TL;DR

提出评估生成式搜索引擎可验证性的方法,发现平均句子支持率仅51.5%。

cs.CL 🔴 高级 2023-04-20 47 次浏览
Nelson F. Liu Tianyi Zhang Percy Liang
信息检索 生成模型 可验证性 评估指标 人类评测

核心发现

方法论

采用人类评测对Bing Chat、NeevaAI、perplexity.ai和YouChat四个主流生成式搜索引擎进行审查。通过多源查询(如Google历史搜索、Reddit开放性问题)评估其生成内容的流畅性、实用性、引用召回率和引用精确率。引入citation recall和citation precision两个指标,前者衡量句子被完全支持的比例,后者衡量引用支持的准确性。采用分句段落划分,结合AIS评估框架进行二元判断,确保指标的客观性。

关键结果

  • 平均句子支持率仅为51.5%,显示大部分生成内容缺乏充分支持。引用支持的句子比例为74.5%,存在明显偏差。高流畅性和实用性并未反映出高可验证性,二者呈负相关(r=-0.96)。生成系统常通过复制或改写网页内容,提高引用精确率,但降低了内容的实用性。
  • 不同系统在引用召回和支持率上差异显著,Bing Chat和YouChat表现略优,但整体支持率仍偏低。引用不准确导致用户误信信息,尤其在缺乏源验证的情况下风险加大。
  • 引入citation F1指标,结合召回和精确率,提供更全面的评估工具。人类标注者对系统回答的评价显示,支持率低是制约信任的关键因素。

研究意义

本研究揭示了当前生成式搜索引擎在信息可信性方面的严重不足,尤其在支持性和准确性方面的缺陷,威胁到其作为主要信息工具的可靠性。通过提出量化指标,推动行业关注内容的可验证性,促进更透明、可信的系统设计。该工作为未来改进提供了评估框架,有助于减少虚假信息的传播,提升用户信任。

技术贡献

首次系统性引入citation recall和citation precision指标,结合人类评测,量化生成内容的支持性与准确性。提出基于AIS框架的二元判断方法,确保指标的客观性。同时,分析不同系统在支持率上的差异,揭示复制和改写网页内容对支持率的影响,为未来模型优化提供指导。

新颖性

本研究首次系统性评估商业生成式搜索引擎的可验证性,提出具体指标衡量支持性和准确性。不同于传统只关注流畅性或相关性的评估方法,强调内容的源验证,为行业标准制定提供基础。这在生成模型应用中具有开创性意义。

局限性

  • 评估主要基于人工标注,存在主观偏差,尽管采用多 annotator 机制,但仍难以完全消除偏差。
  • 指标侧重于句子级支持性,未细化到具体信息片段,可能遗漏部分细节。
  • 系统样本有限,未来需扩大样本规模以验证指标的普适性和稳健性。

未来方向

未来将结合自动化检测技术,提升评估效率。探索多模态支持信息,结合图像、视频等多源数据,增强内容验证能力。推动行业制定可验证性标准,促进生成模型的透明性和可信度提升。

AI 总览摘要

随着大规模语言模型(LLMs)在信息检索中的应用逐渐普及,生成式搜索引擎如Bing Chat、NeevaAI等开始以直观的回答和内嵌引用的形式,改变人们获取信息的方式。然而,这些系统在提供便捷答案的同时,也暴露出严重的可信性问题。传统评估多关注流畅性和相关性,忽视了内容的真实性和源支持。本文提出了“引用召回率”和“引用精确率”两个指标,系统性衡量生成内容的支持程度。通过人类标注者对四个主流系统的评测发现,平均句子支持率仅为51.5%,引用支持的句子比例为74.5%。更令人担忧的是,支持率低的回答往往被用户认为更有用,形成误导风险。研究还发现,复制网页内容虽能提高引用精确率,但反而降低了内容的实用性。这些结果强调,未来生成式搜索引擎必须在保证流畅和实用的基础上,提升内容的可验证性。本文的指标体系为行业提供了量化评估工具,有助于推动更可信的模型发展。最终,研究呼吁行业关注内容的源验证,减少虚假信息的传播,增强用户信任。

深度分析

研究背景

近年来,生成式模型如GPT-3、ChatGPT推动了自然语言处理的快速发展,特别是在信息检索领域。传统搜索引擎依赖网页索引,缺乏内容生成能力,而新兴的生成式搜索引擎结合大模型和网页检索,试图提供更直观的答案。早期研究(如Gao et al., 2022; Lewis et al., 2020)关注模型的生成质量和相关性,但对内容的真实性和源支持关注不足。随着应用逐步扩大,虚假信息和误导风险逐渐暴露,亟需系统性评估内容的可信性。

核心问题

当前生成式搜索系统虽然在流畅性和信息丰富性方面表现优异,但缺乏有效的验证机制,导致生成内容可能缺乏事实依据。缺少量化指标衡量内容支持性,用户难以判断信息的可靠性。这种状况在实际应用中风险巨大,尤其在医疗、金融等敏感领域。如何确保生成内容的真实性和源支持,成为亟待解决的核心问题。

核心创新

本研究创新在于引入“引用召回率”和“引用精确率”两个指标,系统评估生成内容的支持性和准确性。结合人类评测,采用AIS框架实现二元判断,确保指标的客观性。提出的指标能全面反映内容的可信度,区别于传统只关注语义流畅或相关性的评估方法。此方法为行业提供了量化内容验证的新工具,有助于推动可信AI的发展。

方法详解

  • �� 输入用户查询,生成响应文本,嵌入引用标记。• 将响应分割为句子,标注每句对应的引用集合。• 采用AIS框架,判断每句是否由引用完全支持。• 计算支持句子比例(引用召回率)和引用支持的准确性(引用精确率)。• 引入citation F1指标,结合两者进行综合评价。• 进行多系统、多源查询的人工标注,确保评估的代表性和客观性。

实验设计

使用四个商业系统(Bing Chat、NeevaAI、perplexity.ai、YouChat)在多源、多类型查询(如Google历史、Reddit问答)上进行评测。采集1450个查询样本,涵盖不同信息需求。采用人类标注者进行句子支持性、引用准确性评估,统计指标表现。通过对比不同系统和查询类型,验证指标的有效性和鲁棒性。

结果分析

支持率平均为51.5%,引用支持比例为74.5%,显示内容支持性不足。高流畅性和实用性未能保证内容真实性,二者呈显著负相关。复制网页内容虽提升引用精确率,但降低内容实用性。不同系统表现差异明显,支持率低带来潜在误导风险。指标的引入为未来评估提供了科学依据。

应用场景

该评估框架适用于改进生成式搜索引擎的内容可信性,特别是在医疗、法律、金融等领域。企业可用其检测模型输出的真实性,优化内容源管理。学术界也能借助此指标体系,推动可信AI的研究。

局限与展望

评估依赖人工标注,存在主观偏差。指标主要关注句子级支持性,未细化到信息片段。样本规模有限,未来需扩大验证范围。模型复制网页内容虽提升支持率,但可能掩盖内容真实性问题。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,食谱上写着每道菜的步骤和用料。生成式搜索引擎就像一个厨师,能根据你的问题快速“做出”答案,还会标注出处。可是,有时候厨师会随意拼凑菜谱,或者引用的材料不靠谱。这就像系统生成的回答,虽然看起来很流畅、很有用,但可能没有真正的依据。我们用一种“支持度”指标,像检查厨师是否用对材料一样,来判断答案是否可靠。结果显示,大部分答案缺乏充分的出处支持,容易误导人。未来,我们希望这个“支持度”指标能帮厨师(系统)做得更好,让每一道菜(答案)都能让人放心吃。

简单解释 像给14岁少年讲一样

想象你在问一个超级聪明的朋友关于宇宙的秘密,他用很酷的方式回答你,还会告诉你资料来自哪里。但是,有时候这个朋友会胡乱说话,或者引用的资料根本不靠谱。虽然他的回答听起来很酷、很有用,但你不知道是不是可信。科学家们也遇到这个问题,他们想让这些“聪明的朋友”说的话都能有确凿的出处。于是,他们设计了一套“支持度”系统,就像你检查朋友说的话是不是有证据一样。研究发现,大部分回答都没有充分的证据支持,容易误导我们。未来,他们希望这个系统能帮这些“聪明的朋友”变得更可靠,让我们更放心相信他们说的话。

原文摘要

Generative search engines directly generate responses to user queries, along with in-line citations. A prerequisite trait of a trustworthy generative search engine is verifiability, i.e., systems should cite comprehensively (high citation recall; all statements are fully supported by citations) and accurately (high citation precision; every cite supports its associated statement). We conduct human evaluation to audit four popular generative search engines -- Bing Chat, NeevaAI, perplexity.ai, and YouChat -- across a diverse set of queries from a variety of sources (e.g., historical Google user queries, dynamically-collected open-ended questions on Reddit, etc.). We find that responses from existing generative search engines are fluent and appear informative, but frequently contain unsupported statements and inaccurate citations: on average, a mere 51.5% of generated sentences are fully supported by citations and only 74.5% of citations support their associated sentence. We believe that these results are concerningly low for systems that may serve as a primary tool for information-seeking users, especially given their facade of trustworthiness. We hope that our results further motivate the development of trustworthy generative search engines and help researchers and users better understand the shortcomings of existing commercial systems.

cs.CL cs.IR