Blind Men and the Elephant: Probing the Epistemic Myopia of LLMs under Long-Tail Divergent Knowledge

TL;DR

ElephantBench利用图结构检测LLMs对长尾事实多源账户的记忆完整性,揭示模型偏向主流答案。

cs.CL 🔴 高级 2026-08-29 59 次浏览
Zhuoshi Pan Junru Lu Yan Qian H. Vicky Zhao Di Yin Xing Sun
大模型 知识图谱 长尾知识 认知偏差 模型评估

核心发现

方法论

该研究构建了ElephantBench,采用图结构将低曝光网页中的事实冲突源文档连接,利用LLM判别支持与冲突边,生成多源账户问答对。通过源验证和人类审核,确保答案的真实性。模型在闭卷环境中尝试复现这些账户,评估其记忆的完整性。指标包括完整召回率(C)、部分召回(P)和失败(F),以及条件完整性(K)。实验涵盖32个模型,观察模型规模和推理能力对记忆完整性的影响。

关键结果

  • 最强模型仅在52.4%的问题上同时恢复两个账户,显示出明显的认知偏差。模型规模的扩大和推理能力的增强显著提升了召回率,但未能完全解决偏向主流账户的问题。模型在长尾事实中的偏差与源曝光不均有关,偏向主流账户的源文档数量越多,模型越倾向只记住主流答案。
  • 实验还发现,增加少数账户的源曝光能改善模型的记忆完整性。不同知识领域表现差异明显,人物与组织、娱乐内容的记忆较完整,而政府、公共事务等领域则偏向偏颇。模型规模和推理能力对长尾事实的记忆表现具有显著影响,但偏差仍存在。
  • 该方法提供了一个可复现的诊断工具,有助于理解模型在长尾知识中的认知局限,为未来数据采集和模型训练提供指导。

研究意义

该研究突破了传统单一答案评估的局限,提出了多源账户的知识完整性检测机制,揭示了大模型在长尾事实中的认知偏差。通过图结构将源文档关系可视化,为模型的知识偏差诊断提供了新工具,有助于推动模型在知识多样性和真实性方面的改进。该方法兼具可扩展性和可复用性,为未来大规模知识评估提供了基础,有望改善模型的知识覆盖面和偏差控制。

技术贡献

本文提出了基于知识点聚类和实体识别的图结构构建流程,有效缩减候选文档对比规模。利用LLM进行边关系分类,识别支持与冲突关系,结合多源验证生成多账户问答对。创新在于将自然网页中的事实冲突转化为闭卷检测任务,突破了传统开放式推理的限制。该流程实现了源追溯和偏差诊断的自动化,为长尾知识评估提供了新思路。

新颖性

首次系统性将网页中自然出现的事实冲突转化为闭卷问答,利用图结构结合多源验证实现多账户记忆检测。区别于现有的知识冲突或单一答案评估方法,强调模型对多源、多账户知识的完整记忆能力,填补了长尾知识评估的空白。

局限性

  • 该方法依赖于网页源的真实性和多样性,若源数据偏向主流答案,则模型偏向主流的偏差难以根本改善。模型对复杂冲突关系的判别能力有限,尤其在源信息模糊或不一致时表现不佳。此外,当前评估未考虑模型在多任务、多模态环境中的表现,未来需结合实际应用场景进行优化。

未来方向

未来将结合多模态信息和更丰富的知识源,提升模型对复杂事实冲突的理解能力。计划引入动态知识更新机制,减少模型偏差。还将探索多源信息融合与偏差校正技术,推动模型在真实世界中的知识多样性和真实性提升。

AI 总览摘要

随着大规模语言模型(LLMs)在问答任务中的广泛应用,传统的单一答案评估已难以反映模型在长尾事实中的认知偏差。本文提出ElephantBench,通过构建基于网页事实冲突的图结构,将源文档中的多源、多账户信息转化为闭卷问答,检测模型是否能完整记忆这些复杂事实。该方法利用知识点聚类和实体识别筛选候选文档,采用LLM判别支持与冲突关系,自动生成多账户问答对,并经过源验证和人工审核,确保答案的真实性。模型在闭卷环境中尝试复现这些账户,评估其记忆的完整性。实验结果显示,最强模型在52.4%的问题中成功恢复所有账户,但大部分情况下只记住了主流答案,偏差明显。模型规模和推理能力的提升虽改善了表现,但偏向主流的现象依然存在。分析发现,源文档曝光不均是偏差的主要原因,增加少数账户的源曝光能显著改善模型的记忆完整性。这一研究不仅提供了检测认知偏差的工具,也为未来长尾知识的采集和模型训练提供了新思路。该方法具有良好的可扩展性和可复用性,有望推动大模型在知识多样性和真实性方面的持续改进。

深度分析

研究背景

近年来,大型语言模型(如GPT、BERT)在问答、推理等任务中取得突破,但其知识储备多依赖预训练数据,存在偏向主流答案、忽略少数事实的问题。传统评估多关注模型在常见问题上的表现,忽视了长尾事实的认知偏差。已有的长尾知识评估方法多采用单一答案或开放式推理,难以检测模型对多源、多账户信息的记忆完整性。随着模型规模的扩大,偏差问题愈发突出,亟需新的评估工具以揭示模型在多源、多账户事实中的认知局限。

核心问题

核心问题在于,模型是否能在闭卷环境中完整记忆网页中存在的多源、多账户事实,尤其是那些曝光较少的长尾知识。传统方法多只检测模型是否记住某个事实的主流版本,忽略了事实的多样性和复杂性。这导致模型在实际应用中可能只掌握部分信息,存在认知偏差。如何设计一种能够自动检测模型是否能记住多源、多账户信息的评估机制,成为亟待解决的难题。

核心创新

本研究的创新点在于:1)提出基于网页事实冲突的图结构,将多源、多账户信息系统性地连接起来;2)利用LLM判别支持与冲突关系,自动生成多账户问答对;3)引入源验证和人工审核,确保答案真实性。这一流程突破了传统单一答案评估的局限,将网页中的自然事实冲突转化为闭卷检测任务,强调模型对多源、多账户知识的完整记忆能力,为长尾知识评估提供了新工具。

方法详解

  • �� 构建网页源文档图:利用知识点聚类(SuperGPQA)和实体识别筛选候选文档。• 使用LLM判别文档关系:支持、冲突或无关。• 生成冲突子图:提取支持和冲突边,形成子图。• 生成问答对:在冲突边基础上,利用LLM生成对应多账户问答,确保每个答案都可追溯源文档。• 源验证:通过Web搜索验证答案的真实性,结合人工审核过滤错误。• 闭卷评估:模型仅接收问题,尝试复现所有验证账户。• 评价指标:完整召回(C)、部分召回(P)、失败(F)和条件完整性(K)。

实验设计

采用低曝光网页数据(RePro)作为源,构建1,094个多账户问答对,涵盖22个知识领域。对32个模型进行闭卷测试,比较模型规模和推理能力对记忆完整性的影响。评估指标包括完整召回率和偏差表现。通过源曝光分析,探究偏差原因。实验还分析不同知识领域的表现差异,验证模型在长尾事实中的认知局限。

结果分析

最强模型在52.4%的问题中成功复现所有账户,整体偏差明显。模型规模扩大和推理增强显著提升了召回率,但偏向主流答案的现象依然存在。增加少数账户源曝光能有效改善模型记忆的完整性。不同知识领域表现差异明显,人物、娱乐内容的记忆较完整,而政府、公共事务偏向偏颇。这些结果表明,模型偏差与源文档曝光密切相关,偏向主流答案是普遍现象。

应用场景

该方法可用于模型偏差诊断、知识库质量评估、数据采集优化等场景。通过识别模型在长尾知识中的偏差,指导数据平衡和模型训练策略,提升模型的知识多样性和真实性。未来还可结合多模态信息,推动模型在实际应用中的知识覆盖面。

局限与展望

当前方法依赖网页源的真实性和多样性,若源偏向主流答案,则偏差难以根本改善。对复杂冲突关系的判别能力有限,特别在源信息模糊或不一致时表现不足。模型在多任务、多模态环境中的表现尚未充分验证,未来需结合实际应用场景进行优化。

通俗解读 非专业人士也能看懂

想象你在一家工厂工作,工厂里有很多不同的生产线,每条线都在制造不同的产品。有时候,不同的工人会对某个产品的制造方法有不同的看法,有的说用A方法,有的说用B方法。这就像网页中不同源对同一事实的描述一样。有些工人只知道主流的方法,忽略了其他可能的做法。工厂的管理者想知道,工人是否都记得所有的制造方法,尤其是那些不常用的。于是,他们设计了一个系统,把所有工人提供的不同方法整理成一张图,连接相似或冲突的工艺。然后,通过问工人问题,验证他们是否都记得所有的方法。这个系统帮助管理者发现,工人更容易记住常用的方法,而对少见的方法记忆不足。这个比喻说明了论文中用图结构检测模型对多源、多账户知识的记忆完整性的方法。

简单解释 像给14岁少年讲一样

想象你在学校里,有很多同学都知道关于某个历史人物的不同故事。有的说他出生在某个城市,有的说在另一个城市;有的说他获得了奖,有的说他没有。你想知道,你的脑海里是不是都记得这些不同的故事,而不是只记得一个版本。科学家们用一种特别的方法,把这些不同的故事变成一张图,连接相似或相反的部分。然后,他们用智能机器人(模型)来问自己:我记得这些故事吗?机器人会尝试回忆所有的版本,看看自己是不是都记得。结果发现,机器人更喜欢记住最常听到的故事,而忽略那些少有人提及的版本。这个研究帮助我们理解,为什么大模型有时候只记住主流答案,而忽略了其他可能的事实。它也告诉我们,要让模型记得更多不同的故事,就需要让它接触更多不同的资料。

原文摘要

Factual question answering (QA) typically assumes a single canonical answer, obscuring whether large language models (LLMs) retain divergent accounts of long-tail facts. To address this gap, we introduce ElephantBench, a closed-book knowledge probe comprising 1,094 questions generated through an auditable graph-based pipeline. The pipeline retrieves related documents from a low-exposure web corpus, identifies naturally occurring disagreements, and converts them into multi-account QA records. Each answer is verified against the originating documents and authoritative public web sources and is then reviewed by human annotators. Across 32 models, even the strongest model recovers both accounts on only 52.4% of questions, while on nearly all remaining questions it recalls one account but omits the other. Scaling model size and inference-time reasoning improve recall but do not eliminate this incompleteness. Corpus analysis further shows that exposure imbalance favors the dominant account, whereas greater minority-side exposure is associated with more complete recall. These findings establish ElephantBench as a reproducible knowledge probe for diagnosing epistemic myopia in parametric memory. More broadly, our graph-based benchmark construction pipeline provides an efficient and scalable way to turn long-tail corpora into source-traceable knowledge probes, supporting efforts to evaluate and advance the epistemic rigour of next-generation LLMs. Code is available at https://github.com/Tencent/ElephantBench.

cs.CL