TriQua: Reconciling Granularity and Context in Factuality Evaluation

TL;DR

提出TriQua框架,结合基础三元组与修饰符,实现事实评估的细粒度与上下文平衡。

cs.AI 🔴 高级 2026-08-05 46 次浏览
Jin Liu Steffen Thoma Achim Rettinger
自然语言处理 事实验证 信息抽取 结构化知识 模型评估

核心发现

方法论

TriQua采用基于OpenIE的多层次事实表示,将简单事实作为基础三元组,复杂事实通过附加多维修饰符实现上下文保持。核心组件包括事实分解器、检索器和验证器,利用特定算法(如Qwen3.5-397B-A17B)进行事实抽取与验证。验证过程中,模型不仅输出支持/反驳标签,还标注具体错误位置,实现细粒度可解释性。基于关系的评分指标(TriQuaScore)计算支持的事实单元比例,结合去重策略提升准确性。该框架支持多模态文本的细粒度事实分析,确保在保持原子性同时融入丰富上下文信息。

关键结果

  • 在FactScore-Bio数据集上,TriQuaScore与人类标注的相关性达0.89以上,显著优于VeriScore和RefChecker,误差降低4-10%。
  • TriQua在事实分解质量方面表现优异,Entailment支持率达98.54%,Decontextualization支持率达95.39%,有效保持事实的原始语义和上下文完整性。
  • 通过消除重复事实单元,TriQua在多模型验证中展现出更强的鲁棒性和解释能力,尤其在复杂长文本中表现出优越的细粒度错误定位能力。

研究意义

该研究突破了现有事实验证中对复杂信息的处理瓶颈,兼顾事实的原子性与上下文完整性,为大规模语言模型的事实支持提供了可解释、可操作的技术路径。其创新的结构化事实表示和关系式评分机制,为知识图谱构建、事实检索及自动问答等应用提供了理论基础和实践工具,有望推动可信AI的发展。

技术贡献

提出基于超关系的事实表示模型,结合多层次修饰符实现复杂事实的结构化表达。引入关系驱动的评分指标TriQuaScore,支持部分支持与错误定位,提升评估的细粒度和解释性。实现无预定义本体的开放信息抽取,结合少样本学习策略,增强模型适应性。实验验证显示,该方法在多数据集和模型规模下均优于现有主流框架,提供了事实验证的新技术范式。

新颖性

首次将超关系结构引入事实验证框架,有效平衡了事实的原子性与上下文信息的完整性。区别于传统的三元组或句子级别表示,TriQua通过多维修饰符实现复杂事实的细粒度表达,解决了现有方法在复杂语境下的性能瓶颈。这一创新为事实验证提供了全新的结构化思路,具有重要的理论和应用价值。

局限性

  • 当前框架依赖大规模预训练模型,计算成本较高,实际部署存在效率瓶颈。
  • 对修饰符的类别和使用规则仍需人工设计,部分复杂修饰可能导致信息冗余或误用。
  • 在极端复杂或抽象的文本中,事实抽取和验证的准确性仍有提升空间,尤其在多义性和模糊性较强的场景。

未来方向

未来将探索多模态信息融合,提升事实验证的多源适应能力;同时优化修饰符类别自动化识别与管理,增强模型的自主学习能力。此外,将结合知识图谱和推理机制,扩展对复杂推理和因果关系的支持,以实现更全面的事实理解和验证。

AI 总览摘要

在大规模语言模型(LLMs)广泛应用的背景下,事实的正确性成为确保AI可信度的关键。传统的“分解-验证”策略在处理简单事实时表现优异,但面对复杂语境时,往往因缺乏上下文信息而导致验证困难。为解决这一难题,本文提出TriQua框架,创新性地将事实表示为基础三元组结合多维修饰符,兼顾原子性与上下文完整性。该方法借鉴超关系知识表示,利用关系驱动的验证指标,实现对支持与错误的细粒度标注。实验结果显示,TriQua在FactScore-Bio等数据集上,与人类标注的相关性高达0.89,显著优于现有方法,验证了其优越的分解质量和解释能力。通过引入去重策略,模型在复杂长文本中的鲁棒性进一步增强。该研究不仅丰富了事实验证的理论体系,也为知识图谱构建、自动问答等应用提供了坚实基础。未来,作者计划融合多模态信息,提升模型的适应性和推理能力,推动可信AI的持续发展。

深度分析

研究背景

随着大规模预训练模型(如GPT、BERT)的普及,自动事实验证成为AI研究的重要方向。早期方法多采用句子级别的知识抽取与验证,代表性工作包括FactScore、VeriScore等,强调基于三元组的结构化表示。近年来,研究逐步关注上下文信息的保持与复杂事实的表达,提出多维修饰符和超关系结构,试图解决简单三元组无法覆盖复杂语义的问题。然而,现有方法在保持原子性与丰富上下文之间仍存在权衡,尤其在长文本和抽象概念场景中表现不足。如何在保证事实表达的细粒度同时,融入必要的上下文信息,成为当前研究的热点与难点。

核心问题

现有事实验证方法多依赖于单一的三元组或句子级别表示,难以处理复杂、多层次的事实信息。简单三元组无法表达时间、地点、因果等修饰信息,导致验证结果缺乏细粒度解释。另一方面,过度保留上下文又会破坏事实的原子性,影响验证的精确性。如何在保证事实的原子性同时,融入丰富的上下文,避免误判和信息丢失,是事实验证中的核心难题。特别是在长文本或抽象概念中,信息的多义性和模糊性进一步加剧了这一挑战。

核心创新

本文提出基于超关系的多维事实表示模型,将简单事实作为基础三元组,复杂事实通过附加多类别修饰符实现上下文丰富。创新点包括:1)引入关系驱动的结构化表示,支持多层次修饰;2)设计细粒度的验证指标(TriQuaScore),实现部分支持与错误定位;3)结合少样本学习策略,支持开放信息抽取,无需预定义本体。这些创新有效解决了传统方法在复杂事实表达和验证中的局限,提升了模型的解释性和适应性。

方法详解

  • �� 事实分解:利用OpenIE技术,将文本中的事实抽取为基础三元组或附带修饰符的超关系结构。• 组件设计:包括事实分解器(提取基础三元组与修饰符)、检索器(基于构造的查询从外部知识源检索支持信息)、验证器(利用LLM进行事实验证并标注错误位置)。• 关系表示:采用((subject, relation, object), {(qi, vi)})格式,支持多维修饰符。• 评分机制:基于支持的事实单元比例,结合去重策略,计算TriQuaScore,支持部分支持与错误解释。• 训练策略:结合少样本学习,优化事实抽取与验证的准确性。• 端到端流程:从文本输入到事实抽取、检索、验证、评分,形成闭环系统。

实验设计

采用FactScore-Bio和LongFact两个数据集,比较TriQua与VeriScore、RefChecker的性能。指标包括Pearson、Spearman相关系数和MAE,验证模型与人类标注的相关性。设置多种模型规模(如Qwen3.5-397B、GLM-744B)进行多轮实验,评估不同抽取策略和去重效果。还进行消融实验,验证关系表示和修饰符类别的贡献。通过长文本和复杂事实场景,测试模型的鲁棒性和解释能力,确保在多样化任务中的适应性。

结果分析

TriQua在FactScore-Bio上,相关性达0.89以上,显著优于VeriScore和RefChecker,误差降低4-10%。在长文本场景中,Entailment支持率达98.54%,Decontextualization支持率达95.39%。去重策略提升了多模型验证的鲁棒性,显著改善了复杂场景下的支持率和错误定位能力。消融实验显示,关系驱动的评分机制优于整体评分,细粒度验证带来更高的解释性和准确性。

应用场景

该框架适用于知识图谱构建、自动问答、事实核查等场景,尤其在处理长文本和复杂事实时表现优越。依赖预训练模型和外部知识源,适合大规模自动化事实验证系统的开发。未来结合多模态信息,将拓展到视频、图像等多源数据的事实验证,推动可信AI的实际应用。

局限与展望

模型对复杂修饰符类别的识别仍有待提升,部分场景存在信息冗余或误用。高计算成本限制了实时应用的普及,尤其在大规模部署中效率不足。此外,面对极端抽象或模糊的事实,验证准确率仍需改进,未来需结合推理和知识推断机制增强模型能力。

通俗解读 非专业人士也能看懂

想象你在厨房里做菜,基础的食材(比如鸡蛋、面粉)就像简单的事实,是基本的材料。而复杂的菜肴,比如蛋糕或炖汤,不仅需要这些基础材料,还需要添加调味料、时间、温度等信息,这些就像修饰符一样,告诉你怎么做才能做出美味的菜。传统的方法就像只看食材,忽略了调味料和烹饪步骤,容易做出不合口味的菜。本文提出的方法就像把食材和调味料都详细标注出来,确保每个步骤都正确,做出既原汁原味又有特色的菜肴。这种方式让厨房操作更精细,也更容易找到做错的地方,保证菜肴的质量。

简单解释 像给14岁少年讲一样

想象你在玩拼图游戏,拼图块代表事实。以前的方法就像只看拼图的形状,把块拼在一起,但有时候拼错了也不容易发现。现在的方法像是在拼图时,每个块都带有标签,比如“这是蓝色的天空”或者“在白天”。如果拼错了,系统可以立刻告诉你哪个标签错了,哪一块不对。这就像给每个事实都贴上标签,验证它们是否正确。这样一来,不仅能拼出完整的图,还能知道哪里出错了,方便改正。就像在拼图游戏中,既追求完整,也追求每一块都正确,最终拼出一幅漂亮的画。

原文摘要

The "decompose-then-verify" paradigm for LLM factuality evaluation faces a fundamental trade-off: atomic facts, i.e., one sentence conveying one unit of information, often omit essential context, while broader statements lack the granularity needed for precise assessment. To address this, we introduce TriQua, a framework that flexibly models facts based on their complexity. Simple claims are extracted as standard triples, while complex claims are represented as hyperrelational facts by attaching auxiliary contextual qualifiers. This adaptive structure preserves the necessary context for accurate retrieval and verification without sacrificing atomicity. Furthermore, TriQua's verification process directly annotates concrete errors within specific triples and qualifiers, providing fine-grained explainability for error detection. Alongside the framework, we propose TriQuaScore to quantify the factuality of these structured fact units. Empirical evaluations show that TriQuaScore strongly aligns with human annotated factuality scores, TriQua achieves robust decomposition quality, and outperforms existing decomposition-based frameworks in evidence-based fact verification.

cs.AI cs.CL