QA-GNN: Reasoning with Language Models and Knowledge Graphs for Question Answering

TL;DR

提出QA-GNN模型,通过相关性评分和联合推理提升问答性能,超越现有LM+KG方法。

cs.CL 🔴 高级 2021-04-14 53 次浏览
Michihiro Yasunaga Hongyu Ren Antoine Bosselut Percy Liang Jure Leskovec
知识图谱 图神经网络 问答系统 联合推理 知识融合

核心发现

方法论

QA-GNN结合预训练语言模型(如RoBERTa)和知识图谱(如ConceptNet、UMLS),通过两步创新实现问答推理:首先利用LM对KG节点进行相关性评分,衡量节点与QA上下文的关系;其次构建联合图,将QA上下文作为节点连接到KG子图中的实体,利用图神经网络(GAT架构)进行多轮信息传递,动态更新节点表示,实现结构化推理。模型端到端训练,融合文本和知识信息,提升推理能力。

关键结果

  • 在CommonsenseQA、OpenBookQA和MedQA-USMLE数据集上,QA-GNN分别比最优LM+KG模型提升4.7%、2.3%和1.2%的准确率,显著优于对比模型。特别在处理否定和实体替换等结构化推理任务上,表现出更强的鲁棒性和解释能力。
  • 在CommonsenseQA中,QA-GNN在包含否定的题目上提升4.6%,优于现有LM+KG模型0.6%;在MedQA-USMLE中,准确率达38.0%,超越单纯LM模型,验证其跨领域适用性。
  • 通过分析推理路径,模型能提取多路径知识子图,增强可解释性,显示其在复杂推理中的潜力。

研究意义

该研究突破了传统LM或KG单一依赖的局限,提出联合推理框架,有效融合文本语义和结构化知识,增强模型的推理深度和解释性。对知识驱动的问答系统、自动推理和知识图谱应用具有重要推动作用,推动AI在复杂推理任务中的应用落地。

技术贡献

创新点在于引入相关性评分机制,利用预训练LM动态评估KG节点的重要性,结合多轮GAT推理实现节点信息的互补更新。模型端到端训练,兼顾结构化知识和文本语义,显著提升推理效果。提出的联合图结构和多模态融合策略,为知识图谱推理提供新思路。

新颖性

首次系统性结合预训练语言模型的相关性评分与联合图推理,突破传统子图抽取的局限,实现动态知识筛选与结构化推理的无缝融合。相较于以往仅依赖路径或单一模态的模型,QA-GNN在多源信息融合方面具有明显创新。

局限性

  • 模型依赖预训练LM的质量,面对知识不足或偏差时推理效果受限;在超大知识图谱或多跳推理中,计算复杂度仍较高,需优化效率。
  • 对于多模态信息融合的泛化能力仍需验证,特别是在开放域或多任务场景中,模型可能面临知识偏差和解释不充分的问题。
  • 当前训练资源需求较大,模型参数较多,实际部署时需考虑模型压缩与推理速度。

未来方向

未来将探索多模态知识融合,结合视觉、语音等多源信息,提升问答的多样性和鲁棒性。同时,优化模型结构以降低计算成本,增强模型在大规模知识图谱中的扩展能力,推动知识推理在实际应用中的普及。

AI 总览摘要

在人工智能问答领域,如何有效结合大规模预训练语言模型(如RoBERTa)与结构化知识图谱(如ConceptNet、UMLS)一直是核心难题。传统方法或依赖单一模态,或采用粗糙的子图抽取,难以实现深层次的结构化推理,特别是在处理否定、实体替换等复杂逻辑时表现不足。本文提出的QA-GNN模型,通过引入两个关键创新,显著提升了问答的准确性和解释性。

首先,模型利用预训练LM对KG节点进行相关性评分,动态筛选出与QA上下文紧密相关的实体,避免噪声干扰。其次,构建联合图,将QA上下文作为特殊节点连接到KG子图中的实体,利用多轮图神经网络(基于GAT架构)进行信息传递,实现文本与知识的深度融合。整个系统端到端训练,兼顾文本语义和知识结构,增强推理能力。

在多个公开数据集上,QA-GNN均优于现有最优模型,尤其在处理复杂推理场景(如否定句)时表现出更强鲁棒性。实验结果显示,该模型在CommonsenseQA、OpenBookQA和MedQA-USMLE上的准确率分别提升4.7%、2.3%和1.2%,验证其跨领域适用性。模型还能提取多路径推理路径,增强可解释性,为未来知识驱动的智能问答提供新思路。

该研究不仅推动了知识图谱与预训练模型的深度融合,也为结构化推理提供了新框架,具有广泛的应用前景。未来将探索多模态知识融合、模型压缩与大规模扩展,以实现更高效、更智能的知识推理系统。

深度分析

研究背景

知识图谱(KG)和预训练语言模型(LM)是当前问答系统的两大核心技术。早期工作如ConceptNet、Freebase提供丰富的结构化知识,但难以动态筛选相关信息。LM如BERT、RoBERTa在自然语言理解中表现优异,但在结构化推理方面存在局限。近年来,结合两者的LM+KG方法逐渐兴起,代表性有Lin et al. (2019)的路径抽取和Wang et al. (2019a)的关系网络,但多依赖静态子图或路径,难以应对复杂逻辑。现有方法在处理否定、实体替换等结构化推理时表现不足,亟需更灵活的融合机制。

核心问题

核心问题在于如何高效识别大规模KG中的相关知识,并实现文本与知识的深度融合进行联合推理。传统子图抽取方法引入大量无关实体,影响推理效率和准确性。单一模态方法难以捕捉复杂逻辑关系,缺乏可解释性。如何设计动态筛选、结构化融合的模型,成为提升问答系统性能的关键挑战。

核心创新

本研究提出两大创新:一是引入预训练LM的相关性评分机制,动态评估KG节点的重要性,过滤噪声;二是构建联合图,将QA上下文作为特殊节点连接到KG子图,利用多轮GAT推理实现文本与知识的深度融合。模型端到端训练,结合节点相关性和结构信息,提升推理深度。此框架突破了传统静态子图和路径依赖的限制,为多源信息融合提供新思路。

方法详解

  • �� 先用LM编码问答上下文,提取文本向量。
  • �� 检索与问答相关的KG子图,筛选前200节点。
  • �� 计算每个节点的相关性分数,将实体文本与问答文本拼接输入LM,得到节点重要性。
  • �� 构建联合图,加入问答上下文节点z,连接到KG子图中的实体,形成工作图。
  • �� 利用多层GAT在工作图上进行信息传递,更新节点表示。
  • �� 结合节点表示和相关性,进行最终问答预测。

实验设计

采用CommonsenseQA、OpenBookQA和MedQA-USMLE三大数据集,比较基线包括单纯LM模型和现有LM+KG模型。超参数调优包括层数(L=5)、隐藏维度(200)、学习率等。模型训练端到端,使用交叉熵损失,评估准确率。进行消融实验验证相关性评分和联合推理的贡献。

结果分析

在三个数据集上,QA-GNN分别超越最优对比模型4.7%、2.3%、1.2%的准确率。在复杂推理(如否定)任务中提升显著,尤其在CommonsenseQA中,否定题目准确率提升4.6%。模型还能提取多路径推理路径,增强解释性,验证其在结构化推理中的优势。

通俗解读 非专业人士也能看懂

想象你在一个工厂里工作,工厂里有很多不同的机器(知识图谱中的实体),每台机器都能做不同的事情。你需要找到最合适的机器来帮你完成一项任务(问答)。以前的方法就像随机找几台机器,可能会找到一些不相关的,效率低。现在,这个新方法像是你用一个智能助手(预训练模型)告诉你哪些机器最适合这个任务,然后你把这些机器和你的任务(问答内容)连接起来,让它们一起合作工作。这个助手还能告诉你哪些机器更重要(相关性评分),让你只用最关键的机器。通过不断让这些机器交换信息(图神经网络),它们逐渐理解整个工厂的运作方式,最后帮你找到最合适的答案。这种方法让工厂工作得更快、更准,也更容易理解每一步是怎么做的。

简单解释 像给14岁少年讲一样

想象你在学校里,有很多不同的朋友(知识点),每个朋友都知道一些事情。有时候,你需要找到知道某个问题答案的朋友,但不是所有朋友都知道答案。以前,你可能会随便问几个朋友,结果得到的答案不一定正确。现在,有个聪明的哥哥(模型)可以帮你判断哪些朋友最可能知道答案,他会告诉你哪些朋友最靠谱(相关性评分),然后你把这些朋友都叫到一起(联合图),让他们互相讨论(图神经网络),逐步交换信息,最后得出一个最靠谱的答案。这个哥哥还能告诉你,哪些朋友在讨论中起了关键作用(解释路径),让你知道答案是怎么来的。这样一来,你的问题就能更快、更准地得到答案,还能知道答案的来龙去脉。

术语表

知识图谱 (Knowledge Graph)

结构化存储实体及关系的图形数据库,用于表示世界知识,支持推理和查询。

论文中用作结构化知识源,结合问答任务进行推理。

图神经网络 (Graph Neural Network)

一种处理图结构数据的神经网络,通过节点间信息传递实现节点表示学习。

用于在联合图上进行多轮信息传递,增强推理能力。

相关性评分 (Relevance Scoring)

利用预训练模型评估知识节点与问答上下文的关系强度,筛选重要节点。

核心创新之一,用于动态过滤知识图中的噪声节点。

联合图 (Joint Graph)

将问答上下文节点与知识图实体节点连接形成的结构,用于多模态推理。

模型核心结构,用于实现结构化联合推理。

多轮信息传递 (Multi-hop Message Passing)

在图神经网络中多次更新节点表示,融合邻居信息以捕获复杂关系。

实现深层次推理和知识融合的关键机制。

开放问题 这项研究留下的未解疑问

  • 1 如何在极大规模知识图谱中高效筛选相关节点,减少计算成本,仍是未来挑战。
  • 2 模型在多模态知识融合中的泛化能力和解释性还需深入研究。

原文摘要

The problem of answering questions using knowledge from pre-trained language models (LMs) and knowledge graphs (KGs) presents two challenges: given a QA context (question and answer choice), methods need to (i) identify relevant knowledge from large KGs, and (ii) perform joint reasoning over the QA context and KG. In this work, we propose a new model, QA-GNN, which addresses the above challenges through two key innovations: (i) relevance scoring, where we use LMs to estimate the importance of KG nodes relative to the given QA context, and (ii) joint reasoning, where we connect the QA context and KG to form a joint graph, and mutually update their representations through graph neural networks. We evaluate our model on QA benchmarks in the commonsense (CommonsenseQA, OpenBookQA) and biomedical (MedQA-USMLE) domains. QA-GNN outperforms existing LM and LM+KG models, and exhibits capabilities to perform interpretable and structured reasoning, e.g., correctly handling negation in questions.

cs.CL cs.LG