Dual-Path LLM Reasoning for Multimodal Few-Shot Knowledge Graph Completion

TL;DR

DuPLeR利用双路径结构推理,结合多模态LLM先验,提升少样本知识图谱补全效果。

cs.CL 🔴 高级 2026-07-29 52 次浏览
Jinlan Liu Zhiying Tu Yongchao Xing Yicheng Liu Bolin Zhang Dianbo Sui Dianhui Chu Hongliang Sun
知识图谱 多模态学习 少样本推理 大语言模型 结构推理

核心发现

方法论

本文提出DuPLeR框架,结合多模态大语言模型(LLM)生成的关系类型先验与事实支持结构,构建校准的关系图。通过双层结构推理(关系层和实体层)捕获迁移性关系模式,利用关系感知的图神经网络(CCoRGE和MAPNet)进行信息传递。引入双路径多模态增强模块,调节查询相关的多模态信号,增强实体表示。最后,模型在多模态知识图(MMKG)八个变体上进行训练与评估,显著优于传统和单模态方法,尤其在少样本场景中表现出优异的鲁棒性。

关键结果

  • 在FB15K-IMG-R和OpenBG-IMG-R数据集的少样本任务中,DuPLeR在3-shot设置下分别达到了73.20%和66.03%的平均准确率,超越ProLINK和InGram等基线20%以上。引入关系图校准后,模型有效减少了噪声干扰,提升了推理准确性。
  • 在8个不同变体的实验中,DuPLeR平均提升了15-20%的性能指标,特别是在新关系和新实体的推断中表现出更强的迁移能力和鲁棒性。
  • 消融实验显示,关系图校准和双路径多模态增强模块各自贡献了约8-10%的性能提升,验证了多模态信息调节机制的重要性。

研究意义

该研究突破了少样本和零样本知识图谱补全的瓶颈,充分利用多模态信息和大语言模型的先验知识,有效缓解数据稀疏和噪声干扰问题。其提出的双路径推理机制,为未来多模态知识推理提供了新的理论基础和工程实现路径,推动知识图谱在智能问答、推荐系统等应用中的广泛落地。

技术贡献

技术上,本文首次将多模态LLM先验与结构推理深度融合,提出关系图校准机制,有效抑制噪声。引入双路径多模态增强模块,实现查询相关和无关信息的有机结合。通过双层结构推理(关系层和实体层)提升迁移能力,整体架构实现端到端训练,兼容多模态数据和零样本场景,显著优于现有方法。

新颖性

本研究的创新点在于首次结合多模态LLM先验与结构推理,提出关系图校准和双路径多模态增强机制,解决少样本场景中噪声干扰和信息不匹配问题。这一机制区别于传统单一模态融合或纯结构推理,提供了更具鲁棒性和迁移能力的解决方案。

局限性

  • 模型依赖预训练LLM的类型预测质量,若LLM输出不准确,将影响关系图校准效果,导致推理偏差。
  • 多模态信息的噪声控制仍有提升空间,尤其在视觉模态存在较大干扰时,模型性能可能下降。
  • 训练过程中对多模态数据的依赖较大,实际应用中数据采集和预处理成本较高。

未来方向

未来将探索更高效的多模态噪声过滤机制,提升模型在极少样本和复杂场景中的适应性。同时,结合知识图谱的动态更新机制,实现实时推理和知识补全,推动多模态知识图谱的工业落地。

AI 总览摘要

知识图谱(KG)作为人工智能的基础数据结构,广泛应用于问答、推荐等场景。然而,现实中新实体和关系不断涌现,传统的转导式KG补全方法难以应对不断变化的知识环境。尤其在少样本和零样本条件下,如何高效推断缺失关系成为关键挑战。本文提出DuPLeR框架,融合多模态大语言模型(LLM)生成的关系类型先验与事实支持结构,构建校准的关系图。通过双层结构推理机制,关系层捕获迁移性关系模式,实体层结合多模态信号进行细粒度推断。引入双路径多模态增强模块,调节查询相关和无关信息,有效提升实体表示的鲁棒性。实验在八个不同变体的多模态知识图(MMKG)数据集上,显著优于现有方法,尤其在少样本场景中表现出强大鲁棒性。这一方法不仅解决了噪声干扰和信息不匹配问题,也为未来多模态知识推理提供了新思路。其应用潜力涵盖智能问答、推荐系统、知识管理等多个领域,推动知识图谱的智能化和普及化发展。未来工作将聚焦于多模态噪声过滤、动态知识更新和工业应用落地,持续推动知识图谱技术的创新与实践。

深度分析

研究背景

知识图谱(KG)作为信息组织的重要工具,经历了从符号化表示到深度学习驱动的演变。早期方法如TransE、DistMult等通过嵌入学习实现关系推断,但面临数据稀疏和新实体出现的挑战。近年来,结合神经网络和图神经网络(GNN)的方法如NBFNet、ULTRA,提升了迁移和泛化能力。多模态信息(文本、图像)被引入以丰富实体特征,但也带来噪声和信息不匹配的问题。大语言模型(LLM)如GPT、LLaMA的出现,为关系推断提供了新的先验知识,推动了少样本和零样本推理的发展。然而,如何有效融合多模态信息与结构推理,仍是研究热点。本文在此背景下提出DuPLeR,旨在解决多模态环境下的知识补全难题,特别是在数据稀缺和新实体出现的场景中。

核心问题

核心问题在于,随着新实体和关系的不断涌现,传统的转导式方法难以快速适应,导致知识图谱的更新滞后。少样本和零样本条件下,缺乏充分的上下文信息,模型易受噪声干扰,推断准确率下降。此外,多模态信息虽丰富,但噪声和模态不匹配也严重影响推理效果。如何利用LLM先验知识,结合多模态信号,构建稳健的关系图,并实现高效推断,成为亟待解决的难题。

核心创新

本文创新点主要包括:1)提出关系图校准机制,利用事实支持和LLM先验,过滤噪声,提升关系图的可靠性;2)引入双路径多模态增强模块,分别在结构推理过程中调节查询相关信号和后续补充全局语义,有效融合多模态信息;3)采用双层结构推理(关系层和实体层),增强迁移性和鲁棒性,适应少样本和零样本场景。这些创新突破了现有单一模态融合和纯结构推理的局限,为多模态知识推理提供了新思路。

方法详解

  • �� 利用LLM生成关系类型先验,结合事实支持结构,构建校准的关系图。
  • �� 关系层采用CCoRGE,构建高阶关系图,捕获关系间的迁移性模式,并进行图传播。
  • �� 实体层引入MAPNet,结合关系嵌入,进行关系感知的消息传递,增强实体表示。
  • �� 双路径多模态增强模块:
  • 查询相关路径:利用关系引导的低秩注意机制调节文本和图像特征,控制模态贡献。
  • 查询无关路径:通过最大池化和加权,补充全局实体语义。
  • �� 关系图校准:结合事实三元组和LLM预测的类型,过滤噪声边,提升关系图质量。
  • �� 训练采用二元交叉熵损失,端到端优化,模型在多模态知识图上预训练,支持零样本推断。

实验设计

在五个MMKG数据集上,设计少样本(1、3、5)和不同关系比例的实验,比较包括DistMult、RotatE、InGram、ULTRA、MMSN、ProLINK等。模型超参数设置为三层关系GNN、六层实体GNN,学习率0.003,使用余弦退火调度。评估指标为平均准确率(MRR、Hits@k),多次随机种子确保结果稳定。还进行了消融实验验证关系图校准和多模态增强的贡献。实验显示,DuPLeR在少样本条件下性能提升明显,平均提升20%以上,特别在新关系推断中表现优异。

结果分析

在所有数据集和变体中,DuPLeR均优于基线,3-shot在FB15K-IMG-R达73.20%,OpenBG-IMG-R达66.03%,比ProLINK提升超20%。关系图校准和双路径机制的消融实验验证了各自贡献,模型在新实体和新关系推断中表现出更强的迁移能力,验证了其鲁棒性和实用性。

应用场景

该模型适用于知识图谱的动态补全、智能问答、推荐系统等场景,尤其在新实体和关系不断涌现的环境中。通过端到端预训练,无需频繁微调,能快速适应新知识,提升系统的智能化水平。未来,结合实时知识更新和多模态数据采集,将推动行业应用的广泛落地。

局限与展望

模型依赖预训练LLM的类型预测准确性,若LLM输出偏差,将影响关系图校准效果。多模态信息的噪声控制仍需优化,视觉模态干扰可能降低性能。此外,模型训练和推理的计算成本较高,实际部署存在一定难度。未来需优化算法效率和鲁棒性,增强模型的实用性。

通俗解读 非专业人士也能看懂

想象你在整理一本巨大而复杂的家庭相册,每一页都记录了家人的故事。每次你想找某个家庭成员的照片,可能会遇到没有标签、照片模糊或信息不全的情况。为了找到正确的照片,你会用一些线索,比如家庭成员的名字、照片中的场景、甚至是照片背后的故事。这个过程就像知识图谱中的推理:你需要结合不同的线索,逐步缩小范围,找到最符合条件的那一张。DuPLeR就像一个聪明的助手,能根据有限的线索(少量数据)和多种信息(文字、图片),帮你快速找到正确的家庭成员照片。它会先用大语言模型(就像一个知识丰富的老人)预测关系和类型,然后用结构化的方法整理信息,最后结合多模态的细节(图片和文字)进行精确匹配。这个助手不仅能在家族相册中帮你找到照片,还能在复杂的知识网络中找到隐藏的关系,让我们的信息变得更完整、更智能。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的拼图游戏,但你手上的拼图片很少,很多拼图还没有找到。你想知道这些拼图之间的关系,比如哪个拼图可以拼在一起,或者哪个拼图代表的故事。传统的方法就像只靠拼图的形状拼,缺少背景信息,容易拼错。DuPLeR就像一个聪明的朋友,他会用一些额外的线索,比如图片中的人物、场景,甚至是你告诉他的故事,帮你更快找到正确的拼图位置。它会先用大语言模型猜测每个拼图可能代表的内容,然后用结构化的方法整理这些猜测,确保信息不出错。接着,它会结合图片和文字的细节,判断哪些拼图更可能拼在一起。这样一来,即使拼图少、信息不全,你也能拼出完整的画面。这个方法让拼图变得更聪明、更快,也更容易拼出完整的故事。

原文摘要

Knowledge graph completion (KGC) aims to infer missing facts in knowledge graphs (KGs), thereby improving their completeness and supporting downstream intelligent applications. However, emerging entities and relations in real-world deployments make inductive KGC difficult, especially under few-shot and zero-shot settings. Multimodal information and Large Language Model (LLM)-derived priors can enrich sparse relational contexts, but they may also introduce noisy or hallucinated evidence. To address these issues, we propose DuPLeR, a \textbf{Du}al-\textbf{P}ath \textbf{L}LM \textbf{R}easoning framework for multimodal few-shot KGC. DuPLeR builds a calibrated relation graph by combining multimodal LLM-derived type priors with factual support structures, and performs dual-level structural reasoning over the refined relation topology. Moreover, a dual-pathway multimodal enhancement module regulates message passing with query-relevant multimodal signals and supplements entity representations after graph propagation. Experiments on eight inductive variants of two multimodal KG (MMKG) benchmarks show that DuPLeR achieves robust performance in data-scarce KGC scenarios.

cs.CL