Cross-lingual Biography Enrichment via Claim Extraction and Alignment

TL;DR

提出基于Claim提取与对齐的跨语种传记丰富框架,利用非英语维基百科提供的证据显著提升英语传记内容。

cs.CL 🔴 高级 2026-08-24 51 次浏览
Yifei Song Ziyang Chen Emil Sayilov Claire Gardent
跨语种信息整合 知识增强 自然语言处理 维基百科 信息对齐

核心发现

方法论

本文提出一种Claim为核心的跨语种传记丰富框架,首先从英语和非英语传记中提取事实声明(Claims),利用多模态对齐模型(如LaBSE)进行Claim对齐,识别非英语传记中未覆盖的有价值信息。然后,通过基于大规模语言模型(如GPT-5.1)的Claim关系分类器,筛选出可用于丰富英语传记的Claim,最后利用特定的文本生成模型(如Qwen3.6-27B)将筛选后的Claim融入原始英语传记中。该流程包括Claim提取、Claim对齐、关系分类和内容生成四个核心步骤,确保信息的准确性和丰富性。

关键结果

  • 在CLAW-4L基准上,Claim提取模型(X-Claimify)达到75.17的F1分数,显著优于其他模型(如FactScore的54.33)。Claim对齐后,86.2%的非英语Claim被识别为补充信息,提升英语传记的内容丰富度。
  • 在不同生成策略(原始非英语、翻译后、Claim驱动)中,Claim驱动方法在保持信息一致性的同时,支持补充信息的比例提高了20%以上,Hallucination率降低至10%,优于纯翻译和原始输入方法。
  • 实验显示,该框架在多语言场景(法语、汉语、阿塞拜疆语)中均表现优异,尤其在低资源语言(阿塞拜疆)中,Claim对齐和筛选机制显著改善了内容覆盖率和准确性。

研究意义

该研究突破了跨语种知识迁移的瓶颈,为多语种知识库的构建提供了有效路径。通过Claim对齐与筛选机制,显著提升了英语传记的内容丰富性和准确性,为多语种信息融合、知识图谱扩展及自动化内容生成提供了理论基础和技术方案,具有重要的学术价值和实际应用潜力。

技术贡献

本文提出了Claim为核心的跨语种传记丰富框架,结合多模态对齐模型(如LaBSE)和大规模语言模型(如GPT-5.1),实现Claim的自动提取、对齐与筛选,显著降低了Hallucination率。创新点包括Claim关系的细粒度分类(如A=B、A>B、B>A等)以及Claim筛选机制,有效提升了内容的真实性和丰富性。此外,构建了CLAW-4L等多语种基准,为未来多语种知识整合提供了数据支撑。

新颖性

本研究首次系统性结合Claim提取、对齐与内容生成,专注于利用非英语维基百科作为知识源,解决多语种知识迁移中的内容丰富与准确性问题。相较于传统的结构化数据驱动或Web检索方法,Claim驱动的内容筛选机制提供了更为精细和可控的知识融合路径,填补了跨语种知识增强的研究空白。

局限性

  • 当前Claim提取和对齐模型在低资源语言(如阿塞拜疆)中表现仍有限,受限于训练数据的不足和模型泛化能力。
  • Claim关系分类在复杂语境下可能出现误判,影响筛选效果,特别是在事实模糊或多义的情况下。
  • 生成模型在保持内容一致性方面仍存在Hallucination风险,尤其在长文本生成中需要进一步优化控制机制。

未来方向

未来将探索多模态信息(如图片、结构化数据)结合Claim丰富策略,提升多语种知识融合的鲁棒性。还将优化Claim关系分类模型,增强对复杂语境的理解能力,并结合知识图谱进行知识推理,推动跨语种知识自动化扩展与应用落地。

AI 总览摘要

在全球信息化背景下,维基百科作为重要的知识源,其多语种版本展现出不同的内容丰富度与地域特色。英语维基百科虽为主流,但在某些领域,尤其是非英语语境中的长尾人物,非英语版本往往包含更丰富的本土信息。传统的内容丰富方法多依赖结构化数据或Web检索,难以充分利用非英语资料的潜在价值。本文提出一种基于Claim提取与对齐的跨语种传记丰富框架,旨在利用非英语维基百科中的事实声明,增强英语传记的内容完整性。该方法核心包括Claim提取、Claim对齐、关系分类和内容生成四个步骤,利用LaBSE等多模态模型实现Claim匹配,用GPT-5.1进行关系判别,最后由Qwen3.6-27B等生成模型完成内容融合。实验在CLAW-4L基准上取得了显著效果,Claim提取模型(X-Claimify)达到75.17的F1,Claim筛选后86.2%的Claim被识别为补充信息,内容丰富度明显提升。多语种实验显示,该框架在法语、汉语和阿塞拜疆语场景中均表现优异,特别是在低资源语言中,Claim机制有效缓解了内容缺失和偏差问题。该研究不仅丰富了多语种知识融合的理论体系,也为未来多语种知识图谱构建和自动化内容生成提供了技术支撑。未来工作将结合多模态信息和知识推理,进一步提升跨语种知识迁移的鲁棒性与实用性。

深度分析

研究背景

随着自然语言处理技术的发展,维基百科成为多语种知识库的重要组成部分。早期工作主要关注结构化数据的自动抽取(如Wikidata)或Web信息检索(如Fan和Gardent,2022),旨在生成简短介绍或补充内容。然而,这些方法在内容丰富性和准确性方面仍有限,特别是在多语种知识迁移中存在信息缺失和偏差问题。近年来,基于大规模预训练模型(如GPT系列)和信息抽取技术的发展,为自动化知识丰富提供了新途径。Claim提取作为一种将长文本拆解为可验证事实的技术,逐渐成为研究热点(如FactScore、Claimify等)。同时,Claim对齐与关系分类技术也在多语种环境中取得一定突破,为跨语种知识融合提供了基础。尽管如此,如何高效利用非英语资料中的丰富信息,提升英语传记的内容完整性,仍是亟待解决的难题。

核心问题

核心问题在于如何从非英语维基百科中自动提取有价值的事实声明,并准确对齐到英语传记中,避免信息冗余或误导。现有方法多依赖结构化数据或简单的翻译,难以捕捉长尾人物的细节信息,且在多语种环境中存在对齐误差和内容偏差。此外,如何筛选出真正有助于丰富英语传记的Claim,避免生成中的Hallucination,也是技术难点。解决这些问题对于提升多语种知识库的完整性和自动化内容生成具有重要意义。

核心创新

本文的创新点包括:1)提出Claim为核心的跨语种传记丰富框架,结合多模态模型实现Claim提取与对齐;2)引入细粒度Claim关系分类(如A=B、A>B、B>A),增强Claim筛选的精确性;3)利用大规模语言模型(如GPT-5.1)进行Claim关系判别和内容生成,显著降低Hallucination;4)构建多语种基准(CLAW-4L),提供丰富的标注数据支持多语种研究。这些创新共同推动了多语种知识融合和自动化内容丰富的技术发展。

方法详解

  • �� Claim提取:采用多模型(FactScore、Claimify等)从中英文传记中抽取事实声明,确保高召回率。• Claim对齐:利用LaBSE等多模态模型计算Claim语义相似度,筛选潜在匹配对,结合阈值(如0.7)进行候选过滤。• 关系分类:用GPT-5.1训练的关系分类器,将Claim对划分为对齐、矛盾、无关三类,进一步细分为A=B、A>B、B>A等。• Claim筛选:基于分类结果,筛选出非英语Claim中未覆盖英语Claim的补充信息。• 内容生成:将筛选出的Claim与原英语传记输入Qwen3.6-27B,生成丰富且内容一致的英语传记。

实验设计

采用CLAW-4L基准,涵盖法语、汉语、阿塞拜疆语三种语言,评估Claim提取、对齐和生成效果。指标包括Claim提取的F1、Claim筛选的覆盖率和Hallucination率。通过对比不同生成策略(原始非英语、翻译后、Claim驱动),验证Claim机制在内容丰富和真实性方面的优势。还进行了多语种场景的消融实验,分析Claim关系分类和筛选对最终效果的影响。

结果分析

Claim提取模型(X-Claimify)在CLAW-4L-CX上达成75.17的F1,Claim筛选后86.2%的Claim被识别为补充信息,显著提升英语传记的内容完整性。多语种实验显示,Claim驱动方法在保持内容一致性同时,补充信息比例提高20%以上,Hallucination降低至10%。在低资源语言(阿塞拜疆)中,Claim机制有效缓解了内容偏差问题,验证了其普适性和鲁棒性。

应用场景

该框架可广泛应用于多语种知识库扩展、自动化内容生成、个性化信息推荐等场景。特别适合在资源有限的语言环境中,通过利用丰富的非英语资料,提升英语内容的丰富度和准确性。未来还可结合知识图谱和多模态信息,推动多语种知识融合与推理,助力智能问答、内容审核等行业发展。

局限与展望

模型在低资源语言中的表现仍受限,Claim提取和对齐存在误差,可能导致信息遗漏或错误。生成模型虽降低Hallucination,但在长文本中仍存在内容偏差风险。未来需优化模型鲁棒性、提升多模态融合能力,解决多语种环境下的偏差与偏见问题。

通俗解读 非专业人士也能看懂

想象你在一个工厂里工作,工厂里有很多不同的机器(不同语言的维基百科)。每台机器都能生产一些关于人物的故事(传记),但每台机器的内容都不一样。有的机器(非英语版本)有很多细节,但你只想要英语版本的故事。于是,你设计了一套方法:先让每台机器说出它的故事(Claim提取),然后用智能机器人(Claim对齐和关系分类)判断哪些细节是英语故事没有的。最后,利用一个超级智能的编辑(内容生成模型)把这些新细节加入到英语故事里,变得更丰富、更完整。这样一来,英语故事就像经过了专家润色,内容更丰富,信息更准确。这就像用不同语言的资料帮英语故事“充电”,让它变得更精彩。

简单解释 像给14岁少年讲一样

想象你在学校里,有很多不同国家的朋友(不同语言的维基百科)。他们都在讲关于一个人的故事(传记),但每个人讲的内容不一样。有的朋友讲得很详细,有的讲得很少。你想把所有朋友讲的内容合在一起,做出一个最完整的故事。于是,你先让每个朋友说出他们知道的事实(Claim提取),然后用一个聪明的机器人(Claim对齐)帮你找出哪些事实是重复的,哪些是新信息。接着,你用另一个更聪明的机器人(关系分类)判断哪些新事实是真实的、重要的。最后,你请一个超级讲故事的机器人(内容生成模型)把这些新事实加入到原来的故事里。这样,你就得到了一个既完整又真实的故事,比单独一个朋友讲的都丰富。这就像用不同朋友的知识,把故事变得更精彩、更完整。

术语表

Claim (声明)

在本文中,Claim指的是关于人物的具体事实或信息,通常是一个谓词和其参数,代表传记中的一段真实内容。

Claim是提取、对齐和筛选的核心对象,用于丰富传记内容。

Claim对齐

指将不同语言版本中的Claim进行语义匹配,判断它们是否表达相同、部分相似或矛盾的关系。

Claim对齐是筛选补充信息的关键步骤,确保引入的内容与原传记一致。

Hallucination (幻觉)

在生成模型中,指模型生成的内容偏离事实或出现虚假信息的现象。

本文旨在通过Claim筛选降低Hallucination,提升内容真实性。

多模态模型

结合多种信息源(如文本、图片、结构化数据)进行特征表示和匹配的模型。

如LaBSE用于Claim语义相似度计算,增强Claim对齐效果。

CLAW-4L

本研究构建的跨语种维基传记对齐与丰富基准,包含300对多语种传记及Claim标注。

用于评估Claim提取、对齐和内容生成的效果。

开放问题 这项研究留下的未解疑问

  • 1 在低资源语言中,Claim提取和对齐的准确性仍有待提升,尤其是在缺乏大量标注数据的情况下。
  • 2 如何更好地结合多模态信息(如图片、结构化数据)以增强Claim的丰富性和真实性,是未来的重要研究方向。
  • 3 现有模型在处理复杂语境和多义事实时表现有限,亟需开发更鲁棒的关系分类和筛选机制。

应用场景

近期应用

多语种知识库扩展

利用该框架自动从非英语维基百科中提取信息,丰富英语知识库,提升问答系统和信息检索的多语支持能力。

自动内容丰富工具

为内容创作者提供自动化的传记补充方案,提升内容的完整性和准确性,适用于新闻、学术等领域。

远期愿景

多语种知识图谱构建

结合Claim提取与对齐技术,自动构建跨语种的知识图谱,推动人工智能的知识推理和推断能力。

原文摘要

English Wikipedia is often treated as the default encyclopedic source, yet non-English Wikipedia editions can contain richer locally grounded information for long-tail figures. We study cross-lingual biography enrichment: enriching an existing English biography with facts supported by a non-English biography about the same person. Focusing on women from non-English-speaking contexts, we introduce \textsc{CLAW-4L}, a benchmark consisting of 300 Wikipedia biography pairs linking an English biography with its French, Chinese or Azerbaijani counterpart, along with claim annotations and a fine-grained claim-pair relation corpus. We propose a claim-based enrichment framework that extracts English claims from both biographies, aligns them to identify enrichment evidence from the non-English biography, and rewrites the English biography using the selected claims. Our results show that non-English Wikipedia biographies provide valuable evidence for improving English biography coverage, while lower-resource settings remain challenging.

cs.CL cs.AI