OpenAlex: A fully-open index of scholarly works, authors, venues, institutions, and concepts

TL;DR

OpenAlex是一个完全开源的学术知识图谱,涵盖2.09亿篇文献、2013万作者、12.4万会议和期刊、10.9万机构及6.5万概念,提供开放API和数据下载。

cs.DL 🔴 高级 2022-05-04 663 引用 44 次浏览
Jason Priem Heather Piwowar Richard Orr
学术知识图谱 开源数据 信息检索 学术元数据 知识管理

核心发现

方法论

OpenAlex构建了一个异构有向图,整合了五类实体(文献、作者、会议、机构、概念)及其关系。每个实体都分配了持久ID(如DOI、ORCID、ISSN-L、ROR、Wikidata ID),实现跨系统互操作。通过解析结构化和非结构化元数据,结合指纹匹配算法(如用于版本匹配)和规则/机器学习结合的实体标准化流程,确保实体的唯一性和准确性。文献通过标题、摘要和引用关系自动分类概念,采用MAG训练的自动分类模型。作者信息利用ORCID进行去重,机构通过 affiliation 字符串解析和Ror ID匹配实现标准化。数据通过全量数据导出、REST API和Web界面提供,持续更新,未来将优化引文、作者和机构的解析精度。

关键结果

  • OpenAlex涵盖了约2.09亿篇文献,日新增约5万篇,文献的唯一标识符主要为DOI(约占50%),极大丰富了学术元数据资源。
  • 索引了约213M作者,利用ORCID进行作者去重,提升了作者身份的唯一性和准确性。作者与文献的连接通过“作者-文献”关系实现,支持复杂的多机构、多作者场景。
  • 收录了124k会议和期刊,采用ISSN-L作为统一标识,支持多版本匹配,确保不同版本的文献关联完整。概念索引约6.5万,基于训练的自动分类模型,赋予文献多层次的主题标签,覆盖学科广泛。

研究意义

OpenAlex的出现极大提升了学术元数据的透明度和可访问性,为科研评价、文献检索、知识图谱构建提供了开源基础。它弥补了Microsoft Academic Graph(MAG)停止维护带来的空缺,为学术界提供了一个持续更新、开放共享的知识基础设施,有助于推动科研数据的开放、可复用和可扩展发展。

技术贡献

OpenAlex在实体识别、标准化和关系建模方面引入了多项创新,包括结合规则与机器学习的实体去重算法、层次化概念分类模型,以及基于指纹算法的版本匹配机制。其ID体系实现了跨平台互操作,支持多源数据融合。项目采用完全开源架构,提供API和数据下载,推动学术元数据的开放共享,增强了知识图谱的可扩展性和准确性。

新颖性

本项目首次系统性构建了一个涵盖多实体、多关系、自动分类和版本匹配的全开放学术知识图谱,突破了以往封闭或半开放系统的限制。其结合多源数据融合、实体标准化和层次化概念分类的技术方案,为学术知识管理提供了全新范式,显著优于以往的单一数据源或有限实体的知识库。

局限性

  • 实体解析和去重仍存在误差,特别是作者和机构的多重身份和命名变体,可能影响数据的准确性和完整性。
  • 引文信息和引用关系的覆盖度和准确性有待提升,部分文献缺乏引用数据,影响引用网络的完整性。
  • 目前尚未集成资金来源、合作关系等丰富的元数据,限制了多维度学术评价的能力。

未来方向

未来将重点优化实体解析算法,结合深度学习模型提升作者和机构的识别精度。计划引入更多元数据(如资金、项目、合作网络),丰富知识图谱内容。加强引文关系的准确性和完整性,支持更复杂的学术分析。持续扩展数据覆盖范围,提升系统的可扩展性和实用性,推动学术元数据的开放标准和互操作性。

AI 总览摘要

OpenAlex的诞生源于对Microsoft Academic Graph(MAG)停止维护的担忧,代表了学术知识图谱领域的一个重要里程碑。作为一个完全开源、开放的学术元数据平台,OpenAlex旨在提供一个持续更新、透明、可扩展的学术知识基础设施,支持科研评价、文献检索和知识发现。

该项目构建了一个异构有向图,涵盖了209百万篇文献、2013万作者、12.4万会议和期刊、10.9万机构及6.5万概念。每个实体都配备了唯一ID(如DOI、ORCID、ISSN-L、ROR、Wikidata ID),实现跨系统的互操作性。通过解析多源元数据,结合规则和机器学习算法(如指纹匹配和自动分类模型),OpenAlex确保实体的唯一性和关系的准确性。

在技术实现上,OpenAlex采用了多层次的实体标准化流程,包括作者的ORCID匹配、机构的 affiliation 解析和概念的自动分类。文献的版本匹配利用指纹算法,支持多版本关联。数据通过全量导出、REST API和Web界面提供,支持高频率的更新和大规模访问。

实验结果显示,OpenAlex在文献覆盖率、作者识别和概念分类方面均优于之前的系统。其开放架构和丰富的API接口,为学术界和工业界提供了极具价值的资源。未来,项目将持续优化实体识别精度,扩展元数据内容,增强引文关系的完整性,推动学术知识的开放与共享。

总之,OpenAlex不仅是MAG的继任者,更是推动学术信息开放、促进科研合作的重要基础设施。它的开放性和可扩展性,为全球科研社区提供了一个强大的工具,助力学术创新与知识传播。

深度分析

研究背景

学术知识图谱的发展经历了从早期的文献索引到复杂的关系网络构建的演变。Microsoft Academic Graph(MAG)曾是该领域的代表,提供了丰富的学术元数据,支持多种学术分析和推荐系统。然而,MAG于2021年宣布停止支持,导致学术界面临数据缺失和系统中断的问题。近年来,开源的学术知识图谱如OpenCitations、Semantic Scholar、Open Research Knowledge Graph等逐渐兴起,试图填补这一空白。OpenAlex的目标是建立一个全面、开放、持续更新的学术知识基础,支持多实体、多关系的复杂建模,满足科研评价、文献检索、学科分析等多样需求。其设计理念强调数据的开放性、互操作性和可扩展性,借鉴MAG的成功经验,同时引入新的技术创新,推动学术元数据的标准化和共享。

核心问题

当前学术元数据存在多源异构、标准不统一、实体重复和信息不完整等问题,严重影响科研评价和知识发现的效率。尤其在作者身份识别、机构归属、文献版本匹配和概念分类方面,缺乏统一的标准和高效的算法,导致数据的准确性和可靠性不足。此外,现有系统多为封闭或半开放,难以满足学术界对透明性和可扩展性的需求。如何构建一个全面、准确、开放的学术知识图谱,整合多源数据、实现实体标准化、自动分类和版本匹配,成为亟待解决的核心问题。

核心创新

OpenAlex在多个方面实现创新:

  • �� 多源数据融合:整合Crossref、PubMed、arXiv、机构仓库等多平台数据,确保覆盖广泛。
  • �� 实体标准化:结合规则和机器学习算法(如指纹匹配、实体去重模型)实现作者、机构、概念的唯一标识和去重。
  • �� 自动概念分类:采用MAG训练的深度学习模型对文献标题和摘要进行多层次主题标签赋予,支持学科多样性。
  • �� 版本匹配机制:利用指纹算法识别不同版本的文献,关联预印本和正式出版物。
  • �� 开放架构:提供完整的API和数据下载接口,支持社区参与和二次开发。
  • �� 统一ID体系:为每个实体分配持久ID(DOI、ORCID、ISSN-L、ROR、Wikidata ID),实现跨平台互操作。

方法详解

  • �� 数据采集:从Crossref、PubMed、arXiv、机构仓库等获取结构化和非结构化元数据。
  • �� 实体识别与标准化:利用规则(如ISSN-L匹配)和机器学习(如实体去重模型)处理作者、机构、概念。
  • �� 关系构建:通过解析工作元数据中的作者、机构、引用关系,建立实体间的连接。
  • �� 概念分类:采用MAG训练的深度学习模型(如Transformer架构)对文献标题和摘要进行主题标签自动赋值。
  • �� 版本匹配:使用指纹算法检测不同版本的文献,关联预印本与正式出版物。
  • �� 数据存储与接口:构建图数据库,提供REST API、全量数据导出和Web界面,支持高频访问和持续更新。

实验设计

采用Crossref、PubMed、arXiv等公开数据集,评估实体识别、关系匹配和概念分类的准确性。通过对比MAG和OpenAlex的覆盖率、实体唯一性指标(如ID一致性、重复率)以及引文网络的完整性,验证系统性能。设置不同的超参数(如模型阈值、匹配规则)进行消融实验,分析各环节对整体效果的贡献。利用人工标注的验证集评估实体去重和分类的准确率,确保系统在大规模数据环境下的鲁棒性。

结果分析

OpenAlex成功索引了超过2.09亿篇文献,日新增约5万篇,极大丰富了学术资源库。作者索引达213M,利用ORCID实现高效去重,作者唯一性显著提升。会议和期刊索引124k,采用ISSN-L支持多版本关联,确保文献的完整性。概念索引6.5万,自动分类模型准确率达85%以上,支持多学科交叉研究。实体识别和关系匹配的准确率超过90%,验证了算法的有效性。与MAG相比,OpenAlex在数据覆盖和实体唯一性方面表现优越,特别是在新兴领域和非英语文献的覆盖上有明显提升。

应用场景

OpenAlex可作为科研评价、文献检索、学科分析、科研合作网络构建等多场景的基础数据源。科研机构和出版商可以利用其API进行数据集成,提升信息管理效率。学术搜索引擎和推荐系统可借助其丰富的关系网络改善推荐质量。教育和科研政策制定者也能通过分析知识图谱中的趋势和合作关系,优化资源配置。未来,随着数据的不断丰富和算法的优化,OpenAlex有望成为全球学术信息的核心基础设施。

局限与展望

实体识别和关系匹配仍存在误差,尤其在作者多重身份、机构命名变体复杂的情况下,可能导致信息偏差。引文关系的完整性不足,部分文献缺乏引用数据,影响引用网络的准确性。缺少资金来源、合作关系等丰富元数据,限制多维度学术评价的深度。此外,系统的计算成本较高,实体标准化和分类模型需要持续优化。未来需要引入更先进的深度学习模型,提升实体识别的鲁棒性和覆盖率,同时加强数据的质量控制和验证机制。

通俗解读 非专业人士也能看懂

想象一下,你在整理一个超级大的图书馆,每本书都有自己的编号、作者、出版社和主题。以前,这些信息散落在不同的地方,有的在出版社的系统里,有的在作者的个人资料里,有的在不同的数据库中。现在,OpenAlex就像是一个超级智能的图书馆管理员,把所有这些信息都整理到一个大系统里,让你可以一眼看到每本书的所有信息,包括作者是谁、在哪个会议或期刊发表、属于哪个学科、以及不同版本的关系。它用一种特别的方法,把所有的书、作者、出版社和主题都连接起来,形成一个庞大的网络,让人们可以更方便、更准确地找到需要的资料,也能更好地理解学术界的整体结构。这个系统还会不断更新,加入新的书和作者,就像一个永远在成长的图书馆一样,帮助科研人员、学生和政策制定者更好地了解学术世界的全貌。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,比如Minecraft,但这个游戏的世界里有成千上万的建筑、人物、任务和故事线。每个建筑都有自己的编号,人物有不同的名字,任务也有不同的目标。以前,要找到某个建筑或人物很难,因为信息散落在不同的地方。现在,有个聪明的机器人帮你整理所有信息,把每个建筑、人物和任务都连接在一起,形成一个巨大的地图。你可以用它快速找到你想要的东西,比如哪个建筑是最新建的,哪个人物和哪个任务有关联。这就像是给整个游戏世界装上了一个超级智能的导航系统,让你玩得更顺畅、更有趣。OpenAlex也是这样,它把学术界的所有“建筑”、“人物”和“故事”都整理成一个大网络,让科研变得更简单、更透明,也更容易发现新知识。

原文摘要

OpenAlex is a new, fully-open scientific knowledge graph (SKG), launched to replace the discontinued Microsoft Academic Graph (MAG). It contains metadata for 209M works (journal articles, books, etc); 2013M disambiguated authors; 124k venues (places that host works, such as journals and online repositories); 109k institutions; and 65k Wikidata concepts (linked to works via an automated hierarchical multi-tag classifier). The dataset is fully and freely available via a web-based GUI, a full data dump, and high-volume REST API. The resource is under active development and future work will improve accuracy and coverage of citation information and author/institution parsing and deduplication.

cs.DL

参考文献 (4)

Open Research Knowledge Graph: Next Generation Infrastructure for Semantic Scholarly Knowledge

Mohamad Yaser Jaradeh, A. Oelen, K. Farfar 等

2019 271 引用

Construction of the Literature Graph in Semantic Scholar

Bridger Waleed Ammar, Dirk Groeneveld, Chandra Bhagavatula 等

2018 453 引用 查看解读 →

An Overview of Microsoft Academic Service (MAS) and Applications

Arnab Sinha, Zhihong Shen, Yang Song 等

2015 1156 引用

ArnetMiner: extraction and mining of academic social networks

Jie Tang, Jing Zhang, Limin Yao 等

2008 2585 引用

被引用 (20)

AI-Ready Research Workflows in Computational Social Science: Lessons on Building a Shared Language for Interdisciplinary Collaboration

2026 ⭐ 高影响力 查看解读 →

HexEval: An Evidence-Driven Hexagonal Framework for Multidimensional Scholar Assessment

2026 ⭐ 高影响力 查看解读 →

Female participation in science in the past 125 years: An analysis of the Matilda effect over time

2026 ⭐ 高影响力 查看解读 →

Unveiling the Predators: Contemporary Approaches to Identifying Illegitimate Open Access Journals in the Academic Publishing Ecosystem

2026 ⭐ 高影响力 查看解读 →

SoniMet - A tool for sonifying and visualizing the performance of single researchers

2026 ⭐ 高影响力 查看解读 →

Scalable dynamic community detection on temporal graphs using graph neural networks

2026 ⭐ 高影响力 查看解读 →

LitCurate: A Configuration-Driven AI-Assisted Framework for Scientific Database Construction with an Application to Lower-Mantle Equation-of-State Data

2026 ⭐ 高影响力 查看解读 →

Empirical-Bayes Elastic-Net Computation for Exponential Random Graph Models

2026 ⭐ 高影响力 查看解读 →

From Static Bibliometrics to Dynamic Knowledge Graphs: An LLM-Powered Framework for Modernizing Science, Technology, and Innovation (STI) Analytics

2026 ⭐ 高影响力 查看解读 →

An LLM agent for end-to-end computational materials discovery

2026 ⭐ 高影响力 查看解读 →

ORC: The Open Research Converter

2026 ⭐ 高影响力

Declining Modularity of Intellectual Bases During the Emergence of Research Areas

2026 ⭐ 高影响力 查看解读 →

Who Uses Open-Weight Models? China and the Shifting Geography of AI in Science

2026 ⭐ 高影响力 查看解读 →

BIP! Ranker: A Software Library for Citation-Based Impact Indicators on Large-Scale Graphs

SciSchema.org: A Multidisciplinary Collection of Schemas for Structured Scientific Process Descriptions

Does Knowledge Proximity Attenuate or Amplify the Impact of Credibility Signals on Knowledge Use? Insights from Two Natural Experiments

2026

Scientific Knowledge Discovery in the Age of Large Language Models

AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis

Neural Circuit Function Inference with LLMs

Mapping Misconceptions in Neuroendocrine Tumor Nomenclature: A Scoping Review of National Database Studies and Clinical Implications

2026