DeepXiv-SDK: An Agentic Data Interface for Scientific Literature

TL;DR

DeepXiv-SDK通过结构化、渐进式数据接口提升科研文献检索与利用效率,支持ArXiv全文同步。

cs.DL 🔴 高级 2026-02-15 1 引用 46 次浏览
Hongjin Qian Ziyi Xia Ze Liu Jianlyu Chen Kun Luo Minghao Qin Chaofan Li Lei Xiong Junwei Lan Sen Wang Zhengyang Liang Yingxia Shao Defu Lian Zheng Liu
科学文献检索 结构化数据 AI工具 科研效率 知识图谱

核心发现

方法论

DeepXiv-SDK采用三层架构:数据层、服务层和应用层。数据层将非结构化的PDF和HTML文献转化为标准化的JSON格式,提取元数据、结构信息和信号指标,支持逐步访问。服务层提供RESTful API,支持多种检索方式(如属性条件检索、混合索引)和渐进式访问(头部、章节、证据级别),实现低成本筛选和精确定位。应用层封装SDK和内置智能代理,支持复杂科研任务中的深度搜索和证据验证。整个系统每日同步ArXiv全文,支持多任务高并发调用,显著降低检索成本,提升效率。

关键结果

  • 在50个多约束查询中,DeepXiv实现了平均Recall@1达78.26%,明显优于Google Scholar和其他平台,且延迟降低至平均43.9毫秒,提升了近54倍的检索速度。通过结构化索引和渐进式访问,有效减少了Token消耗,节省了约70%的计算成本。
  • 在深度研究任务中,DeepXiv通过属性条件检索和证据级别访问,显著提升了答案的准确率(提升约15%),同时降低了Token使用量(减少约60%),验证了其在复杂问答中的优越性能。
  • 系统在百万级请求下保持稳定,支持多任务并发,响应时间稳定在几百毫秒以内,验证了其在实际科研场景中的高可用性和扩展性。

研究意义

该系统突破了传统文献检索的效率瓶颈,将非结构化文档转化为结构化、可调用的知识对象,为科研人员提供了高效、低成本的文献访问工具。它不仅提升了科研信息的可用性,也为AI驱动的科学发现提供了坚实基础,推动科研自动化和智能化发展,解决了现有文献检索中存在的碎片化、低效和不可靠的问题。

技术贡献

DeepXiv-SDK创新性地提出了三层结构的文献数据接口,结合结构化信号、渐进式访问和混合检索机制,实现了文献的可控、可重用和高效调用。其核心技术包括基于MinerU的PDF/HTML结构恢复、多模态信号提取、预算感知的渐进访问策略,以及属性条件的混合索引检索,显著优于现有的ar5iv和AlphaXiv等工具。系统设计支持大规模同步与高并发调用,为科研自动化提供了可扩展的基础架构。

新颖性

这是首个将科研论文转化为结构化、渐进式、工具可调用的接口体系,突破了传统全文检索的局限。不同于以往仅提供静态浏览或全文镜像的工具,DeepXiv-SDK实现了按需、预算感知的多层次访问,结合混合索引技术,为科研自动化和智能问答提供了全新解决方案。

局限性

  • 系统目前主要依赖arXiv公开数据,尚未覆盖所有学科领域的全文资源,未来需扩展到PubMed Central、bioRxiv等多源数据以增强多样性。
  • 结构化信号提取在复杂布局或低质量PDF中可能出现误差,影响信息的完整性和准确性,需进一步优化算法鲁棒性。
  • 高并发环境下的资源调度和成本控制仍需完善,尤其是在大规模部署时的弹性扩展和维护成本。

未来方向

未来将引入更智能的结构恢复算法,提升在低质量文档中的表现。计划扩展多源学术数据库,支持多语种和多格式文献。还将结合知识图谱技术,增强文献的语义理解和推理能力,推动科研智能助手的实现。此外,优化API接口和SDK的易用性,降低科研人员的使用门槛,也是未来重点方向。

AI 总览摘要

在当今科学研究中,文献检索与利用效率直接影响科研进展的速度与质量。传统的全文检索方式存在信息碎片化、成本高昂、结构不明确等诸多难题,严重制约了自动化科研工具的发展。为应对这一挑战,DeepXiv-SDK提出了一套创新的三层结构化文献数据接口体系,旨在实现科研文献的高效、结构化、渐进式访问。

该系统的核心思想是将非结构化的PDF和HTML文档转化为标准化的JSON格式,提取关键信息和信号指标,支持多层次的渐进式访问,从头部信息、章节内容到证据级内容逐步展开,极大降低了Token消耗和计算成本。通过结合混合索引(包括词汇索引和密集向量索引)技术,DeepXiv实现了属性条件的高效检索与筛选,为科研人员提供了快速定位相关文献的能力。

DeepXiv-SDK的设计充分考虑了实际科研场景中的需求,支持多种调用方式,包括RESTful API、Python SDK和命令行工具,方便集成到科研自动化流程中。系统每日同步最新的ArXiv全文,确保数据的时效性和完整性。实验结果显示,在50个多约束检索任务中,DeepXiv的Top-1召回率达78.26%,检索延迟仅43.9毫秒,远优于传统平台。深度研究任务中,系统显著提升了答案的准确性和效率,Token消耗降低了60%以上。

这一创新架构不仅解决了科研文献的碎片化问题,也为未来AI驱动的科学发现提供了坚实基础。它的结构化、渐进式和预算感知的设计理念,有望成为科研信息管理的行业标准。未来,系统将扩展到更多学科和多语种文献,结合知识图谱和推理能力,推动科研自动化迈向更高水平。DeepXiv-SDK的推出,标志着科研文献访问进入了一个全新的智能化时代,为科学研究的高效、可靠和智能化提供了强大支撑。

深度分析

研究背景

随着人工智能技术的快速发展,科研文献的规模和复杂度不断增加,传统的全文检索方式已难以满足高效、精准的需求。早期的文献管理工具如Google Scholar、Microsoft Academic等,主要提供关键词搜索和基本元数据检索,但在面对长篇论文、结构复杂的内容时,效率明显不足。近年来,诸如ar5iv和AlphaXiv等工具尝试将论文转化为更友好的浏览界面,增强用户体验,但仍未解决文献结构化、渐进式访问和高效检索的核心问题。科研自动化和AI驱动的证据验证需求日益增长,推动了对结构化、工具可调用的文献接口的探索。现有研究多集中在改进搜索算法或界面优化,缺乏统一的、可扩展的文献数据接口体系,限制了AI模型在科研中的深度应用。

核心问题

当前科研文献检索主要依赖全文匹配和关键词搜索,存在信息碎片化、检索成本高、证据验证困难等问题。PDF和HTML格式的论文内容结构复杂,缺乏标准化接口,导致模型在处理长文本时效率低下,容易出错。此外,缺乏渐进式访问机制使得模型难以在低成本条件下快速筛选候选文献,增加了计算资源的消耗。传统系统难以支持多任务、多约束的检索需求,限制了科研自动化和智能问答的发展。解决这些问题的关键在于构建一个结构化、可调用、渐进式的文献数据接口体系,既能保证信息的完整性,又能实现高效、低成本的检索与验证。

核心创新

DeepXiv-SDK的核心创新在于提出三层结构的文献接口体系:数据层、服务层和应用层。首先,数据层通过MinerU等工具,将PDF和HTML文档转化为结构化的JSON对象,提取元数据、结构信息和信号指标,支持逐步访问。其次,服务层提供RESTful API,支持多种检索方式(属性条件、混合索引)和渐进式访问(头部、章节、证据级别),实现低成本筛选和精确定位。最后,应用层封装SDK和智能代理,支持多任务深度科研,包括深度搜索和证据验证。该体系突破了传统全文检索的局限,实现了按需、预算感知的高效访问,为科研自动化提供了基础架构。

方法详解

  • �� 数据层:
  • 输入:arXiv ID
  • 处理流程:
  • �� 通过OAI-PMH接口获取元数据
  • �� 获取HTML或PDF源文件,HTML优先,PDF作为备选
  • �� PDF转Markdown(MinerU)或HTML内容提取
  • �� 结构化:检测标题、段落,构建章节树
  • �� 生成标准JSON(包含元数据、结构信息、信号指标)
  • �� 计算预算提示(如Token数、长度)
  • �� 提取语义信号(TL;DR、关键词)
  • �� 关联引用和社交信号(如引用数、社交媒体指标)
  • 输出:结构化的JSON对象及多种视图(overview、section、evidence)

  • �� 服务层:
  • 提供REST API接口
  • 支持渐进式访问(header、section、full text)
  • 支持属性条件检索(类别、作者、时间、引用)
  • 支持混合索引(词汇+向量)
  • 通过API调用实现低成本筛选和定位
  • 提供Python SDK和CLI工具

  • �� 应用层:
  • 封装SDK,支持深度科研任务
  • 内置智能代理,自动执行检索、筛选、路由和证据验证
  • 支持多轮交互式查询
  • 提供示范工作流(深度搜索、深度研究)
  • 支持多任务并发和高吞吐

整体架构确保文献数据的标准化、渐进式访问和高效调用,满足科研自动化的多样需求。

实验设计

实验设计包括两大任务:多约束文献检索和复杂证据问答。数据集为50个多条件检索查询和47个深度问答任务,全部基于最新的ArXiv数据。对比基线包括Google Scholar、AlphaXiv等平台,指标涵盖Top-1召回率、延迟、Token消耗和答案准确率。检索任务中,DeepXiv在Recall@1达78.26%,延迟仅43.9毫秒,优于对比平台的平均数(如Google Scholar Labs 7的120毫秒)。深度问答中,系统在答案正确率上提升15%,Token节省60%以上。系统在百万级请求下保持稳定,支持多任务高并发,验证了其在实际科研场景中的高可用性和扩展性。

结果分析

DeepXiv在多任务、多约束检索中表现优异,显著优于传统平台,尤其在延迟和准确率方面。其渐进式访问策略有效减少Token消耗,提升检索效率。深度问答任务中,系统能在保证答案质量的同时,节省大量计算资源。系统的高并发性能和稳定性也得到验证,为大规模科研场景提供了技术保障。这些结果表明,DeepXiv-SDK不仅在理论上具有创新性,也在实际应用中展现出强大的性能优势。

应用场景

该系统可广泛应用于科研自动化、文献综述、证据验证、科研助手等场景。科研人员可以利用其高效的检索和证据提取能力,加快文献筛选和信息整合过程。学术机构和科研平台也能借助DeepXiv实现文献管理自动化,提升科研效率。未来,结合知识图谱和推理能力,还能支持更复杂的科研推断和创新发现,推动AI在科学领域的深度融合。

局限与展望

目前系统主要依赖arXiv公开数据,覆盖范围有限,未来需扩展到更多数据库。结构化信号提取在复杂布局或低质量文档中可能出现误差,影响信息完整性。高并发环境下的资源调度和成本控制仍需优化,尤其在大规模部署时的弹性扩展和维护成本较高。此外,系统在多学科、多语种环境中的表现仍需验证,未来需增强多源、多语种支持能力。

通俗解读 非专业人士也能看懂

想象你在一个大型图书馆里找资料。以前,你只能逐本翻阅书本,花费很多时间,也容易错过重要信息。DeepXiv-SDK就像是一个智能助手,它把所有书本的内容整理成电子版,按章节、重点、证据等不同层次整理好。你可以让它帮你快速找到你需要的部分,比如只看摘要或只看某个章节,然后再深入了解具体内容。它还能根据你的需求,筛选出最相关的书和段落,节省你的时间和精力。这样一来,科研工作变得像在有了超级搜索引擎和智能导览一样高效、方便,不再为海量资料而烦恼。

简单解释 像给14岁少年讲一样

想象你在学校图书馆里找资料,但书太多,翻来翻去很费时间。DeepXiv就像是一个超级聪明的机器人助手,它把所有的书都整理成电子版,还会把重要内容总结出来。你可以告诉它你想找关于“太阳能电池”的资料,它会先帮你筛选出最相关的几本书,只看摘要和重点部分。等你觉得需要详细了解某个内容时,再让它帮你打开那一章节,甚至找到具体的证据。这样一来,你不用翻遍所有书,就能很快找到你要的答案,还省下很多时间。就像有个智能图书馆助手一样,帮你变得更聪明、更快!

原文摘要

LLM-agents are increasingly used to accelerate the progress of scientific research. Yet a persistent bottleneck is data access: agents not only lack readily available tools for retrieval, but also have to work with unstrcutured, human-centric data on the Internet, such as HTML web-pages and PDF files, leading to excessive token consumption, limit working efficiency, and brittle evidence look-up. This gap motivates the development of \textit{an agentic data interface}, which is designed to enable agents to access and utilize scientific literature in a more effective, efficient, and cost-aware manner. In this paper, we introduce DeepXiv-SDK, which offers a three-layer agentic data interface for scientific literature. 1) Data Layer, which transforms unstructured, human-centric data into normalized and structured representations in JSON format, improving data usability and enabling progressive accessibility of the data. 2) Service Layer, which presents readily available tools for data access and ad-hoc retrieval. It also enables a rich form of agent usage, including CLI, MCP, and Python SDK. 3) Application Layer, which creates a built-in agent, packaging basic tools from the service layer to support complex data access demands. DeepXiv-SDK currently supports the complete ArXiv corpus, and is synchronized daily to incorporate new releases. It is designed to extend to all common open-access corpora, such as PubMed Central, bioRxiv, medRxiv, and chemRxiv. We release RESTful APIs, an open-source Python SDK, and a web demo showcasing deep search and deep research workflows. DeepXiv-SDK is free to use with registration.

cs.DL cs.AI cs.CL cs.IR

参考文献 (14)

Synthesizing scientific literature with retrieval-augmented language models

Akari Asai, Jacqueline He, Rulin Shao 等

2026 75 引用

Model-Document Protocol for AI Search

Hong-Jin Qian, Zheng Liu

2025 2 引用 查看解读 →

Paper2Agent: Reimagining Research Papers As Interactive and Reliable AI Agents

Jia-Cheng Miao, Joe R. Davis, Jonathan K. Pritchard 等

2025 30 引用 查看解读 →

Agentic Web: Weaving the Next Web with AI Agents

Yingxuan Yang, Mulei Ma, Yuxuan Huang 等

2025 62 引用 查看解读 →

Build the web for agents, not agents for the web

Xing Han Lù, Gaurav Kamath, Marius Mosbach 等

2025 17 引用 查看解读 →

PaSa: An LLM Agent for Comprehensive Academic Paper Search

Yichen He, Guanhua Huang, Peiyuan Feng 等

2025 78 引用 查看解读 →

Agent Laboratory: Using LLM Agents as Research Assistants

Samuel Schmidgall, Yusheng Su, Ze Wang 等

2025 478 引用 查看解读 →

Beyond Browsing: API-Based Web Agents

Yueqi Song, Frank F. Xu, Shuyan Zhou 等

2024 87 引用 查看解读 →

MinerU: An Open-Source Solution for Precise Document Content Extraction

Bin Wang, Chaochao Xu, Xiaomeng Zhao 等

2024 324 引用 查看解读 →

Autonomous LLM-driven research from data to human-verifiable research papers

Tal Ifargan, L. Hafner, M. Kern 等

2024 83 引用 查看解读 →

LitLLM: A Toolkit for Scientific Literature Review

Shubham Agarwal, I. Laradji, Laurent Charlin 等

2024 76 引用 查看解读 →

A survey on large language model based autonomous agents

Lei Wang, Chengbang Ma, Xueyang Feng 等

2023 3753 引用 查看解读 →

ReAct: Synergizing Reasoning and Acting in Language Models

Shunyu Yao, Jeffrey Zhao, Dian Yu 等

2022 10895 引用 查看解读 →

Web Data Knowledge Extraction

J. M. Tirado, O. Șerban, Qiang Guo 等

2016 6 引用 查看解读 →

被引用 (1)

ScholarQuest: A Taxonomy-Guided Benchmark for Agentic Academic Paper Search in Open Literature Environments