SciEGQA: A Dataset for Scientific Evidence-Grounded Question Answering and Reasoning

TL;DR

SciEGQA以语义区域框选和Grounding–Crop–then–Answer评测科学文档推理,含1,623条人工QA与30K+训练QA。

cs.DB 🔴 高级 2025-11-19 30 次浏览
Wenhan Yu Zhaoxi Zhang Wang Chen Guanqiang Qi Weikang Li Lei Sha Deguo Xia Jizhou Huang
科学文档问答 视觉语言模型 证据定位 多模态推理 数据集

核心发现

方法论

论文将样本形式化为S=(D,Q,A,T,E),证据E由页面索引、归一化边界框(x1,y1,x2,y2)及文本、图表等语义类别组成。数据包含SPSR、SPMR、MPMR三类推理;人工集由12名标注员和24名领域专家构建,自动集使用SAM3分割、VLM筛选与分组,并由GPT-5.2、Gemini 3生成和复核QA。

关键结果

  • SciEGQA人工基准覆盖80篇arXiv论文、1,941页和1,623条QA;SPSR、SPMR、MPMR占46.15%、34.26%和19.59%,跨页面、多区域问题约占五分之一,体现递增推理难度。
  • 自动训练集来自3,671篇论文、42,380页,包含30,780条QA;论文报告现有VLM在证据定位上普遍低于40% IoU,说明页面级输入不能替代精确区域 grounding。
  • Grounding–Crop–then–Answer固定使用Qwen3.5-27B回答,隔离定位与回答能力;IoU@τ以τ∈{0.3,0.5,0.7}评估,训练SciEGQA后模型科学推理能力显著改善,但给定摘录未提供逐模型增益表。

研究意义

SciEGQA把科学文档问答从“答对即可”推进到“指出依据并据此作答”。它解决页面级监督过粗、token级监督破坏语义完整性、图表数据集脱离全文上下文等长期问题,使模型是否真正读取相关段落、表格和图形变得可检验。该设计也为可解释文献检索、科研辅助阅读和可靠性审计提供统一评测接口。

技术贡献

核心技术贡献是语义区域级证据表示:用完整文本块、表格或图形的边界框保留语义闭合性,同时支持空间定位和跨模态组合。评测协议先预测坐标,再裁剪区域,最后交给统一的Qwen3.5-27B回答;这比直接端到端答案分数更能区分视觉 grounding 与推理错误。自动管线以SAM3替代pdfplumber等规则OCR流程,增强视觉区域的开放式分割能力。

新颖性

相较DocVQA、MP-DocVQA、SciDQA等页面或文档级数据,以及SPIQA、Charxiv等孤立表格/图表任务,SciEGQA据论文定位为首个同时支持科学文档语义区域框选、多模态证据和多页推理的数据集。其关键创新不是更细的token,而是介于页面与token之间的语义完整区域。

局限性

  • 人工基准仅80篇论文、1,623条QA,规模与领域覆盖仍有限,且论文摘录未报告完整的人类一致性或逐领域难度分析。
  • 自动集依赖SAM3、GPT-5.2和Gemini 3,可能继承分割、生成和验证模型偏差;自动复核也不能保证答案在科学事实上正确。
  • 提供的实验正文不完整,缺少各VLM名称、基线分数、训练超参数和逐场景消融结果。

未来方向

后续可扩大论文与学科覆盖,加入科学事实核验、公式和复杂图表推理;比较不同分割器、生成器与回答器的偏差。还应公布完整模型级结果、人工与自动集的质量审计,并研究端到端联合定位—推理、长上下文检索及不确定性校准。

AI 总览摘要

科学论文不是普通图片:一页中可能同时有密集段落、表格、图形和跨页引用。传统DocVQA通常只标注页面,模型即使猜对答案,也未必真正找到依据;token级标注又容易切碎完整语义,组件级数据则常把图表从全文语境中孤立出来。

SciEGQA提出语义区域级证据 grounding。每条样本记录文档、问题、答案、问题类型,以及带页面坐标和语义类别的证据框,并覆盖Single Page Single Region、Single Page Multi Regions和Multi Pages Multi Regions。人工基准由80篇、八个arXiv领域论文构成,共1,623条QA;大型训练集由3,671篇论文自动生成30,780条QA。自动流程使用SAM3分割页面,以VLM筛选、分组,再由GPT-5.2或Gemini 3生成并验证问题答案。

论文设计Grounding–Crop–then–Answer:模型先预测框,系统裁剪证据,再统一交给Qwen3.5-27B回答;[email protected]、0.5、0.7衡量定位质量。结果显示,多数现有VLM证据定位低于40% IoU,证明科学文档仍远未被可靠理解;使用SciEGQA训练则显著提升科学推理。其价值在于把“答案是否正确”与“依据是否正确”分开测量,但当前摘录没有提供逐模型增益、完整基线和消融表。

深度分析

研究背景

多模态大模型已推动图像问答和文档理解发展。DocVQA、MP-DocVQA和MMLongBench-Doc覆盖页面或长文档,SciDQA、PeerQA关注科学论文;SPIQA、Charxiv、AnaFig分别聚焦表格、图表和图形,VisualMRC、DUDE、BoundingDocs采用token级证据。然而科学论文同时包含文字、表格、图形及跨页关系,单一页面或孤立组件难以表达完整依据。

核心问题

给定科学文档D、问题Q,模型不仅要生成答案A,还要找出支持答案的页面区域E。页面级证据定位太粗,一页可含多个技术单元;token级定位虽精确,却破坏段落、表格和图形的语义整体;组件级任务又忽略上下文。因此难点是跨模态、跨区域、跨页面的信息组合,以及在复杂布局中准确框选证据。

核心创新

  • ��提出语义区域级标注,在页面级与token级之间取得平衡。
  • ��构建1,623条人工评测QA和30,780条自动训练QA,覆盖八个arXiv领域。
  • ��定义SPSR、SPMR、MPMR三种递增场景,显式测试单区域、多区域与跨页推理。
  • ��提出Grounding–Crop–then–Answer,用统一Qwen3.5-27B隔离定位和回答能力。

方法详解

  • ��数据预处理:用arxiv-dl下载论文,并以300 dpi渲染为PNG页面。
  • ��人工标注:12名标注员标记文本、表格、图形等语义完整区域;两次独立标注,IoU<0.9时由第三人复核;24名领域专家设计和验证问题。
  • ��自动分割:SAM3直接从视觉内容生成候选区域,面积阈值移除异常片段。
  • ��筛选分组:强VLM保留有意义区域,再按空间邻近和语义关系组建证据集合。
  • ��生成验证:GPT-5.2、Gemini 3按三种场景生成QA,并要求VLM仅凭证据重新作答,答错样本删除。
  • ��评测:预测归一化至[0,1000]的框,计算[email protected]/0.5/0.7,并将裁剪图交给Qwen3.5-27B。

实验设计

人工基准含80篇论文、1,941页和1,623条QA,覆盖cs、econ、eess、math、physics、q-bio、q-fin、stat各10篇;训练集含3,671篇、42,380页和30,780条QA。任务包括证据框定位及不同输入粒度的Evidence-Granularity-QA:全文、证据页、裁剪区域。指标为答案准确率和IoU@τ。给定摘录说明评估多种VLM,但未列出完整模型、超参数或消融配置。

结果分析

数据分布显示人工集SPSR为46.15%、SPMR为34.26%、MPMR为19.59%;训练集分别为37.91%、24.41%和37.69%,后者更强调跨页推理。多数VLM证据定位低于40% IoU,表明定位是主要瓶颈。固定回答器的裁剪评测能判断错误来自找错区域还是推理失败;论文称训练SciEGQA显著改善科学推理,但摘录未给出逐模型数值。

应用场景

科研阅读助手可先框选支撑段落、表格或图形,再生成带依据答案;文献检索系统可用区域级证据提高可审计性。部署需要PDF渲染、页面分割、坐标归一化和可靠的答案验证。出版社、实验室和企业知识库可据此检查模型是否引用了正确证据,而不只是输出看似合理的结论。

局限与展望

数据依赖arXiv开放论文,可能偏向特定排版、英文和计算机科学风格;80篇人工论文仍不足以覆盖全部科学写作。SAM3与生成式VLM会引入区域和问题偏差,自动验证关注可回答性而非事实真值。框选、裁剪和多页处理也带来计算成本。未来应扩大领域,加入公式/图表核验,公开完整基线与消融,并研究联合定位、推理和不确定性估计。

通俗解读 非专业人士也能看懂

把科学论文想成一座巨大的图书馆。普通方法只告诉你“答案在第几间房”,但房间里可能同时摆着十张桌子、几幅图和许多段文字;另一种方法只圈出几个字,又像把一句完整说明剪成零散纸片。

SciEGQA要求助手做得更像真正的图书管理员:先在页面上圈出一块完整、有意义的区域,例如一段解释、整张表或一幅图;如果问题需要,还要把同页或其他页面的几块区域一起找出来。之后,助手只能阅读这些被圈出的地方再回答。

研究者用SAM3帮助切分页面,用GPT-5.2和Gemini 3生成并检查练习题,并用Qwen3.5-27B作为统一答题员。这样可以分清:是助手没有找到正确资料,还是找到了资料却没看懂。结果显示,很多现有助手连正确证据都圈不准,IoU普遍低于40%;用SciEGQA训练后,科学推理有所提高。

简单解释 像给14岁少年讲一样

想象你在做一道超级难的“看论文找答案”游戏。屏幕上是一页科学文章,里面有小字、表格、图片,还可能要翻到别的页面。只说出答案不够,你还要用荧光笔准确标出“我为什么这么答”的地方。

SciEGQA就是为这个游戏制作的题库。它不只记录答案,还记录证据框:框可以圈住一整段话、一张表或一幅图。题目分三种:一个地方就能答、同页多个地方一起答、不同页面多个地方一起答。这样,题目越来越像真实科研阅读,而不是只查一个数字。

研究团队先请人标注80篇论文,又用SAM3自动切页面,用GPT-5.2和Gemini 3出题和验题,得到30,780条训练题。测试时,模型先画框,系统把框里的内容裁下来,再让Qwen3.5-27B回答。

结果有点像游戏里“知道答案但瞄不准目标”:多数模型的证据框IoU低于40%。不过用这个题库训练后,科学推理明显变好。下一关是让模型处理更多学科、公式和更复杂的图表。

术语表

Semantic Region Grounding(语义区域定位)

把支持答案的完整语义单元用页面边界框标出,而不是只标页面或零散词元。它兼顾空间精度与上下文完整性。

SciEGQA的核心证据标注形式。

SPSR / SPMR / MPMR

分别表示单页单区域、单页多区域、多页多区域推理。三者对应逐渐增加的证据组合难度。

用于组织问题类型和统计数据。

SAM3

基于视觉内容进行区域分割的模型。它不必依赖固定的OCR或文档组件规则。

自动训练集的候选区域生成器。

IoU

交并比,公式为预测框与真实框交集面积除以并集面积。数值越高,框的位置重合越准确。

以[email protected]、0.5、0.7评估证据定位。

Grounding–Crop–then–Answer

先定位证据框,再裁剪区域,最后回答问题的评测流程。它把找证据与理解证据分开。

SciEGQA的主要评测协议。

Evidence-Granularity-QA

比较全文、证据页和裁剪证据区域三种输入粒度下的回答表现。它研究信息范围对问答的影响。

第二项评测任务。

开放问题 这项研究留下的未解疑问

  • 1 论文摘录未报告各VLM在答案准确率、IoU阈值和三类场景上的完整分数,因此难以判断不同模型的具体优势与训练增益。
  • 2 自动生成QA是否存在学科、排版或生成模型偏差仍需系统人工审计,并应增加科学事实正确性而不只是可回答性验证。

应用场景

近期应用

可审计科研问答

研究人员可让系统同时返回答案、页码和语义证据框,快速核对论文依据。部署前需具备PDF渲染、区域分割和引用展示能力,预期可减少无依据总结。

文献阅读与检索助手

系统可先检索相关页面,再圈出段落、表格或图形并回答比较问题。适合实验室知识库和企业技术调研,但必须保留原文链接并提示模型不确定性。

远期愿景

可靠科学智能体

未来可将区域定位、跨页检索、公式和图表推理结合,形成可追溯的科研代理。主要障碍是事实核验、长上下文成本、学科迁移和自动标注偏差。

原文摘要

Scientific documents contain complex multimodal structures, which makes evidence localization and scientific reasoning in Document Visual Question Answering particularly challenging. However, most existing benchmarks evaluate models only at the page level without explicitly annotating the evidence regions that support the answer, which limits both interpretability and the reliability of evaluation. To address this limitation, we introduce SciEGQA, a scientific document question answering and reasoning dataset with semantic evidence grounding, where supporting evidence is represented as semantically coherent document regions annotated with bounding boxes. SciEGQA consists of two components: a **human-annotated fine-grained benchmark** containing 1,623 high-quality question--answer pairs, and a **large-scale automatically constructed training set** with over 30K QA pairs generated through an automated data construction pipeline. Extensive experiments on a wide range of Vision-Language Models (VLMs) show that existing models still struggle with evidence localization and evidence-based question answering in scientific documents. Training on the proposed dataset significantly improves the scientific reasoning capabilities of VLMs. The project page is available at https://yuwenhan07.github.io/SciEGQA-project/.

cs.DB cs.AI cs.CV