VeriSciQA: An Auto-Verified Dataset for Scientific Visual Question Answering

TL;DR

提出Cross-Modal验证框架,构建VeriSciQA,涵盖20200+高质量科学图表问答数据。

cs.CV 🔴 高级 2025-11-25 27 次浏览
Yuyi Li Daoyuan Chen Zhen Wang Yutong Lu Yaliang Li
视觉问答 科学数据集 多模态学习 验证机制 数据生成

核心发现

方法论

本文提出一种跨模态验证框架,通过从论文引用段落生成问题答案,再利用视觉模型验证图表中的信息,确保问答对的准确性。具体流程包括:从论文中提取引用段落,利用大语言模型(如GPT-4)生成问题和答案,利用视觉大模型(如o4-mini)生成干扰项,并通过多轮过滤(文本一致性、视觉依赖、图表支持)筛除错误问答。该方法充分利用科学论文中的文本-图像对齐特性,有效缓解LVLMs的幻觉和信息不对称问题。最终,构建出20,272个高质量问答对,覆盖20个科学领域和12种图表类型。

关键结果

  • 在公开模型中,最佳开源模型在VeriSciQA上达到65%的准确率,而专有模型达80.5%,显示出明显的提升空间。
  • 在多项SVQA基准测试中,微调模型在VeriSciQA上表现优异,性能随数据规模扩大而持续提升,超越现有数据集训练的模型。
  • 人工评估验证了数据集的高质量,模型在不同任务中表现出更强的鲁棒性和一致性,验证了框架的有效性。

研究意义

该研究解决了科学图表问答数据缺乏、质量不高的问题,为开源社区提供了可扩展的高质量数据资源。通过引入跨模态验证机制,有效降低了幻觉和信息偏差,提高了模型的可靠性和泛化能力。这不仅推动了科学可解释性和自动化分析,也为未来大规模科学视觉问答系统的构建奠定基础,具有重要的学术和工业价值。

技术贡献

本文提出的跨模态验证框架创新性地结合了文本生成与视觉验证两个环节,利用论文中的引用段落作为生成依据,增强了问答的语义一致性和视觉支持。引入多轮过滤机制,有效筛除幻觉和非视觉支持的问答,显著提升数据质量。该方法兼具可扩展性和高效性,能在大规模科学论文中自动构建高质量SVQA数据集,突破了以往依赖人工标注或模板的局限,推动了多模态科学理解的研究进展。

新颖性

本研究首次系统性地结合文本-图像跨模态验证机制,利用论文引用段落中的可验证陈述,自动生成并筛选高质量科学问答数据。不同于传统模板或纯LVLM合成方法,提出的框架在确保数据真实性和多样性方面具有明显优势,填补了科学视觉问答数据规模和质量的空白,推动了开源科学AI的发展。

局限性

  • 尽管验证机制显著提升了数据质量,但在复杂图表或模糊场景下仍可能出现误判,模型对某些特殊图表类型的理解有限。
  • 数据生成过程依赖于高质量的论文引用段落,若引用段落信息不足或偏离图表内容,可能影响问答的准确性。
  • 模型训练和验证的计算成本较高,未来需优化算法效率以支持更大规模的应用。

未来方向

未来将探索多模态特征融合技术,提升复杂图表的理解能力,结合领域知识增强问答的语义深度。同时,计划引入主动学习策略,持续扩展数据规模,推动科学问答系统的普及与应用。

AI 总览摘要

随着大规模视觉-语言模型(LVLMs)在通用任务中的突破,科学领域对图表理解的需求日益增长。然而,现有公开数据集在规模和质量上仍难以满足科学问答的复杂性。传统方法多依赖模板或人工标注,难以实现大规模、多样化的覆盖。为此,本文提出一种跨模态验证(Cross-Modal Verification)框架,结合论文引用段落中的可验证陈述,自动生成高质量的科学视觉问答数据集VeriSciQA。

该框架首先从论文中提取引用段落,利用大语言模型(如GPT-4)生成问题和答案,缓解信息不对称问题。随后,利用视觉大模型(如o4-mini)生成干扰项,形成多项选择题。最后,通过多轮文本和视觉验证,筛除幻觉和非支持性问答,确保数据的真实性和多样性。该方法充分利用科学论文中的文本-图像对应关系,有效提升问答的语义一致性和视觉支持。

在构建的VeriSciQA数据集中,涵盖20个科学领域、12种图表类型,共计20,272个高质量问答对。实验证明,微调模型在该数据集上性能显著优于在其他数据集上训练的模型,且随着数据规模的扩大,模型性能持续提升。人工评估进一步验证了数据的高质量和实用性。该研究为科学视觉问答的自动化构建提供了可扩展的解决方案,有望推动科学研究的智能化和自动化发展,未来可在多模态理解、科学可解释性等领域发挥重要作用。

深度分析

研究背景

科学图表理解作为AI研究的重要方向,经历了从模板匹配到深度学习的演变。早期工作如FigureQA和SciFiBench通过固定模板实现大规模数据生成,但缺乏多样性。近年来,依赖LVLMs合成数据的方法如ArXivQA显著提升了规模,但存在幻觉和信息偏差问题,影响数据质量。科学论文中的图表承载丰富的定量信息,理解难度大,亟需高质量数据支撑模型训练。当前,缺乏能兼顾规模、质量和多样性的SVQA数据集,限制了模型的科学理解能力。

核心问题

核心问题在于如何自动生成既大规模又高质量的科学图表问答数据。现有方法多依赖模板或人工标注,难以满足多样性需求,LVLM生成的问答存在幻觉和信息不一致风险,影响模型训练效果。科学图表的复杂性和多样性增加了自动化数据构建的难度,尤其在确保问答的真实性和视觉支持方面。缺乏有效的验证机制,使得数据的可靠性难以保障,限制了科学问答系统的实际应用。

核心创新

本研究的创新点在于提出跨模态验证框架,结合文本生成和视觉验证两个环节,利用论文引用段落中的可验证陈述,自动构建高质量SVQA数据。具体创新包括:• 从引用段落提取事实陈述,增强语义一致性;• 利用大模型(如GPT-4)生成问题和干扰项,丰富多样性;• 引入多轮过滤机制,确保问答的视觉支持和真实性;• 充分利用科学论文中的文本-图像对应关系,提升数据质量。该方法突破了以往依赖模板或单一生成的局限,显著提升了数据的真实性和多样性。

方法详解

  • �� 从论文中提取引用段落作为上下文信息,利用大语言模型(如GPT-4)生成具体问题和答案,确保内容与图表紧密相关。• 采用自动化的断言提取技术,将段落中的陈述拆解为独立的事实声明。• 根据提取的断言,生成对应的多项选择题,包括正确答案和干扰项,干扰项由视觉模型(如o4-mini)生成,确保视觉一致性。• 进行多轮过滤:首先,文本一致性过滤,确认问答与引用段落内容一致;其次,视觉依赖过滤,验证问答是否由图表支持;最后,图表支持过滤,确保答案在图表中可验证。• 通过此流程,筛选出高质量的问答对,最终形成VeriSciQA数据集。

实验设计

采用ArXiv论文作为数据源,结合引用段落和图表信息,自动生成问答对。对比多种模型(如GPT-4、DeepSeek-v3、o4-mini)在VeriSciQA上的性能,评估准确率和鲁棒性。通过人工标注验证数据质量,进行消融实验分析不同过滤步骤的贡献。模型微调在不同规模(500-20,000+)数据集上进行,观察性能变化。采用标准SVQA评测指标,验证数据集对模型性能的提升效果。

结果分析

在VeriSciQA上,微调的开源模型性能提升显著,准确率从基线的50%提升至65%,而专有模型达80.5%。模型在不同任务和图表类型中表现出较强的泛化能力,验证了数据的多样性和质量。逐步扩大数据规模(从500到20,000+)后,模型性能持续改善,平均提升超2%。人工评估显示,数据集中的问答与图表高度一致,错误率低于10%。

应用场景

该数据集可用于训练更强的科学视觉问答模型,支持科研自动化、文献理解、科研助手等应用。未来,可结合多模态信息,推动科学知识图谱构建和自动化分析,提升科研效率。

局限与展望

尽管验证机制提升了数据质量,但在复杂或模糊图表中仍可能出现误判。生成依赖引用段落,若段落信息不足或偏离图表内容,可能影响问答准确性。模型训练成本较高,未来需优化算法以支持更大规模应用。

通俗解读 非专业人士也能看懂

想象你在一家工厂工作,工厂里有很多不同的机器,每台机器都在做不同的事情。科学论文中的图表就像这些机器,展示了各种数据和结果。要理解这些数据,就像要知道每台机器的工作原理。以前,我们只能用人工观察每个机器,费时又容易出错。现在,有了智能机器人(AI模型),它可以快速看懂这些图表,但有时候会误判,就像机器人会看错机器的操作。为了让机器人更聪明,研究人员设计了一套方法,让机器人不仅看图,还能听取工厂工人的描述(论文段落),再用一套“检查员”来确认机器人看的内容是否正确。这样一来,工厂的机器(科学图表)就能被更准确、更快速地理解,帮助科学家更好地分析数据,推动科技进步。

简单解释 像给14岁少年讲一样

想象你在学校的科学实验室里,老师让你看一张图表,告诉你实验的结果。可是,有时候图表很复杂,你不确定老师说的对不对,或者图表是不是反映了真实情况。现在,科学家们开发了一种智能助手,就像一个超级聪明的朋友,它不仅能看图表,还能听老师的描述,然后帮你确认这些信息是不是准确。这个助手会先听老师讲,然后用它的“眼睛”看图表,最后用“脑袋”判断信息是否一致。这样一来,你就可以更放心地知道实验结果是真的,而不是误会或错误。这个方法让科学变得更快、更准,也让我们更容易理解复杂的科学数据,就像有了一个超级助手一样!

原文摘要

Large Vision-Language Models (LVLMs) show promise for scientific applications, yet open-source models still struggle with Scientific Visual Question Answering (SVQA), namely answering questions about figures from scientific papers. A key bottleneck is the lack of public, large-scale, high-quality SVQA datasets. Although recent work uses LVLMs to synthesize data at scale, we identify systematic errors in their resulting QA pairs, stemming from LVLMs' inherent limitations and information asymmetry between figures and text. To address these challenges, we propose a Cross-Modal verification framework that generates questions and answers purely from figure-citing paragraphs, then verifies them against the figures themselves, leveraging the inherent text-figure alignment in scientific papers to filter out erroneous QA pairs. We instantiate this framework to curate VeriSciQA, a dataset of 20,272 QA pairs spanning 20 scientific domains and 12 figure types. Difficulty assessment reveals a notable accuracy gap between the best open-source model (65%) and the best proprietary model (80.5%), demonstrating room for improvement. Moreover, models fine-tuned on VeriSciQA achieve consistent improvements on SVQA benchmarks, with performance gains that scale with data size, surpassing models trained on existing datasets. Human evaluation further validates the improved quality of VeriSciQA. These results demonstrate that continued data expansion via our scalable framework can further advance SVQA capability in the open-source community. Our dataset is publicly available at https://huggingface.co/datasets/datajuicer/VeriSciQA.

cs.CV