PRiSM: An Agentic Multimodal Benchmark for Scientific Reasoning via Python-Grounded Evaluation

TL;DR

PRiSM通过Python代码评估科学推理,包含24,750个物理和数学问题。

cs.AI 🔴 高级 2025-12-06 3 次浏览
Shima Imani Seungwhan Moon Adel Ahmadyan Lu Zhang Kirmani Ahmed Babak Damavandi
多模态 科学推理 Python 数据集 模型评估

核心发现

方法论

PRiSM使用PrismAgent生成多模态科学推理问题,结合文本、图像和Python代码。每个问题包含动态输入和结构化输出,支持细粒度的模型评估。

关键结果

  • PRiSM揭示现有VLMs在科学推理中的局限性,特别是在处理输入变异和视觉扰动时的鲁棒性不足。
  • 通过五个评估任务,PRiSM展示了模型在符号程序合成和推理纠错中的表现差异。
  • 实验表明,某些模型在处理不确定性和模糊性时表现较差,暴露了推理能力的不足。

研究意义

PRiSM为评估科学推理提供了一个动态和多模态的基准,填补了现有数据集在中间推理步骤和计算验证方面的空白,对学术界和工业界具有重要意义。

技术贡献

PRiSM通过Python代码实现自动化的地面真值生成,支持细粒度的实验审计,提供了新的工程可能性和理论保证。

新颖性

PRiSM首次结合动态生成的多模态输入和Python代码验证,提供了比现有基准更全面的科学推理评估。

局限性

  • PRiSM在处理真实世界的复杂性和多样性方面可能存在局限,因其问题集是合成的。
  • 某些模型在处理高度复杂的符号推理问题时表现不佳。

未来方向

未来工作可以扩展PRiSM的领域覆盖范围,并探索如何提高模型在处理复杂科学问题时的鲁棒性和准确性。

AI 总览摘要

PRiSM是一个用于科学推理的多模态基准,结合了Python代码评估。现有的视觉语言模型在科学领域的评估面临挑战,尤其是在数学和物理中。PRiSM通过动态生成的物理和数学问题,结合文本、图像和Python代码,提供了一个全面的评估框架。实验结果揭示了现有模型在处理输入变异和视觉扰动时的局限性,并展示了PRiSM在揭示模型推理能力方面的有效性。未来的研究可以进一步扩展PRiSM的应用范围,提升模型在科学推理中的表现。

深度分析

研究背景

科学推理在数学和物理等领域至关重要,现有的基准通常缺乏中间推理步骤和计算验证。PRiSM通过动态生成问题和Python代码验证,填补了这一空白。

核心问题

现有基准在评估科学推理时通常缺乏动态性和多模态输入,无法全面评估模型的推理能力。

核心创新

PRiSM通过动态生成的多模态输入和Python代码验证,提供了一个全面的科学推理评估框架。

方法详解

  • �� 使用PrismAgent生成问题
  • �� 动态输入和结构化输出
  • �� Python代码验证
  • �� 五个评估任务

实验设计

PRiSM包含24,750个大学水平的物理和数学问题,使用五个评估任务测试模型的推理能力。

结果分析

实验揭示了现有模型在处理输入变异和视觉扰动时的局限性,展示了PRiSM在评估模型推理能力方面的有效性。

应用场景

PRiSM可用于评估科学推理模型的鲁棒性和准确性,尤其是在处理复杂科学问题时。

局限与展望

PRiSM在处理真实世界的复杂性和多样性方面可能存在局限,未来工作可以扩展其领域覆盖范围。

通俗解读 非专业人士也能看懂

想象一个复杂的数学问题就像一个谜题。PRiSM就像一个智能助手,帮助你一步步解开谜题。它不仅给出最终答案,还展示了解题的每一个步骤,确保每一步都符合科学原理。

简单解释 像给14岁少年讲一样

想象你在玩一个需要解谜的游戏。PRiSM就像一个超级助手,帮你一步步解开谜题。它不仅告诉你答案,还展示了解题的每一步,就像游戏中的提示一样。是不是很酷?

术语表

PrismAgent (棱镜代理)

用于生成多模态科学问题的自动化管道。

用于生成PRiSM数据集中的问题实例。

VLMs (视觉语言模型)

结合视觉和语言输入进行推理的模型。

用于科学推理的模型评估。

Python Code (Python代码)

用于验证科学问题解的可执行代码。

用于PRiSM中问题解的验证。

Multimodal (多模态)

结合多种输入形式,如文本和图像。

PRiSM中的问题包括文本和图像输入。

Benchmark (基准)

用于评估模型性能的标准测试集。

PRiSM作为科学推理的评估基准。

开放问题 这项研究留下的未解疑问

  • 1 如何在真实世界中应用PRiSM生成的问题?
  • 2 如何提高模型在处理复杂科学问题时的鲁棒性?

应用场景

近期应用

科学教育

PRiSM可用于科学教育中,帮助学生理解复杂的科学概念。

远期愿景

自动化科学研究

PRiSM可能推动自动化科学研究的发展,提升研究效率。

原文摘要

Evaluating vision-language models (VLMs) in scientific domains like mathematics and physics poses unique challenges that go far beyond predicting final answers. These domains demand conceptual understanding, symbolic reasoning, and adherence to formal laws, requirements that most existing benchmarks fail to address. In particular, current datasets tend to be static, lacking intermediate reasoning steps, robustness to variations, or mechanisms for verifying scientific correctness. To address these limitations, we introduce PRiSM, a synthetic, fully dynamic, and multimodal benchmark for evaluating scientific reasoning via grounded Python code. PRiSM includes over 24,750 university-level physics and math problems, and it leverages our scalable agent-based pipeline, PrismAgent, to generate well-structured problem instances. Each problem contains dynamic textual and visual input, a generated figure, alongside rich structured outputs: executable Python code for ground truth generation and verification, and detailed step-by-step reasoning. The dynamic nature and Python-powered automated ground truth generation of our benchmark allow for fine-grained experimental auditing of multimodal VLMs, revealing failure modes, uncertainty behaviors, and limitations in scientific reasoning. To this end, we propose five targeted evaluation tasks covering generalization, symbolic program synthesis, perturbation robustness, reasoning correction, and ambiguity resolution. Through comprehensive evaluation of existing VLMs, we highlight their limitations and showcase how PRiSM enables deeper insights into their scientific reasoning capabilities.

cs.AI