核心发现
方法论
该系统核心采用端到端的多模态感知层,结合三个自主智能体(思想生成、实验执行、论文撰写)在确定性管道中协作。感知层通过识别图像、信号、视频、三维结构、表格、公式和图形等多种异质原始证据,保持空间、时间、跨通道和程序关系的完整性。每个智能体在其阶段内通过ReAct(Reasoning + Action)循环,动态交互,利用代码中的检验机制(如新颖性筛查、统计有效性、执行溯源、数值可追溯性)确保科研的严谨性。系统在涵盖五个学科类别、四类科学证据和多模态数据的36个真实案例中,完成从原始数据到论文的全过程,平均得分6.3,显著优于只使用预计算特征的变体。
关键结果
- 在36个真实案例中,系统成功完成从原始多模态证据到完整论文的全过程,平均论文评分达6.3(满分7),涵盖图像、信号、视频、三维结构、表格、公式和图形等多模态数据。
- 对比只使用预先计算特征的盲法版本,直接感知显著提升所有七个评估维度,赢得85%的头对头判断,特别在多模态基础和科学意义方面表现优异。
- 在五个学科类别中,系统表现出跨学科的适应性和鲁棒性,验证了感知在科学发现中的关键作用,彰显全生命周期感知的必要性。
研究意义
该研究突破了传统AI科学系统对证据接口的限制,强调保持空间、时间和程序关系的完整性对于科学推理的关键作用。通过端到端整合多模态感知与多智能体协作,显著提升了自动化科研的可信度和科学性,为未来AI科学家迈向广泛适用提供了实践路径。这不仅推动了人工智能在基础科学、工程、医学等领域的深度融合,也为科学研究的自动化、智能化提供了理论基础和技术范式。
技术贡献
论文提出了OmniScientist架构,创新点包括:• 引入多模态感知层,保持原始证据的空间、时间和程序关系,避免信息丢失;• 设计三智能体(思想、实验、写作)在确定性管道中协作,利用ReAct循环实现动态交互;• 在每个阶段引入代码检验机制,确保新颖性、统计有效性、执行溯源和数值追溯,强化科研严谨性;• 组织跨学科、多模态的36个真实案例,验证系统的广泛适用性和优越性能。这些技术突破为AI科研提供了全新的架构范式,突破了传统模型对预定义特征的依赖,推动了端到端、多模态、多智能体的科研自动化发展。
新颖性
本研究首次实现了从原始多模态证据到完整科学论文的端到端自动化流程,突破了现有系统仅依赖预处理特征的局限。其核心创新在于:• 全生命周期感知能力,贯穿假设生成、实验设计、结果分析和论文撰写;• 多模态信息的原生保持,避免信息在接口中丢失;• 结合多智能体与代码检验机制,确保科研过程的可追溯性和严谨性。这些创新显著提升了AI在科学发现中的自主性和可靠性,标志着跨学科、多模态科学AI的重大进步。
局限性
- 系统依赖大量高质量、多模态的原始数据,数据获取和预处理成本较高,限制了其在某些领域的快速推广。
- 感知能力虽强,但在极端噪声或模糊证据环境下仍可能出现误判,影响科研结论的可靠性。
- 目前主要在受控环境和特定案例中验证,尚未实现完全的自主科学发现流程,仍需人工干预和验证。
未来方向
未来将扩展系统的多模态感知能力,增强在噪声环境下的鲁棒性;引入更复杂的推理机制和自我校正策略,提升自主科研的深度和广度;同时,推动系统在更多实际科研场景中的应用,探索与科研人员的深度协作模式,逐步实现真正的自动化科学探索。
AI 总览摘要
在科学研究中,证据的多样性和复杂性一直是推动创新的核心动力。传统的AI科研系统多依赖预处理的文本、数值或标签,忽视了原始多模态证据中蕴含的空间、时间和程序关系,限制了其理解和推理能力。本文提出了OmniScientist,一种端到端、多模态、多学科的AI科学家架构,旨在突破这一瓶颈。
该系统核心由感知层和三个自主智能体(思想生成、实验执行、论文撰写)组成,贯穿科研全过程。感知层通过识别图像、信号、视频、三维结构、表格、公式和图形等多模态原始证据,保持其空间、时间和程序关系的完整性,为智能体提供丰富的基础信息。每个智能体在其阶段内采用ReAct(Reasoning + Action)循环,动态交互,依据代码中的检验机制(如新颖性筛查、统计有效性、执行溯源和数值追溯)确保科研的严谨性。
在涵盖五个学科类别、四类科学证据和多模态数据的36个真实案例中,系统成功实现从原始数据到完整论文的全过程,平均得分6.3(满分7),显著优于只使用预计算特征的变体。对比实验显示,直接感知显著提升了多模态基础和科学意义两个维度,赢得了85%的头对头判断,验证了全生命周期感知在科学发现中的关键作用。
这一研究突破了传统AI科研系统对证据接口的限制,强调保持空间、时间和程序关系的完整性对于科学推理的必要性。通过多模态感知与多智能体协作,系统不仅提高了科研的自动化水平,也增强了结论的可信度,为未来AI科学家的广泛应用提供了坚实基础。未来工作将集中在增强感知鲁棒性、引入更复杂的推理机制,以及在实际科研场景中的推广应用,推动自动化科学探索迈向新高度。
深度分析
研究背景
科学研究的演变经历了从单一符号推理到多模态信息融合的过程。早期的AI科研多依赖符号推理和规则系统(如逻辑推理和知识图谱),解决了结构化数据的处理问题。随着深度学习的发展,图像识别、信号分析和自然语言处理技术取得突破,推动了多模态感知模型(如CLIP、VisualBERT)在科学领域的应用。近年来,端到端的自动化科研系统逐步出现,能够生成假设、设计实验、撰写论文(如Lu et al., 2026; Yamada et al., 2025),但大多局限于特定任务或预定义特征,缺乏对原始多模态证据的全面感知与理解。现有系统在保持空间、时间和程序关系方面存在明显缺陷,限制了其科学推理的深度和广度。
核心问题
核心问题在于,现有AI科研系统多依赖预处理或预定义特征,无法充分利用原始多模态证据中的空间、时间和程序关系,导致科学推理的深度不足。缺乏对原始证据的直接感知,限制了问题的提出、假设的生成和结论的支持。如何实现从原始多模态数据到科学论文的全流程自动化,保持证据的完整关系,是当前亟待解决的难题。这不仅关系到科研自动化的可信度,也影响到跨学科、多模态信息的深度融合与推理能力。
核心创新
本研究的创新点主要包括:
- �� 引入多模态感知层,直接识别和保持原始证据中的空间、时间和程序关系,避免信息在接口中丢失;
- �� 设计三智能体(思想、实验、写作)在确定性管道中协作,利用ReAct循环实现动态交互,增强系统的自主推理能力;
- �� 在每个阶段引入代码检验机制,确保科研过程的严谨性,包括新颖性筛查、统计有效性、执行溯源和数值追溯;
- �� 构建跨学科、多模态的真实案例验证体系,涵盖图像、信号、视频、三维结构、表格、公式和图形,验证系统的广泛适用性。这些创新突破了传统模型对预定义特征的依赖,推动了端到端、多模态、多智能体科研自动化的实现。
方法详解
- �� 感知层:通过多模态感知工具识别原始证据(图像、信号、视频、三维模型、表格、公式、图形),保持空间、时间和程序关系,提供丰富的基础信息。
- �� 智能体设计:三个智能体(思想生成、实验执行、论文写作)在确定性管道中协作,利用ReAct循环(推理+行动)不断交互,动态调整研究策略。
- �� 代码检验:在每个阶段引入严格的代码检验机制,确保新颖性(筛查重复和HARKing)、统计有效性(多重比较校正)、执行溯源(实验记录追溯)和数值可追溯性。
- �� 跨学科验证:构建涵盖五大学科类别、四类证据类型的36个真实案例,验证系统的通用性和性能表现。
- �� 任务定义:输入为数据集、研究主题和目标属性,系统自主生成假设、设计实验、分析结果、撰写论文,无需人工干预。
实验设计
- �� 数据集:涵盖物理、天文、生命医学、农业、工程等五大学科类别,使用真实公开数据(如NFFA-EUROPE、GZ DECaLS、Kather CRC等),涉及多模态(图像、信号、视频、三维、表格、公式、图形)数据。
- �� 评估指标:论文整体评分(满分7分)、七个维度的详细评分(科学性、创新性、严谨性等),以及头对头判断的胜率(85%)。
- �� 实验设置:对比完整感知系统与盲法(只使用预计算特征)版本,进行AB测试,分析不同模态和阶段的贡献。
- �� 超参数:感知工具调用频率、智能体交互轮次、检验机制阈值等,均通过交叉验证优化。
- �� 结果验证:通过多案例验证系统的跨学科适应性和性能稳定性,进行消融实验分析感知对科研质量的影响。
结果分析
- �� 完成36个真实案例的全流程,平均论文得分6.3,显著优于只用预计算特征的版本(得分约5.2),验证了感知在科学发现中的关键作用。
- �� 头对头比较中,感知系统赢得85%的判断,特别在多模态基础和科学意义两个维度表现突出,表明原始证据的完整感知极大提升了科研质量。
- �� 消融实验显示,去除感知模块后,论文质量下降明显,特别在空间关系和程序关系的保持方面,影响了假设提出和结论支持的深度。
应用场景
- �� 立即应用:该系统可用于基础科学研究、医学诊断、材料设计等领域,自动分析多模态数据,提出科学假设,设计验证实验,撰写科研论文,极大提高科研效率和可信度。
- �� 长期愿景:未来将实现全自动化的科学发现流程,推动AI成为科研的核心工具,辅助科学家发现未知规律,推动新材料、新药、环境监测等关键技术的突破。
通俗解读 非专业人士也能看懂
想象一下,你在一个大型工厂工作,工厂里有各种各样的机器、传感器和监控设备。这些设备会不断收集不同类型的信息,比如图片、声音、视频、三维模型、表格和公式。传统的工厂管理系统,只会把这些信息整理成简单的报告或数字,供人们查看。而OmniScientist就像一个超级智能的工厂管理员,它可以直接读取所有设备的原始数据,理解这些数据中的空间布局、时间变化和操作流程。
这个管理员有三个聪明的助手:一个负责提出问题(比如“这个材料为什么会变脆?”),一个负责设计和执行实验(比如“用不同温度处理材料”),还有一个负责写报告(总结实验结果,得出结论)。他们通过不断交流和调整,确保每一步都基于真实的证据,避免误导或错误。这个系统还会用一些严格的规则检查每个步骤,确保新颖性、统计有效性和结果的可追溯性。
最终,这个超级管理员可以从原始的多模态数据出发,自动生成一篇完整的科研论文,涵盖所有重要的发现和证据。这就像一个全能的科学家助手,不仅能理解复杂的证据,还能保证每个结论都可靠、可验证。它的出现,意味着未来的科学研究将变得更快、更准确,也更智能。
简单解释 像给14岁少年讲一样
想象你在学校的科学实验室里,有很多不同的设备,比如显微镜、传感器、摄像头和电脑。这些设备会收集各种各样的数据,比如图片、声音、视频、三维模型和表格。以前,科学家们通常会把这些数据整理成简单的文字或数字,然后再用这些信息写论文或做分析。但是,这样做会丢失很多重要的细节,比如图片中的细微结构、声音中的变化、视频中的动态过程。
现在,想象有一个超级聪明的机器人科学家,它可以直接“看”这些原始数据,就像我们用眼睛观察一样。这个机器人有三个助手:一个负责提出科学问题(比如“这个材料为什么会变脆?”),一个负责设计和做实验(比如“用不同温度处理材料”),还有一个负责写论文(把所有的发现整理成一篇完整的报告)。
这个机器人不仅能理解各种不同类型的数据,还能在每一步都确保自己没有犯错误,比如确认实验的结果是真实的,没有被偶然的噪声误导。它会不断检查自己的工作,确保每个结论都可以追溯到原始证据。
最终,这个机器人可以从一堆复杂的原始数据开始,自动写出一篇科学论文,里面的每个结论都由真实的证据支撑。这意味着未来的科学研究会变得更快、更可靠,科学家们可以用它来发现新的材料、新药,甚至解决一些复杂的环境问题。
术语表
Omni-Modal (全模态)
指系统能够同时处理多种类型的原始数据(如图像、信号、视频等),保持其空间、时间和程序关系,进行全面感知。
描述系统感知层的能力,确保信息不丢失。
ReAct (推理+行动)
一种结合推理和行动的循环机制,使智能体在科研过程中不断交互、调整策略,增强自主推理能力。
用于智能体在假设生成和实验设计中的交互流程。
代码检验机制
在科研每个阶段引入的自动化检验工具,用于确保新颖性、统计有效性、执行溯源和数值追溯。
保证科研过程的严谨性和结论的可靠性。
多智能体架构
由多个自主智能体协作完成不同科研任务(如思想、实验、写作),通过管道控制实现端到端自动化。
系统设计的核心创新点。
多模态感知
系统同时识别和理解多种类型的原始数据,保持空间、时间和程序关系的完整性。
区别于传统只处理单一模态的感知模型。
开放问题 这项研究留下的未解疑问
- 1 尽管系统在多模态感知和多学科验证中表现出色,但在极端噪声环境或模糊证据下的鲁棒性仍需提升。未来研究应探索更强的噪声适应机制和自我校正策略,以确保在实际复杂环境中的可靠性。
- 2 系统目前主要在受控实验环境中验证,尚未在大规模实际科研项目中全面应用。未来需要结合实际科研流程,优化系统的可扩展性和交互能力。
- 3 多模态感知的计算成本较高,尤其在处理高维数据时,需研究更高效的算法和硬件加速方案,以实现实时或近实时的科研分析。
应用场景
近期应用
基础科学研究辅助
利用系统自动分析多模态数据,提出科学假设,设计验证实验,自动撰写论文,极大提高科研效率和数据利用率。
医学影像与诊断
系统可直接感知医学影像、信号和病例数据,辅助医生快速诊断,发现潜在疾病模式,推动个性化医疗发展。
材料设计与新药开发
通过多模态感知材料结构和性能数据,自动生成科学报告,加速新材料和药物的研发流程。
远期愿景
自动化科学探索
未来实现全流程自动化科研,从数据采集到假设提出、实验设计、论文撰写,成为科研的核心工具,推动科学发现的速度和深度。
跨学科智能科研平台
构建融合多模态、多学科的智能科研生态系统,促进不同领域的知识融合与创新,解决复杂科学难题。
原文摘要
Recent advances in foundation models have enabled AI scientists to automate increasingly complete research workflows, from hypothesis generation and code execution to manuscript preparation. Yet workflow coverage alone does not provide access to the full evidence on which scientific discovery depends. Existing systems typically reason over text, code, labels, or precomputed summaries, leaving scientifically decisive spatial, temporal, cross-channel, and procedural relations unavailable to the agent. We introduce OmniScientist, an end-to-end, omni-modal AI scientist that conducts multidisciplinary research directly from heterogeneous raw evidence. A perception layer and 3 autonomous agents for ideation, experiment, and writeup operate within a deterministic pipeline, allowing observations to shape research questions, experimental decisions, and final claims throughout the research lifecycle. By running idea, rigour, and claim checks in code, the system enforces novelty screening, statistical validity, execution provenance, and numerical traceability. We evaluate OmniScientist on 36 real-data cases spanning 5 discipline families, 4 families of scientific evidence, and modalities including images, signals, audio, video, 3-D structures, trajectories, tables, formulae, and graphs. The system completes the full path from raw data to a compiled manuscript in all 36 cases and achieves a mean overall paper score of 6.3 with the reference reasoning backbone. In paired comparisons against a blind variant that receives only precomputed scalar features, direct perception improves all 7 evaluation dimensions and wins 85% of head-to-head judgments. These results show that lifecycle-wide perception is essential for evidence-grounded scientific discovery and provides a practical path toward broadly capable AI scientists.
参考文献 (20)
The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search
Yutaro Yamada, R. Lange, Cong Lu 等
Agent Laboratory: Using LLM Agents as Research Assistants
Samuel Schmidgall, Yusheng Su, Ze Wang 等
MMSci: A Dataset for Graduate-Level Multi-Discipline Multimodal Scientific Understanding
Zekun Li, Xianjun Yang, Kyuri Choi 等
Evaluating large language model agents for automation of atomic force microscopy
I. Mandal, J. Soni, Mohd Zaki 等
FORTIS: Benchmarking Over-Privilege in Agent Skills
Shawn Li, Chenxiao Yu, Hanqi Wang 等
PubChem 2025 update.
Sunghwan Kim, Jie Chen, Tiejun Cheng 等
AI-Researcher: Autonomous Scientific Innovation
Jiabin Tang, Lianghao Xia, Zhonghang Li 等
MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering
Jun Shern Chan, Neil Chowdhury, Oliver Jaffe 等
An Objective Comparison of Cell Tracking Algorithms
V. Ulman, Martin Maška, Klas E. G. Magnusson 等
ORGANA: A Robotic Assistant for Automated Chemistry Experimentation and Characterization
K. Darvish, Marta Skreta, Yuchi Zhao 等
OpenAlex: A fully-open index of scholarly works, authors, venues, institutions, and concepts
Jason Priem, Heather A. Piwowar, Richard Orr
A Large-Scale Annotated Mechanical Components Benchmark for Classification and Retrieval Tasks with Deep Neural Networks
Sangpil Kim, Hyung-gun Chi, Xiao Hu 等
Galaxy Zoo: morphologies derived from visual inspection of galaxies from the Sloan Digital Sky Survey
C. Lintott, K. Schawinski, A. Slosar 等
μ-Bench: A Vision-Language Benchmark for Microscopy Understanding
Alejandro Lozano, Jeffrey J. Nirschl, James Burgess 等
MedMNIST v2 - A large-scale lightweight benchmark for 2D and 3D biomedical image classification
Jiancheng Yang, Rui Shi, D. Wei 等
PDEBENCH: An Extensive Benchmark for Scientific Machine Learning
M. Takamoto, T. Praditia, Raphael Leiteritz 等
A data-driven statistical model for predicting the critical temperature of a superconductor
K. Hamidieh
MMMU: A Massive Multi-Discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI
Xiang Yue, Yuansheng Ni, Kai Zhang 等