Can LLMs Discover Scientific Laws in Real and Parallel Worlds?
引入SCILAWS-BENCH,利用真实科学数据评估LLMs发现科学定律能力,涵盖118题,291条潜在定律。
核心发现
方法论
本文构建了基于已发表论文和真实数据的SCILAWS-BENCH,包括两个评估设置:SCILAWS-REAL和SCILAWS-PARALLEL。采用九个前沿LLMs,结合ReAct框架,通过被动观察和主动查询两种方式,评估模型在固定观察和主动探索中的科学定律发现能力。指标涵盖预测拟合、科学有效性和结构恢复,结合源文献验证,确保评估的科学性和实用性。
关键结果
- 模型在预测拟合与科学有效性之间存在明显偏差,最高模型GPT-5.5在部分任务中预测拟合达50.77%,但科学有效性仅达81.84%。多任务和多领域表现差异显著,模型在结构恢复方面表现有限,最高仅达58.26%。
- 模型倾向于记忆已知公式,能在已知任务中表现优异,但在未见任务中表现较差,平均记忆率仅11.9%,GPT-5.5能冷召回34.7%的任务。主动查询能部分提升结构恢复,但仍有限,最大全结构恢复率为21%。
- 研究揭示当前LLMs在科学定律发现方面具备潜力,但其可靠性不足,预测拟合与科学有效性不总是同步,模型在探索新结构时仍受限于记忆和推理能力。
研究意义
该研究提出了面向真实科学问题的评估基准,突破传统合成环境限制,强调模型在复杂、噪声和异质数据中的实用性。为AI在科学发现中的应用提供了新的评估工具,有助推动模型在实际科研中的应用,从而加速科学理论的自动发现和验证,解决现有方法在真实性和可靠性上的瓶颈。
技术贡献
本文创新性在于构建真实数据驱动的科学定律发现基准,结合主动查询与被动观察两种评估方式,系统评估模型在复杂环境中的推理和结构恢复能力。引入多任务、多领域设计,丰富了评估场景,提出了科学有效性与预测拟合的双重指标体系,增强了评估的科学性和实用性。
新颖性
首次在真实科学数据基础上系统评估LLMs的科学定律发现能力,突破了以往纯合成或教材式评估的局限。引入主动查询机制,模拟科学家探索未知规律的过程,强调模型的结构推理与科学合理性,具有较强创新性。
局限性
- 模型在复杂多变的科学环境中仍表现出较大偏差,尤其在新颖结构和未知领域的推理能力不足,受制于训练数据的覆盖范围和推理能力的局限。
- 评估指标虽多维,但仍难完全衡量科学合理性和创新性,未来需引入更多领域专家评审和动态验证机制。
- 模型训练和推理成本较高,实际应用中仍面临算力和数据获取的挑战,需优化模型效率和数据采集策略。
未来方向
未来将扩展多学科、多任务场景,增强模型的跨领域迁移能力。引入更复杂的主动探索策略和动态验证机制,提升模型在未知环境中的推理和创新能力。同时,结合物理、化学等领域的专业知识,推动模型向科学自动发现的深层次发展。
AI 总览摘要
科学定律的自动发现一直是推动科学进步的核心动力。传统方法多依赖人工推导和实验验证,效率有限,难以应对复杂多变的真实世界数据。近年来,随着大语言模型(LLMs)在自然语言处理和推理任务中的突破,学界开始探索其在科学发现中的潜力。
本文提出了SCILAWS-BENCH,这是一个基于真实科学论文和数据的科学定律发现基准,旨在系统评估LLMs在复杂环境中的表现。该基准包含118个科学问题,涵盖六个学科领域,涉及291条潜在定律和约8百万个真实数据点。评估设置包括被动观察的SCILAWS-REAL和主动查询的SCILAWS-PARALLEL,模拟科学家在不同环境下的探索过程。
通过对九个前沿LLMs的测试,研究发现模型在预测拟合和科学有效性之间存在明显偏差,记忆能力在已知公式的重现中起到重要作用,但在新颖结构的发现中表现有限。最高模型GPT-5.5在部分任务中预测拟合达50.77%,但科学有效性仅达81.84%。主动查询能提升结构恢复,但最大全结构恢复率仍不足21%。
这项工作揭示了当前LLMs在科学定律发现中的潜力与局限,为未来模型的设计提供了宝贵的参考。它强调了模型在复杂、噪声和异质数据环境中的适应性,推动AI在科学研究中的实际应用。未来,将通过扩展多学科场景、增强主动探索策略,进一步提升模型的推理和创新能力,助力科学自动化发现的长远目标。
深度分析
研究背景
科学发现一直是推动人类认知的核心动力。从牛顿的万有引力定律到现代的基因组学,科学家们不断通过实验和数学推导总结自然规律。传统方法依赖大量实验和人工推导,效率有限,难以应对复杂系统的高维数据。近年来,符号回归和机器学习技术,如基于遗传算法的Eureqa、AI Feynman等,尝试自动化发现科学公式,但多局限于合成环境或教材数据。随着大规模预训练模型(如GPT系列)的崛起,学界开始探索其在科学推理中的潜力,试图突破传统方法的瓶颈,推动自动化科学发现迈向新阶段。
核心问题
现有方法在真实科学数据中的表现仍不理想,主要受限于模型对复杂、多源异质数据的理解能力不足。传统基准多集中在合成数据或教材公式,缺乏对模型在真实科研环境中的评估。如何设计一个既能反映实际科学问题,又能系统评估模型推理、结构恢复和科学合理性的基准,成为亟待解决的问题。尤其是在多学科、多任务、多源数据环境下,模型的泛化能力和创新能力仍待验证。
核心创新
本研究的创新点主要有:
1)构建真实数据驱动的科学定律发现基准,涵盖六大学科,提供多任务、多场景评估平台;
2)引入主动查询机制,模拟科学家探索未知规律的过程,考察模型在有限查询预算下的结构发现能力;
3)结合预测拟合和科学有效性双重指标,确保模型提出的公式不仅拟合数据,还符合科学合理性;
4)采用ReAct框架,增强模型的推理和交互能力,提升复杂任务中的表现。
方法详解
- �� 数据采集:从非教材论文中筛选科学问题,确保数据真实性和多样性。
- �� 任务构建:基于论文和数据,设计单组和多组任务,定义输入输出、验证指标。
- �� 评估设置:SCILAWS-REAL要求模型从固定观察中提出公式,评估预测和科学性;SCILAWS-PARALLEL则模拟主动探索,模型选择输入,生成隐藏规律。
- �� 模型测试:采用九个前沿LLMs,结合ReAct框架,通过30轮交互,利用Python沙箱进行推理和公式生成。
- �� 评判指标:预测拟合用RMSE、SMAPE、R2,科学有效性由专家评审,结构恢复由专门判定机制。
- �� 统计分析:比较不同模型在不同任务、不同指标上的表现,分析偏差和潜在提升空间。
实验设计
实验采用六个学科的真实论文和数据,涵盖天文学、物理、材料、生物、生态和社会科学。每个任务设有固定观察和主动查询两种评估方式,指标包括预测拟合、科学有效性和结构恢复。模型包括GPT-5.5、Claude 4.8、Gemini 3.5等,结合ReAct框架进行多轮交互。通过不同任务难度和数据分布,评估模型在复杂环境中的推理和创新能力。还进行了记忆能力分析,验证模型在已知公式和新结构中的表现差异。
结果分析
GPT-5.5在部分任务中预测拟合达50.77%,科学有效性达81.84%,但结构恢复率仅58.26%。模型在已知公式中表现优异,但在新颖结构发现方面仍有限,最大全结构恢复率为21%。记忆能力对公式重现起关键作用,但在发现未知规律时表现不足。主动查询能提升结构恢复,但仍未突破20%的瓶颈。这些结果表明,当前LLMs在科学定律发现方面具有潜力,但在可靠性和创新性方面仍需改进。
应用场景
该基准可用于评估科研中AI模型的推理和发现能力,推动自动化科学探索。未来可结合物理、化学等专业知识,开发智能科研助手,辅助科学家快速验证假设、发现新规律。长远来看,模型有望实现全自动科学发现,缩短科研周期,加速新材料、新药等创新。
局限与展望
模型在复杂、多源、多学科环境中仍表现出偏差,尤其在未知领域推理不足。评估指标虽多,但难以全面衡量科学合理性和创新性。训练成本高,模型对大规模数据和算力要求较高。未来需改进模型的泛化能力和推理深度,增强跨领域迁移和创新能力。
通俗解读 非专业人士也能看懂
想象你在厨房做菜,科学家就像厨师,他们要不断尝试不同的食材和调料,找到最美味的配方。传统上,厨师靠经验和试错,但有时他们会用一本食谱,按照步骤做菜。现在,科学家希望用智能厨师——大语言模型,自动从厨房的各种食材中发现新的菜谱。这个过程就像模型在观察厨房里的食材和味道后,自己总结出一套新菜谱,不仅能做出好吃的,还能创新出别人没试过的菜。这个研究就像是让模型成为一个聪明的厨师,既能模仿经典菜谱,也能自己探索新味道。
简单解释 像给14岁少年讲一样
你知道厨师做菜时会用食谱吗?但有时候厨师会试着自己创造新菜,比如用不同的调料和食材组合,做出特别的味道。科学家也一样,他们用实验和数学公式来理解自然规律,但这个过程很慢很复杂。现在,科学家用一种超级聪明的机器人——大语言模型,帮他们发现新的科学规律。这个机器人可以看很多科学论文和数据,然后自己尝试找到隐藏的规律,就像厨师试着创造新菜一样。这个研究的意思是,让这些机器人变得更聪明,不仅能模仿已有的公式,还能自己探索出新的科学“菜谱”。未来,这样的机器人可以帮我们更快找到新药、新材料,推动科技飞跃!
原文摘要
Scientific equation discovery has long been central to scientific progress, proceeding through iterative cycles of hypothesis generation, observational testing, and refinement under scientific constraints. As LLM capabilities advance and their role in AI for Science expands, it remains an open problem whether they can genuinely discover scientific laws and how this ability should be evaluated. Existing evaluations, however, often either simplify discovery through synthetic settings or reuse published targets that may already be familiar to LLMs. We therefore introduce SCILAWS-BENCH, a benchmark for scientific law discovery built from published research and real scientific data. It comprises 118 problems drawn from 381 scientific papers, covering 291 candidate laws and roughly 8M real data points across six scientific disciplines. Each problem is instantiated in two complementary settings: (1) SCILAWS-REAL asks models to propose laws from fixed real observations and evaluates held-out predictive fit and scientific validity derived from the source literature, and (2) SCILAWS-PARALLEL asks models to actively query residual-calibrated worlds and recover synthesized hidden laws derived from published forms. This two-setting task design preserves each problem's scientific context while separately evaluating fixed-record law discovery and active recovery of a newly synthesized hidden law. We find that predictive fit can diverge from scientific validity, memorization shapes whether models reproduce or move beyond published formulas, and our best-of-N study reveals a selection bottleneck. Our work provides a paper-grounded benchmark and new empirical perspectives for evaluating AI for scientific discovery. Project page: https://yiyihum.github.io/SciLaws-Bench