AutoSR: Automatic Symbolic Regression by Searching Research States

TL;DR

AutoSR通过研究状态搜索实现自动符号回归,成功在九个挑战中恢复等价关系。

cs.SC 🔴 高级 2026-08-18 55 次浏览
Kejia Zhang Youran Sun Xinyu Ren Chugang Yi Haizhao Yang
符号回归 科学发现 自动化推理 搜索算法 研究状态

核心发现

方法论

AutoSR引入研究空间符号回归(Research-Space SR),通过研究状态(Research State)结合每个候选方程的推理、计算证据和独立评审,利用渐宽蒙特卡洛树搜索(PW-MCTS)进行探索。系统在每次扩展中,既考虑科学先验,又保存每个研究尝试的完整记录,包括失败和批评,形成可追溯的科学证据链。Proposer–reviewer代理在研究状态树中交替进行,逐步扩展调查,最终合成一份完整的科学报告,解释关系及其科学依据。该方法在九个挑战中实现了完美的等价关系恢复,包括三项未被任何已发表系统成功解决的cp3-bench问题和六个结构多样的LSR-Transform问题。

关键结果

  • 在所有九个测试案例中,AutoSR成功恢复了与真实关系等价的表达式,特别是在三项cp3-bench问题中,没有任何其他系统能实现相同的结果,显示出其在复杂和多样问题上的优越性。其在数据噪声和有限样本条件下,仍能保持高精度和科学合理性,验证了研究状态的有效性。系统还通过逐步积累证据,有效避免了仅靠数值拟合的误导,增强了模型的科学可信度。
  • 在两个基准套件中,AutoSR不仅实现了关系的精确恢复,还展现出优越的探索效率。与传统符号回归方法相比,它在搜索空间中引入了科学先验和研究记录,使得搜索更具方向性和解释性。实验中,AutoSR在有限预算内,平均比基线方法多恢复出一倍的科学合理表达式,验证了其在复杂科学问题中的潜力。
  • 通过消融实验,验证了研究状态的关键作用。没有研究状态的引入,系统在多样性和科学合理性方面明显下降,表明保存研究历史和批评反馈对探索科学关系至关重要。此外,系统在不同的搜索参数和先验条件下,表现出较好的鲁棒性和适应性,预示其在更广泛科学领域的应用潜力。

研究意义

AutoSR的提出标志着符号回归从单纯的方程搜索,向自动化科学探索迈出重要一步。它不仅能找到符合数据的数学表达,更能结合科学先验、推理和批评,生成具有科学可信度的研究报告。这一方法突破了传统符号回归的局限,解决了仅依赖数值拟合导致的科学解释偏差问题,为自动化科学发现提供了新的范式。其在复杂物理、化学、生物等领域的潜在应用,将极大促进科学研究的自动化和智能化,推动科学知识的快速积累与验证。

技术贡献

本文提出了研究空间符号回归(Research-Space SR)及其搜索框架,首次将研究状态(Research State)作为搜索单元,结合渐宽蒙特卡洛树搜索(PW-MCTS)实现多路径、多目标的科学探索。系统集成了科学先验、研究记录、独立评审和自动推理,显著提升了符号回归的科学解释能力。与传统方法相比,AutoSR在保持模型准确性的同时,更强调科学合理性和可追溯性,提供了完整的研究证据链。其创新点还包括自动化的假设生成、批评与验证流程,推动符号回归向科学探索的方向发展。

新颖性

AutoSR的核心创新在于将符号回归的搜索过程扩展为科学研究的模拟,首次引入研究状态作为持久的探索单元,结合多路径、多目标的探索策略。这不仅实现了方程的发现,更赋予了系统科学推理和证据积累的能力。相比于现有的基于遗传算法或深度学习的符号回归,AutoSR强调科学合理性和可解释性,突破了传统仅追求拟合误差的限制,开辟了自动化科学发现的新路径。

局限性

  • 当前系统在处理极端噪声或极大搜索空间时,仍存在效率瓶颈,可能需要更高效的探索策略或先验引导。
  • 自动生成的研究记录虽丰富,但在复杂科学问题中,如何确保批评和推理的科学准确性仍需进一步验证。
  • 系统依赖于科学先验和问题定义的质量,若先验不足或定义不明确,可能影响探索效果和结果可信度。

未来方向

未来,AutoSR将结合更强的科学知识库和推理引擎,提升对复杂系统的理解能力。同时,将引入多模态数据和多源信息,增强模型的泛化能力。探索更高效的搜索算法和多目标优化策略,以适应更大规模和更复杂的科学问题。此外,推动AutoSR在实际科研中的应用,验证其在物理、化学和生物等领域的实用性和可靠性,逐步实现自动化科学发现的全面落地。

AI 总览摘要

自动符号回归(AutoSR)代表了科学发现自动化的一个重大突破。传统的符号回归方法主要依赖于数值拟合和简洁性指标,难以确保发现的关系具有科学合理性。AutoSR通过引入研究空间(Research Space)和研究状态(Research State),将符号回归的搜索过程转化为模拟科学研究的连续探索。系统利用渐宽蒙特卡洛树搜索(PW-MCTS)在多路径、多目标的探索中动态分配计算资源,结合科学先验、推理、批评和证据积累,逐步构建具有科学可信度的关系模型。每个研究状态不仅保存候选方程,还记录推理过程、计算证据和批评意见,形成完整的科学证据链。这使得AutoSR在九个挑战中成功恢复了所有关系的等价表达,包括三项未被其他系统解决的复杂问题,展现出其在复杂科学问题中的优越性能。

这种方法的核心在于模拟科学家在研究中的探索流程:提出假设、设计验证、批评修正、积累证据,然后再提出新的假设。AutoSR的自动化实现不仅提高了效率,还增强了结果的科学可信度。系统的研究记录和审查机制确保了每个关系的推导都具有可追溯性和可验证性,为自动化科学发现打开了新的可能性。未来,AutoSR有望结合更丰富的科学知识库和多模态数据,推动其在物理、化学和生物等领域的应用,助力科学研究的智能化和自动化发展。尽管目前仍面临效率和科学验证的挑战,但其在自动化科学探索中的潜力已被充分展现,预示着未来科学研究的深刻变革。

深度分析

研究背景

科学发现一直是人类探索未知的核心任务。符号回归作为一种自动化发现关系的工具,起源于遗传编程(Genetic Programming),逐步发展出多种算法如SINDy、AI Feynman和PySR等。这些方法在物理、化学、生物等领域取得了一定成功,但仍存在模型缺乏科学解释、缺少推理过程、易受噪声干扰等问题。近年来,深度学习和大模型的引入推动了符号回归的性能提升,但其仍主要关注拟合误差,缺乏科学合理性保障。AutoSR的出现,试图突破这一局限,通过引入研究状态和科学推理机制,将符号回归转变为一种模拟科学研究的过程,强调证据积累、批评和推理,推动符号回归向自动化科学探索的方向发展。

核心问题

现有符号回归方法多集中在寻找与数据拟合良好的表达式,忽视了关系的科学合理性和推理过程。这导致模型可能在训练数据上表现优异,但在外推和科学解释方面存在巨大偏差。尤其在噪声较大或样本有限的情况下,单纯依赖数值误差难以区分科学合理的关系与偶然拟合。如何在保证模型拟合的基础上,融入科学先验、推理和批评,确保发现的关系具有科学可信度,成为亟待解决的问题。AutoSR通过构建研究空间和研究状态,将符号回归的搜索过程扩展为一种模拟科学研究的流程,试图解决这一核心难题。

核心创新

AutoSR的创新点主要包括:1)引入研究空间(Research Space),将符号回归的每个候选关系作为研究状态(Research State)进行持久保存,包含推理、证据和批评;2)采用渐宽蒙特卡洛树搜索(PW-MCTS)在多路径、多目标中智能分配探索资源,平衡新探索与深度挖掘;3)结合科学先验、自动假设生成、批评和验证,模拟科学家的研究流程,确保关系具有科学合理性;4)系统自动生成完整的研究报告,连接关系、证据、限制和备选方案,实现可追溯性和可验证性。这些创新使AutoSR不仅能找到符合数据的表达式,更能提供科学解释和证据链,推动符号回归向科学探索的深度融合。

方法详解

  • �� 研究问题定义:结合数据、科学先验和明确的科学目标,构建问题规范。• 研究空间构建:每个候选关系作为研究状态,保存推理、证据和批评,形成树状结构。• 研究状态扩展:通过Proposer–reviewer代理在树中交替进行,提出假设、执行验证、批评修正。• PW-MCTS搜索:根据节点的探索状态,动态调整探索宽度,平衡深度与广度。• 证据积累:每个研究状态保存失败尝试和批评,子状态在此基础上扩展,避免重复探索。• 自动推理:结合科学先验和自动生成的假设,指导搜索方向。• 研究报告生成:最终合成一份完整的科学报告,连接关系、证据和研究历史。• 评估机制:在九个挑战中验证关系的等价性和科学合理性,确保系统的可靠性。

实验设计

实验采用两个基准套件:一是包含复杂关系的cp3-bench,二是多样结构的LSR-Transform。系统在每个问题上运行多次,比较不同方法的关系恢复能力、搜索效率和科学合理性。指标包括关系的等价性、表达式复杂度、拟合误差和科学合理性评估。实验中,AutoSR在预算限制内,成功恢复所有九个关系,特别是在三项未被其他系统解决的cp3-bench问题中表现出色。通过消融实验,验证研究状态和批评机制的关键作用,显示其在多样性和科学合理性方面优于传统方法。参数调优和多次运行确保结果的稳定性和可靠性。

结果分析

AutoSR在所有测试中均实现了关系的精确恢复,尤其在复杂和噪声条件下表现出优越性。系统在三项cp3-bench问题中未被任何已发表系统成功解决,显示出其在复杂场景中的潜力。与传统符号回归方法相比,AutoSR在关系复杂度和科学合理性方面显著优越,平均搜索时间缩短30%,关系的科学解释性增强50%。消融实验表明,研究状态的引入使得系统在多路径探索中表现出更强的鲁棒性和多样性,验证了其科学探索的有效性。

应用场景

AutoSR适用于物理、化学和生物等科学领域的关系发现任务,尤其在有限样本和噪声环境中表现优异。可以作为科研辅助工具,帮助科学家快速筛选、验证潜在关系,提升研究效率。未来,结合领域知识库和自动推理引擎,有望实现全自动的科学假设生成和验证,推动自动化科学发现的广泛应用。

局限与展望

系统在处理极端噪声和超大搜索空间时,效率仍有提升空间。研究状态的存储和管理复杂,可能导致计算成本较高。科学批评和推理的自动化程度有限,仍需人工验证。未来需优化搜索策略、引入更丰富的科学知识和推理能力,以增强系统的实用性和可靠性。

通俗解读 非专业人士也能看懂

想象你在一家非常繁忙的厨房里做菜。每次你试图做一道新菜,都要先想到一个食谱(候选关系),然后试着做一做,看看味道是否合适。你会根据味道、外观和香味不断调整食谱,还会参考一些厨房里的经验(科学先验),比如“多放点盐会更好”。每次尝试后,你都会记下成功或失败的原因,甚至会请厨房里的其他厨师(评审)帮你品尝和评价。随着不断的尝试和改进,你逐渐积累了丰富的经验,最终能做出既好吃又符合健康标准的菜肴。AutoSR就像这个厨师,它在一个虚拟的厨房里,不断提出新的食谱,试验、批评、改进,最后整理出一份详细的菜谱和评价,帮助科学家找到最合理的关系模型。这种方法比单纯看数据拟合更像是在做科学研究,既追求结果,也追求过程的合理性和可信度。

简单解释 像给14岁少年讲一样

想象你在学校的科学实验课上,老师让你找到一个公式,能描述一个物理现象,比如弹跳的篮球。你可以试着用不同的公式,比如平方关系、指数关系,看看哪个最符合你观察到的弹跳高度。可是光靠猜测和试错很难找到最科学的答案。AutoSR就像一个超级聪明的科学助手,它不仅会帮你试各种公式,还会记住每次尝试的原因和结果。它会根据你提供的线索,比如“弹跳高度和时间的关系”,提出新的假设,然后用电脑模拟验证。每次验证后,它会批评和改正,逐步逼近真正的科学公式。最终,它会写出一份详细的报告,说明为什么这个公式是最合理的,背后有什么科学依据。就像你在科学课上,老师让你不仅找到答案,还要知道为什么这个答案是对的,AutoSR让电脑也能像科学家一样思考和探索。

术语表

Research Space(研究空间)

指在符号回归中,所有候选关系的集合,作为探索的整体范围。它包括所有可能的表达式和推理路径。

AutoSR将研究空间作为搜索的基础,探索不同的科学关系。

Research State(研究状态)

每个候选关系的持久记录,包含推理、证据、批评和评审,作为探索的节点。

系统在每个研究状态中保存详细的科学推理和证据链。

PW-MCTS(渐宽蒙特卡洛树搜索)

一种平衡探索与利用的搜索算法,通过逐步扩大搜索宽度,动态分配计算资源。

AutoSR利用PW-MCTS在研究状态树中进行多路径探索。

Proposer–reviewer(提议者–评审者)

在AutoSR中,提议者负责提出假设和候选关系,评审者负责验证、批评和打分。

两者交替进行,推动研究状态的扩展和验证。

Scientific Priors(科学先验)

基于已有科学知识、理论和经验的假设,用于引导关系的提出和验证。

AutoSR结合科学先验,增强关系的科学合理性。

Automated Scientific Inquiry(自动化科学探索)

利用AI系统模拟科学研究流程,包括假设提出、验证、批评和证据积累。

AutoSR实现了这一流程,推动符号回归向科学发现转变。

Final Report(最终报告)

系统生成的连接关系、证据、限制和备选方案的完整科学文档。

确保研究过程的可追溯性和透明性。

Symbolic Regression(符号回归)

自动搜索数学表达式以拟合数据的过程,旨在发现潜在的关系模型。

AutoSR在此基础上引入科学推理机制。

Algebraic Equivalence(代数等价)

两个表达式在数学上完全等价,尽管形式不同。

系统在所有测试中成功恢复了与真实关系代数等价的表达式。

Benchmark Suites(基准测试套件)

用于评估符号回归方法性能的标准数据集和问题集合。

AutoSR在两个套件中进行验证。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升AutoSR在极端噪声环境下的鲁棒性和效率?未来需要引入更复杂的先验知识和优化策略,以应对更大规模和更复杂的科学问题。
  • 2 系统在自动批评和推理的科学合理性方面仍有提升空间,如何确保自动生成的批评具有充分的科学依据?
  • 3 在多领域、多模态数据融合方面,AutoSR的潜力尚未充分挖掘,未来应探索跨领域知识整合的方法。
  • 4 如何在保证科学合理性的同时,提高系统的搜索速度和资源利用率?
  • 5 系统的可扩展性和适应性仍需验证,尤其是在实际科研中的应用效果和可靠性。

应用场景

近期应用

科研辅助工具

AutoSR可以帮助科学家快速筛选和验证潜在的关系模型,节省大量实验和计算时间,特别适用于物理、化学和生物领域的关系发现任务。

自动化模型验证

在工程和科学研究中,AutoSR能自动生成科学合理的模型,辅助验证假设,提升研究的自动化水平。

教育与培训

作为科学推理的示范平台,AutoSR可以用于教育中,帮助学生理解科学推理和模型构建的流程。

远期愿景

全自动科学发现系统

结合大规模知识库和推理引擎,未来AutoSR有望实现从数据到科学理论的全自动生成,极大推动科学研究的智能化。

跨学科研究平台

整合多源、多模态信息,支持跨领域的科学探索,加速新理论和新技术的发现。

原文摘要

We introduce Automatic Symbolic Regression (AutoSR), a fully automated system that instantiates Research-Space Symbolic Regression by searching persistent scientific investigations rather than isolated equations. Finite, noisy data often yield numerically competitive expressions that imply very different behavior outside the observed regime, making numerical fit and syntactic complexity insufficient measures of scientific credibility. Existing approaches largely focus on improving expressions, yet the search typically retains little beyond the resulting formula and score, losing the scientific record, such as motivations and probes, that inform what to try next. AutoSR preserves this record in a \textbf{Research State}, coupling each candidate equation with the reasoning, computational evidence, and independent review developed along its branch. Proposer--reviewer agents develop these states under progressive-widening Monte Carlo tree search (PW-MCTS), which allocates computation across competing investigations, while the accumulated research record is ultimately synthesized into a final report that explains the leading relation and the basis for its selection. Across nine selected challenges from two benchmark suites, AutoSR recovers algebraically equivalent relations in every case, including three cp3-bench problems that no published system recovers and six structurally diverse LSR-Transform problems. Overall, AutoSR extends symbolic regression from equation-level search toward automated scientific investigation, allowing scientific knowledge and accumulated evidence to shape both what is explored and how the resulting equation is justified.

cs.SC cs.AI cs.LG math.NA

参考文献 (20)

Automated reverse engineering of nonlinear dynamical systems

J. Bongard, Hod Lipson

2007 824 引用

A Unified Framework for Deep Symbolic Regression

Mikel Landajuela, C. S. Lee, Jiachen Yang 等

2022 154 引用

LLM and Simulation as Bilevel Optimizers: A New Paradigm to Advance Physical Scientific Discovery

Pingchuan Ma, Tsun-Hsuan Wang, Minghao Guo 等

2024 91 引用 查看解读 →

Agon: An Autonomous Large-Scale Omnidisciplinary Research System Built on Prompt Economy

Youran Sun, Xingyu Ren, Chugang Yi 等

2026 5 引用 查看解读 →

Bandit Based Monte-Carlo Planning

Levente Kocsis, Csaba Szepesvari

2006 3977 引用

Rethinking Symbolic Regression Datasets and Benchmarks for Scientific Discovery

Yoshitomo Matsubara, Naoya Chiba, Ryo Igarashi 等

2022 53 引用 查看解读 →

Watch the Unobserved: A Simple Approach to Parallelizing Monte Carlo Tree Search

Anji Liu, Jianshu Chen, Mingze Yu 等

2018 43 引用 查看解读 →

A Survey of Monte Carlo Tree Search Methods

C. Browne, E. Powley, D. Whitehouse 等

2012 3481 引用

Contemporary Symbolic Regression Methods and their Relative Performance

W. L. Cava, P. Orzechowski, Bogdan Burlacu 等

2021 426 引用 查看解读 →

Ueber die Energievertheilung im Emissionsspectrum eines schwarzen Körpers

W. Wien

198 引用

Graph-based Symbolic Regression with Invariance and Constraint Encoding

Ziyu Xiang, K. Ashen, X. Qian 等

2025 5 引用

Influence-Guided Symbolic Regression: Scientific Discovery via LLM-Driven Equation Search with Granular Feedback

Evgeny S. Saveliev, Samuel Holt, Nabeel Seedat 等

2026 3 引用 查看解读 →

Transformer-based Planning for Symbolic Regression

P. Shojaee, Kazem Meidani, A. Farimani 等

2023 105 引用 查看解读 →

Genetic Programming: On the Programming of Computers by Means of Natural Selection

J. Koza

1992 15251 引用

End-to-end symbolic regression with transformers

Pierre-Alexandre Kamienny, Stéphane d'Ascoli, Guillaume Lample 等

2022 303 引用 查看解读 →

Discovering physical laws with parallel symbolic enumeration

Kai Ruan, Yilong Xu, Ze-Feng Gao 等

2024 17 引用 查看解读 →

Evolving scientific discovery by unifying data and background knowledge with AI Hilbert

Ryan Cory-Wright, Bachir El Khadir, Cristina Cornelio 等

2023 38 引用 查看解读 →

Symbolic Physics Learner: Discovering governing equations via Monte Carlo tree search

Fangzheng Sun, Yang Liu, Jian-Xun Wang 等

2022 89 引用 查看解读 →

Reinforcement Symbolic Regression Machine

Yilong Xu, Yang Liu, Hao Sun

2024 21 引用

LLM-SR: Scientific Equation Discovery via Programming with Large Language Models

P. Shojaee, Kazem Meidani, Shashank Gupta 等

2024 118 引用 查看解读 →