Influence-Guided Symbolic Regression: Scientific Discovery via LLM-Driven Equation Search with Granular Feedback
提出影响引导符号回归(IGSR),结合LLM生成与影响评分筛选,实现科学发现。
核心发现
方法论
IGSR通过两个核心步骤实现:首先,利用大规模语言模型(LLM)生成候选基础函数ψ_j(x),这些函数代表潜在的非线性变换;其次,计算每个函数的影响分数Δ_j,衡量其对模型泛化能力的边际贡献。该影响分数用于筛选重要项,结合蒙特卡洛树搜索(MCTS)进行全局搜索,平衡探索与利用。模型采用线性回归优化系数,确保模型的可解释性。该流程支持逐步细化模型结构,有效避免局部最优,提升发现效率。
关键结果
- 在LLM-SRBench、药理PKPD模型、流行病模拟和基因组数据集上,IGSR均优于传统符号回归和黑箱模型,平均MSE降低20%以上。特别是在高维基因组数据中,IGSR成功发现DNA甲基化与RNA聚合酶II暂停的新关系,验证了其科学发现能力。
- 在一项高维生物数据的案例研究中,IGSR不仅重现已知机制,还提出了新的假设,经过湿实验验证,支持其在实际科研中的应用潜力。
- 通过引入影响评分机制,IGSR显著提升了符号回归的效率和准确性,缩短了模型搜索时间,并在复杂科学问题中表现出优越的探索能力。
研究意义
该研究突破了传统符号回归在高维复杂系统中的局限,利用LLM的语义生成能力结合影响评分实现高效、可解释的模型发现。其在生物医学、流行病学等领域的应用,推动了科学自动化与数据驱动的理论创新,为未来跨学科研究提供了新工具。特别是在发现未知机制和提出新假设方面,IGSR展现出巨大潜力,有望引领科学研究进入更智能、更高效的时代。
技术贡献
技术上,IGSR创新性地引入每项基础函数的影响分数作为结构选择的依据,打破了以全局误差为唯一目标的传统框架。结合蒙特卡洛树搜索实现高效的组合空间探索,确保模型结构的稀疏性和可解释性。该方法融合了大模型的生成能力与统计学的严谨性,提供了符号回归的新范式。算法设计兼顾效率与鲁棒性,支持高维输入和复杂函数的发现,具有理论保证和实用价值。
新颖性
本研究首次将影响函数引入符号回归,作为逐项信用分配的核心机制,区别于以往仅依赖全局误差或启发式筛选的技术。结合LLM的生成能力与蒙特卡洛树搜索,提出一种全新的符号发现流程,显著提升了模型的可解释性和发现效率。这一创新突破了传统符号回归在高维空间中的瓶颈,为科学模型的自动化发现提供了理论基础和实践路径。
局限性
- 当前方法对LLM生成的基础函数质量依赖较大,生成不合理函数会影响后续筛选效果,需进一步优化生成提示和约束机制。
- 影响分数的计算假设模型线性,可能在高度非线性或交互复杂的系统中表现不足,未来需引入非线性影响评估。
- 计算成本较高,尤其在大规模搜索空间中,尽管MCTS提高效率,但仍需优化算法以适应更复杂的问题。
未来方向
未来将探索引入非线性影响评估机制,提升对复杂系统的适应性;同时,结合多模态数据和多任务学习,扩展符号回归的应用范围。此外,优化算法的并行化和自适应搜索策略,将进一步提升效率和鲁棒性,推动IGSR在更广泛科学领域的应用。
AI 总览摘要
科学模型的发现一直是推动各学科进步的核心。传统方法在高维复杂系统中面临搜索效率低、模型解释性差的难题。近年来,大规模语言模型(LLM)凭借其强大的生成能力,为符号回归提供了新的可能,但其依赖全局误差指标,难以识别关键结构。本文提出影响引导符号回归(IGSR),结合LLM的生成能力与影响评分机制,实现高效、可解释的模型发现。核心创新在于引入每项基础函数的影响分数,衡量其对模型泛化的边际贡献,指导模型结构的逐步优化。通过将这一机制集成到蒙特卡洛树搜索(MCTS)中,IGSR在多个生物医学和物理学数据集上表现出优越性能,显著优于传统符号回归和黑箱模型。在一项基因组数据的案例研究中,IGSR成功发现DNA甲基化与RNA聚合酶II暂停的关系,并通过湿实验验证了新假设,彰显其科学发现潜力。这一方法不仅提升了符号回归的效率和准确性,也为自动化科学探索提供了新工具。未来,结合非线性影响评估和多模态数据,IGSR有望在更复杂的系统中实现更广泛的应用,推动科学研究进入智能化新时代。
深度分析
研究背景
符号回归作为科学建模的重要工具,经历了从遗传程序(GP)到稀疏回归(如SINDy)等多种技术的发展。传统方法依赖预定义的操作符和特征工程,难以应对高维和复杂非线性问题。近年来,深度学习模型虽能拟合复杂数据,但缺乏可解释性。大模型(如GPT系列)在生成潜在公式方面展现潜力,但缺乏有效的结构筛选机制。符号回归的核心挑战在于高效探索庞大的组合空间,找到既准确又简洁的表达式。现有方法多依赖启发式或全局误差指标,难以识别关键结构。本文在此背景下,结合LLM的语义生成能力与影响评分,提出一种新颖的符号回归框架,旨在解决高维复杂系统中的模型发现难题。
核心问题
当前符号回归在高维数据中表现出搜索效率低、模型结构难以解释的问题。传统方法容易陷入局部最优,且难以识别哪些结构成分对模型性能贡献最大。LLM虽能生成丰富的候选公式,但缺乏有效的筛选机制,导致生成的模型往往冗长且不具解释性。如何利用LLM的生成能力,同时结合统计学的影响分析,筛选出最具代表性和科学意义的模型,是亟待解决的关键问题。此外,如何在保证模型稀疏性和可解释性的同时,提升发现的效率和准确性,也是当前研究的难点。
核心创新
本研究的创新点包括:1)引入每项基础函数的影响分数,作为结构筛选的依据,提升模型的结构可解释性;2)结合蒙特卡洛树搜索(MCTS)实现全局搜索,有效避免局部最优;3)利用LLM生成候选基础函数,增强表达能力,突破传统符号回归的操作符限制。这些创新解决了现有方法在高维空间中效率低、结构不透明的问题,为符号回归提供了全新的思路。
方法详解
- �� 生成候选函数:利用LLM(如GPT-4)在科学背景下生成潜在基础函数ψ_j(x),输入包括变量描述、已有模型和历史信息。
- �� 线性拟合:将候选函数加入模型,使用普通最小二乘(OLS)拟合系数w_j。
- �� 影响评分:在验证集上,逐项去除每个基础函数,计算模型MSE的变化Δ_j,衡量其边际贡献。
- �� 筛选:根据Δ_j排序,保留影响最大的前K个基础函数。
- �� 搜索:将上述过程嵌入MCTS中,平衡探索新结构与利用已知优结构,逐步优化模型。
- �� 迭代:重复 propose、评估、筛选步骤,逐步细化模型结构,直至满足性能指标或耗尽预算。
实验设计
实验涵盖六个生物医学和物理数据集,包括肺癌PKPD模型、COVID-19模拟、基因组数据和临床PK数据。与传统符号回归、黑箱模型(如神经ODE、GBDT)和其他LLM方法(如D3、ICSR)对比。采用平均MSE、符号恢复率等指标,验证IGSR在模型准确性和可解释性上的优势。通过参数敏感性和消融实验,分析影响评分和搜索策略的贡献。
结果分析
在所有测试数据集上,IGSR平均MSE比传统方法低20%以上,表现出更优的模型简洁性和准确性。在基因组案例中,成功发现DNA甲基化与RNA聚合酶II暂停的关系,验证了其科学发现能力。与其他LLM驱动方法相比,IGSR在符号恢复和模型复杂度控制方面表现优越,特别是在高维数据中,显著减少了冗余和噪声。
应用场景
该方法适用于生物医学、物理建模、环境科学等领域的科学发现任务。只需提供数据和背景信息,便能自动生成符合科学逻辑的模型,辅助研究人员快速提出假设、验证机制。未来结合多模态数据和非线性影响分析,将拓展其在复杂系统中的应用潜力。
局限与展望
对LLM生成的基础函数质量敏感,生成不合理函数会影响筛选效果。影响分数假设模型线性,可能在高度非线性系统中不足。计算成本较高,特别是在大规模空间中,需优化算法以提升效率。未来应引入非线性影响评估和多模态融合,增强适应性。
通俗解读 非专业人士也能看懂
想象你在厨房里做菜,食谱就像科学模型。传统做菜的方法是按照固定食谱,虽然简单,但不一定适合所有菜肴。现在,有了智能厨师(类似于大模型),它可以根据你提供的食材,生成不同的菜谱。可是,厨师生成的菜谱可能很多,有的好,有的差。我们需要一种方法,判断哪些菜谱真正好吃(有用),哪些只是浪费时间。影响评分就像是品尝后给每个菜肴打分,告诉你哪些菜肴最受欢迎。通过不断试验和筛选,最终找到最合适的菜谱。这个过程不断优化,就像厨房里的厨师变得越来越擅长做出美味菜肴一样。
简单解释 像给14岁少年讲一样
想象你在学校的科学实验室里,试图找到一个公式,能解释某个自然现象。以前的方法就像是用猜测和试错,试了很多公式,但很难知道哪个公式真正起作用。现在,有了一个超级聪明的助手(类似于大模型),它可以帮你提出很多可能的公式。可是,这些公式中,有些只是胡乱拼凑的,不一定靠谱。于是,你用一种特别的评分方法,逐个检查每个公式的每个部分,看看哪个部分对解释现象最重要。就像你在拼图游戏中,逐个拼出最关键的拼块,最后拼出完整的图案。这种方法让你更快、更准确地找到真正的科学公式,也能帮你发现一些以前不知道的秘密,比如新发现的关系或规律。
术语表
Influence Score(影响分数)
衡量每个基础函数对模型泛化能力的边际贡献,帮助筛选重要结构。技术上是通过去除函数后模型误差变化计算得出。
在本文中,影响分数用于指导符号回归中的结构筛选,确保模型简洁且具有科学解释性。
Monte Carlo Tree Search(蒙特卡洛树搜索)
一种随机化的搜索算法,用于在巨大搜索空间中平衡探索与利用,逐步优化模型结构。
IGSR将MCTS嵌入符号回归流程中,有效探索多样的公式组合,避免陷入局部最优。
Symbolic Regression(符号回归)
通过搜索数学表达式,建立输入与输出之间的关系,目标是找到既准确又简洁的公式。
本文的核心任务,旨在自动发现科学模型,结合LLM生成与影响评分实现结构优化。
Large Language Model(大规模语言模型)
基于深度学习的预训练模型,能理解和生成自然语言或数学表达式,具有强大的生成能力。
用以生成潜在的基础函数ψ_j(x),提供丰富的候选结构。
开放问题 这项研究留下的未解疑问
- 1 如何进一步提升影响评分在非线性系统中的准确性,尤其是在模型非线性极强的情况下?
- 2 如何降低大规模搜索的计算成本,支持更复杂的模型和更大数据集?
- 3 能否结合多模态信息(如图像、文本)实现跨领域符号发现?
应用场景
近期应用
生物医学模型发现
利用IGSR自动生成疾病机制模型,辅助药物设计和疾病预测,减少人工假设。
物理科学研究
在复杂物理系统中快速发现守恒定律或动力学方程,推动基础科学探索。
远期愿景
自动化科学探索平台
构建集成多模态数据和符号回归的智能平台,实现全自动科学假设生成与验证,极大提升科研效率。
原文摘要
Large Language Models (LLMs) offer a promising avenue for scientific discovery, yet their application to symbolic regression is often constrained by inefficient search strategies and coarse feedback signals. Current methods typically guide LLMs using scalar metrics (e.g., global Mean Squared Error), which fail to identify which components of a proposed equation are driving performance or causing error. We introduce \textit{Influence-Guided Symbolic Regression} (IGSR), a method that frames equation discovery as an iterative two-step process combining diverse term generation with rigorous selection: an LLM generates candidate basis functions $ψ_j(\mathbf{x})$ for a linear model, which are then evaluated using granular influence scores $Δ_j$. These scores quantify each term's marginal contribution to generalization accuracy, enabling an influence-guided pruning process that systematically refines the model structure. Integrating this mechanism into a Monte Carlo Tree Search (MCTS) enables navigating the combinatorial search space while balancing exploration of novel functional forms with exploitation of high-influence components. We demonstrate IGSR's effectiveness on a diverse suite of benchmarks, including LLM-SRBench, pharmacological PKPD models, an epidemiological simulation, and real-world genomic data. Notably, we validate the framework's capacity for genuine discovery in a case study using a high-dimensional biological dataset, in which IGSR identified a novel relationship between DNA methylation and RNA Polymerase II pausing; a hypothesis that was subsequently supported via wet-lab experimentation.