DASyR-LLM: Domain-Aware Symbolic Regression with LLMs for Kinetic Model Discovery

TL;DR

引入基于大语言模型(LLMs)的符号回归(SR)框架,用于自动发现反应动力学模型,显著缩短模型识别迭代次数。

cs.LG 🔴 高级 2026-08-06 93 次浏览
Roberto Aliaga Medina Paulina Quintanilla Antonio del Rio Chanona
符号回归 大语言模型 动力学模型 化学工程 自动化模型发现

核心发现

方法论

本文提出的DASyR-LLM框架在传统的符号回归基础上嵌入了大语言模型(LLM)模块,结合迭代式模型搜索与领域知识引导。核心包括:• 采用ADoK-S作为符号回归的基础算法,结合模型参数估计和模型选择(AIC)实现逐步优化;• 在每次迭代中,LLM对当前最佳候选模型进行定性化的物理化学评价,识别潜在不合理结构;• LLM还根据已生成的模型和化学知识,提出新的候选表达式,指导下一轮搜索;• 通过模拟合成数据(四个不同复杂度的案例)验证框架,比较纯SR与LLM引导的模型发现效率。该方法在缩短模型识别时间、减少实验次数方面表现优异,特别在反应动力学和催化系统中展现出强大潜力。

关键结果

  • 在四个模拟案例中,LLM引导的符号回归显著减少了模型识别的迭代次数,平均降低41.7%至79.3%,大大提升了效率。具体而言,在复杂催化反应系统中,传统SR需要约20轮迭代,而引入LLM后,平均仅需约4-12轮。超过一半的 guided runs,LLM成功提出了与真实模型结构一致的表达式,验证了其在模型结构推断中的有效性。
  • 在独立验证集上的预测性能保持一致,所有案例中R²值均超过0.98,表明模型的泛化能力未受影响。通过消融实验,发现无论是符号回归算法还是LLM规模的减小,模型发现效率均有所下降,但较大规模LLM仍能保持较高性能,显示出方法的鲁棒性。
  • 该框架在实际应用中,能显著减少实验次数和成本,特别是在每次迭代通常需要湿实验验证的场景中,节省了大量时间和资源。整体而言,本文的创新在于将领域知识引入模型搜索过程,结合大语言模型的推理能力,推动自动化、智能化的动力学模型发现,具有重要的理论和实践意义。

研究意义

该研究突破了传统符号回归在物理化学合理性方面的局限,首次系统性引入大语言模型作为定性评价和生成工具,有效融合领域知识与数据驱动方法。其意义在于推动化学工程、催化、生命科学等领域的自动模型发现,从而加快新反应机制的揭示和工艺优化的步伐。通过显著缩短模型识别周期,降低实验成本,为工业应用提供了可行路径。此外,该方法也为未来结合人工智能与科学推理的模型构建提供了新范式,开启了自动化科学发现的新纪元。

技术贡献

技术上,本文创新性地将大语言模型嵌入符号回归的迭代流程,作为定性评估和候选表达式生成的智能引擎。具体贡献包括:• 设计了结合物理化学知识的LLM评价机制,提升模型合理性;• 提出基于LLM的模型结构生成策略,有效引导搜索空间;• 通过多轮迭代,结合模型选择(AIC)与实验设计(MBDoE),实现模型的高效识别。该框架在保持符号回归灵活性的同时,增强了模型的物理一致性和解释性,为自动化模型发现提供了新工具。

新颖性

本研究的创新点在于首次将大语言模型作为符号回归的核心组成部分,结合定性物理评价与生成,突破了以往仅依赖统计指标或预定义结构的限制。不同于现有的基于统计或优化的模型搜索方法,本文引入了基于科学推理的领域知识引导机制,使模型结构的合理性得到保障。这种多模态、多角色的结合,为反应动力学模型的自动发现提供了全新的思路,具有开创性意义。

局限性

  • 尽管LLM在模型结构生成和评价中表现出色,但其依赖于预训练知识库,可能在未涵盖特定化学反应或新颖机制时出现偏差,影响模型的普适性。
  • 该方法在复杂反应网络或高噪声数据中,仍存在一定的稳定性挑战,尤其是在模型结构极其庞大或参数空间极宽的情况下,搜索效率可能下降。
  • 目前的实验主要在模拟数据上验证,实际湿实验环境中的数据噪声、测量误差和系统非理想性可能影响模型的准确性和鲁棒性,未来需在真实工业数据中验证和优化。

未来方向

未来方向包括:• 扩展LLM的知识库,增强其在新兴反应机制中的推理能力;• 结合多模态数据(如光谱、质谱)提升模型的多源信息融合能力;• 开发更高效的多轮交互式模型生成策略,以适应更复杂的反应体系;• 在实际工业流程中部署,验证其在真实环境中的表现和适应性;• 探索多任务学习框架,结合动力学、热力学等多方面知识,实现更全面的模型自动发现。

AI 总览摘要

在化学工程和生命科学领域,理解和控制复杂反应系统的动力学行为一直是核心挑战。传统方法依赖于专家经验和繁琐的实验设计,既耗时又难以应对高复杂度的反应网络。符号回归(SR)作为一种数据驱动的模型发现工具,能够从实验数据中自动推导出具有物理解释的数学表达式,但其在模型合理性和搜索效率方面存在明显局限。特别是在缺乏领域知识指导的情况下,SR容易探索到物理化学上不合理的模型结构,影响模型的可信度和实用性。

为解决这一难题,本文提出了DASyR-LLM(Domain-Aware Symbolic Regression with Large Language Models)框架。该方法在传统符号回归流程中嵌入了大语言模型(LLM),使其不仅作为候选模型的生成器,更作为模型合理性评估的“智囊”。具体而言,框架包括:• 以ADoK-S为基础的符号回归算法,结合模型参数估计和AIC模型选择;• 在每轮迭代中,LLM对当前最优候选模型进行定性化的物理化学评价,识别潜在的不合理结构;• LLM还根据已知的化学知识和模型结构,提出新的候选表达式,指导下一轮搜索。通过模拟四个不同复杂度的动力学案例,作者验证了该方法在缩短模型识别时间、减少实验次数方面的显著优势。

实验结果显示,LLM引导的符号回归平均将模型识别所需的迭代次数降低了41.7%至79.3%,在复杂催化反应系统中,模型结构的正确率超过50%。同时,模型在独立验证集上的预测性能保持优异,所有案例的R²值均超过0.98。这表明,该方法不仅提高了效率,也确保了模型的准确性和泛化能力。

从长远来看,本文的贡献在于将人工智能中的推理能力引入科学模型发现流程,为自动化、智能化的动力学建模提供了新工具。这一技术突破有望推动催化、反应工程、生物过程等多个领域的研究进展,缩短新反应机制的发现周期,降低实验成本。未来,作者建议扩展知识库,结合多模态数据,优化模型生成策略,并在工业环境中进行实际验证,推动该技术走向应用落地。整体而言,DASyR-LLM代表了科学模型自动发现的未来方向,具有深远的学术和产业价值。

深度解读

原文摘要

Kinetic model discovery is a central challenge in chemical engineering, as accurate rate expressions are essential for understanding and controlling chemical and biological processes. Symbolic regression (SR) has emerged as a powerful data-driven approach for identifying interpretable kinetic models, but usually operates without domain knowledge, often exploring physicochemically implausible models. Large language models (LLMs) offer a promising avenue for injecting domain expertise into this search. Here, we introduce an LLM-guided SR framework, embedding an LLM module within an iterative SR algorithm for automated kinetic model discovery. The LLM performs two roles at each iteration: (1) a qualitative physicochemical critique of the best SR candidates, and (2) the proposal of new candidate rate expressions guided by the SR-generated models and embedded chemical knowledge. Our framework is evaluated on four in silico case studies of increasing complexity, spanning heterogeneous catalysis and bioprocess systems. Results show the LLM-guided framework reduces iterations to identify the ground-truth model by $41.7-79.3\%$ versus a state-of-the-art SR framework, with the LLM directly proposing the correct model structure in over half of the guided runs. In practical settings, where each iteration typically requires a new wet-lab experiment, this translates into a substantial reduction in experimental effort. Predictive performance on an independent validation set is equivalent between both approaches, with $R^2>0.98$ in all case studies. Ablation studies indicate that both the SR component and the LLM scale contribute to this performance, with a reduced-size LLM largely retaining discovery efficiency. These findings demonstrate that LLMs can effectively inject domain knowledge into scientific model discovery, paving the way toward fully automated, domain-aware kinetic modelling pipelines.

cs.LG cs.CE cs.SC