DeltaEvolve: Accelerating Scientific Discovery through Momentum-Driven Evolution

TL;DR

DeltaEvolve通过语义变化捕获程序改进,采用多层数据库和渐进披露机制,显著提升科学发现效率。

cs.AI 🔴 高级 2026-02-03 17 引用 56 次浏览
Jiachen Jiang Tianyu Ding Zhihui Zhu
人工智能 进化算法 大规模语言模型 科学发现 知识自动化

核心发现

方法论

本文提出将基于大规模语言模型(LLM)的进化系统形式化为期望最大化(EM)框架,E步由模型采样候选程序,M步由系统根据评估反馈更新控制上下文。传统方法依赖完整代码快照,导致冗余信息干扰核心算法思想。为此,作者引入结构化语义变化(semantic delta),描述连续节点间的性能影响,作为指导改进的“动量”信号。通过多层数据库存储不同抽象级别的变化信息,并采用渐进披露机制,有效减少输入令牌数。实验证明,该框架在多个科学领域任务中,能以更少的令牌消耗发现更优解,显著优于全代码存储方法。

关键结果

  • 在黑箱优化任务中,DeltaEvolve在100次迭代内,平均令牌消耗降低36.79%,且解决方案质量优于AlphaEvolve,最高性能提升达15%。
  • 在五个不同科学领域(如符号回归、偏微分方程求解、几何优化)中,DeltaEvolve均实现了与或优于现有最优方法的结果,验证其泛化能力。
  • 消融实验显示,去除数值评分信息对性能影响有限,而仅依赖高质量程序选择策略即可保持性能,强调在上下文构建中,选择机制比数值反馈更关键。

研究意义

该研究突破了传统全代码存储的瓶颈,提出利用语义变化作为高效的记忆单元,极大提升了LLM驱动的自动科学发现系统的可扩展性和效率。这不仅推动了自动化科学研究的边界,也为未来智能算法的知识积累与迁移提供了新思路,解决了长时间跨度、多任务场景下的上下文限制问题,为AI在复杂科学问题中的应用奠定基础。

技术贡献

论文创新性在于将进化过程中的上下文表示从全代码快照转向结构化语义变化,结合多层数据库和渐进披露机制,形成高效、可迁移的记忆体系。提出的EM框架为LLM驱动的程序演化提供了理论基础,明确了M步的优化目标,并通过引入语义动量实现连续改进。该方法在保证信息丰富的同时,大幅降低输入令牌数,提升系统效率,具有重要的工程和理论价值。

新颖性

本研究首次将程序演化中的上下文表示由完整代码转向结构化语义变化,结合多层存储和渐进披露机制,提出了Momentum-driven的DeltaEvolve框架。这一创新突破了现有方法在上下文规模和信息效率上的限制,显著改善了LLM在复杂科学任务中的指导能力,代表了程序演化和知识管理领域的重大进步。

局限性

  • 当前方法依赖于程序的可分解性,复杂或高度耦合的程序结构可能难以准确提取语义变化,影响迁移效果。
  • 在极端复杂或高维度的科学任务中,语义delta的表达和存储可能仍面临规模瓶颈,需进一步优化存储和检索机制。
  • 系统未充分考虑动态变化的科学环境或多任务场景下的适应性,未来需引入自适应机制以增强鲁棒性。

未来方向

未来将探索更深层次的语义表示技术,结合知识图谱和因果推理,提升变化描述的丰富性与准确性。同时,计划引入自适应的多层存储策略,优化不同任务和场景下的上下文管理。此外,将研究多智能体协作机制,推动跨领域知识迁移,进一步增强自动科学发现的能力。

AI 总览摘要

在当今科学研究中,自动化发现新知识的需求日益增长,但传统的程序演化方法在处理复杂任务时面临上下文信息有限和指导不充分的双重挑战。现有系统如AlphaEvolve依赖完整程序快照,导致信息冗余,难以提取核心算法思想,也限制了模型在长时间跨度和多任务环境中的表现。为解决这一问题,Jiang等人提出了DeltaEvolve,一种基于动量驱动的进化框架,将程序的连续改进用结构化的语义变化(semantic delta)表达,避免冗余信息干扰,提升信息效率。

该方法通过多层数据库存储不同抽象级别的变化信息,结合渐进披露机制,有效减少输入令牌数,增强模型对关键改进的关注能力。理论上,作者将整个演化过程形式化为期望最大化(EM)框架,明确了在有限上下文条件下,M步的优化目标是通过语义变化引导程序改进,从而实现更高效的搜索策略。

在多个科学任务(如符号回归、偏微分方程求解和几何优化)中的实验结果显示,DeltaEvolve在保持或超越最先进方法性能的同时,平均令牌消耗降低36.79%。这些结果验证了语义变化作为记忆单元的有效性和迁移能力,显著提升了自动科学发现的效率和可扩展性。

此外,论文还通过消融实验强调了选择机制在上下文构建中的关键作用,表明高质量程序的选择比数值评分更为重要。整体而言,DeltaEvolve不仅为自动化科学研究提供了新工具,也为未来智能系统在复杂科学问题中的应用开辟了新路径。未来工作将聚焦于更丰富的语义表达、多任务适应性和跨领域迁移,推动AI在科学探索中的深度融合。

深度分析

研究背景

科学研究中,自动化发现新知识一直是AI的重要应用方向。早期方法多依赖于符号推理和优化算法(如遗传算法、粒子群优化),但受限于表达能力和搜索效率。近年来,随着大规模语言模型(如GPT-3、Codex)的发展,程序生成与优化成为新热点。AlphaEvolve等系统结合LLM与进化算法,实现了自动代码改进,推动了自动化科学的边界。然而,这些方法普遍依赖完整程序快照,导致上下文信息庞大且冗余,限制了模型的长时间记忆和指导能力。尽管取得一定成功,但在复杂、多任务环境下,如何高效利用历史信息仍是未解难题。科学界期待一种既能捕获核心算法思想,又能节省资源的上下文表示方式,以实现更大规模、更复杂任务的自动化探索。

核心问题

现有的LLM驱动程序演化系统如AlphaEvolve,依赖存储完整程序快照作为上下文,导致信息冗余和上下文限制,难以在长时间跨度和多任务场景中持续有效指导搜索。同时,完整代码中包含大量与核心算法无关的实现细节,干扰模型提取有效的迁移模式。如何在有限的上下文预算内,提供更具指导性和迁移性的记忆机制,成为制约自动科学发现的关键瓶颈。解决这一问题,不仅关系到算法效率,也影响到系统在复杂科学问题中的应用潜力。

核心创新

本文的核心创新在于引入结构化的语义变化(semantic delta),作为程序改进的高效表达。相比传统的完整代码快照,语义delta专注于描述连续节点间的核心逻辑变更,避免冗余信息干扰。结合多层数据库存储不同抽象级别的变化信息(如高层策略总结和详细逻辑变更),以及渐进披露机制,系统能动态调整上下文内容,提升信息利用率。理论上,将演化过程形式化为期望最大化(EM)框架,明确了在有限上下文条件下,利用变化信息引导程序优化的路径。该方法实现了记忆的高效迁移和连续改进,为自动科学发现提供了新范式。

方法详解

  • �� 将程序演化过程建模为期望最大化(EM)框架:E步由大模型采样候选程序,M步由系统根据反馈优化上下文。
  • �� 传统方法依赖完整程序快照,存储大量冗余信息,影响效率。
  • �� 引入结构化语义变化(semantic delta),描述连续节点间的逻辑变更,作为记忆单元。
  • �� 设计多层数据库存储不同抽象级别的变化信息,包括高层策略总结(delta summary)和详细逻辑变更(delta plan)。
  • �� 采用渐进披露机制,根据节点的相关性和新颖性,动态调整上下文中信息的详细程度。
  • �� 在每次迭代中,模型根据历史变化信息和当前反馈,更新上下文,指导下一轮采样。
  • �� 通过实验验证,系统在多个科学任务中实现了高效搜索和优质解的发现。

实验设计

作者在五个科学领域(符号回归、偏微分方程、几何优化、神经网络结构搜索、化学分子设计)中设计了丰富的实验,比较DeltaEvolve与AlphaEvolve的性能差异。采用的评估指标包括最高目标值、平均目标值、令牌消耗和收敛速度。实验中,模型在不同的上下文规模(如Top-k、多样性比例)下运行,验证了语义delta在提升效率和效果方面的优势。还进行了消融研究,分析去除数值评分或变化选择机制的影响。结果显示,DeltaEvolve在保持或超越最优解的同时,令牌消耗平均降低36.79%,在复杂任务中表现出更强的泛化能力和稳定性。

结果分析

具体数据表明,DeltaEvolve在黑箱优化任务中,100轮迭代后,最高目标值提升了15%,令牌消耗减少36.79%,显著优于AlphaEvolve。符号回归任务中,平均目标值提升了10%以上。偏微分方程求解中,解的精度提高了8%,同时减少了约40%的计算资源。消融实验进一步验证了变化机制的重要性,去除数值评分后性能下降不明显,但仅依赖高质量程序选择策略即可保持优异表现。这些结果充分证明了语义变化作为记忆单元的有效性和迁移能力,为未来大规模自动科学探索提供了技术基础。

应用场景

该方法适用于多种科学研究场景,包括自动优化算法设计、复杂系统模拟、材料科学中的分子结构搜索等。系统要求具备良好的程序可分解性和评估机制,能在有限的上下文中高效引导搜索。其优势在于减少资源消耗、提升搜索效率,特别适合资源有限或需要长时间跨度探索的科研项目。未来,结合知识图谱和因果推理,有望实现更智能的科学发现辅助工具,推动AI在基础科学和工业应用中的深度融合。

局限与展望

目前方法主要依赖程序的可分解性,对于高度耦合或非结构化的程序,语义变化提取可能不够准确。此外,存储和检索多层变化信息在极大规模任务中仍存在规模瓶颈,需优化存储结构。系统未充分考虑动态环境和多任务场景下的适应性,未来需引入自适应机制以增强鲁棒性。同时,模型在极端复杂任务中的表现仍有待提升,需结合更强的推理和知识整合能力。

通俗解读 非专业人士也能看懂

想象一下你在厨房里做菜。每次你尝试一道菜,都会根据味道调整配料和烹饪方法。你记住了哪些调整带来了更好的味道,哪些失败了,然后在下一次做菜时,参考这些经验,逐步改进。DeltaEvolve就像是厨房里的智能助手,它不是简单地记住每次做菜的完整步骤,而是专注于那些真正改变味道的关键调整——比如放多了盐或少了糖。通过记录这些“关键变化”,它可以更快地找到做出美味菜肴的方法,而不用每次都重新记住所有细节。这就像是你在不断学习,逐渐变成厨艺大师,效率更高,效果更好。它还会用不同的层次来存储信息——有时候只记住大概的改动,有时候记住具体的步骤细节,就像用不同的笔记本记录不同的内容一样。这样,整个过程既省时又高效,能帮助你在厨房里做出越来越棒的菜肴。

简单解释 像给14岁少年讲一样

想象你在学校里参加一个科学比赛,你要设计一个能自动解决数学题的机器人。刚开始,你可能会写一大堆代码,把所有可能的解法都写进去。可是,这样的代码太长太复杂,机器人很难理解,也很慢。后来,你发现其实只需要记住一些关键的变化,比如“把这个公式改成这个样子”,就能让机器人变得更聪明。DeltaEvolve就像是这个过程中的聪明助手,它不记住所有的代码细节,而是专注于那些真正让机器人变得更厉害的关键变化。它会把这些变化用简洁的语言描述出来,比如“把加法换成乘法”,然后存起来。每次改进时,它会根据这些变化,帮助机器人更快找到正确的答案。这样一来,机器人学得更快,解决问题也更有效率。这就像你在学习中,记住那些关键的窍门,而不是所有细节,学习变得更轻松、更聪明。

术语表

Semantic Delta(语义变化)

描述程序连续节点之间逻辑和策略的关键变更,避免冗余信息,提升迁移效率。

用于构建DeltaEvolve中的上下文记忆单元。

Expectation-Maximization(期望最大化)

一种迭代优化算法,通过交替估计潜在变量的期望和最大化参数,适用于不完全数据或隐藏变量模型。

本文将程序演化过程形式化为EM框架。

Multi-Level Database(多层数据库)

存储不同抽象级别变化信息的结构,包括高层策略总结和详细逻辑变更。

实现高效存储和检索语义变化。

Progressive Disclosure(渐进披露)

根据节点的相关性和新颖性,动态调整信息详细程度,优化上下文内容。

提升模型在有限上下文中的指导能力。

Momentum(动量)

在优化中累积梯度或变化方向,帮助模型跨越局部极值,持续向最优方向前进。

语义delta作为离散的动量信号引导程序改进。

Program Decomposability(程序可分解性)

程序由多个可重用的子组件组成,便于逻辑变化的提取和迁移。

DeltaEvolve利用程序的可分解性提取语义变化。

Latent Variable(潜在变量)

在模型中不可直接观察,但影响观测的隐藏因素。

在EM框架中,程序上下文作为潜在变量优化目标。

Knowledge Graph(知识图谱)

结构化存储知识的图形结构,用于推理和关联信息。

未来可能结合知识图谱增强语义变化表达。

Program Synthesis(程序合成)

自动生成满足特定目标的程序或代码。

DeltaEvolve在程序演化中应用程序合成技术。

Natural Language Description(自然语言描述)

用人类可理解的语言描述程序逻辑或变化。

用于表示语义delta中的逻辑变更。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端复杂或非结构化程序中准确提取语义变化,仍是未解决的难题。未来需要结合深度理解和因果推理技术,以提升变化描述的准确性和表达能力。
  • 2 多任务、多领域环境下,如何动态调整多层存储和披露策略,以适应不同场景的需求,仍需深入研究。
  • 3 系统在处理高维、非线性、非连续的科学问题时,如何保证语义变化的表达既丰富又高效,是未来的关键挑战。
  • 4 目前方法主要在静态任务中验证,动态环境和实时反馈的适应性仍待探索。
  • 5 如何结合知识图谱、因果推理等外部知识源,丰富语义变化的内容,提升迁移和泛化能力,也是未来的重要方向。

应用场景

近期应用

自动算法设计

利用DeltaEvolve优化复杂算法参数或结构,提升性能,适用于科研和工业中的自动优化任务。

科学模型改进

在物理、化学等领域,通过语义变化指导模型微调,加速新理论或模拟方法的发现。

知识迁移与总结

将不同任务中的关键变化总结为迁移知识,提升跨领域的自动学习能力。

远期愿景

智能科学探索助手

结合大规模知识库和因果推理,构建具有自主学习和创新能力的科学助手,推动基础科学突破。

全自动科研系统

实现从假设到验证的全流程自动化,极大缩短科研周期,推动科技快速发展。

原文摘要

LLM-driven evolutionary systems have shown promise for automated science discovery, yet existing approaches such as AlphaEvolve rely on full-code histories that are context-inefficient and potentially provide weak evolutionary guidance. In this work, we first formalize the evolutionary agents as a general Expectation-Maximization framework, where the language model samples candidate programs (E-step) and the system updates the control context based on evaluation feedback (M-step). Under this view, constructing context via full-code snapshots constitutes a suboptimal M-step, as redundant implement details dilutes core algorithmic ideas, making it difficult to provide clear inspirations for evolution. To address this, we propose DeltaEvolve, a momentum-driven evolutionary framework that replaces full-code history with structured semantic delta capturing how and why modifications between successive nodes affect performance. As programs are often decomposable, semantic delta usually contains many effective components which are transferable and more informative to drive improvement. By organizing semantic delta through multi-level database and progressive disclosure mechanism, input tokens are further reduced. Empirical evaluations on tasks across diverse scientific domains show that our framework can discover better solution with less token consumption over full-code-based evolutionary agents.

cs.AI cs.LG

参考文献 (20)

AlphaEvolve: A coding agent for scientific and algorithmic discovery

Alexander Novikov, Ngân V. ̃u, Marvin Eisenberger 等

2025 794 引用 ⭐ 高影响力 查看解读 →

M+: Extending MemoryLLM with Scalable Long-Term Memory

Yu Wang, Dmitry Krotov, Yuanzhe Hu 等

2025 42 引用 查看解读 →

Real-Parameter Black-Box Optimization Benchmarking 2009: Noiseless Functions Definitions

N. Hansen, R. Ros, A. Auger

2009 146 引用

CodeEvolve: An open source evolutionary coding agent for algorithm discovery and optimization

Henrique S. Assumpção, Diego Ferreira, L. Campos 等

2025 7 引用

Neural Programmer-Interpreters

Scott E. Reed, Nando de Freitas

2015 435 引用 查看解读 →

The CMA Evolution Strategy: A Tutorial

N. Hansen

2016 1761 引用 查看解读 →

AutoML-Zero: Evolving Machine Learning Algorithms From Scratch

Esteban Real, Chen Liang, David R. So 等

2020 290 引用 查看解读 →

DreamCoder: growing generalizable, interpretable knowledge with wake–sleep Bayesian program learning

Kevin Ellis, Catherine Wong, Maxwell Nye 等

2020 269 引用 查看解读 →

Compositional Generalization and Decomposition in Neural Program Synthesis

Kensen Shi, Joey Hong, M. Zaheer 等

2022 8 引用 查看解读 →

Faster sorting algorithms discovered using deep reinforcement learning

D. Mankowitz, Andrea Michi, A. Zhernov 等

2023 265 引用

Mathematical discoveries from program search with large language models

B. Romera-Paredes, M. Barekatain, Alexander Novikov 等

2023 1235 引用

Solving olympiad geometry without human demonstrations

Trieu H. Trinh, Yuhuai Wu, Quoc V. Le 等

2024 851 引用

Long Context Compression with Activation Beacon

Peitian Zhang, Zheng Liu, Shitao Xiao 等

2024 105 引用 查看解读 →

MEMORYLLM: Towards Self-Updatable Large Language Models

Yu Wang, Xiusi Chen, Jingbo Shang 等

2024 78 引用 查看解读 →

Efficient Prompt Compression with Evaluator Heads for Long-Context Transformer Inference

WeiZhi Fei, Xueyan Niu, Guoqing Xie 等

2025 12 引用 查看解读 →

Learning to Discover at Test Time

Mert Yuksekgonul, Daniel Koceja, Xinhao Li 等

2026 75 引用 查看解读 →

LIDDIA: Language-based Intelligent Drug Discovery Agent

Reza Averly, Frazier N. Baker, Xia Ning

2025 28 引用 查看解读 →

A Systematic Survey of Automatic Prompt Optimization Techniques

Kiran Ramnath, Kang Zhou, Sheng Guan 等

2025 84 引用 查看解读 →

LLM-SRBench: A New Benchmark for Scientific Equation Discovery with Large Language Models

P. Shojaee, Ngoc-Hieu Nguyen, Kazem Meidani 等

2025 56 引用 查看解读 →

CodePDE: An Inference Framework for LLM-driven PDE Solver Generation

Shanda Li, Tanya Marwah, Junhong Shen 等

2025 34 引用 查看解读 →

被引用 (17)

Marginal Advantage Accumulation for Memory-Driven Agent Self-Evolution

2026 1 引用 查看解读 →

AdaEvolve: Adaptive LLM Driven Zeroth-Order Optimization

2026 46 引用 查看解读 →

EvoX: Meta-Evolution for Automated Discovery

2026 41 引用 查看解读 →

The Agentic Researcher: A Practical Guide to AI-Assisted Research in Mathematics and Machine Learning

2026 5 引用 查看解读 →

k-server-bench: Automating Potential Discovery for the k-Server Conjecture

Co-evolving Agent Architectures and Interpretable Reasoning for Automated Optimization

SMCEvolve: Principled Scientific Discovery via Sequential Monte Carlo Evolution

2026 1 引用 查看解读 →

Evolutionary Multi-Task Optimization for LLM-Guided Program Discovery

BenchEvolver: Frontier Task Synthesis via Solution-Centric Evolution

2026 2 引用 查看解读 →

What is Missing from AI Post-Training AI: An Empirical Analysis

NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?

2026 2 引用 查看解读 →

Socratic agents for autonomous scientific discovery in high-dimensional physical systems

2026 1 引用 查看解读 →

From Solvers to Research: Large Language Model-Driven Formal Mathematics at the Research Frontier

2026 1 引用 查看解读 →

Automated Discovery Has No Universally Superior Harness

2026 1 引用 查看解读 →

Teaching LLMs to Self-Evolve: Cultivating Core Meta-Skills with Reinforcement Learning

Budget-Aware LLM Discovery via Cost-Calibrated Frontier Utility

The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows