CausalEvolve: Towards Open-Ended Discovery with Causal Scratchpad

TL;DR

CausalEvolve用因果草稿引导进化,在四项任务中提升效率并达最佳结果。

cs.LG 🔴 高级 2026-03-16 23 次浏览
Yongqiang Chen Chenxi Liu Zhenhao Chen Tongliang Liu Bo Han Kun Zhang
因果推理 LLM智能体 开放式发现 程序进化 科学自动化

核心发现

方法论

CausalEvolve将进化式科学发现建模为POMDP,并维护因果草稿。LLM先生成结果层因素,再由CausalPlanner通过多臂老虎机选择干预方向;随后利用COAT识别程序层因素,估计其平均处理效应,并对“意外模式”进行溯因推理,提出新因素与假设。

关键结果

  • 在Grok-4.1-fast-reasoning、3个随机种子下,CausalEvolve在Hadamard Matrix最终Mean/Best为0.568/0.576,高于ShinkaEvolve的0.521/0.540。
  • 在Second Autocorrelation Inequality上,最终Mean/Best为0.793/0.809,优于ShinkaEvolve的0.737/0.751;AIME最终准确率为38.89%,超过原ShinkaEvolve报告的34.4%。
  • 消融结果显示,COAT的程序因素有助于找到更优解,CausalPlanner主要改善早期效率;完整CausalEvolve在四项任务中总体最强,但Circle Packing早期表现较弱。

研究意义

论文把“让程序不断试错”推进为“根据可解释因素主动实验”。它回应了AlphaEvolve、ShinkaEvolve在性能边界附近效率下降、反复震荡和知识难以复用的问题。理论上,因果结构可将样本复杂度从O(K)降至O(d log K);实践上,该框架为自动科学家提供了跨实验积累机制。

技术贡献

核心贡献包括:用SCM与POMDP形式化开放式程序发现;定义结果层因素作为可操作的搜索坐标;以CausalPlanner和折扣奖励Ra=(yc−τvt)+进行方向选择;用COAT提取程序层因素并估计处理效应;检测效应反转或幅度突变,再以LLM开展溯因推理。相比仅靠相关性记忆的ShinkaEvolve,它显式组织干预知识。

新颖性

新颖之处不在于单独使用LLM、进化搜索或因果术语,而在于将“因素—干预—结果—意外—新假设”闭环嵌入程序进化。据论文所示,这是把因果草稿用于开放式科学程序发现的系统性框架,并同时覆盖结果层和程序层因素。

局限性

  • 程序层处理效应受小样本、隐藏混杂和LLM误识别影响,因此只能保证排序大致有用,不能视为可靠因果估计。
  • 实验仅覆盖四项任务、Grok-4.1-fast-reasoning和三个种子;结果是否迁移到其他模型、预算、领域及真实实验环境仍未知。
  • 结果层因素依赖任务定制代码,自动构造因素的稳定性和错误代价尚未充分评估。

未来方向

未来可引入正式不确定性估计、主动混杂控制和真实干预验证;比较更多LLM与成本预算,学习跨任务可迁移的因素库,并将文本、实验室机器人和多环境分布偏移纳入统一因果记忆。

AI 总览摘要

大型语言模型正在从回答问题走向设计实验。AlphaEvolve和ShinkaEvolve让模型反复编写、执行并改进程序,但这类搜索常像无地图爬山:早期进步明显,接近已知边界后便反复试错、效率下降,历史经验也难以转化为下一轮的明确方向。

CausalEvolve提出“因果草稿”作为进化记忆。开始时,LLM从程序输出构造结果层因素,例如矩阵性质或几何分布;CausalPlanner把每个因素及其方向视为行动,用多臂老虎机选择干预。进化过程中,COAT进一步从程序步骤中发现程序层因素,并估计它们与目标变化的处理效应。当因素组合产生反常结果时,系统检测效应反转或显著幅度变化,再由LLM进行溯因推理,提出待验证的新解释。

在统一使用Grok-4.1-fast-reasoning并运行三个随机种子的实验中,CausalEvolve在四项开放式任务上总体优于ShinkaEvolve。Hadamard Matrix最终Mean/Best为0.568/0.576,而基线为0.521/0.540;Second Autocorrelation Inequality为0.793/0.809,而基线为0.737/0.751;AIME最终准确率达到38.89%,高于原报告的34.4%。这项工作显示,自动科学家不仅需要更强的生成能力,也需要能积累、解释并主动使用实验知识的机制。其主要风险是LLM因素和处理效应并不等于真实因果关系,未来仍需更严格的干预验证和跨领域评测。

深度分析

研究背景

AI Scientist研究从文献综述、假设生成逐渐扩展到程序进化。AlphaEvolve、ShinkaEvolve利用LLM生成候选代码并迭代优化,在组合优化和数学任务上取得进展。但它们主要依赖相关性经验或摘要记忆,缺乏“为何有效、下一步应干预什么”的结构化知识,因而容易陷入局部最优。

核心问题

论文将科学发现写成POMDP:隐藏状态是科学知识θsci,行动是程序p,观察是目标值y。评价可写为F(p;θsci)=E[Y do(X=xp),θsci]。有限预算下,代理既要找到高分程序,也要揭示可迁移机制;仅优化源环境可能利用伪相关,导致效率低和跨环境泛化差。

核心创新

第一,提出因果草稿,将进化历史组织为可干预因素。第二,结果层因素把复杂程序空间压缩为任务相关描述,并由CausalPlanner选择方向。第三,程序层因素解释算法设计与得分变化。第四,利用surprise detection和abductive reasoning处理反常组合,主动生成新假设,而不是简单保留高分代码。

方法详解

  • �� 初始化:LLM读取任务描述和程序输出格式,生成因素名称及可执行映射代码。
  • �� 规划:动作空间A=∪m{(m,+1),(m,−1)};按m×d排序历史程序,选取灵感样本。
  • �� 反馈:子程序目标yc与当前最佳vt形成Ra=(yc−τvt)+;随机探索K轮后选择当前最佳动作K轮。
  • �� 解释:LLM从程序差异提取procedure-level factors,COAT估计近似平均处理效应。
  • �� 更新:检测效应符号反转或显著量级变化,溯因提出混杂因素和新实验方向。

实验设计

任务包括n=29 Hadamard Matrix、256步Second Autocorrelation Inequality、N=26 Circle Packing,以及2024 AIME。基线为ShinkaEvolve;消融为CausalPlanner(Meta)和COAT。所有方法使用Grok-4.1-fast-reasoning、种子1/2/3,并报告Mean与Best。评估步数分别为20/40/80/100、50/100/150/200或20/40/60/80。

结果分析

最终结果显示,Hadamard为0.568/0.576,Second Autocorrelation为0.793/0.809,均明显高于ShinkaEvolve的0.521/0.540和0.737/0.751。AIME为38.89% Mean、40.00% Best,基线为34.44%/36.67%。Circle Packing最终Mean为2.476,接近COAT的2.456且Best为2.564,说明收益并非所有阶段都一致。

应用场景

该框架适用于可执行、可评分且能提取结构描述的任务:组合优化、算法设计、数学证明代理、机器学习流水线和高性能代码搜索。使用者需要可靠评估器、可执行因素映射和足够实验预算;在工程中可用于减少无效候选、记录设计规律并辅助专家复现实验。

局限与展望

论文没有证明LLM识别因素具有真实因果性;处理效应可能被隐藏混杂、样本量和选择偏差扭曲。实验规模也较小,单一模型和四个基准不足以说明普适性。未来应加入置信区间、随机干预、多环境测试、成本分析及真实实验闭环,并研究因素库的跨任务迁移。

通俗解读 非专业人士也能看懂

把CausalEvolve想成一支不断改进菜谱的厨房团队。普通方法会让厨师随意修改配料、火候和摆盘,尝到更好吃的就保留;但当味道接近极限时,他们可能来回改同几个地方,却不知道真正起作用的是什么。

CausalEvolve先列出可观察的线索:咸度、甜度、酥脆程度、摆盘密度等,并分别尝试“增加”或“减少”。一个小管家会记录哪种调整更常带来好结果,决定下一轮优先测试什么。它还会观察做菜步骤,例如先煎后炖是否比先炖后煎更好。

如果“加糖和降温”组合反而变难吃,系统不会简单丢弃这次结果,而会追问:是不是糖在高温下发生了变化?是不是某种隐藏条件影响了味道?于是它提出新的解释,再设计下一次试菜。论文中的程序就是菜谱,目标值就是评分,因果草稿就是记录“哪些改变为何有效”的实验笔记。

简单解释 像给14岁少年讲一样

想象你在玩一个不断升级的游戏。你要让角色得分最高,但每次只能改一小部分装备或技能。普通机器人会不断生成新配装:分高就留下,分低就丢掉。这样开始升级很快,可到了高分区,它可能不停换回旧装备,像在原地打转。

CausalEvolve给机器人加了一本“攻略实验本”。它不只记录哪套装备分高,还记录速度、攻击范围、防御、技能顺序等特点,并尝试主动增加或减少某个特点。CausalPlanner像抽卡策略,会判断下一步应该测试哪个方向。

机器人还会研究“奇怪结果”。比如攻击力和速度都提高,分数却下降。它会让语言模型猜原因:也许速度太快导致操作失控,或者两项技能互相冲突。然后把这个猜测变成下一轮实验。

论文测试了矩阵、函数、圆形摆放和2024 AIME数学题。最终AIME准确率达到38.89%,超过ShinkaEvolve的34.44%;矩阵和自相关任务也得到更高分。简单说,它让机器人从“盲目刷题”变成“边实验边总结规律”,不过这些规律仍可能只是聪明的猜测,需要更多测试确认。

术语表

Causal Scratchpad(因果草稿)

记录因素、干预、结果及解释的结构化记忆。它帮助代理把历史试验转化为下一步搜索依据。

CausalEvolve的核心模块。

POMDP(部分可观测马尔可夫决策过程)

状态不可直接观察、只能通过行动获得信息的决策模型。论文把隐藏科学知识作为静态状态。

用于形式化科学发现循环。

SCM(结构因果模型)

用图G、结构方程F和外生变量分布PU描述因果机制。干预写作do(X=x)。

定义目标函数和科学知识θsci。

CausalPlanner(因果规划器)

将因素方向作为动作并选择搜索方向的模块。它使用多臂老虎机在探索与利用间切换。

负责结果层引导。

COAT

利用LLM从非结构化程序经验中识别解释性因素的框架。论文借此估计程序因素的近似处理效应。

负责程序层因素发现。

Abductive reasoning(溯因推理)

从异常观察反推最可能的解释或新假设。它不是证明因果关系,而是产生待验证方向。

解释surprise patterns。

开放问题 这项研究留下的未解疑问

  • 1 LLM生成的因素是否真正对应稳定机制,而非语言模型的事后解释?需要随机干预、反事实测试和跨环境复现实验证。
  • 2 结果层因素依赖任务代码,尚不清楚能否自动迁移到新任务;需要学习通用因素表示和可复用因素库。
  • 3 因果引导带来的收益与额外LLM调用成本如何权衡,论文尚未给出系统成本曲线。

应用场景

近期应用

算法与代码搜索

研究团队可为性能指标编写结果因素映射,让代理优先测试正交性、稀疏性或运行时等方向,并用程序因素记录有效优化技巧。前提是有可靠执行环境和评分器。

数学解题代理

在AIME等任务中,可把解题步骤、验证方式和格式遵循作为程序因素,分析哪些策略提高正确率与稳定性,从而减少随机提示试错。

远期愿景

自主科学实验室

未来可把因果草稿连接到机器人实验、传感器和多环境数据,使代理不仅优化模拟程序,还能提出干预、验证机制并积累可审计的科学知识。

原文摘要

Evolve-based agent such as AlphaEvolve is one of the notable successes in using Large Language Models (LLMs) to build AI Scientists. These agents tackle open-ended scientific problems by iteratively improving and evolving programs, leveraging the prior knowledge and reasoning capabilities of LLMs. Despite the success, existing evolve-based agents lack targeted guidance for evolution and effective mechanisms for organizing and utilizing knowledge acquired from past evolutionary experience. Consequently, they suffer from decreasing evolution efficiency and exhibit oscillatory behavior when approaching known performance boundaries. To mitigate the gap, we develop CausalEvolve, equipped with a causal scratchpad that leverages LLMs to identify and reason about guiding factors for evolution. At the beginning, CausalEvolve first identifies outcome-level factors that offer complementary inspirations in improving the target objective. During the evolution, CausalEvolve also inspects surprise patterns during the evolution and abductive reasoning to hypothesize new factors, which in turn offer novel directions. Through comprehensive experiments, we show that CausalEvolve effectively improves the evolutionary efficiency and discovers better solutions in 4 challenging open-ended scientific tasks.

cs.LG cs.CL stat.ML