ScienceFlow: A long-horizon agent for ML research, scientific discovery and beyond
ScienceFlow通过可恢复的可执行状态和ESTRA实现长远自主科研,提升搜索效率。
核心发现
方法论
ScienceFlow采用可恢复的工作空间表示研究状态,结合ESTRA机制进行研究段间的状态切换。系统包括状态存档、证据感知的执行控制和多研究工人协作。通过Checkpoint机制保存关键节点,利用ESTRA选择锚点或重定向路径,动态调整研究方向。资源调度由证据感知控制器实现,依据资源状态和验证进展分配任务。系统在ML、科学建模和优化任务中表现出优异性能,达成70.22%的最高Any-Medal得分,超越先前方法4.92个百分点。
关键结果
- 在全套MLE-bench任务中,ScienceFlow实现70.22%的Any-Medal,24小时内表现优于最优基线4.92个百分点,显示其在长远自主研究中的高效性。
- 在科学建模和数学优化任务中,系统不仅保持持续的研究流程,还在多个指标上刷新了前沿记录,验证了其跨领域适应性。
- 通过消融实验,验证了状态管理、探索策略和证据驱动调度对性能提升的关键作用,突出系统的整体优势。
研究意义
本研究突破了长远自主科研的瓶颈,解决了状态连续性、路径恢复和资源优化的难题,为未来自动化科学探索提供了可行框架。系统的多任务适应性和高效调度能力,有望推动AI在科研、工业创新等领域的深度应用,极大提升科研效率和探索深度,开启智能科研的新纪元。
技术贡献
提出基于可恢复工作空间的研究状态表示,创新性引入ESTRA机制实现研究路径的动态切换,结合证据感知的资源调度策略,显著提升长远自主研究的连续性与效率。系统架构支持多工人并行探索,资源调度与状态管理紧密结合,提供理论保证和工程实现的双重突破,为自动科研系统奠定基础。
新颖性
首次系统性结合可恢复状态、ESTRA路径调控和证据驱动调度,解决长远自主研究中的状态连续性与路径重启难题。不同于传统短期交互或单一资源调度方法,ScienceFlow实现了长时间、多任务、多路径的高效协作,推动自主科研向更大规模、更复杂目标迈进。
局限性
- 系统在极端资源受限或验证信号噪声较高时,可能导致路径选择不稳定,影响研究连续性。
- 大规模多工人协作带来的资源调度复杂性仍需优化,尤其在动态变化环境中。
- 当前模型对某些高复杂度任务的泛化能力有限,未来需结合更强的知识推理机制。
未来方向
未来将探索多模态数据融合、强化学习优化路径选择,以及更智能的资源调度策略。还计划扩展系统的自主调试能力,提升在超大规模科研场景中的适应性。此外,将结合元学习技术,增强系统的迁移和泛化能力,推动自动科研的全面落地。
AI 总览摘要
ScienceFlow代表了自主科研系统的最新突破,旨在解决长远科研中的状态连续性、路径恢复与资源调度难题。传统的自动研究代理多局限于短期任务,难以持续追踪复杂研究流程。ScienceFlow通过引入可恢复的工作空间,将研究状态以可存取的快照形式保存,实现状态的持续性和可重用性。核心机制ESTRA(Executable-State Transition through Re-Anchoring)允许系统在研究路径中灵活切换,依据验证证据和资源状况,动态选择锚点或重定向研究方向。系统中的证据感知执行控制器依据资源可用性和验证结果,智能调度计算任务,确保研究的高效推进。系统支持多研究工人并行探索,彼此只交换简洁的验证信息,极大提升了多任务协作能力。在ML、科学建模和优化任务中的实验显示,ScienceFlow在多项指标上均优于现有方法,尤其在全套MLE-bench中达成70.22%的最高Any-Medal,超越最优基线4.92个百分点。这表明,科学研究的长远自主化已成为可能,未来有望推动AI在科研创新中的深度应用,开启自动化科学探索的新篇章。尽管如此,系统在极端环境下仍面临路径不稳定和调度复杂的挑战,未来将继续优化算法和架构,推动其在更复杂场景中的应用落地。
深度分析
研究背景
随着AI自主研究的快速发展,早期系统多集中于短期任务执行,如AlphaEvolve和AutoML工具。近年来,研究逐渐转向长远、多阶段的科研流程,涉及假设生成、实验设计、结果验证等环节。已有工作如Zhu等的结构化记忆、Chen等的路径管理,解决了部分状态管理问题,但缺乏整体的路径切换和资源调度机制。传统方法多依赖线性流程,难以应对复杂的研究路径变化和多任务协作。科学发现的复杂性要求系统具备持续性、恢复性和动态调度能力,以实现真正的自主科研。
核心问题
核心问题在于如何在长时间、多阶段的科研过程中,持续维护研究状态、动态调整研究路径,并高效调度有限资源。现有系统多在状态保存或路径管理上存在碎片化,难以实现连续性和高效性。研究路径可能因探索偏差或资源限制中断,导致重复劳动或资源浪费。此外,如何在多工人环境中协调资源,确保研究目标一致,也是亟待解决的难题。
核心创新
本研究提出三大创新:1)可恢复的工作空间,确保研究状态的持续性和重用;2)ESTRA机制,动态选择锚点和路径重定向,提升路径灵活性;3)证据感知的资源调度,结合验证结果优化任务分配。这些创新共同解决了长远科研中的状态连续性、路径恢复和资源优化难题,显著提升自主研究的效率和稳定性。
方法详解
- �� 构建可恢复的工作空间,存储源代码、数据、模型等关键工件。• 设计状态存档机制,定期Checkpoint关键节点,形成状态快照。• 引入ESTRA机制,根据验证证据和资源状态,选择锚点或重定向路径。• 采用证据感知的调度策略,依据验证结果和资源状况,动态调配计算任务。• 多工人协作,彼此只交换验证信息,减少干扰。• 结合长远任务目标,优化路径探索和资源利用,确保持续性。
实验设计
在ML、科学建模和优化任务中,使用MLE-bench、SciModelingBench等数据集,比较不同方法的性能。指标包括Any-Medal得分、任务完成率和资源利用率。设置不同预算和环境条件,验证系统的适应性。采用消融实验,分析状态管理、路径切换和调度策略对性能的贡献。参数调优包括工作空间大小、验证频率和路径选择策略。
结果分析
ScienceFlow在MLE-bench中达成70.22%的Any-Medal,超越最优基线4.92个百分点,表现出强大的长远探索能力。在科学建模和优化任务中,也刷新了多项指标,验证了其跨领域适应性。消融实验显示,状态管理和路径调控是性能提升的关键因素。系统在多任务、多工人环境中表现出优异的协作效率和资源利用率,验证了设计的有效性。
应用场景
该系统可应用于自动化科研平台、复杂工程设计、药物发现等领域,支持长周期、多阶段的自主研究。依赖于丰富的工作空间和验证机制,适合需要持续探索和多路径优化的场景。未来,结合大规模知识库和强化学习,将进一步提升系统的智能化水平,推动科研自动化的产业化。
局限与展望
系统在极端资源受限或验证信号噪声较高时,路径选择可能不稳定,影响研究连续性。多工人调度复杂,需优化算法以适应动态环境。此外,模型在高复杂度任务中的泛化能力有限,未来需结合更强的推理和知识整合机制。
通俗解读 非专业人士也能看懂
想象一个工厂里有很多工人,他们负责不断改进产品。每个工人都有自己的工作台,可以保存当前的工作状态,遇到问题时可以回到之前的某个状态继续工作。工厂里有一个智能调度员,根据每个工人的工作进展和资源情况,决定谁去做什么,什么时候休息。这个系统让工厂的生产变得更高效、更有序,能不断调整策略,避免重复劳动,也能在遇到困难时快速恢复。就像科学研究一样,科学家不断试验、调整、总结,系统帮他们管理所有的资料和路径,让整个过程更顺畅、更智能。
简单解释 像给14岁少年讲一样
想象你在做一个超级复杂的拼图游戏,你一开始有很多拼图片,但不知道怎么拼。每次你拼了一部分后,发现不对了,就可以把这部分拆开,重新开始,或者用之前拼好的部分作为起点继续拼。这个系统就像一个聪明的助手,能记住你拼到哪一步,帮你决定是继续拼下去还是从某个之前的拼图开始。它还能帮你安排时间和工具,比如让你用更快的拼图板或者更强的放大镜。这样,你就可以更快、更好地完成拼图,不会浪费时间在重复的步骤上。科学研究也是一样,科学家需要不断试验、调整、总结,系统帮他们管理所有的资料和路径,让整个探索变得更聪明、更高效。
原文摘要
Enabling LLM agents to sustain productive, stable, and goal-aligned research over extended horizons is a central challenge for autonomous machine learning and scientific discovery, as progress hinges on continuously managing evolving state, exploration decisions, and computational resources. Pioneering autoresearch agents, despite great success, still lack mechanisms for continuity, recovery from dead ends, and value-driven compute allocation, which inherently undermines overall search efficiency, wastes computational resources, and lowers the chance of ultimate success. To bridge this gap, we introduce ScienceFlow, an end-to-end autoresearch agent framework that organizes long-horizon research work into research segments grounded in executable workspaces. It represents research progress as recoverable executable states, enabling efficient exploration, revision, and execution. Transitions between research segments are governed by Executable-State Transition through Re-Anchoring (ESTRA), which selects either the live state or an archived state as the next anchor and determines whether to continue or redirect the research trajectory. An evidence-aware execution controller allocates resources to physical jobs based on resource availability, remaining budget, and validated progress. We evaluate ScienceFlow on tasks spanning machine learning, scientific modeling, and mathematical optimization. Results on diverse long-horizon benchmarks demonstrate its ability to sustain effective research processes, highlighted by a SOTA 70.22 percent Any-Medal score on the full MLE-bench within a 24-hour budget, outperforming prior reported results by 4.92 percentage points. The efficacy of ScienceFlow further demonstrates that efficient state management, adaptive exploration, and objective-aligned execution are critical for scaling autonomous research beyond short-horizon interactions.