Persistent Recursive Worlds Enable Autonomous Software Evolution

TL;DR

提出EvoX Genesis,通过持久递归世界模型实现软件自主演化,成功构建Rust C编译器和迁移MESA模块。

cs.SE 🔴 高级 2026-08-11 72 次浏览
Beichen Huang Zhenyu Liang Bowen Zheng Ran Cheng
软件工程 人工智能 持续集成 软件演化 递归世界模型

核心发现

方法论

本文提出一种基于持久递归世界的组织架构,将软件项目的状态和历史作为持久对象,而将局部代理定义为有限生命周期的工作单元。系统通过接受版本和路径定位局部世界,有限生命周期的代理在指定路径上提出变更,递归委托机制允许工作跨路径迁移,只有经过验证和接受的变更才会推动版本历史的前进。该架构结合深度学习模型DeepSeek V4 Flash,利用路径作用域和验证机制,有效实现了从空仓库构建复杂软件系统、持续开发以及迁移重构。实验中,系统在无编译器实现的仓库中,利用DeepSeek V4 Flash构建了一个约25万行的Rust C编译器,历时120小时,归档超过1000个代理会话,仅耗费44美元模型令牌,成功通过全部c-testsuite和大部分LLVM及Csmith测试。在迁移实验中,系统在不同基础模型(GLM 5.2)支持下,持续开发同一编译器,保持了完整的测试性能。此外,系统还将13个MESA模块(超过10万行Fortran)迁移为近9万行Rust代码,在六个数值计算任务中实现了1.55至6.87倍的中位数加速。整体而言,该方法通过持久项目而非持久代理,展示了长远软件开发的可行性与优势。

关键结果

  • 系统成功从空仓库构建了一个完整的Rust C编译器,包含Clang兼容接口、LLVM IR导出、C11标准支持和x86/x86-64后端,历时120小时,归档1000余个代理会话,模型令牌成本仅44美元,验证全部c-testsuite和LLVM测试,表现优异。
  • 在基础模型GLM 5.2支持下,系统实现了编译器的持续开发,经过多次代理更替,仍能保持完整的测试覆盖和性能指标,验证了系统的持续性和可迁移性。
  • 迁移13个MESA模块(超过10万行Fortran)到Rust,完成时间33小时,生成近9万行Rust代码,六个数值任务中实现中位数加速1.55至6.87倍,验证了迁移的正确性和效率提升。

研究意义

该研究突破了传统软件开发中依赖持续代理或人工维护的局限,将软件作为持久递归世界进行组织,显著提升了长远软件演化的自动化水平。其创新架构不仅支持从无到有的复杂系统构建,还实现了跨模型、跨语言的持续开发和迁移,为自动化软件工程提供了新思路。此方法有望推动未来AI驱动的软件开发,减少人工干预,提高软件质量与维护效率,特别适用于科学计算、基础设施和大规模系统的持续演化。

技术贡献

本文提出的持久递归世界模型,结合路径作用域、版本控制和验证机制,创新性地将软件状态作为持久对象,代理仅在有限生命周期内操作,避免了传统持久代理的复杂性。系统利用DeepSeek V4 Flash实现大规模自动化构建,采用路径委托机制实现工作迁移,确保版本历史的连续性。通过结合Git版本控制和验证机制,有效管理变更的接受与拒绝,确保软件演化的正确性。实验中,系统在无编译器基础的仓库中实现了从零到完整编译器的构建,验证了架构的可扩展性和鲁棒性。

新颖性

该研究首次提出以持久递归世界为核心的组织架构,将软件项目作为持久对象,突破了传统依赖持续代理或人工维护的局限。其核心创新在于通过路径作用域和递归委托实现工作迁移与版本管理,结合深度学习模型实现自动化构建与迁移,展示了长远软件演化的可能性。这在软件工程和AI自动化领域具有开创性意义,填补了长距离软件连续性管理的研究空白。

局限性

  • 系统在大规模迁移和复杂系统构建中仍面临验证机制的局限,尤其在多语言、多平台环境下的适应性有待提升。
  • 模型成本和计算资源依赖较高,长时间运行和大规模代理会话的成本控制仍需优化。
  • 当前验证机制主要依赖测试用例,未来需要引入形式验证和静态分析以增强软件的可靠性。

未来方向

未来将探索多模型、多语言环境下的持久递归世界架构,提升验证机制的鲁棒性,结合形式验证和静态分析技术,增强软件的可靠性。同时,计划引入更智能的代理管理策略,实现更高效的工作分配与协作,推动自动化软件开发向更高层次演进。此外,将关注系统的可扩展性和安全性,确保其在工业级应用中的适用性和稳定性。

AI 总览摘要

在软件工程的长远发展中,持续性和可扩展性一直是核心挑战。传统方法依赖于持续的代理或人工维护,难以应对软件系统规模和复杂度的不断增长。本文提出的EvoX Genesis系统,通过引入持久递归世界模型,重新定义了软件开发的组织架构。该模型将软件状态作为持久对象,局部代理在有限生命周期内操作,递归委托机制实现工作迁移,只有经过验证的变更才能推动版本历史前进。这一创新架构突破了以往依赖持续代理的局限,展现出支持从零开始构建复杂系统、持续开发以及迁移重构的强大能力。

在具体实践中,系统利用DeepSeek V4 Flash实现了从空仓库到完整Rust C编译器的自动构建,历时120小时,归档超过1000个代理会话,仅花费44美元模型令牌,验证了其高效性和经济性。该编译器不仅通过全部c-testsuite,还在LLVM和Csmith测试中表现优异,展示了系统在复杂软件构建中的潜力。更令人振奋的是,系统在基础模型GLM 5.2支持下,持续开发同一编译器,经过多次代理更替,仍能保持完整的测试覆盖和性能指标,验证了其在模型替换环境中的持续性。

此外,系统成功将13个MESA模块(超过10万行Fortran)迁移为近9万行Rust代码,完成时间仅33小时,在六个数值计算任务中实现了1.55至6.87倍的中位数加速。这不仅验证了迁移的正确性,也彰显了该架构在科学软件迁移和重构中的应用潜力。整体来看,EvoX Genesis提供了一种全新的软件组织方式,将软件作为持久递归世界进行管理,极大地推动了自动化软件开发的未来发展。未来,系统将在多模型、多语言环境中优化验证机制,结合形式验证和静态分析,提升软件的可靠性和安全性,助力工业界实现更智能、更高效的软件演化。

深度分析

研究背景

软件工程作为一门学科,经历了从手工编码到自动化开发的演变。早期的版本控制和模块化设计极大提升了软件的可维护性,但仍面临长远演化中的连续性和一致性问题。近年来,大型语言模型(如GPT-4、PaLM)引入了代码生成和自动修复,推动了仓库级别的自动化开发,但其依赖持续代理或人工干预,难以实现真正的长远连续性。已有研究如SWE-bench、OpenHands等在issue解决和多步骤仓库构建方面取得一定进展,但仍未解决多轮演化中的版本一致性和迁移问题。科学软件如MESA、GROMACS等在长时间运行中积累了大量接口和变更,如何保证其演化的连续性和正确性,成为亟待突破的难题。本文提出的持久递归世界模型,结合深度学习和版本控制技术,为长远软件演化提供了新思路。

核心问题

当前软件开发中,随着系统规模的扩大,版本管理和变更追踪变得愈发复杂。传统方法依赖持续代理或人工维护,难以应对多轮变更带来的版本不一致、技术债务和验证难题。尤其在科学计算和基础设施软件中,变更的影响需要严格验证,确保数值行为不变。现有的自动化工具多关注单次修复或短期优化,缺乏对长远演化的支持。如何在保证软件连续性和正确性的同时,实现自动化、可扩展的长远演化,成为亟待解决的核心问题。

核心创新

本研究的核心创新在于提出持久递归世界模型,将软件状态作为持久对象,代理在有限生命周期内操作,避免了传统持续代理带来的复杂性。具体创新点包括:• 版本-路径模型:将软件版本(𝑣)与路径(𝑝)结合,定义局部世界,实现版本的持久性与路径的局部责任。• 递归委托机制:父代理在路径上创建子代理,子代理在固定版本下工作,支持多层次工作迁移。• 验证机制:通过测试、约束和验证结果决定变更是否被接受,确保版本演化的正确性。• 深度学习集成:利用DeepSeek V4 Flash实现大规模自动化构建,支持从空仓库到完整系统的递归积累。• 版本控制结合:结合Git实现变更管理,确保版本历史的连续性和可追溯性。这些创新共同支撑了系统在复杂软件系统构建、持续开发和迁移重构中的优异表现。

方法详解

  • �� 版本-路径模型:定义软件局部世界为(𝑣, 𝑝),其中𝑣为已接受版本,𝑝为仓库相对路径,局部世界由此定位。• 代理操作:有限生命周期的代理在路径𝑝上提出变更Δ𝑖,接受验证后提交变更,推动版本更新。• 递归委托:父代理在路径𝑝创建子代理在路径𝑞,子代理在固定版本下工作,支持多层次迁移。• 验证机制:通过测试、验证和约束,决定变更是否被接受,只有验证通过的变更才会更新版本。• 版本管理:采用Git存储变更,确保版本历史的连续性。• 深度学习支持:利用DeepSeek V4 Flash进行大规模自动化构建,支持从空仓库到完整系统的递归积累。• 实验验证:在无编译器实现的仓库中,递归构建Rust C编译器,验证系统的可扩展性和鲁棒性。

实验设计

  • �� 形成阶段:从空仓库开始,利用DeepSeek V4 Flash递归构建Rust C编译器,历时120小时,归档1000余会话,完成248,989行代码,验证全部c-testsuite和LLVM测试,表现优异。• 持续性验证:在基础模型GLM 5.2支持下,持续开发已完成的编译器,经过多次代理更替,保持完整测试和性能指标。• 迁移重构:将13个MESA模块(超过10万行Fortran)迁移为Rust,完成时间33小时,生成近9万行Rust代码,在六个数值任务中实现中位数加速1.55至6.87倍。• 其他验证:采用多场景验证,包括不同模型、不同迁移路径,确保软件的正确性和一致性。实验设计注重验证系统在复杂长远开发中的持续性、迁移能力和性能表现。

结果分析

  • �� 系统成功构建了完整的Rust C编译器,涵盖Clang兼容接口、LLVM IR导出、C11支持和x86/x86-64后端,历时120小时,归档1000余会话,模型成本44美元,全部测试通过,表现优异。• 在模型GLM 5.2支持下,持续开发该编译器,经过多次代理更替,仍能保持全部测试通过,验证了系统的持续性和迁移能力。• 迁移13个MESA模块(超过10万行Fortran)到Rust,完成时间33小时,生成近9万行Rust代码,在六个数值任务中实现中位数加速1.55到6.87倍,验证了迁移的正确性和效率。• 这些结果共同证明了该架构在复杂软件系统构建、持续开发和迁移重构中的强大能力,展示了自动化软件演化的未来潜力。

应用场景

  • �� 立即应用:该架构可用于自动化科研软件的持续演化,减少人工干预,提高软件可靠性和维护效率,特别适合科学计算、基础设施和大规模系统。• 长期愿景:未来通过引入多模型、多语言支持和形式验证,推动工业界实现全自动化、可持续的软件开发流程,减少人力成本,提升软件质量,支持复杂系统的长远演化。

局限与展望

  • �� 当前验证机制主要依赖测试用例,缺乏形式验证和静态分析,可能在极端场景下存在风险。• 大规模迁移和构建过程中的模型成本较高,长时间运行和多代理会话的能耗和经济性仍需优化。• 系统在多语言、多平台环境下的适应性有限,未来需增强兼容性和扩展性。• 未来还需解决版本冲突管理、系统安全性和多用户协作等关键问题,以实现工业级应用。

通俗解读 非专业人士也能看懂

想象一下,你在管理一个超级复杂的工厂,这个工厂每天都在不断生产新产品。每个工人(代理)只负责一段时间,完成特定任务,然后离开,但工厂的整体布局、生产流程和目标都不会改变。工厂的管理者(系统)会记录每次工人完成的工作,只有当工作经过严格检查(验证)后,才会被加入到工厂的正式流程中。每次新工人来接手时,他们会从已有的工厂布局开始,做一些改动,然后由管理者决定是否采纳这些改动。这样,即使工人不断更换,工厂的整体结构依然稳定、连续。这个系统让工厂可以长久稳定地运转,不用担心每个工人是否记得全部流程,只要整体布局被记录下来,工厂就能持续发展。

简单解释 像给14岁少年讲一样

想象你在学校里参加一个超级酷的科学项目。每次你和你的朋友们都只负责做一部分实验,然后把结果交给老师检查。如果老师觉得你的工作不错,就会把你的结果加入到整个项目的最终报告里。每次你完成一部分,老师都会检查和决定是否采纳。即使你和朋友们每次都换人,整个项目还是可以一直往前推进,因为老师会记住每次的好结果,把它们存下来。这样,整个科学项目就像一个永远不会结束的故事,每个人都可以在不同时间加入,做出贡献,但整个故事的核心内容一直被保存和传承。这种方式让科学项目可以持续不断地发展,即使每个人都只负责一段时间,也能保证最终的成果是连贯和可靠的。

术语表

持久递归世界 (Persistent Recursive World)

一种将软件项目的状态和历史作为持久对象的组织架构,通过路径和版本管理实现软件的连续性和可扩展性。

论文中提出的核心模型,用于支持软件的长远演化和迁移。

版本-路径模型 (Version-Path Model)

将软件版本与仓库路径结合,定义局部软件世界,实现版本的持久化和路径责任的划分。

用于描述局部世界的定位和变更管理机制。

递归委托 (Recursive Delegation)

父代理在路径上创建子代理,子代理在固定版本下工作,支持多层次迁移和工作分配。

实现工作迁移和版本管理的关键机制。

验证机制 (Validation Mechanism)

通过测试、验证和约束决定变更是否被接受,确保软件版本的正确性和一致性。

控制变更进入版本历史的核心流程。

DeepSeek V4 Flash

一种基于深度学习的自动化构建工具,支持大规模递归积累软件系统。

在实验中用于从空仓库自动构建复杂软件。

版本控制 (Version Control)

采用Git等工具管理软件变更历史,确保变更的可追溯性和版本的连续性。

支撑持久递归世界模型的基础技术。

模型令牌 (Model Token)

深度学习模型在推理和训练中使用的基本单位,用于衡量计算成本。

系统在实验中的成本控制指标。

迁移重构 (Migration and Reengineering)

将软件从一种语言或平台迁移到另一种,同时保持功能和行为的一致性。

论文中迁移Fortran到Rust的关键任务。

开放问题 这项研究留下的未解疑问

  • 1 如何在多模型、多平台环境中实现高效的验证和版本管理?未来需要结合形式验证、静态分析和分布式版本控制技术,提升系统的鲁棒性和扩展性。
  • 2 在多用户协作场景中,如何设计权限控制和冲突解决机制?这对于工业应用中的安全和一致性至关重要,仍需深入研究。
  • 3 系统在极端故障(如模型崩溃、数据丢失)下的恢复策略和安全保障措施尚不完善,未来应加强容错设计。
  • 4 结合自动推理和学习,优化代理的决策和工作分配策略,将推动系统的智能化发展。
  • 5 在实际部署中,如何降低成本、提升效率和扩展能力?这是未来工业应用的关键挑战。

应用场景

近期应用

科研软件自动演化平台

利用该架构实现科研软件的自动化持续开发和迁移,减少人工干预,提升软件的可靠性和可维护性,特别适合天体物理、气候模拟等领域。

基础设施软件迁移

支持大型基础设施软件(如操作系统、数据库)在不同平台和语言间的迁移,确保行为一致性,降低迁移成本。

自动化软件重构工具

为软件维护人员提供自动迁移和重构工具,提升软件生命周期管理效率,减少人为错误。

远期愿景

全自动化软件工程生态

未来实现从需求分析、设计、编码到测试的全自动化流程,极大降低软件开发成本,加快创新速度。

跨行业智能软件平台

构建支持多行业、多语言、多平台的智能软件开发平台,推动工业互联网、智慧城市等领域的数字化转型。

原文摘要

Complex software systems develop over timescales that exceed the lifespan of any individual coding agent. Most agentic software systems preserve continuity through persistent sessions, memories, managers or shared context. We introduce EvoX Genesis (hereafter, Genesis), which instead makes the software project persistent while allowing local agents to remain finite-lived. Genesis represents software as a persistent recursive world: each local world is situated by an accepted version and a repository path, finite-lived agents propose local changes, recursive delegation moves work across paths, and only accepted consequences advance the persistent version history. We evaluate this organization across formation, continuation and redevelopment. Starting from a repository with no compiler implementation, Genesis used DeepSeek V4 Flash to build a Rust-based C compiler with about 250k tracked lines; the run lasted over 120 hours, archived over 1,000 agent episodes and incurred only US$44 in model-token charges. The compiler passed the complete c-testsuite and most LLVM and Csmith tests. In a separate compiler world generated with GLM 5.2, development continued after repeated agent replacement while retaining full test performance. Genesis also reimplemented 13 MESA modules with over 100k Fortran lines as a Rust workspace with nearly 90k Rust lines; across six numerical workloads, it achieved median speedups of 1.55--6.87x. These results show that long-horizon software development can be organized around a persistent project rather than a persistent agent.

cs.SE cs.AI cs.MA cs.NE

参考文献 (20)

MODULES FOR EXPERIMENTS IN STELLAR ASTROPHYSICS (MESA)

B. Paxton, L. Bildsten, A. Dotter 等

2010 3196 引用 ⭐ 高影响力 查看解读 →

On the criteria to be used in decomposing systems into modules

D. Parnas

1972 4897 引用

Programs, life cycles, and laws of software evolution

M. Lehman

1980 1389 引用

Voyager: An Open-Ended Embodied Agent with Large Language Models

Guanzhi Wang, Yuqi Xie, Yunfan Jiang 等

2023 2123 引用 查看解读 →

AlphaEvolve: A coding agent for scientific and algorithmic discovery

Alexander Novikov, Ngân V˜u, Marvin Eisenberger 等

2025 741 引用 查看解读 →

Evaluating AGENTS.md: Are Repository-Level Context Files Helpful for Coding Agents?

Thibaud Gloaguen, Niels Mündler, M. Muller 等

2026 14 引用 查看解读 →

Mathematical discoveries from program search with large language models

B. Romera-Paredes, M. Barekatain, Alexander Novikov 等

2023 1175 引用

Containers for computational reproducibility

2023 28 引用

Turning Interaction History into Execution State: A Runtime Layer for Long-Horizon Coding Agents

Zehao Wang, Yisen Xu, Chenglin Li 等

2026 1 引用 查看解读 →

Introducing the FAIR Principles for research software

M. Barker, N. C. Chue Hong, D. Katz 等

2022 435 引用

SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

Carlos E. Jimenez, John Yang, Alexander Wettig 等

2023 3340 引用 查看解读 →

An AI system to help scientists write expert-level empirical software

Eser Aygün, Anastasiya Belyaeva, Gheorghe Comanici 等

2025 51 引用 查看解读 →

SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks

Gabriel Orlanski, Devjeet Roy, Alexander Yun 等

2026 14 引用 查看解读 →

SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios

Minh-Tin Thai, Tue Le, Dũng Nguyễn Mạnh 等

2025 35 引用 查看解读 →

NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents

Jingzhe Ding, Shengda Long, Changxin Pu 等

2025 37 引用 查看解读 →

MetaGPT: Meta Programming for Multi-Agent Collaborative Framework

Sirui Hong, Xiawu Zheng, Jonathan P. Chen 等

2023 2249 引用 查看解读 →

SWE-MeM: Learning Adaptive Memory Management for Long-Horizon Coding Agents

Shuzheng Gao, Wenhao Zeng, Zhaojian Yu 等

2026 5 引用 查看解读 →

Beyond Isolated Tasks: A Framework for Evaluating Coding Agents on Sequential Software Evolution

K. Shastry, Ganesh Senrayan, Shrey Satapara 等

2026 2 引用 查看解读 →

When the Specification Emerges: Benchmarking Faithfulness Loss in Long-Horizon Coding Agents

Lu Yan, Xuan Chen, Xiangyu Zhang

2026 3 引用 查看解读 →

EvoGit: Decentralized Code Evolution via Git-Based Multi-Agent Collaboration

Beichen Huang, Ran Cheng, Kay Chen Tan

2025 7 引用 查看解读 →