SWE-Milestone: Evaluating AI Agents on Continuous Software Evolution

TL;DR

提出DeepCommit,重建可验证的Milestone DAG,用于评估AI在连续软件演化中的表现。

cs.SE 🔴 高级 2026-03-13 48 次浏览
Gangda Deng Zhaoling Chen Zhongming Yu Haoyang Fan Yuhong Liu Yuxin Yang Dhruv Parikh Rajgopal Kannan Le Cong Mengdi Wang Qian Zhang Viktor Prasanna Xiangru Tang Xingyao Wang
软件工程 AI代理 持续集成 软件演化 基准测试

核心发现

方法论

该研究构建了DeepCommit管道,结合静态分析、LLM引导的里程碑构建与运行时验证,重组噪声较大的提交日志,生成可验证的Milestone DAG。通过静态分析提取提交、符号和文件变化信息,利用Claude Opus 4.5模型进行里程碑推断,结合测试验证确保可执行性。基于此,设计SWE-Milestone基准,评估12个前沿模型在连续演化场景中的表现,强调系统完整性与误差控制。

关键结果

  • 在孤立任务中,模型平均得分超过80%,但在连续演化环境中显著下降至38.03%,Gemini 3 Pro的Resolve Rate仅为13.37%。
  • 模型Recall呈线性增长,达成新功能的能力较强,但Precision趋于饱和,反映系统维护难题。错误积累导致后续任务停滞,表现出长远维护的巨大挑战。
  • 主动探索和验证策略显著改善演化效果,避免技术债累积,验证了系统维护中的关键因素。

研究意义

该研究填补了软件演化连续性评估的空白,突破了传统孤立任务评估的局限,为AI在真实软件开发中的长期维护提供了量化指标。推动了面向长周期、依赖关系复杂的系统的自动化评估体系,具有深远的学术和工业价值,特别是在自动化软件维护和持续集成领域。

技术贡献

提出DeepCommit自动重建Milestone DAG,结合静态分析与LLM验证,确保生成的里程碑具备可执行性。设计SWE-Milestone基准,涵盖多语言、多场景,评估模型在长远演化中的表现。系统性分析模型在连续任务中的性能退化,揭示误差传播机制,为未来优化提供理论基础。

新颖性

首次将Milestone级别的依赖关系引入连续软件演化评估,结合静态分析与LLM验证,突破了传统提交级或版本级评估的局限。提出的DeepCommit管道实现了从噪声提交到可验证演化轨迹的自动化重建,创新性地解决了长周期、多任务依赖的评估难题。

局限性

  • 当前方法对大型仓库的依赖较高,重建过程计算成本较大,存在扩展性挑战。
  • 模型在极端复杂依赖或非标准开发流程中表现不佳,需进一步优化鲁棒性。
  • 测试验证主要依赖静态分析与有限的动态验证,仍可能漏掉部分潜在错误。

未来方向

未来将结合更强大的大模型和多模态信息,提升Milestone重建的准确性与效率。探索多仓库、多语言环境的适应性,完善误差传播机制的理论分析,推动连续软件演化的自动化评估体系向工业规模应用扩展。

AI 总览摘要

在现代软件开发中,软件系统不断演化以满足复杂多变的需求。传统的AI代理评估多集中于孤立任务,忽视了软件演化中的时间依赖和技术债积累问题。本文提出DeepCommit管道,结合静态分析和大模型验证,自动重建高可信度的Milestone DAG,作为连续软件演化的基础单元。基于此,设计了SWE-Milestone基准,模拟真实开发场景,评估12个前沿模型在多语言、多任务环境中的表现。实验显示,模型在孤立任务中表现优异(超过80%),但在连续演化中显著下降(最低38.03%),揭示了模型在长远维护中的巨大挑战。研究发现,模型在新功能实现方面表现出线性增长,但在系统维护和误差控制方面存在严重瓶颈,错误的积累导致开发停滞。通过主动探索和验证策略,部分缓解了技术债问题。该工作不仅丰富了软件工程中AI评估的理论体系,也为未来自动化软件维护提供了重要技术支撑。未来,将结合更强大模型和多源信息,优化Milestone重建流程,推动工业界的持续集成与自动维护技术发展。

深度分析

研究背景

软件开发已从传统的线性流程演变为持续集成、持续部署的复杂体系。近年来,诸如CodeX、GitHub Copilot等AI驱动工具在单一任务中取得突破,但缺乏对长周期、多任务依赖关系的系统评估。现有基准多关注孤立的代码片段或版本快照,未能反映软件演化的连续性与复杂性。随着大模型的发展,自动化评估连续软件演化的需求日益增长,亟需建立能捕捉时间依赖、技术债积累的评估体系。

核心问题

当前评估方法多集中于单一任务或快照状态,难以反映软件在长时间、多任务、多依赖环境中的维护难题。模型在连续演化中易出现误差累积、系统退化,导致开发停滞。缺乏有效的工具和指标衡量模型在复杂依赖关系中的表现,限制了AI在工业软件维护中的应用推广。

核心创新

提出DeepCommit,结合静态分析、LLM验证与运行时测试,自动重建高可信度的Milestone DAG,确保依赖关系的正确性。设计SWE-Milestone基准,模拟真实连续开发场景,评估模型在多任务、多语言环境中的表现。创新点包括里程碑级别的任务划分、动态验证机制,以及系统误差传播的分析,为长周期软件维护提供新思路。

方法详解

  • �� 采集仓库提交历史,利用静态分析提取提交、符号和文件变化信息。• 由LLM模型(Claude Opus 4.5)引导构建Milestone DAG,包括种子发现、合并、依赖推断和拆分。• 结合测试环境验证,确保每个里程碑的可执行性。• 采用多轮验证与修复机制,确保DAG的正确性。• 最终生成可验证的演化轨迹,作为评估基础。

实验设计

在7个开源仓库(涵盖Python、C++等)上,构建98个人工验证的里程碑,评估12个模型。指标包括Score(结合召回率和精确率)和Resolve Rate。对比孤立任务表现,分析连续演化中的性能退化。采用ablation验证不同组件对效果的贡献,测试模型在不同复杂度场景中的鲁棒性。

结果分析

模型在孤立任务中平均得分超过80%,但连续场景下降至38.03%,Gemini 3 Pro的Resolve Rate仅13.37%。Recall持续增长,反映新功能实现能力,但Precision趋于饱和,说明系统维护难度大。错误积累导致开发停滞,验证主动探索和验证策略能部分缓解问题,验证了误差传播机制的关键作用。

应用场景

该评估体系可应用于自动化软件维护、持续集成优化、AI驱动的代码演化管理。为工业界提供量化模型性能的工具,推动自动修复、技术债管理等关键技术的发展。未来可结合大模型,提升长周期演化的自动化能力,助力软件行业实现更高效的持续集成。

局限与展望

当前方法对大型仓库的计算成本较高,重建过程耗时长。模型在复杂依赖或非标准流程中表现有限,鲁棒性待提升。测试验证主要依赖静态分析,可能漏掉部分潜在错误。未来需优化算法效率,增强适应性,降低成本。

通俗解读 非专业人士也能看懂

想象你在管理一个大型工厂,每天都有不同的任务和新产品需要生产。为了确保每个环节都顺利进行,你需要知道每个任务的前后关系,不能随意跳过或重复。传统方法就像只看每个工序的快照,不能理解整体流程。本文提出一种智能系统,像是给工厂设计了一套智能调度员,能自动整理所有任务的关系,确保每一步都合理,且能追踪每个任务的变化。这样,工厂就能持续高效地生产新产品,即使遇到问题也能及时修正,不会堆积技术债。这个系统用大模型帮忙分析和验证,确保每个环节都可靠,最终实现工厂的长远稳定运行。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的积木游戏,每次你都要搭建不同的城堡。每次搭完一部分,你都要记住下一步怎么搭,不能乱来。以前的人只看每次搭完的城堡快照,不能理解整个搭建过程,也不能保证每次都搭得稳。现在,这个新方法就像给你一个智能助手,它能帮你整理每个搭建步骤的关系,确保每一块积木都放得对,不会倒塌。它还能检查你搭的城堡是不是牢固,遇到问题还能帮你修正。这样,你就可以不断建出更漂亮、更稳固的城堡,而且不用担心积木堆得乱七八糟。这个助手用大脑一样的模型,帮你分析和验证,保证整个搭建过程顺利进行,城堡越建越好。

原文摘要

Real-world software must continuously evolve to meet ever-changing and open-ended requirements. AI agents, increasingly deployed as long-running systems, are now entrusted to drive this evolution. Yet, existing benchmarks evaluate agents on isolated, one-off coding tasks, neglecting the temporal dependencies and technical debt inherent in real-world software evolution. To bridge this gap, we introduce DeepCommit, an agentic pipeline that reconstructs verifiable Milestone DAGs from noisy commit logs, where milestones are defined as functionally cohesive development goals. These executable sequences enable SWE-Milestone, a benchmark that evaluates agents on streams of milestone-level tasks, requiring them to sustain system integrity and limit error accumulation, dimensions of long-term software evolution largely missing from current benchmarks. Our evaluation of 12 frontier models across 4 agent frameworks reveals a critical vulnerability: overall performance scores drop significantly from >80% on isolated tasks to 38.03% in continuous settings, exposing agents' profound struggle with long-term maintenance and error propagation.

cs.SE cs.AI