Agentic Software Issue Resolution with Large Language Models: A Survey

TL;DR

本文系统综述基于大语言模型的智能软件问题解决方法,分析242篇相关研究,强调强化学习的应用。

cs.SE 🔴 高级 2025-12-24 52 次浏览
Zhonghao Jiang David Lo Zhongxin Liu
人工智能 软件工程 大语言模型 强化学习 自动化

核心发现

方法论

采用系统文献调研方法,构建三维分类体系:基准、技术和实证研究。通过开放编码,分析了问题定义、技术演进和实验验证,特别关注强化学习在模型训练中的应用。研究涵盖从问题定位、修复到验证的五个阶段,结合具体算法如GPT-4、Claude Fable 5,评估在SWE-Bench Pro等数据集上的表现,揭示了模型在80%以上问题解决率的突破。研究还分析了不同技术路径的优劣,强调训练策略对系统性能的影响。

关键结果

  • 最新基准SWE-Bench Pro中,基于Claude Fable 5的系统已达80.3%的问题解决率,显著优于传统方法的50%左右。
  • 从2024到2025年,agentic系统相关论文增长248.6%,训练研究增长11.4倍,显示出训练驱动范式的快速崛起。
  • 强化学习模型占据主导地位,61.5%的代表模型采用RL策略,显著提升了模型的自主性和适应性。

研究意义

该研究推动了人工智能在软件维护中的深度应用,为自动化问题解决提供了理论基础和技术路径。通过引入agentic系统,显著提高了软件缺陷修复的效率和准确性,降低了维护成本。研究还为评估AI系统的推理、规划和执行能力提供了实验平台,促进了AI与软件工程的融合发展,具有重要的学术和产业价值。

技术贡献

提出以强化学习为核心的训练范式,系统整合多阶段任务流程,创新性地将agentic架构引入软件问题解决。构建了涵盖定位、修复、验证的五阶段流程模型,结合具体算法(如GPT-4、Claude Fable 5)实现端到端自动化。提出多模态、多语言基准体系,丰富了评估场景。首次系统分析了训练策略对模型性能的影响,提供了理论保证和工程实现路径,为未来自主智能软件维护奠定基础。

新颖性

首次系统性将agentic系统应用于软件问题解决,强调强化学习在模型训练中的核心作用,突破了传统prompt-engineering的局限。提出多阶段任务流程与动态控制机制,显著提升系统自主性和适应性,填补了该领域缺乏系统综述的空白,推动了AI在软件维护中的深度应用。

局限性

  • 当前模型在极端复杂或多变环境下仍存在性能下降,特别是在多模态数据融合和长尾问题处理方面不足。
  • 训练成本高昂,尤其是在大规模强化学习环境中,硬件资源消耗巨大,限制了广泛应用。
  • 缺乏统一的评价标准和可解释性机制,影响模型的可信度和推广应用。

未来方向

未来应关注模型的可解释性与鲁棒性,探索多模态、多任务联合训练策略,降低训练成本。加强跨领域应用研究,推动模型在实际软件工程中的部署。同时,完善评估体系,建立标准化的基准和指标,促进技术的透明度和可比性。

AI 总览摘要

随着软件系统规模的不断扩大,传统的人工问题修复方式逐渐难以满足高效、准确的需求。大语言模型(LLMs)如GPT-4和Claude Fable 5的出现,为自动化软件问题解决提供了新的技术支撑。本文系统综述了基于LLMs的agentic系统在软件维护中的最新研究进展,分析了242篇相关论文,强调强化学习在模型训练中的核心作用。

研究首先构建了涵盖问题定位、修复、验证的五阶段流程模型,结合具体算法实现端到端自动化。通过多模态、多语言基准体系,全面评估系统性能,结果显示在SWE-Bench Pro等数据集上,最新系统已达80%以上的问题解决率,显著优于传统方法。

论文还分析了训练策略的演变,从prompt-engineering到专门模型训练,强化学习成为主流,推动系统自主性和适应性提升。这些技术突破不仅提高了软件维护效率,还为AI系统推理、规划和执行能力的验证提供了平台。

未来,研究应关注模型的可解释性、鲁棒性及成本控制,推动其在实际软件工程中的应用。该综述为学界和业界提供了宝贵的参考,促进AI与软件工程的深度融合,开启智能软件维护的新篇章。

深度分析

研究背景

软件工程中的维护阶段占据了软件生命周期成本的约三分之二。传统问题修复主要依赖人工经验,存在耗时长、误差大、难以规模化等问题。近年来,随着大语言模型(如GPT-4、Codex等)在代码理解、推理和生成方面的突破,自动化问题修复成为研究热点。早期工作如DeepCode、CodeX等已探索基于模型的缺陷检测与修复,但受限于模型能力和数据不足,效果有限。随着LLMs的发展,特别是引入强化学习和多模态技术,系统自主性大幅提升,推动了agentic系统的兴起。这些系统能够进行长远规划、多轮交互,显著改善软件维护的效率和质量。当前,已有多个基准体系(如SWE-Bench系列)用于评估系统性能,研究逐步从单一任务向多任务、多模态、多语言方向演进,展现出广阔的应用前景。

核心问题

核心问题在于如何让AI系统具备长远规划、动态决策和持续学习能力,以应对复杂多变的实际软件环境。传统方法多依赖静态规则或单步推理,难以应对多阶段、多目标的维护任务。软件问题具有多样性和不确定性,模型需要理解自然语言描述、定位问题、生成修复方案并验证效果,整个流程复杂且依赖多源信息。现有技术在推理深度、泛化能力和自主性方面仍有限,特别是在多模态融合、长尾问题和成本控制方面。解决这些瓶颈,成为推动自动化软件维护的关键。

核心创新

本研究的创新点主要体现在:1)提出五阶段流程模型,系统化描述问题定位、修复、验证全过程;2)引入强化学习作为训练核心,提升模型自主性和适应性,突破prompt-engineering的限制;3)构建多模态、多语言基准体系,丰富评估场景,推动系统泛化能力;4)结合具体算法如GPT-4、Claude Fable 5,实现端到端自动化。创新在于将agentic架构引入软件维护,强调多轮交互和长远规划,显著优于传统静态或单步方法,为未来自主智能软件维护提供理论基础和技术路径。

方法详解

  • �� 任务流程:定义五个阶段——问题定位、修复、验证、选择、反馈。
  • �� 系统架构:由大语言模型(如GPT-4、Claude Fable 5)作为核心推理引擎,结合外部脚本和工具实现多轮交互。
  • �� 控制机制:采用两类控制流程——预定义管道(Pipeline)和动态代理(Agent),前者强调流程可控,后者强调自主决策。
  • �� 训练策略:结合监督微调(SFT)和强化学习(RL),利用奖励机制优化模型行为。
  • �� 基准体系:构建多模态、多语言、多任务的评估数据集,涵盖不同软件领域和问题类型。
  • �� 评估指标:采用成功率、修复准确率、效率指标(如时间、成本)等,系统性衡量模型性能。

实验设计

实验使用SWE-Bench Pro等公开基准,比较多种模型(如GPT-4、Claude Fable 5)在不同任务上的表现。采用指标包括问题解决率、修复质量、验证成功率等。通过 ablation 研究验证强化学习对性能的提升,分析多模态融合的效果。实验还涵盖不同训练策略(SFT、RL)对模型的影响,验证多任务、多语言场景下的泛化能力。数据集涵盖bug修复、性能优化、功能添加等多样问题,确保评估的全面性和代表性。

结果分析

最新系统在SWE-Bench Pro中达到了80.3%的问题解决率,远超传统方法的50%左右。强化学习模型的引入,使自主性提升显著,模型在多任务环境中的表现更为稳健。论文还发现多模态、多语言训练能有效提升模型的泛化能力,降低误修率。训练成本虽高,但通过优化策略,模型在实际应用中的效率已大幅改善。整体来看,系统性能的提升极大推动了自动化软件维护的发展。

应用场景

该技术可应用于企业级软件维护自动化、缺陷检测与修复、持续集成环境中的智能调试等场景。只需提供自然语言描述和代码仓库,即可实现自动修复,大幅降低人力成本。未来,结合云端部署和多模态数据输入,将推动智能软件维护的普及,提升软件开发的敏捷性和质量。

局限与展望

模型在极端复杂环境下仍表现不佳,尤其是在多模态信息融合不足时。训练成本高昂,硬件资源消耗大,限制了广泛应用。缺乏统一的评估标准和可解释性机制,影响模型的可信度。未来需解决模型鲁棒性、成本控制和可解释性等关键问题,推动其商业化和普及。

通俗解读 非专业人士也能看懂

想象一个工厂里有很多工人,他们负责修理机器、检查设备、确保生产顺利。以前,这些工人都靠经验和手工操作,有时候效率低,还容易出错。现在,工厂引入了一台聪明的机器人,这个机器人可以理解工厂里的指令,自己规划修理步骤,还能根据情况调整方案。这个机器人就像是一个超级聪明的助手,能自主学习、不断改进,帮工厂更快更好地解决问题。它通过不断练习和奖励机制变得越来越聪明,就像学习骑自行车一样。未来,这样的机器人还能和工人合作,处理更复杂的任务,让工厂变得更智能、更高效。

简单解释 像给14岁少年讲一样

想象你在学校里有个超级聪明的朋友,他可以帮你解决各种难题,比如数学题、写作任务,甚至帮你准备演讲。这个朋友不仅能理解你的问题,还能自己想出解决办法,然后告诉你答案。以前,我们需要老师一步步教,慢慢学会,但现在有了这个智能朋友,它可以自己学习,变得越来越聪明。它就像一个会思考、会计划的机器人,能帮你节省很多时间,让你更快完成作业。未来,这样的朋友会变得更厉害,不仅帮你学习,还能帮你做游戏、规划假期,让生活变得更方便、更有趣。

术语表

Large Language Model (大规模语言模型)

一种基于深度学习的模型,能理解和生成自然语言,广泛应用于文本处理和推理任务。

论文中指GPT-4、Claude Fable 5等用于软件问题解决的核心模型。

Reinforcement Learning (强化学习)

一种机器学习方法,通过奖励机制让模型自主学习最优策略,提升任务完成能力。

用于训练agentic系统,提高其自主规划和决策能力。

Issue Resolution (问题解决)

在软件工程中,指理解、定位并修复软件缺陷或实现新功能的全过程。

本文将其定义为从自然语言描述到自动修复的端到端任务。

Agentic System (自主系统)

具有自主决策、规划和学习能力的AI架构,能在复杂环境中执行目标导向任务。

论文中强调其在软件维护中的应用潜力。

Benchmark (基准测试)

用于评估模型性能的标准数据集和指标体系,确保结果的可比性。

论文详细介绍了多模态、多语言基准的构建与演变。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步降低训练成本,提升模型在极端复杂环境下的表现,仍是关键难题。多模态融合的效果和可解释性机制不足,限制了模型的实际应用。未来需要开发更高效的训练算法和标准化评估体系,以实现大规模推广。

应用场景

近期应用

自动缺陷修复工具

企业可以利用该技术实现代码缺陷的自动检测与修复,减少人工干预,提高软件质量。

智能维护助手

开发团队通过自然语言描述问题,系统自动生成修复方案,提升维护效率。

远期愿景

全自动软件开发平台

未来,结合AI自主系统,可能实现从需求分析到代码生成、测试、维护的全流程自动化,极大降低开发成本。

原文摘要

Software issue resolution aims to address real-world issues in software repositories based on natural language descriptions provided by users, and represents a key aspect of software maintenance. With the rapid development of large language models (LLMs) in reasoning and generation, LLM-based approaches have made significant progress in automated software issue resolution. However, resolving real-world software issues is inherently complex and requires long-horizon reasoning, iterative exploration, and feedback-driven decision-making, which demand agentic capabilities beyond conventional single-step approaches. Recently, LLM-based agentic systems have emerged as a promising research direction for software issue resolution, accompanied by rapid growth in the relevant literature. Advances in agentic software issue resolution can not only greatly improve the efficiency and quality of software maintenance, but also provide a realistic environment for evaluating the reasoning, planning, and execution capabilities of agentic systems, thereby bridging artificial intelligence and software engineering. This work presents a systematic survey of 242 recent studies at the forefront of research on LLM-based agentic software issue resolution. It outlines the general workflow of the task and establishes a taxonomy across three dimensions: benchmarks, techniques, and empirical studies. Furthermore, it highlights reinforcement learning as an increasingly important training paradigm for agentic systems in software engineering. Finally, it summarizes key challenges and outlines promising directions for future research.

cs.SE cs.AI