BeyondSWE: Can Current Code Agent Survive Beyond Single-Repo Bug Fixing?

TL;DR

BeyondSWE基准评估代码智能在跨仓库、领域知识、依赖迁移和文档生成中的表现,最佳模型仅达56.65分。

cs.CL 🔴 高级 2026-03-04 55 次浏览
Guoxin Chen Fanzhe Meng Jiale Zhao Minghao Li Daixuan Cheng Huatong Song Jie Chen Yuzhi Lin Hui Chen Xin Zhao Ruihua Song Chang Liu Cheng Chen Kai Jia Ji-Rong Wen
软件工程 代码智能 跨仓库任务 外部知识 搜索增强

核心发现

方法论

本研究构建了BeyondSWE基准,包含246个真实GitHub仓库的500个实例,涵盖跨仓库问题解决、领域特定修复、依赖迁移及文档生成四类任务。采用环境重建、任务验证和人类专家审核,确保任务真实性与难度。引入SearchSWE作为搜索增强的诊断工具,评估模型结合外部信息的能力。模型包括OpenHands、Codex(GPT-5.4)等,利用不同提示策略进行性能测试。通过精细化的环境构建和严格的测试流程,量化模型在复杂任务中的表现差异。

关键结果

  • 最佳OpenHands模型平均得分为46.12,表现尚未饱和;而使用GPT-5.4(xhigh)在搜索提示下达56.65,显示搜索信息有一定帮助,但提升有限。
  • 引入搜索工具后,大部分模型性能提升显著,但在将检索信息转化为精确、版本兼容且局部可操作的代码方面仍存在困难,说明深度搜索在编码中的应用仍是未解决的问题。
  • 不同任务表现差异明显,跨仓库和依赖迁移任务难度较大,模型在复杂场景下的鲁棒性和知识迁移能力仍需提升。

研究意义

该研究揭示了当前代码智能模型在处理超出单仓库范围的复杂软件工程任务中的局限性,为未来多仓库、多知识源集成的研究指明方向。推动实现具备跨仓库推理、领域知识融合和外部信息利用的智能编码系统,有助于解决实际软件维护中遇到的知识孤岛和迁移难题,具有重要的学术和工业价值。

技术贡献

提出BeyondSWE多任务基准,系统评估模型在跨仓库、领域知识、依赖迁移和文档生成中的能力。引入搜索增强机制,设计搜索-编码结合的诊断框架,揭示模型在信息整合和代码生成中的瓶颈。通过严格的环境重建和多轮验证,确保评估的真实性与可复现性,为未来多源信息融合提供技术基础。

新颖性

首次系统性构建涵盖多维度、真实场景的跨仓库软件工程任务基准,超越传统单仓库修复,强调外部知识和全局协作能力。引入搜索增强的诊断框架,系统分析模型在信息检索与代码生成中的结合难题,填补该领域研究空白。

局限性

  • 当前模型在复杂任务中表现仍有限,尤其在跨仓库推理和依赖迁移场景中鲁棒性不足,模型对外部信息的整合能力有待提升。
  • 环境重建依赖大量人工验证,存在一定的成本和主观性,未来需自动化和标准化流程。
  • 实验主要集中在Python仓库,跨语言、多平台场景尚未充分覆盖。

未来方向

未来将探索多模态知识融合、强化学习策略以提升模型推理能力,优化环境自动重建流程,扩展多语言、多平台任务,推动模型在实际软件工程中的应用落地。

AI 总览摘要

软件工程中的自动化代码修复已取得显著进展,但大多评估集中在单仓库范围内的问题解决。实际开发中,许多任务超越了仓库边界,涉及跨仓库信息、领域知识和依赖迁移等复杂场景。为此,本文提出BeyondSWE基准,涵盖246个真实GitHub仓库的500个多维任务实例,旨在评估当前代码智能在更广泛知识和范围内的表现。基准任务包括跨仓库问题解决、领域特定修复、依赖迁移和文档生成,涉及平均10.9个文件、1039行代码的修改规模。实验结果显示,最优模型OpenHands仅达46.12分,而结合搜索信息的GPT-5.4(xhigh)最高达56.65分,仍未接近完全解决。引入SearchSWE搜索增强机制后,模型性能有所提升,但在将检索到的外部信息转化为精确代码方面仍存在明显瓶颈。这表明深度搜索与编码的融合仍是未解难题。该研究强调,未来需要开发能有效融合外部证据、进行仓库级推理和验证的智能模型,以应对真实软件工程中的复杂任务。这一工作不仅丰富了软件工程的自动化评估体系,也为多源知识融合、跨仓库协作提供了技术基础,推动行业向更智能、更高效的方向发展。

深度分析

研究背景

软件工程中的自动化代码修复技术近年来快速发展,代表性工作包括CodeX、DeepCode等。早期研究主要集中在单仓库内的问题定位与修复,利用静态分析、测试驱动和机器学习模型实现自动修复。随着大规模预训练模型的出现,如GPT-3、Codex,代码生成能力大幅提升,推动了代码智能的实用化。然而,现有研究多局限于局部修复,缺乏对跨仓库、领域知识和依赖迁移等复杂场景的系统评估。近年来,SWE-bench-Verified等基准推动了真实场景的评测,但仍未充分覆盖多仓库、多知识源的挑战。软件工程的复杂性在于实际任务常常超出单仓库范围,涉及多源信息整合、系统级变更和全局迁移,亟需更全面的评估体系。

核心问题

当前代码智能模型在单仓库修复任务中表现尚可,但在跨仓库、领域知识和依赖迁移等复杂场景中表现不足。实际开发中,开发者常需参考外部文档、上游项目或进行全局迁移,模型难以有效利用外部信息,导致修复效果有限。如何设计能处理多源信息、实现跨仓库推理的智能系统,成为亟待解决的核心问题。这不仅关系到模型的实用性,也影响其在工业界的推广应用。

核心创新

本研究提出多维度基准BeyondSWE,首次系统性评估模型在跨仓库、领域知识、依赖迁移和文档生成中的能力。引入搜索增强机制,设计搜索-编码结合的诊断框架,突破传统单仓库限制。创新点包括:1)多任务实例设计,模拟真实复杂场景;2)环境自动重建,确保评估公平性;3)搜索-编码融合,提升信息利用效率。这些创新推动模型在复杂软件工程任务中的表现,填补了多源信息融合的研究空白。

方法详解

  • �� 构建BeyondSWE基准,采集246仓库的500个实例,涵盖四类任务。• 采用环境自动重建技术,利用Shell命令和Docker确保环境一致性。• 设计多任务测试,包括跨仓库问题、领域修复、依赖迁移和文档生成。• 引入SearchSWE,结合Web搜索和网页抓取工具,增强模型外部信息访问能力。• 采用多模型评估,包括OpenHands、Codex(GPT-5.4)等,比较不同提示策略的效果。• 通过严格的测试流程,确保每个实例的环境稳定性和任务真实性。• 结合人工专家审核,过滤掉不符合实际的软件工程场景的实例。

实验设计

实验在真实环境中进行,使用Python仓库,评估模型在不同任务中的表现。指标包括Resolved Rate、Pass Rate和(Almost) Correct Count。模型参数保持一致,采用不同提示策略,比较无搜索与搜索增强的效果。对比多种模型,包括OpenHands、DeepSeek-V4-Pro和GPT-5.4(xhigh),分析其在复杂场景中的鲁棒性和知识迁移能力。还进行了消融实验,验证搜索信息对性能的贡献。所有环境均经过多轮验证,确保结果的可靠性和可复现性。

结果分析

实验结果显示,最优模型OpenHands在所有任务中平均得分为46.12,表现尚未饱和;引入搜索后,GPT-5.4(xhigh)在搜索提示下达56.65,明显优于无搜索状态的48.48。不同任务表现差异显著,跨仓库和依赖迁移任务难度较大。搜索增强虽提升部分模型性能,但在将检索信息转化为准确代码方面仍存在瓶颈,说明深度搜索与编码的结合仍需突破。整体来看,模型在复杂多源场景下的能力仍有限,未来需在知识融合和推理能力上持续优化。

应用场景

该研究推动了智能化软件维护工具的发展,适用于自动修复跨仓库依赖、迁移和文档生成等场景。企业可利用此技术实现自动化代码迁移、系统升级和知识管理,减少人工成本。未来,结合多模态知识和强化学习,有望实现更智能的系统,支持大规模软件系统的自动化维护与演化。

局限与展望

模型在复杂任务中的表现仍有限,尤其在跨仓库推理和依赖迁移场景中鲁棒性不足。环境重建依赖大量人工验证,成本较高,自动化程度有待提升。实验主要集中在Python生态,跨语言、多平台场景尚未充分覆盖。未来需增强模型的多源知识融合能力,优化环境自动化流程,扩展多语言支持,提升实际应用的可行性。

通俗解读 非专业人士也能看懂

想象你在厨房做菜,平时只用一个锅和几种调料就能做出菜肴,但有时候你需要用到不同厨房的工具、调料,甚至参考食谱和其他厨师的经验。现在的智能厨师(模型)就像这样,它们在简单情况下表现不错,但面对复杂任务,比如跨厨房合作、使用不同食谱或迁移食材,就会遇到困难。本文的研究就像是在测试这些厨师在更复杂的厨房环境中的表现,看看他们能否利用外部信息、合作完成大菜。通过设计各种“厨房任务”,研究发现即使最好的厨师也还需要改进,未来的目标是让他们像顶级厨师一样,能灵活应对各种复杂挑战,真正成为厨房里的万能高手。

简单解释 像给14岁少年讲一样

你知道平时做饭的时候,有时候只用一个锅就能搞定菜肴,但有时候需要参考别的厨房的食谱或者用到不同的调料,这样才能做出更好吃的菜。现在的智能厨师(就是那些会写代码的机器人)平时在修复代码时表现还不错,但遇到更复杂的任务,比如要用别的仓库的代码、参考专业领域的知识、迁移依赖或者从零搭建一个新系统,就会变得很困难。这个研究就像是在测试这些机器人在更复杂的厨房环境中能不能用外部的食谱、工具和经验帮忙做菜。结果发现,即使是最厉害的机器人,也还不能完全胜任这些复杂任务。未来,我们希望让它们像顶级厨师一样,能灵活应对各种复杂情况,帮我们更快更好地完成软件开发工作。

原文摘要

Current code-agent benchmarks primarily evaluate localized issue resolution within a single target repository, leaving under-tested many software engineering tasks that require external knowledge or broader repository-level changes. We introduce BeyondSWE, a 500-instance benchmark drawn from 246 real-world GitHub repositories to evaluate code agents beyond single-repository bug fixing. BeyondSWE covers four representative settings: cross-repository issue resolution, domain-specific issue resolution, dependency-driven migration, and document-to-repository generation, spanning both broader knowledge scope and broader resolution scope. Our evaluation shows that BeyondSWE remains far from saturated: the best OpenHands-based agent reaches 46.12 average score, while the strongest Codex harness with GPT-5.4 (xhigh) reaches 56.65 under a search-aware prompt. To study whether external information access closes this gap, we use SearchSWE as a controlled diagnostic baseline for search-augmented coding. Search access improves most models and substantially helps some tasks, but the gains remain limited and uneven, showing that current agents still struggle to convert retrieved information into precise, version-compatible, and locally actionable code changes. These results suggest that deep search for coding remains an open problem: progress requires agents that can reliably combine external evidence with repository-local reasoning and execution-based verification.

cs.CL cs.SE