An Empirical Study of Harness Design for Coding Agents

TL;DR

研究通过轻量级编码框架提高自动编码代理的长远性能,实验显示上下文管理最有效。

cs.AI 🔴 高级 2026-09-18 11 次浏览
Run-Ze Fan Zihao Zhang Simin Ma Yebowen Hu Shouju Wang Kaiqiang Song Fei Liu Hamed Zamani Xiaoyang Wang
编码代理 上下文管理 规划 行动空间 实验研究

核心发现

方法论

本文提出了一种固定执行循环的轻量级编码框架,通过改变规划、行动空间和上下文管理三个组件来进行比较。使用SWE-Bench Verified和Terminal-Bench 2.1进行实验,评估了176种设置。

关键结果

  • 上下文管理在上下文窗口预算紧张时最有效,能防止上下文溢出失败,成功率提高约35%。
  • 规划对弱模型是准确性支架,对强模型则是成本节约工具,准确性变化不大。
  • 预定义工具提高了弱bash能力模型的性能,而bash能力强的模型在命令行任务中成本显著降低。

研究意义

研究揭示了编码框架中各组件的独立效用,为未来的框架设计提供了模块化评估框架。上下文管理策略的效率对模型和预算有重要影响,提供了防止上下文溢出失败的解决方案。

技术贡献

本文在SOTA方法上进行了改进,通过模块化设计实现了对各组件的独立评估,提出了新的上下文管理策略,提供了新的工程可能性。

新颖性

首次在固定执行循环的框架中系统地比较了规划、行动空间和上下文管理的效用,提供了模块化评估方法。

局限性

  • 上下文管理策略在宽松的上下文窗口预算下效果减弱,准确性收益减少。
  • 规划组件对强模型的成本节约效果有限。

未来方向

未来研究可以探索更多上下文管理策略的组合,以及在不同模型和任务类型下的效用。

AI 总览摘要

自动编码代理在软件工程任务中表现出色,但现有的编码框架通常作为整体系统进行评估,无法明确各组件的效用。本文提出了一种轻量级编码框架,通过改变规划、行动空间和上下文管理三个组件来进行比较。实验显示上下文管理在上下文窗口预算紧张时最有效,能防止上下文溢出失败。规划对弱模型是准确性支架,对强模型则是成本节约工具。预定义工具提高了弱bash能力模型的性能,而bash能力强的模型在命令行任务中成本显著降低。这些发现为未来的框架设计提供了模块化评估框架,并揭示了各组件的独立效用。

深度分析

研究背景

随着大型语言模型在软件工程任务中的应用增加,编码框架成为实现自动化的关键。现有研究通常将框架作为整体系统进行评估,无法明确各组件的效用。

核心问题

现有编码框架无法明确各组件的效用,无法进行组件级别的比较,影响模型性能的优化。

核心创新

提出了一种轻量级编码框架,通过改变规划、行动空间和上下文管理三个组件来进行比较,提供了模块化评估方法。

方法详解

  • �� 固定执行循环框架
  • �� 规划组件用于维护任务进度
  • �� 行动空间决定模型意图如何转化为可执行操作
  • �� 上下文管理策略决定在有限窗口下保留哪些交互历史

实验设计

使用SWE-Bench Verified和Terminal-Bench 2.1进行实验,评估了176种设置,比较了五种上下文管理策略和四种上下文窗口预算。

结果分析

上下文管理在上下文窗口预算紧张时最有效,能防止上下文溢出失败。规划对弱模型是准确性支架,对强模型则是成本节约工具。

应用场景

可用于优化自动编码代理的框架设计,提高模型在软件工程任务中的性能。

局限与展望

上下文管理策略在宽松的上下文窗口预算下效果减弱,规划组件对强模型的成本节约效果有限。

通俗解读 非专业人士也能看懂

想象一个厨房,厨师需要在有限的空间内准备多道菜。上下文管理就像厨师合理安排食材和工具的位置,确保不会因为空间不足而无法完成任务。规划就像厨师制定的菜谱,指导每一步的操作。行动空间则是厨师的工具箱,决定如何使用工具来完成烹饪。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,需要在有限的时间内完成多个任务。上下文管理就像游戏中的背包管理,确保你不会因为物品太多而无法继续游戏。规划就像你的任务列表,指导你如何完成每个任务。行动空间则是你的技能树,决定你如何使用技能来完成任务。

术语表

上下文管理 (Context Management)

决定在有限窗口下保留哪些交互历史。

用于防止上下文溢出失败。

规划 (Planning)

维护任务进度的组件。

用于指导模型的操作。

行动空间 (Action Space)

决定模型意图如何转化为可执行操作。

影响模型的执行效率。

SWE-Bench Verified

测试库级问题解决的基准。

用于评估模型的任务成功率。

Terminal-Bench 2.1

测试终端任务完成的基准。

用于评估模型的任务成功率。

开放问题 这项研究留下的未解疑问

  • 1 如何在宽松的上下文窗口预算下提高上下文管理策略的效用?
  • 2 规划组件对强模型的成本节约效果有限,如何优化?

应用场景

近期应用

自动编码优化

通过模块化设计提高自动编码代理的性能。

远期愿景

智能软件开发

实现更加智能化的软件开发流程,减少人工干预。

原文摘要

Coding harnesses shape how autonomous coding agents translate model capabilities into long-horizon software-engineering performance, yet existing work typically evaluates harnesses as monolithic systems, leaving the effectiveness of individual components unclear. To enable component-level comparisons, we study this question with a lightweight coding harness whose execution loop is fixed while three components are varied: planning, action space, and context management. Across four models evaluated on SWE-Bench Verified and Terminal-Bench 2.1, we evaluate 176 matched settings spanning five context-management strategies, four context-window budgets, and targeted ablations of planning and action space. We find that: (1) Context management becomes increasingly valuable as the context-window budget tightens, with most of its benefit coming from preventing context-overflow failures. (2) Staging rule-based elision before LLM-based summarization provides the strongest overall efficiency among the context-management strategies, whereas making elided content recoverable adds machinery that models rarely use and yields no accuracy gain. (3) Planning shifts from an accuracy scaffold for weaker models to a cost saver for stronger models, with little change in accuracy. (4) Predefined tools improve performance for models with weaker bash proficiency, whereas bash-capable models can operate effectively with a bash-only interface and achieve substantially lower cost, especially on command-line-centric tasks. Trajectory-level analysis explains these effects: context management extends execution trajectories without substantially altering agent behavior, planning changes where trajectories stop, and the action space changes the granularity at which code is written. These findings inform model- and budget-aware harness design and provide a modular framework for evaluating future harness components.

cs.AI cs.CL cs.LG cs.SE