On the Impact of AGENTS.md Files on the Efficiency of AI Coding Agents

TL;DR

本研究分析AGENTS.md文件对AI编码代理在GitHub拉取请求中的运行时间和Token消耗的影响,结果显示有文件时效率提升明显。

cs.SE 🔴 高级 2026-01-28 38 次浏览
Jai Lal Lulla Seyedmoein Mohsenimofidi Matthias Galster Jie M. Zhang Sebastian Baltes Christoph Treude
AI编码代理 AGENTS.md 软件开发效率 GitHub 资源优化

核心发现

方法论

采用实证研究方法,分析10个开源仓库中的124个拉取请求,比较有无AGENTS.md文件条件下的代理运行表现。使用OpenAI Codex模型,控制任务、仓库状态一致,测量墙钟时间和Token消耗。通过Paired设计确保变量一致,采用Wilcoxon符号秩检验验证差异显著性。筛选内容涵盖项目描述、架构和规范,确保AGENTS.md内容相关性。实验在Docker环境中隔离执行,确保可重复性。对输出质量进行随机抽样验证,确保效率指标不受任务失败影响。

关键结果

  • 有AGENTS.md文件时,平均Token消耗从5744.81降至4591.46,减少约20.08%;中位数下降至2480,减少16.58%。墙钟时间由162.94秒降至129.91秒,减少约20.27%,中位数由98.57秒降至70.34秒,减少28.64%。
  • 在资源使用方面,输出Token和时间均显著减少,表明AGENTS.md文件能有效引导代理更高效地完成任务。实验结果在统计学上显著(p<0.05),验证了效果的稳健性。
  • 内容筛选显示,AGENTS.md文件中关于项目结构和规范的内容对效率提升起关键作用,减少了探索和推理的时间成本。

研究意义

本研究首次系统性量化了仓库级指令文件对AI编码代理性能的影响,为软件工程中智能代理的优化提供实证依据。结果表明,合理设计和维护AGENTS.md文件能显著降低开发成本,提高自动化水平,有助于推动AI在持续集成和自动化开发中的应用。研究强调了仓库配置在智能开发流程中的重要性,为未来智能开发工具的标准化和智能化提供理论基础。

技术贡献

提出了基于仓库内容的效率评估框架,结合Paired设计和统计检验,系统验证AGENTS.md文件对AI编码代理的正向影响。创新点在于引入内容筛选机制确保内容相关性,结合多指标(Token和时间)量化效率变化。为未来多模型、多任务场景的效率优化提供了实验基础,推动了仓库级指令文件的标准化应用。

新颖性

首次系统性实证验证了仓库级AGENTS.md文件对AI编码代理效率的影响,突破了以往仅关注模型性能或任务成功率的研究局限。不同于传统的prompt工程,本研究强调配置文件的持久性和可维护性,提出内容筛选机制,彰显仓库配置在智能开发中的关键作用。

局限性

  • 样本规模有限,仅涵盖10个仓库和124个PR,未来需扩大样本多样性以验证普适性。
  • 实验仅使用OpenAI Codex模型,其他模型和代理架构的效果尚未验证,模型差异可能影响结果。
  • 效率指标主要集中在Token和时间,未深入评估输出质量和正确性,未来应结合功能性评估。

未来方向

未来将扩展多模型、多任务场景,验证AGENTS.md内容的影响范围。计划引入内容丰富度和结构复杂度指标,分析不同内容特性对效率的影响。同时结合输出正确性和功能性评价,完善效率与质量的平衡机制。探索自动生成和优化AGENTS.md的技术,推动智能配置的标准化,为工业界提供实用指南。

AI 总览摘要

随着AI编码代理在软件开发中的广泛应用,理解其行为影响因素尤为重要。本研究聚焦于仓库级配置文件AGENTS.md对代理效率的影响,采用实证方法,分析了10个开源仓库中的124个拉取请求。在控制任务和仓库状态一致的条件下,比较了有无AGENTS.md文件的代理表现。结果显示,存在AGENTS.md文件时,代理的平均Token消耗降低20%,墙钟时间缩短20%以上,表明配置文件能显著提升代理效率。这一发现强调了仓库配置在自动化开发中的关键作用,为未来智能开发工具的设计提供了理论基础。研究还指出,内容中关于项目结构和规范的描述对效率提升起到核心作用。未来工作将拓展样本规模,结合输出质量评估,探索内容特性与效率的关系,推动智能配置的标准化和工业应用。整体而言,本研究为优化AI编码代理的配置策略提供了实证依据,助力软件开发流程的智能化升级。

深度分析

研究背景

近年来,AI编码代理如OpenAI Codex和Claude在软件开发中扮演着越来越重要的角色,支持代码生成、调试和审查。早期研究主要关注模型性能和任务成功率,缺乏对仓库配置文件影响的系统性分析。随着AGENTS.md等仓库级指令文件的出现,开发者开始利用其描述项目结构、规范和操作流程,以提升代理的效率和一致性。已有研究表明,这些文件在功能指导和行为塑造中具有重要作用,但缺乏实证数据支持其在实际开发中的具体效果。本研究弥补了这一空白,首次量化AGENTS.md对代理运行时间和Token消耗的影响,为智能开发流程的优化提供依据。

核心问题

尽管仓库配置文件被广泛采用,但其对AI编码代理性能的具体影响尚未明确。开发者面临的核心问题是如何设计和维护有效的配置文件,以提升自动化效率,降低资源消耗。缺乏实证数据使得配置优化缺乏科学依据,限制了其在工业界的推广。解决这一问题需要系统性研究不同配置内容对代理行为的影响机制,明确哪些内容能带来最大效率提升,从而指导实践中的配置策略。

核心创新

本研究的创新点在于:1)引入内容筛选机制,确保AGENTS.md内容与项目结构和规范高度相关;2)采用Paired设计,控制任务和仓库状态,确保结果的可靠性;3)结合Token和时间指标,量化配置文件对效率的影响。这些创新使得研究结果具有较强的实证性和指导性,为仓库配置优化提供了科学依据。不同于传统模型优化方法,本研究强调配置文件的持久性和内容结构,推动了配置管理在智能开发中的应用创新。

方法详解

  • �� 选择OpenAI Codex模型,确保模型版本一致。• 从已有仓库样本中筛选符合条件的仓库,确保每个仓库仅含一个根目录AGENTS.md文件。• 利用内容分类体系筛选内容,确保文件涵盖项目描述、架构和规范。• 从每个仓库随机抽取符合条件的已合并PR,确保PR规模小(≤100行变动,≤5文件)。• 在仓库历史状态下,模拟PR前状态,提取对应AGENTS.md内容。• 生成标准化任务描述,确保输入一致性。• 在Docker环境中,分别运行有无AGENTS.md的两组实验,控制变量,测量Token和时间。• 采样输出,验证任务完成情况,确保效率指标反映真实表现。

实验设计

实验在真实GitHub仓库中进行,采用随机抽样的10个仓库,每个仓库15个PR。每个PR在相同仓库状态下,分别运行有无AGENTS.md条件。指标包括Token总数和墙钟时间,统计学检验确保差异显著。通过内容筛选确保AGENTS.md内容相关性,控制任务复杂度,避免大规模变更干扰。多次重复实验,确保数据的稳定性和可靠性。实验还包括输出质量的随机抽样验证,确保效率提升不是由任务失败或无效输出驱动。

结果分析

实验结果显示,AGENTS.md文件的存在显著降低Token消耗和时间成本。平均Token使用从5744.81降至4591.46,减少约20%;墙钟时间由162.94秒降至129.91秒,减少约20%。中位数变化也支持这一结论,说明效率提升具有普遍性。这些数据验证了配置文件在引导代理行为、减少探索和推理时间方面的作用,为自动化开发提供了实证依据。

应用场景

该研究结果可指导开源项目和企业在配置AI编码代理时,优先设计和维护AGENTS.md文件,以提升自动化效率。适用场景包括持续集成、自动修复和代码审查等。未来,结合内容丰富度和结构优化,将进一步推动智能开发工具的标准化和工业化应用,降低开发成本,加快软件交付速度。

局限与展望

本研究样本有限,未来需扩大规模验证普适性。模型仅使用Codex,其他模型表现尚未验证。效率指标主要集中在Token和时间,未充分评估输出正确性和维护性。内容筛选依赖人工和模型分类,可能存在偏差。未来应结合多模型、多任务、多指标的综合评估,完善配置文件设计指南。

通俗解读 非专业人士也能看懂

想象一个工厂里生产不同的产品。工厂有一份详细的操作手册(就像AGENTS.md文件),告诉工人们如何组装、检验和包装产品。有了这份手册,工人们可以更快、更准确地完成工作,不用每次都自己摸索流程。没有手册时,工人可能需要花更多时间试错,甚至做错,导致生产变慢,浪费资源。这个研究发现,给AI编码代理提供类似的“操作手册”能让它们更高效地完成任务,减少不必要的计算和等待时间,就像工厂里有了详细的操作指南一样。这样,软件开发就能变得更快、更省钱,也更可靠。

简单解释 像给14岁少年讲一样

想象你在厨房里做饭。平时你可能会随意放调料,试试味道,但这样可能会浪费时间,也做不好菜。有时候,厨师会用一本菜谱,告诉你用什么材料、怎么做。这个菜谱就像论文中的AGENTS.md文件,给AI提供了详细的做饭指南。有了菜谱,你可以更快做出好菜,不会浪费食材,也不用反复试错。研究发现,给AI“菜谱”后,它们在做饭(写代码)时会用更少的调料(Token)和花更少的时间(墙钟时间),效率大大提高。就像有了好菜谱,厨房变得更顺畅,做饭也变得更轻松。

原文摘要

AI coding agents such as Codex and Claude Code are increasingly used to autonomously contribute to software repositories. However, little is known about how repository-level configuration artifacts affect operational efficiency of the agents. In this paper, we study the impact of AGENTS$.$md files on the runtime and token consumption of AI coding agents operating on GitHub pull requests. We analyze 10 repositories and 124 pull requests, executing agents under two conditions: with and without an AGENTS$.$md file. We measure wall-clock execution time and token usage during agent execution. Our results show that the presence of AGENTS$.$md is associated with a lower median runtime ($Δ28.64$%) and reduced output token consumption ($Δ16.58$%), while maintaining a comparable task completion behavior. Based on these results, we discuss immediate implications for the configuration and deployment of AI coding agents in practice, and outline a broader research agenda on the role of repository-level instructions in shaping the behavior, efficiency, and integration of AI coding agents in software development workflows.

cs.SE cs.AI cs.ET cs.HC