Efficient SWE Agent Benchmarking via Trajectory-Aware Evaluation

TL;DR

提出PTA-IRT,通过轨迹信息提升软件工程代理评估效率,低预算下优于传统IRT。

cs.SE 🔴 高级 2026-09-02 95 次浏览
Kefeng Duan Dewu Zheng Yanlin Wang Xiwen Wang Ensheng Shi Xilin Liu Yuchi Ma Jiachi Chen Mingwei Liu Zibin Zheng
软件工程 评估方法 深度学习 项目响应理论 轨迹分析

核心发现

方法论

PTA-IRT结合历史执行轨迹作为特权信息,利用结构化摘要压缩长文本轨迹,构建轨迹感知的4参数逻辑模型。通过信息熵和Fisher信息选择代表性任务子集,采用LUPI机制将轨迹信息迁移到能力估计中。模型包括轨迹解析、任务选择和能力推断三个阶段,显著提升低预算条件下的性能恢复能力。

关键结果

  • 在四个SWE基准测试中,10%校准预算下PTA-IRT平均MAE为0.041,排名相关指标τ达0.888,ρ达0.973,优于所有对比方法。在Lite和Verified数据集上表现尤为突出,平均MAE降低20%以上,排名指标提升15%以上。 Ablation分析显示轨迹摘要和信息选择机制是性能提升的关键因素。
  • 在预算敏感性分析中,5%预算已实现τ值0.768,显示出极强的鲁棒性。与传统IRT和深度IRT相比,PTA-IRT在极低预算下仍保持优越性能,验证其在实际场景中的应用潜力。
  • 消融实验表明,去除轨迹摘要或信息选择机制会导致MAE上升约30%,排名指标下降20%,说明轨迹信息的引入显著改善了模型的预测能力。

研究意义

该研究解决了软件工程代理评估成本高昂的问题,提出轨迹感知的评估框架,有效利用过程信息,显著降低评估成本,提升低预算下的性能估计准确率。为大规模软件工程自动化评估提供了理论基础和实践工具,推动智能代理在实际开发中的应用落地。该方法结合深度学习与统计模型,为未来软件工程自动化评估提供了新思路,有望在代码生成、缺陷检测等场景中广泛应用。

技术贡献

创新点在于引入轨迹作为特权信息,结合4参数逻辑模型和信息熵策略实现任务选择,采用LUPI机制进行能力迁移。模型结构融合深度学习与统计IRT,提升复杂场景下的适应性。提出轨迹压缩与结构化摘要方法,有效提取过程信号,增强模型的解释能力。该框架在低预算条件下实现高效、准确的性能估计,突破了传统二元响应限制,拓展了IRT在软件工程中的应用边界。

新颖性

首次将轨迹信息作为特权信号引入IRT模型,结合结构化摘要和信息熵策略实现任务选择与能力估计,显著优于仅用结果的传统方法。该方法突破了以往只关注最终结果的局限,强调过程信号在评估中的价值,开创了软件工程代理评估的新范式。

局限性

  • 模型依赖轨迹摘要的质量,若轨迹信息噪声大或不完整,可能影响性能。
  • 在极端复杂或长时间轨迹中,摘要压缩可能丢失关键信息,影响能力估计。
  • 当前方法主要在模拟环境验证,实际工业场景中还需考虑系统复杂性和实时性问题。

未来方向

未来将探索多模态轨迹融合,提升摘要的表达能力;优化轨迹解析算法以适应更复杂的场景;结合强化学习实现动态任务选择;扩展到多任务、多代理环境中的性能评估,推动工业级应用落地。

AI 总览摘要

随着大规模语言模型在软件工程中的广泛应用,评估其性能成为一大挑战。传统方法依赖大量资源进行多轮代码探索和测试,成本高昂且效率低下。为应对这一难题,本文提出PTA-IRT框架,通过引入历史执行轨迹作为特权信息,有效提升低预算条件下的评估准确性。该方法将长文本轨迹压缩为结构化摘要,结合信息熵和Fisher信息进行任务选择,利用LUPI机制将轨迹信号迁移到能力估计中。实验结果显示,在四个不同的SWE基准测试中,10%校准预算下,PTA-IRT的平均MAE为0.041,排名指标τ达0.888,显著优于传统IRT和深度IRT。特别是在极低预算(5%)下,仍能保持良好的排名一致性,验证其鲁棒性。 Ablation分析表明,轨迹摘要和信息选择机制是模型性能提升的关键因素。该研究不仅降低了软件工程代理评估的成本,也为未来自动化评估提供了新思路。未来工作将聚焦多模态轨迹融合、系统复杂性适应和工业应用推广,推动软件工程智能化发展。

深度分析

研究背景

近年来,随着大规模语言模型(如GPT-4、Codex)在代码生成、缺陷检测等任务中的突破,软件工程自动化评估成为研究热点。传统评估多依赖单轮测试或静态指标,成本高且难以反映复杂多步骤的解决过程。近年来,项目响应理论(IRT)被引入,用于通过少量代表性任务估算模型能力,但多局限于二元结果,忽略了过程信息。深度IRT和PSN-IRT等模型引入神经网络增强表达,但仍未充分利用长轨迹中的过程信号。现有基准如SWE-bench面临高成本和低效率的问题,亟需更智能的评估策略。

核心问题

软件工程代理在真实环境中的表现评估成本极高,尤其是在需要多步骤探索、修改和测试的复杂任务中。传统方法依赖大量任务执行,资源消耗巨大,难以实现大规模评估。现有的IRT方法只关注最终结果,忽略了过程中的关键线索,如探索路径、编辑尝试等。这导致在低预算条件下难以准确估算模型能力,影响模型的实际应用推广。如何在有限资源下,利用过程信息提升评估效率,成为亟待解决的核心问题。

核心创新

本研究提出轨迹感知的IRT(PTA-IRT),引入结构化轨迹摘要作为特权信息,结合信息熵和Fisher信息实现任务选择。创新点包括:1)利用长轨迹压缩提取过程信号,增强模型的解释能力;2)引入轨迹感知的4参数逻辑模型,提升任务难度估计的准确性;3)采用LUPI机制,将轨迹信息迁移到能力估计中,显著改善低预算下的性能恢复。该框架融合深度学习与统计模型,突破传统二元响应限制,提升评估效率。

方法详解

  • �� 轨迹解析:将长文本轨迹转化为结构化摘要,包括任务目标、探索内容、编辑路径和解决方案路径。• 任务选择:基于轨迹感知的4PL模型,利用Fisher信息和信息熵对任务进行难度和信息量评估,形成代表性子集。• 能力估计:在训练阶段,利用轨迹摘要训练教师模型,将过程信号迁移到学生模型;在测试阶段,只用有限任务的响应估算模型整体能力。• 结构化摘要:采用深度学习模型(如MiniLM)提取摘要特征,增强轨迹信息的表达。• 任务筛选:通过信息量最大化策略,确保子集覆盖不同难度区间,提升估算精度。

实验设计

在四个SWE基准(Lite、Verified、Full、Pro)上进行验证,比较多种IRT变体和AutoJudger。采用10%预算进行任务选择,评估指标包括MAE、Kendall’s τ和Spearman’s ρ。通过交叉验证确保结果稳健,调优模型参数。 Ablation研究验证轨迹摘要和信息选择机制的重要性。结果显示,PTA-IRT在低预算下优于所有对比方法,尤其在排名一致性和分数恢复方面表现突出。

结果分析

在四个基准中,PTA-IRT平均MAE为0.041,排名指标τ达0.888,明显优于传统IRT(MAE约0.171,τ约0.528)和深度IRT。5%预算已实现τ值0.768,显示出极强鲁棒性。消融实验表明,去除轨迹摘要或信息选择机制会导致性能下降约30%。此外,轨迹摘要的引入显著改善了模型对复杂任务的适应能力,验证了其在实际场景中的潜力。

应用场景

该方法适用于大规模软件工程自动化评估、代码生成模型能力排序、缺陷检测系统性能监控等场景。只需少量代表性任务,即可准确估算模型整体表现,节省大量计算资源。未来可结合工业环境中的持续集成流程,实现实时性能监控和模型优化,推动自动化开发工具的普及。

局限与展望

模型依赖轨迹摘要的质量,若轨迹信息噪声大或不完整,可能影响估算效果。复杂或长时间轨迹的摘要可能丢失关键信息,影响能力推断。当前方法主要在模拟环境验证,实际工业场景中还需考虑系统复杂性、实时性和多模态信息融合等因素。未来需优化轨迹解析和摘要生成算法,提升鲁棒性和适应性。

通俗解读 非专业人士也能看懂

想象你在一家工厂工作,工厂里每个工人(模型)都要完成一项任务,比如组装产品。传统评估就像只看工人最后是否成功(成功或失败),但实际上工人在过程中会经历很多步骤,比如试错、调整、学习。现在,研究者发现,如果能记录工人在每一步的行动(轨迹),就像看工人在工厂里的每个动作一样,就能更好地判断他们的能力。这个方法就像教练不仅看比赛结果,还观察比赛中的每个动作,帮助更准确地评估工人的水平。这样,即使只观察一部分比赛,也能知道工人整体水平,节省时间和成本。

简单解释 像给14岁少年讲一样

想象你在玩一款游戏,你的朋友想知道你到底多厉害,但又不想看你每次玩完整个游戏。于是,你们决定只看你玩了哪个关卡、怎么过的、用了哪些技巧。通过这些细节,朋友可以大概知道你整体的水平,而不用看你每次打完所有关卡。这个研究就是用类似的方法,只看软件模型在一些任务中的表现,但还结合了它在过程中做了什么、试了哪些方法,来更准确地估算它的整体能力。这样既省时间,又能得到更靠谱的评估结果。

原文摘要

Evaluating software engineering agents on realistic benchmarks is costly, since each task may require multi-step code exploration, modification, and test execution. Existing efficient evaluation methods select representative subsets to estimate full-benchmark performance, but are largely result-only: they fit historical pass/fail response matrices or static task semantics, discarding how agents solve problems. We propose PTA-IRT, a Privileged Trajectory-Aware Item Response Theory framework that fuses process and outcome signals. Historical execution trajectories supply process-level evidence beyond pass/fail, such as explored context, attempted edits, and solving paths, which PTA-IRT uses as privileged information for calibration subset selection and ability estimation. Under low calibration budgets, PTA-IRT consistently outperforms prior IRT baselines on score and ranking recovery across four SWE benchmarks. Code and data are publicly available at https://github.com/DeepSoftwareAnalytics/PTA-IRT.

cs.SE cs.AI cs.CL