核心发现
方法论
采用Qwen2.5-Coder-7B-Instruct模型,提出效率与风格两维度的轨迹质量评分框架,结合16个对照实验,分析不同筛选策略、规模和消融效果。以交叉熵(CE)损失作为主要指标,验证其与首次行动生成的相关性,确保指标的代理性。实验中通过筛选不同质量等级的轨迹,评估其对模型性能的影响,特别关注数据规模变化带来的效果差异。
关键结果
- 在500轨迹规模下,数据量翻倍(500→1000)带来约12.7%的CE损失降低,而质量筛选(TopQ-Random)差异不足1%;到2000轨迹时,差异扩大至3.6%,p值为0.016,显示规模对质量筛选的影响逐渐增强。
- 误差重试率(Error-Retry Rate)作为最主要的质量子维度,其消融效果与完整指标相当,表明低重试率轨迹更能直接反映模型的状态-动作映射能力。
- 通过代理验证,CE损失与首次行动的ROUGE-L得分高度相关(Spearman ρ = -1.00),验证了使用CE作为性能指标的合理性,尤其在大规模数据条件下。
- 实验结果表明,数据规模的增加优于单纯的质量筛选,且在规模扩大时,筛选策略的效果逐步显著,提示规模敏感的质量-数量权衡关系。
研究意义
本研究揭示了在开源大模型微调中,轨迹数据的质量与数量的关系,强调数据量在性能提升中的主导作用,为代码代理的训练策略提供量化依据。提出的多维质量评分框架和代理验证方法,为未来轨迹数据筛选与模型评估提供了系统性工具,有助于推动开源模型在软件工程中的应用落地。研究结果对模型微调的效率优化和数据工程实践具有重要指导意义,尤其在资源有限的场景中,提供了可行的性能提升策略。
技术贡献
提出结合效率与风格两个维度的轨迹质量评分框架,创新性地将连续质量指标应用于多步骤轨迹筛选。采用交叉熵损失作为模型性能代理,验证其与首次行动生成的高度相关性,突破了端到端评估的统计瓶颈。系统设计16个筛选策略的对照实验,揭示数据规模对筛选效果的影响,特别强调误差重试率的关键作用。实现了在低资源条件下,通过轨迹质量调控提升模型性能的可行性,为LoRA微调提供了量化的调节手段。
新颖性
首次在代码代理轨迹数据中引入多维连续质量评分,突破传统二元筛选限制,系统性分析质量与数量的交互作用。提出基于交叉熵损失的性能代理验证机制,为模型性能评估提供新思路。通过大规模对照实验,揭示规模敏感的质量-数量权衡关系,丰富了微调数据工程的理论基础,填补了轨迹级质量控制的研究空白。
局限性
- 实验仅基于Qwen2.5-Coder-7B-Instruct模型和SWE-trajectory数据,泛化到其他模型和数据源仍需验证,存在一定局限性。
- 代理验证主要依赖CE损失与首次行动ROUGE-L的相关性,虽然高度相关,但在极端场景下可能存在偏差,需进一步验证其他性能指标。
- 规模扩展受限于计算资源,未能在≥5000轨迹规模上验证跨越式性能提升,未来需在更大规模上验证尺度效应。
未来方向
未来将扩展多模型、多数据源的验证,探索轨迹原生的质量评估指标,结合强化学习等方法优化筛选策略。计划引入格式感知的训练增强,解决工具调用JSON格式不规范的问题。同时,研究更大规模数据集的性能变化,探索质量筛选与数据增强的结合路径,为开源代码代理模型的高效微调提供更全面的理论与实践支持。
AI 总览摘要
随着大模型在软件工程中的应用日益广泛,如何高效利用有限的轨迹数据进行微调成为关键问题。传统上,模型性能依赖于数据的规模和质量,但在多步骤轨迹数据中,质量的定义与筛选尚未系统化。本研究提出一种结合效率与风格的多维质量评分框架,旨在优化LoRA微调过程中的轨迹筛选策略。通过16个对照实验,分析不同筛选策略在不同数据规模下的效果,发现数据量的增加对模型性能的提升更为显著,筛选策略的影响在规模扩大时逐渐增强。采用交叉熵损失作为性能代理,验证其与首次行动生成的高度相关性,为模型评估提供了有效工具。实验结果显示,在500到2000轨迹的规模变化中,数据量翻倍带来的性能提升远超筛选策略的贡献,提示未来应优先考虑数据规模扩展。误差重试率作为关键子维度,表现出对模型性能的显著影响,强调低重试率轨迹的重要性。这些发现不仅丰富了轨迹数据筛选的理论体系,也为开源模型的高效微调提供了实践指南。未来工作将聚焦于更大规模数据验证、多模型泛化以及格式感知训练的优化,推动代码代理技术的持续发展。整体而言,本研究为模型微调中的数据工程提供了科学依据,强调规模敏感的质量-数量权衡,为软件工程中的AI应用奠定了基础。
深度分析
研究背景
近年来,随着大规模预训练语言模型(如GPT-4、Codex)在代码生成和软件工程中的突破,研究者开始关注如何利用有限的高质量轨迹数据提升模型能力。早期工作如LIMA、DEITA强调数据质量的重要性,提出自动评分机制,但多为单轮指令或静态数据。近年来,基于轨迹的微调(如SWE-Gym、R2E-Gym)逐渐兴起,采用二元筛选(成功/失败)策略,提升模型在多步骤任务中的表现。然而,这些方法未充分考虑轨迹的连续质量变化,缺乏系统化的多维评分体系。随着开源模型的崛起,如何在有限数据中实现高效微调成为核心问题。此前研究多集中在数据规模或单一指标,缺少对多维质量因素的深入分析,也未系统验证筛选策略在不同规模下的效果差异。
核心问题
当前轨迹数据筛选多依赖二元成功/失败标记,忽视轨迹内部的质量差异,导致筛选效果有限。尤其在模型规模较小时,筛选策略对性能提升作用有限,反而数据量的增加带来更大收益。此外,缺乏有效的性能代理指标,使得筛选策略难以优化。如何在保证数据质量的同时,最大化利用有限轨迹,成为制约开源模型性能提升的瓶颈。尤其在模型端到端的评估难以统计时,缺乏可靠的性能指标限制了筛选策略的优化空间。
核心创新
本研究创新性地提出多维连续质量评分体系,结合效率(误差重试率、步骤比)与风格(动作多样性、观察利用率),突破传统二元筛选的局限。引入交叉熵(CE)损失作为模型性能的代理指标,验证其与首次行动生成的高度相关性,为筛选策略提供量化依据。通过16个对照实验系统分析不同策略在不同规模下的效果,揭示数据量对性能的主导作用,强调规模敏感的质量-数量关系。创新性地将轨迹内部的连续质量指标引入微调流程,为开源模型的高效训练提供新思路。
方法详解
- �� 采用Qwen2.5-Coder-7B-Instruct模型,结合LoRA低秩微调技术,进行轨迹数据筛选。• 提出效率(误差重试率、步骤比)和风格(动作多样性、观察利用率)两维度的质量评分框架,筛选出47.9%的已解决轨迹。• 通过Binary Gates(正确性、完整性、格式)确保轨迹质量基础,再计算子指标。• 设计16个不同筛选策略,包括随机、ResolvedOnly、TopQ、BottomQ,覆盖不同规模(500/1000/2000)。• 以交叉熵(CE)损失作为模型性能的代理指标,验证其与首次行动ROUGE-L的相关性。• 进行消融实验,分析误差重试率、动作多样性等子指标对性能的影响。• 采用三组测试集(Gold、Random、Low-Q)评估模型性能,确保指标的稳健性。
实验设计
- �� 训练数据来自SWE-trajectory,筛选后规模为500、1000、2000轨迹。• 采用交叉验证,验证CE损失与首次行动ROUGE-L的相关性,确保指标代理性。• 设计16个筛选策略,比较筛选效果,分析规模变化带来的性能差异。• 采用统一超参数(LoRA r=64,α=128,学习率2e-5)进行微调,确保实验可比性。• 评估指标包括CE损失、ROUGE-L、文件匹配率,验证筛选策略的有效性。• 通过消融分析,确认误差重试率为最关键子指标。• 在不同规模下,观察筛选策略对模型性能的影响,分析规模敏感性。
结果分析
- �� 数据量翻倍(500→1000)带来12.7%的CE损失降低,筛选策略影响较小;• 到2000轨迹时,筛选差异扩大至3.6%,p值为0.016,表明规模扩大后筛选效果逐渐显著;• 误差重试率(B2)在消融中表现出最大影响,单独使用B2指标几乎等同于完整指标;• 代理验证显示,CE损失与首次行动ROUGE-L完全相关(Spearman ρ = -1.00),验证了指标的可靠性;• 结果强调数据规模在模型性能提升中的主导作用,筛选策略在大规模条件下逐步显现优势。
应用场景
- �� 该方法适用于开源代码代理模型的微调,尤其在有限轨迹数据条件下提升模型能力。• 通过多维质量评分,可以优化数据采集与筛选流程,减少标注成本。• 未来可结合强化学习,进一步提升轨迹质量控制的精度。• 长期来看,该策略有望推动自动化软件工程工具的普及,降低开发成本,提升软件开发效率。
局限与展望
- �� 仅在Qwen2.5-Coder-7B-Instruct模型和SWE-trajectory数据集上验证,泛化性有待验证。• 代理指标主要依赖CE损失与首次行动ROUGE-L,可能在极端场景下偏离实际性能。• 规模扩展受限,未在≥5000轨迹规模上验证跨越式性能提升,未来需验证大规模效果。
通俗解读 非专业人士也能看懂
想象你在准备一份大餐,食材的质量和数量都很重要。质量好的食材能让菜更美味,但如果食材太少,即使很挑剔也做不出丰盛的菜肴。相反,增加食材的数量,菜肻也会变得更丰富。这个研究就像在厨房里试验:他们用一种方法,评估每一份轨迹(就像食材)是否优质,考虑两个方面:一是做菜的效率(用少少的步骤做出好菜),二是菜的风格(味道多样、搭配合理)。他们发现,增加食材(数据量)比单纯挑选“好食材”更能提升菜的整体水平。通过不断试验,验证了在有限的食材下,如何筛选出最有用的,最终让菜变得更好吃。这就像在软件工程中,用少量高质量的轨迹训练模型,效果比只挑“优质”轨迹更明显。
原文摘要
Supervised fine-tuning (SFT) of open-weight LLMs on expert agent trajectories has emerged as a prominent approach to building capable code agents without reliance on proprietary models. A central yet underexplored question is how trajectory quality and quantity jointly shape model performance. We present a systematic empirical study of trajectory data filtering for LoRA fine-tuning of Qwen2.5-Coder-7B-Instruct on the SWE-trajectory dataset (67,074 trajectories, of which 32,161 are resolved). We propose a two-axis quality scoring framework -- Efficiency and Style -- and evaluate it through 16 controlled experiments spanning strategy, scale, and ablation analyses. Since 7B-scale models attain near-zero SWE-bench resolve rates, we adopt cross-entropy (CE) loss on held-out trajectories as the primary metric, validated via first-action generation: CE loss and ROUGE-L are perfectly rank-correlated (Spearman $ρ$ = -1.00), with limited-sample evidence supporting but not conclusively establishing this proxy. Our results reveal a scale-dependent quality-quantity trade-off: at small scales, doubling the dataset (500 to 1,000) yields ~12.7% CE-loss reduction whereas the TopQ-Random gap stays <1% (Mann-Whitney p > 0.10); at 2,000 trajectories this same gap widens to 3.6% (p = 0.016). Ablation further identifies error-retry rate as the dominant sub-dimension, performing comparably to the full composite ($Δ$ < 0.2%). Together, these findings establish trajectory-level quality scoring as a viable but scale-sensitive lever for code-agent SFT and offer a proxy-validated evaluation protocol for the regime where end-to-end resolve rate is statistically infeasible.