Imitation Learning for Multi-turn LM Agents via On-policy Expert Corrections

TL;DR

提出基于On-policy专家校正的多轮语言模型训练方法,有效缓解协变量偏移,提升软件工程任务表现。

cs.LG 🔴 高级 2025-12-17 45 次浏览
Niklas Lauffer Xiang Deng Srivatsa Kundurthy Brad Kenstler Jeff Da
模仿学习 多轮对话 协变量偏移 强化学习 软件工程

核心发现

方法论

本文借鉴DAgger算法思想,提出On-policy专家校正(OEC)方法,通过在学生模型生成的轨迹中间切换到专家模型,结合拒绝采样和监督微调,有效缓解多轮LM代理中的协变量偏移问题。具体实现包括随机切换点、轨迹重写和奖励过滤,兼顾模型自主性与专家指导,增强训练数据的代表性和多样性。

关键结果

  • 在软件工程任务中的SWE-bench验证中,7B和32B模型的OEC轨迹分别比传统模仿学习提升了14%和13%的解决率,达到了更优的样本效率和泛化能力。实验显示,结合拒绝采样和轨迹过滤的微调策略,有助于提升模型在复杂多轮交互中的表现,显著优于纯行为克隆和全自主轨迹。
  • 多轮轨迹的对比实验中,纯自主轨迹甚至导致性能下降,而OEC结合专家指导的轨迹能有效缓解此问题,尤其在高参数模型中表现突出。 Ablation研究表明,轨迹过滤和专家切换策略是性能提升的关键因素。
  • 通过embedding分析,轨迹中的协变量偏移逐步加剧,OEC策略能在一定程度上缓解这一趋势,确保模型在不同状态空间中的鲁棒性。

研究意义

该研究突破了多轮LM代理训练中协变量偏移的瓶颈,为实现更高效、更稳健的自动化软件开发工具提供了理论基础和实践方案。结合专家示范与在线数据,显著提升了模型在实际复杂任务中的适应性和解决能力,推动了AI在软件工程等多轮交互场景的应用落地。

技术贡献

提出结合轨迹中途切换专家模型的OEC方法,创新性地融合了基于拒绝采样的监督微调与多轮交互的在线数据生成机制。该方法突破了传统模仿学习对轨迹全自主的限制,兼具样本效率和泛化能力,为多轮LM训练提供了新的技术路径。实验验证了其在不同参数规模模型中的优越性能,具有较强的推广潜力。

新颖性

首次将DAgger思想应用于大规模多轮语言模型训练中,提出部分轨迹中途切换专家模型的创新机制,有效缓解协变量偏移问题。与传统行为克隆和纯自主轨迹相比,该方法在多轮任务中表现出明显优势,填补了多轮对话和软件工程任务中协变量偏移的研究空白。

局限性

  • 当前方法依赖于高质量的专家模型,训练成本较高,且在极端复杂任务中仍存在轨迹偏离和性能下降的风险。
  • 轨迹过滤策略虽能减少重复和低质量轨迹,但可能导致样本偏差,影响模型的泛化能力。
  • 在极大规模模型或多模态任务中,OEC的效果和效率仍需进一步验证。

未来方向

未来将探索多模态、多任务场景中的OEC扩展,结合强化学习奖励信号优化轨迹采样策略,提升模型在更复杂环境中的适应性。同时,研究更高效的专家模型训练与轨迹筛选机制,降低成本,增强系统的实用性和可扩展性。

AI 总览摘要

近年来,基于模仿学习的多轮语言模型(LM)训练在自动化软件开发、工具调用和推理任务中取得显著进展。然而,传统的离策略训练方式面临协变量偏移问题,即模型偏离专家轨迹后,遇到未在训练数据中出现的状态,导致性能下降。本文借鉴DAgger算法思想,提出一种创新的On-policy专家校正(OEC)方法,通过在轨迹中途切换到专家模型,结合拒绝采样和监督微调,有效缓解了多轮交互中的偏移问题。实验在软件工程任务中的SWE-bench验证了该方法的优越性,7B和32B模型的解决率分别比传统模仿学习提升了14%和13%。这种结合专家示范与在线数据的策略,不仅提升了模型的泛化能力,也为多轮对话和复杂任务的自动化提供了新的技术路径。研究强调,单纯依赖自主轨迹或专家轨迹都存在局限,OEC的引入实现了两者的有效融合,推动了多轮LM代理的稳健训练。未来,结合多模态数据和强化学习奖励,将进一步拓展该方法的应用范围,解决更复杂的实际问题。

深度分析

研究背景

多轮对话和任务导向的语言模型(LM)近年来成为人工智能研究的热点,尤其在软件工程、工具调用和推理任务中展现出巨大潜力。早期工作如Hinton的知识蒸馏(2015)和行为克隆(1988)奠定了基础,但在多轮交互中,模型易陷入偏差累积,导致性能退化。近年来,强化学习(如Gao et al., 2024)和拒绝采样(Zhang et al., 2023)被引入以改善训练效果。然而,协变量偏移仍是瓶颈,限制模型在实际复杂场景中的应用。

核心问题

多轮LM训练中,模型偏离专家轨迹后,遇到未见状态,导致性能下降。传统模仿学习依赖离策略数据,难以应对状态空间的动态变化,特别在软件工程等复杂任务中表现尤为明显。如何在保证样本效率的同时,缓解偏移,提升模型鲁棒性,成为亟待解决的问题。

核心创新

本文提出OEC方法,结合DAgger思想,允许在轨迹中途切换到专家模型,生成更具代表性的训练数据。创新点包括:1)随机切换点,覆盖多样状态;2)轨迹重写,确保一致性;3)结合拒绝采样,利用环境奖励筛选高质量轨迹。这一机制突破了传统全自主或全专家轨迹的限制,为多轮训练提供了新思路。

方法详解

  • �� 轨迹生成:以学生模型开始,随机在中途切换到专家模型,形成部分自主、部分专家指导的轨迹。• 轨迹重写:在切换后,重写历史上下文,确保模型输入格式一致。• 数据过滤:利用环境奖励(如单元测试)筛选高质量轨迹,剔除低效或偏差轨迹。• 微调策略:只在专家部分进行微调,避免模型陷入重复行为。• 结合拒绝采样:利用环境反馈动态调整训练样本,提升样本质量。• 重复过滤:检测并剔除重复或低质量轨迹,确保训练多样性。

实验设计

采用SWE-bench中的软件工程任务,比较OEC、行为克隆和纯自主轨迹的性能。模型包括7B和32B参数规模,使用不同的专家模型(如Claude-3.7-Sonnet)进行轨迹采样。通过不同轨迹数量和过滤策略,评估模型在解决率、泛化能力和样本效率上的差异。实验还包括轨迹偏移分析和 ablation 研究,验证轨迹过滤和切换策略的重要性。

结果分析

OEC在7B和32B模型中,解决率分别比传统模仿学习提升14%和13%,在软件工程任务中表现优越。结合拒绝采样和轨迹过滤,显著减少偏差,增强模型鲁棒性。纯自主轨迹反而导致性能下降,验证了专家指导的重要性。embedding分析显示,OEC能缓解轨迹中的协变量偏移,提升模型在不同状态空间中的适应性。

应用场景

该方法适用于自动化软件调试、多轮交互系统、工具调用等场景。通过结合专家示范和环境奖励,提升模型在复杂任务中的表现,降低人工标注成本。未来可扩展到多模态、多任务环境,推动AI在工业界的广泛应用。

局限与展望

依赖高质量专家模型,训练成本较高,且在极端复杂或多模态任务中效果仍需验证。此外,轨迹过滤可能引入偏差,影响模型泛化。未来需优化专家模型训练和轨迹筛选机制,降低成本,提升鲁棒性。

通俗解读 非专业人士也能看懂

想象你在教一个学生做一道复杂的菜。传统方法是让学生自己尝试,出错后再由老师指导。这种方式容易让学生偏离正确路径,尤其在多步骤操作中,错误会不断累积,最后菜可能做不好。本文提出一种新方法,像是在学生尝试到一半时,老师突然接手,帮忙纠正错误,然后让学生继续。这样既让学生学会自主操作,又能确保菜的质量。通过在关键时刻插入老师的指导,避免了偏离正确步骤的问题。这就像是在学习过程中,既有自主探索,也有专家随时指导,最终能做出更好、更稳的菜。

原文摘要

A popular paradigm for training LM agents relies on imitation learning, fine-tuning on expert trajectories. However, we show that the off-policy nature of imitation learning for multi-turn LM agents suffers from the fundamental limitation known as covariate shift: as the student policy's behavior diverges from the expert's, it encounters states not present in the training data, reducing the effectiveness of fine-tuning. Taking inspiration from the classic DAgger algorithm, we propose a novel data generation methodology for addressing covariate shift for multi-turn LLM training. We introduce on-policy expert corrections (OECs), partially on-policy data generated by starting rollouts with a student model and then switching to an expert model part way through the trajectory. We explore the effectiveness of our data generation technique in the domain of software engineering (SWE) tasks, a multi-turn setting where LLM agents must interact with a development environment to fix software bugs. Our experiments compare OEC data against various other on-policy and imitation learning approaches on SWE agent problems and train models using a common rejection sampling (i.e., using environment reward) combined with supervised fine-tuning technique. Experiments find that OEC trajectories show a relative 14% and 13% improvement over traditional imitation learning in the 7b and 32b setting, respectively, on SWE-bench verified. Our results demonstrate the need for combining expert demonstrations with on-policy data for effective multi-turn LM agent training.

cs.LG cs.AI