Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories

TL;DR

提出Agentic-DPO,通过专家轨迹实现无环境交互的偏好引导强化训练,显著提升模型性能。

cs.AI 🔴 高级 2026-07-12 40 次浏览
Yixiong Chen Alan Yuille
强化学习 偏好学习 离线训练 策略优化 大模型

核心发现

方法论

Agentic-DPO基于偏好对比,结合专家轨迹和样本采样,利用DPO风格的目标函数在离线环境中优化策略。核心包括:• 采样专家轨迹中的状态和动作,• 从当前模型采样一阶动作作为负样本,• 通过多视角的Schema渲染(PPA)增强稳定性,• 结合SFT锚点确保格式一致,• 采用对比偏好损失引导模型偏好专家动作,• 无需环境交互或奖励模型,纯离线优化。

关键结果

  • 在StableToolBench上,9B模型的准确率由SFT的21.7%提升至41.4%,超越在线GRPO的40.0%,仅用步骤级采样,无环境交互。
  • 在τ-bench零售任务中,Qwen3.5-9B模型通过Agentic-DPO达成41.4%的成功率,显著优于纯SFT和其他偏好方法,验证其低成本高效性。
  • 在Mind2Web任务中,Agentic-DPO提升平均步骤成功率至64.4%,表现出优异的跨任务和跨域泛化能力。

研究意义

该方法突破了传统行为克隆的局限,利用专家轨迹实现低成本的策略优化,避免昂贵的环境交互和奖励模型训练,为大规模离线强化学习提供新思路,推动LLM智能体在复杂任务中的应用落地,具有重要的学术和工业价值。

技术贡献

引入状态条件偏好对比机制,结合Schema多视角增强稳定性,提出无环境交互的离线策略优化框架。创新点包括:• 设计偏好对比损失,• PPA增强模型鲁棒性,• 结合SFT锚点确保格式稳定,• 实现无需全轨迹探索的高效训练,显著优于现有偏好和强化学习方法。

新颖性

首次提出将专家轨迹转化为状态条件偏好信号,结合Schema多视角增强偏好学习的离线策略优化框架,突破了传统行为模仿的限制,显著提升模型性能和泛化能力。

局限性

  • 对专家轨迹质量依赖较高,若轨迹存在偏差,模型性能可能受影响。
  • 未充分探索多任务或多模态场景的适应性,未来需扩展到更复杂环境。
  • 训练过程中参数调优复杂,模型对Schema渲染的敏感性仍需进一步研究。

未来方向

未来将结合多模态信息和更复杂的Schema变换,提升模型对多样任务的适应性。探索多任务、多域的偏好引导策略,结合在线微调和人类反馈,进一步增强模型的鲁棒性和泛化能力。

AI 总览摘要

在大规模语言模型(LLM)应用中,训练具有自主决策能力的智能体一直是核心挑战。传统的监督微调(SFT)通过模仿专家轨迹,虽低成本且稳定,但仅能复制动作序列,难以应对复杂环境中的错误决策。为突破这一瓶颈,本文提出Agentic-DPO,一种基于偏好对比的离线策略优化方法,将专家轨迹转化为状态条件偏好信号,无需环境交互或奖励模型。该方法通过在每个专家状态采样模型动作,将可能的错误动作作为负样本,利用偏好损失引导模型偏好专家动作。引入Schema多视角增强(PPA)机制,确保偏好学习的稳定性和鲁棒性。实验结果显示,Agentic-DPO在多个任务和模型规模上均优于传统SFT和其他偏好方法,显著提升模型性能。例如,在9B模型的StableToolBench中,准确率由21.7%提升至41.4%,在τ-bench零售任务中达成41.4%的成功率,优于在线强化学习方法。该研究证明,专家轨迹经过适当转化后,可成为低成本高效的策略优化资源,为未来大规模离线强化学习提供新思路。整体而言,Agentic-DPO实现了在无需昂贵环境交互的情况下,显著提升LLM智能体的决策能力,具有广泛的应用潜力和深远的学术意义。

深度分析

研究背景

近年来,大规模语言模型(LLMs)在多任务、多模态场景中展现出强大能力。传统训练方法多依赖行为克隆(behavior cloning)或监督微调(SFT),通过模仿专家轨迹实现策略学习,但存在泛化差、对抗错误能力不足的问题。强化学习(RL)结合人类反馈(RLHF)虽能改善,但成本高昂,难以大规模应用。偏好学习(Preference Learning)逐渐成为替代方案,利用偏好信号引导模型优化,但多依赖环境交互或奖励模型,限制了离线训练的效率。近年来,研究者尝试结合轨迹结构、局部偏好和自我对抗等技术,以提升模型的鲁棒性和泛化能力,但仍未解决低成本离线策略优化的核心难题。

核心问题

现有方法多依赖环境交互或昂贵的奖励模型,限制了大规模离线训练的可行性。行为模仿仅复制动作序列,缺乏对错误决策的识别和修正能力。如何在不依赖环境交互的前提下,利用专家轨迹实现策略的有效优化,成为关键难题。这不仅关系到模型的泛化能力,也影响到实际应用中的部署成本和效率。解决方案需要在保证训练效率的同时,提高模型对复杂任务的适应性和鲁棒性。

核心创新

本文提出Agentic-DPO,创新点包括:• 将专家轨迹转化为状态条件偏好信号,避免全轨迹依赖,• 引入偏好对比机制,直接在动作层面引导模型偏好专家动作,• 设计Schema多视角增强(PPA),提升偏好学习的稳定性和鲁棒性,• 结合SFT锚点确保模型格式一致,• 实现无环境交互的离线优化,显著降低训练成本。这些创新突破了传统行为模仿的局限,为低成本高效的策略优化提供了新路径。

方法详解

  • �� 采集专家轨迹数据,包含状态和潜在动作信息。• 在每个专家状态采样模型当前动作,作为负样本。• 利用偏好对比损失,训练模型偏好专家动作。• 引入Schema多视角(PPA),对动作和状态进行多样化渲染,增强偏好学习的鲁棒性。• 结合SFT锚点,确保模型格式稳定。• 通过多轮偏好对比,逐步优化模型策略,无需环境交互。• 采用样本采样和多视角渲染机制,确保偏好信号的稳定性和泛化能力。

实验设计

在StableToolBench、τ-bench零售和Mind2Web三大基准上,评估Agentic-DPO的性能。使用Qwen3.5-2B/4B/9B和Gemma3-4B作为模型基础,比较SFT、PPA+SFT、DPO变体、GRPO等方法。指标包括准确率、任务成功率和步骤成功率。采用不同模型规模和数据比例,进行消融和鲁棒性测试。训练参数如批次大小、负样本数和偏好系数均调优到最佳状态,确保公平比较。

结果分析

Agentic-DPO在所有任务中均优于基线,9B模型准确率从21.7%提升至41.4%,超越在线强化学习方法。τ-bench成功率由21.7%提升至41.4%,与GRPO持平但成本更低。Mind2Web中,平均步骤成功率达64.4%,表现出优异的跨任务和跨域泛化能力。消融实验验证了SFT锚点和PPA的重要性,缺失则导致性能大幅下降。训练过程中,负样本采样数和数据比例对性能影响有限,表明方法具有良好的扩展性。

应用场景

该方法适用于需要低成本策略优化的场景,如客服机器人、自动化工具、网页交互等。只需专家轨迹,无需环境交互或奖励模型,便可实现高效训练。未来可结合多模态信息和人类反馈,推动智能体在复杂、多任务环境中的应用,降低部署成本,提升泛化能力。

局限与展望

对专家轨迹质量依赖较高,轨迹偏差会影响模型效果。未充分验证多模态、多任务场景的适应性。训练参数调优复杂,模型对Schema渲染的敏感性仍需改进。未来需解决轨迹偏差、扩展多模态能力和提升训练稳定性的问题。

通俗解读 非专业人士也能看懂

想象你在厨房做菜。传统做法就是跟着食谱一步步操作,学会了怎么做,但遇到新菜或调料变化时就不知道怎么调整。现在,假如你有个智能厨师,它不仅记住了食谱,还能根据你手头的材料和味道偏好,自己判断怎么做。它会观察你做菜的每一步,知道哪些步骤是关键,哪些可以变通。通过不断尝试和比较,它学会了在不同情况下都能做出好菜。这就像本文的Agentic-DPO,不仅模仿专家的动作,还能自己判断哪些操作更合适,避免盲目复制,变得更聪明、更灵活。

简单解释 像给14岁少年讲一样

想象你在学校里学做手工。老师教你怎么折纸,你跟着做,学会了折出漂亮的作品。但如果老师只告诉你每一步怎么做,你可能在遇到不同纸张或新形状时不知道怎么调整。现在,假如有个聪明的朋友,他不仅教你怎么折,还会观察你每次折的样子,告诉你哪些折法更好,哪些不行。每次你试错,他都帮你分析,告诉你哪个步骤可以改进。这样,你就能在不同的纸张和设计中都能做出漂亮的折纸。这就像Agentic-DPO,它不仅模仿专家的动作,还能自己判断哪些操作更合适,避免盲目跟随,从而变得更聪明、更灵活。

术语表

Preference Learning (偏好学习)

一种利用偏好信号引导模型优化的方法,通过比较不同动作的优劣,提升策略性能。技术上通过偏好对比损失实现。

本文中用偏好学习引导模型偏向专家动作,避免全轨迹依赖。

Schema (模式/结构)

动作或状态的渲染模板,用于多样化表示同一潜在决策。技术上通过不同渲染视角实现多样化。

PPA机制利用Schema多视角增强偏好学习的稳定性。

Agentic Policy Optimization (主动策略优化)

通过偏好对比等技术,离线优化模型策略,增强自主决策能力。区别于传统行为模仿。

本文提出的核心方法,避免环境交互,实现低成本优化。

Offline Reinforcement Learning (离线强化学习)

在没有环境交互的情况下,利用历史数据优化策略。技术上通过偏好、对比等方法实现。

Agentic-DPO属于离线RL范畴,强调无需环境交互。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升偏好对比在复杂多任务环境中的效果,特别是在偏差轨迹和多模态信息融合方面仍未充分解决。
  • 2 模型对Schema多视角渲染的敏感性及其在不同任务中的泛化能力仍需深入研究。
  • 3 如何结合人类反馈和主动学习机制,进一步提升偏好学习的效率和鲁棒性。

应用场景

近期应用

智能客服机器人

利用专家对话轨迹,通过Agentic-DPO训练出能自主应答、处理复杂请求的客服系统,无需环境交互,降低成本。

自动化网页交互

在网页操作任务中,利用专家轨迹优化模型,实现高效、鲁棒的自动化操作,适应不同网页结构和内容变化。

远期愿景

自主决策系统

结合偏好学习和Schema多视角,打造能自主学习、适应多任务、多环境的智能体,推动AI在工业、医疗等领域的深度应用。

原文摘要

Large Language Model (LLM) agents are commonly trained from expert trajectories using supervised fine-tuning (SFT), which treats multi-turn agent behavior as ordinary text imitation. This recipe is simple and low-cost, but it only learns to imitate the sequence of expert actions, rather than training the agent to choose the right action against plausible mistakes at each state. Existing methods to mitigate this problem include preference learning or reinforcement learning, but they usually need high-cost environment rollouts and reward models. We propose Agentic-DPO, a lightweight offline agent policy optimization method that turns expert trajectories into state-conditioned preference supervision. At each expert action state, Agentic-DPO samples a one-step action from the current state, treats plausible wrong actions as negatives, and contrasts them with the expert action using a DPO-style preference objective. To avoid mixing both policy and schema in preference learning, we introduce Policy-Preserving Augmentation (PPA), which renders the same latent trajectory under multiple schemas while keeping the expert policy fixed. Agentic-DPO requires no online environment rollout, reward model, or full-trajectory student exploration. We conduct experiments across StableToolBench, tau-bench retail, and Mind2Web, where Agentic-DPO consistently improves agents at different model scales beyond imitation. In particular, it raises tau-bench accuracy from 21.7% (SFT) to 41.4% for a 9B model, matching online GRPO under the same backbone with only step-level rollouts and without environment interaction during gradient steps. The results suggest that expert trajectories can support low-cost agentic policy optimization when converted from demonstrations into state-level action preferences. Code for Agentic-DPO is released at https://github.com/Schuture/Agentic-DPO.

cs.AI