From Trajectories to Prefixes: Reusing Teacher Trajectories via Replayed Prefixes and Online Continuation

TL;DR

Prefix-GRPO通过重用教师轨迹前缀和在线续接,提升小模型在长时环境中的表现。

cs.LG 🔴 高级 2026-07-03 2 次浏览
Yihan Wang Zhong Guan Haoran Sun Jiale Huang Likang Wu Hongke Zhao
强化学习 小语言模型 轨迹重用 前缀优化 在线学习

核心发现

方法论

Prefix-GRPO是一种强化学习框架,将教师轨迹分解为可重放的前缀查询和在线续接。每个前缀在环境中重放以恢复有效的中间状态,学生随后继续在线交互并获得任务奖励。与仅响应的GRPO不同,Prefix-GRPO还对重放前缀中的历史助手标记应用截断策略更新,使用策略蒸馏的SFT检查点估计其旧的对数概率。

关键结果

  • 在TextCraft中,Prefix-GRPO的Pass@8达到96.00%,显著优于Replay-GRPO的78.79%。
  • 在BabyAI中,Prefix-GRPO的整体Pass@8达到100.00%,显示出在多样化任务中的强大适应性。
  • 在ALFWorld中,Prefix-GRPO的Pass@8达到94.50%,表明其在复杂环境中的有效性。

研究意义

Prefix-GRPO通过将教师轨迹分解为前缀查询和在线续接,解决了小模型在长时交互环境中表现不佳的问题。该方法不仅提高了数据效率,还增强了模型在复杂任务中的适应性,具有重要的学术和工业意义。

技术贡献

Prefix-GRPO首次将前缀学习和续接学习统一在同一策略优化形式中,显著提高了小模型的学习效率。通过策略蒸馏的SFT检查点实现对历史助手标记的截断策略更新,提供了新的工程可能性。

新颖性

Prefix-GRPO首次将教师轨迹分解为可重放的前缀查询和在线续接,区别于传统的单次模仿目标,提供了更高效的学习路径。

局限性

  • 在某些复杂环境中,Prefix-GRPO的平均成功率仍低于最强的SFT初始化RL基线。
  • 需要大量计算资源进行前缀优化,可能不适合资源受限的应用场景。

未来方向

未来研究可以探索更高效的前缀选择策略,以及在资源受限环境中的应用。进一步的工作还可以研究如何在不同的任务和环境中优化Prefix-GRPO的性能。

AI 总览摘要

在交互式代理中,小语言模型因其高频部署和低延迟交互的优势而备受关注。然而,直接从强教师轨迹进行蒸馏往往将丰富的多轮行为转化为单次模仿目标,这在长时环境中效率低下。Prefix-GRPO通过将教师轨迹分解为重放对齐的前缀查询和在线续接,解决了这一问题。实验结果表明,Prefix-GRPO在TextCraft、BabyAI和ALFWorld中显著提高了小模型代理的性能,尤其是在复杂任务中的表现尤为突出。尽管如此,Prefix-GRPO在某些环境中的平均成功率仍低于最强的SFT初始化RL基线,未来的研究可以探索更高效的前缀选择策略和在资源受限环境中的应用。

深度分析

研究背景

近年来,小语言模型因其在交互式代理中的应用潜力而受到广泛关注。与大规模模型相比,小模型在高频部署和低延迟交互方面具有显著优势。然而,如何有效地将教师轨迹中的丰富决策结构转移到小模型中,仍然是一个挑战。

核心问题

直接从强教师轨迹进行蒸馏往往将复杂的多轮交互行为简化为单次模仿目标。这种方法在长时环境中效率低下,因为早期决策会影响后续状态和奖励。

核心创新

Prefix-GRPO通过将教师轨迹分解为重放对齐的前缀查询和在线续接,提供了一种更高效的学习路径。该方法不仅提高了数据效率,还增强了模型在复杂任务中的适应性。

方法详解

  • �� 将教师轨迹分解为前缀查询和在线续接
  • �� 使用策略蒸馏的SFT检查点估计历史助手标记的旧对数概率
  • �� 对重放前缀中的历史助手标记应用截断策略更新

实验设计

实验在TextCraft、BabyAI和ALFWorld三个长时交互环境中进行,评估了Prefix-GRPO在不同任务中的表现。实验结果表明,Prefix-GRPO在所有环境中均显著提高了小模型代理的性能。

结果分析

在TextCraft中,Prefix-GRPO的Pass@8达到96.00%,显著优于Replay-GRPO的78.79%。在BabyAI中,Prefix-GRPO的整体Pass@8达到100.00%,显示出在多样化任务中的强大适应性。在ALFWorld中,Prefix-GRPO的Pass@8达到94.50%,表明其在复杂环境中的有效性。

应用场景

Prefix-GRPO可以应用于需要高效决策的交互式代理中,如智能助手、游戏AI和自动化客服系统。其在长时任务中的优异表现使其在这些领域具有广泛的应用潜力。

局限与展望

尽管Prefix-GRPO在多个环境中表现出色,但在某些复杂环境中的平均成功率仍低于最强的SFT初始化RL基线。此外,前缀优化需要大量计算资源,可能不适合资源受限的应用场景。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你有一个经验丰富的厨师作为老师,他会告诉你每一步该怎么做。通常,你会尝试记住整个过程,但这可能会让你感到不知所措。Prefix-GRPO就像是把厨师的指令分成小段,每段都是一个独立的步骤。这样,你可以专注于当前的步骤,而不必担心整个过程。每完成一个步骤,你就会获得一些反馈,这样你就可以调整下一步的操作。这种方法让你在做饭时更加高效和自信。

简单解释 像给14岁少年讲一样

想象你在玩一个复杂的电子游戏。你有一个超级厉害的玩家作为指导,他会告诉你如何通关。通常,你可能会试图记住他所有的技巧,但这很难。Prefix-GRPO就像是把他的指导分成小段,每段都是一个独立的任务。这样,你可以专注于当前的任务,而不必担心整个游戏。每完成一个任务,你就会获得一些奖励,这样你就可以调整下一步的策略。这种方法让你在游戏中更加高效和自信。

术语表

Prefix-GRPO

一种强化学习框架,将教师轨迹分解为前缀查询和在线续接。

用于提高小模型在长时环境中的表现。

SFT

策略蒸馏的检查点,用于估计历史助手标记的旧对数概率。

在Prefix-GRPO中用于前缀优化。

Pass@8

在8次尝试中至少成功一次的概率。

用于评估模型在任务中的成功率。

Replay-GRPO

一种仅重放前缀的强化学习方法。

与Prefix-GRPO进行对比实验。

TextCraft

一个用于评估符号规划的长时交互环境。

Prefix-GRPO实验中使用的环境之一。

开放问题 这项研究留下的未解疑问

  • 1 如何在资源受限的环境中高效应用Prefix-GRPO?
  • 2 是否可以进一步优化前缀选择策略以提高学习效率?

应用场景

近期应用

智能助手

通过Prefix-GRPO提高智能助手在复杂任务中的决策效率。

远期愿景

自动化客服系统

在自动化客服系统中应用Prefix-GRPO,以提高用户交互体验。

原文摘要

Small language models are attractive backbones for interactive agents, but direct distillation from strong teacher trajectories often turns rich multi-turn behavior into one-shot imitation targets. This is inefficient in long-horizon environments, where early decisions shape later states and rewards. We propose Prefix-GRPO, a reinforcement learning framework that decomposes teacher trajectories into replay-aligned prefix queries and online continuations. Each prefix is replayed in the environment to recover a valid intermediate state, after which the student continues online interaction and receives task reward. Unlike response-only GRPO, Prefix-GRPO also applies clipped policy updates to historical assistant tokens inside the replayed prefix, using a policy-distilled SFT checkpoint to estimate their old log-probabilities. This unifies prefix learning and continuation learning within the same policy-optimization form. Experiments on TextCraft, BabyAI, and ALFWorld show that Prefix-GRPO improves small-model agents over distillation and standard RL baselines, while ablations show that replay alone is insufficient without explicit prefix-token optimization. The implementation and reproduction scripts are available at https://github.com/HappynessI/Prefix_GRPO.

cs.LG cs.AI