Don't Mask the Environment: Observation Supervision Changes How Agents Explore Under RL

TL;DR

ActObs方法通过监督观察改变RL中的探索,提升了Qwen3模型在Terminal-Bench 2.0上的表现。

cs.LG 🔴 高级 2026-09-18 14 次浏览
Juzheng Zhang Disha Makhija Manoj Ghuhan Arivazhagan Vinayshekhar Bannihatti Kumar Rashmi Gangadharaiah
强化学习 监督学习 环境观察 策略优化 跨领域

核心发现

方法论

ActObs方法通过在SFT阶段同时监督动作和观察,改变了强化学习的初始化。该方法不增加数据或参数,仅改变损失函数的掩码,保留了环境预测能力。

关键结果

  • 在Qwen3-4B上,ActObs在Terminal-Bench 2.0的pass@16上比ActionSFT高3.4个百分点。
  • 在跨领域的aider-polyglot任务中,ActObs在pass@1上比ActionSFT高4.2个百分点。
  • ActObs在RL中保留了更多的熵,减少了策略移动。

研究意义

该研究通过引入观察监督,改善了RL中策略的初始化,提升了任务解决能力。这一方法在跨领域任务中表现出色,显示出其在多领域应用中的潜力。

技术贡献

ActObs方法通过联合监督动作和观察,避免了梯度的单侧特化,保留了环境预测能力,提升了RL的探索效率。

新颖性

这是首次在SFT阶段同时监督动作和观察,改变了RL的初始化策略,提升了任务解决能力。

局限性

  • ActObs在单次尝试的可靠性上略有下降。
  • 在更大的采样预算下,ActionSFT在某些情况下表现更好。

未来方向

未来可以探索在更多领域应用ActObs方法,研究其在不同任务和模型规模下的表现。

AI 总览摘要

强化学习中的策略初始化通常忽略环境观察,仅关注动作。本文提出的ActObs方法通过在SFT阶段同时监督动作和观察,改变了这一传统。实验表明,ActObs在Qwen3模型上显著提升了任务解决能力,尤其是在Terminal-Bench 2.0和跨领域的aider-polyglot任务中表现出色。该方法通过保留更多的策略熵,减少了策略移动,提升了探索效率。尽管在单次尝试的可靠性上略有下降,ActObs在更大的采样预算下表现优异。未来的研究可以探索其在更多领域的应用潜力。

深度分析

研究背景

强化学习(RL)在策略优化中通常忽略环境观察,仅关注动作。这种方法在某些情况下可能导致策略的单侧特化,限制了探索效率。近年来,研究者们尝试通过不同的初始化策略来改善RL的表现,但在如何有效利用环境观察方面仍存在挑战。

核心问题

传统的RL策略初始化忽略了环境观察,导致策略在探索过程中缺乏对环境变化的预测能力。这一问题在复杂任务中尤为显著,限制了RL的任务解决能力。

核心创新

ActObs方法通过在SFT阶段同时监督动作和观察,改变了RL的初始化策略。该方法不增加数据或参数,仅改变损失函数的掩码,保留了环境预测能力,提升了任务解决能力。

方法详解

  • �� 在SFT阶段,ActObs同时监督动作和观察。
  • �� 通过改变损失函数的掩码,保留环境预测能力。
  • �� 在RL阶段,ActObs保留了更多的策略熵,减少了策略移动。

实验设计

实验在Qwen3-4B和Qwen3-8B模型上进行,使用Terminal-Bench 2.0和aider-polyglot数据集。通过对比ActionSFT和Obs→Act方法,验证了ActObs的有效性。

结果分析

ActObs在Qwen3-4B的pass@16上比ActionSFT高3.4个百分点,在aider-polyglot的pass@1上高4.2个百分点,显示出其在不同任务中的优越性。

应用场景

ActObs可用于需要高探索效率的RL任务,如自动驾驶和机器人控制。其在跨领域任务中的表现也显示出其在多领域应用中的潜力。

局限与展望

ActObs在单次尝试的可靠性上略有下降,且在更大的采样预算下,ActionSFT在某些情况下表现更好。未来研究需探索如何在不影响可靠性的情况下提升探索效率。

通俗解读 非专业人士也能看懂

想象一个厨师在厨房里做饭。传统的RL方法就像只关注厨师的动作,而忽略了食材的变化。ActObs方法则同时关注厨师的动作和食材的变化,帮助厨师更好地预测下一步该做什么。这样,厨师不仅能做出更美味的菜肴,还能更快地适应新的食材。

简单解释 像给14岁少年讲一样

嘿,小伙伴!想象你在玩一个游戏,游戏里有很多任务要完成。传统的方法就像只看你按了哪些按钮,而不看屏幕上发生了什么。ActObs就像同时关注你按的按钮和屏幕上的变化,这样你就能更快地完成任务啦!是不是很酷?

术语表

强化学习 (Reinforcement Learning)

一种机器学习方法,通过奖励和惩罚来训练智能体。

在本文中用于训练智能体进行任务探索。

监督学习 (Supervised Learning)

一种机器学习方法,通过已标注的数据来训练模型。

在SFT阶段用于训练智能体。

动作监督 (Action Supervision)

在训练过程中仅关注智能体的动作。

传统SFT方法中的一种策略。

观察监督 (Observation Supervision)

在训练过程中同时关注智能体的动作和环境观察。

ActObs方法的核心创新。

策略熵 (Policy Entropy)

衡量策略的不确定性,熵越高,策略越多样。

ActObs方法中用于提升探索效率。

开放问题 这项研究留下的未解疑问

  • 1 如何在不影响单次尝试可靠性的情况下提升探索效率?
  • 2 ActObs方法在更大规模模型上的表现如何?
  • 3 如何在更多领域应用ActObs方法?

应用场景

近期应用

自动驾驶

ActObs方法可用于提升自动驾驶系统的探索效率,帮助车辆更好地适应复杂路况。

远期愿景

多领域应用

ActObs方法在跨领域任务中的表现显示出其在多领域应用中的潜力,未来可用于更多复杂任务。

原文摘要

Agent trajectories record what an agent does and what happens next. Yet standard supervised fine-tuning (SFT) applies loss only to agent-authored action tokens, using environment observations as context but not as prediction targets. We ask whether this convention provides the best initialization for subsequent reinforcement learning. We introduce ActObs, which also supervises the observation tokens already present in each trajectory. Although deployed agents never generate observations, learning to predict them encourages the policy to model action consequences without adding data, parameters, sequence tokens, or forward passes. The methods perform similarly after SFT but diverge after GRPO. On Qwen3-4B, GRPO from ActObs achieves higher pass@k at every evaluated sampling budget than its action-only counterpart on Terminal-Bench 2.0. On Qwen3-8B, it trades some pass@1 reliability for higher pass@k (+3.4 pp at pass@16) and solves more distinct tasks. The advantage extends to cross-domain code editing on aider-polyglot (+4.2 pp at pass@1 at 4B), whose tasks are unseen during SFT and RL. ActObs retains more entropy during RL while requiring less policy movement, leaving the final policy closer to its SFT initialization. Our analysis traces this difference to SFT: action and observation gradients rapidly become orthogonal, while action-only training leaves a large residual observation gradient and degrades environment prediction below the base model. Joint supervision prevents this one-sided specialization, preserving consequence prediction and preparing the policy for downstream exploration.

cs.LG cs.AI cs.CL