ECHO: Terminal Agents Learn World Models for Free

TL;DR

ECHO结合环境观察预测与策略优化,显著提升终端代理任务成功率,Qwen3-8B从2.70%提升至5.17%。

cs.LG 🔴 高级 2026-05-23 43 次浏览
Vaishnavi Shrivastava Piero Kauffmann Ahmed Awadallah Dimitris Papailiopoulos
强化学习 语言模型 环境建模 终端代理 策略优化

核心发现

方法论

本文提出ECHO(环境交叉熵混合目标),通过在传统策略梯度基础上加入环境观察预测的辅助损失,利用模型在rollout中的环境响应作为密集监督信号。ECHO复用GRPO的前向传播,无需额外rollout,利用模型自身输出作为目标,训练策略预测环境观察,从而增强模型对环境动态的理解。该方法在多任务终端环境中验证,显著提升任务成功率和环境动态预测能力,尤其在未见轨迹上表现优异。

关键结果

  • 在TerminalBench-2.0上,Qwen3-8B模型的pass@1从2.70%提升至5.17%,Qwen3-14B从5.17%提升至10.79%,提升幅度接近一倍以上。ECHO在环境观察预测上显著降低了环境token的交叉熵,表明模型对终端动态的预测能力增强。即使在未生成轨迹上,ECHO也能更准确地模拟环境响应,显示出更强的泛化能力。
  • 在不依赖专家示范的情况下,ECHO能匹配甚至超越基于专家模仿的模型性能,恢复了约一半的专家初始化优势。
  • 通过环境观察预测单独训练,模型实现了无验证器的自我提升能力,能在未见任务中通过环境交互自主改进策略。

研究意义

该研究突破了传统强化学习中稀疏奖励的局限,将环境观察作为密集的监督信号,极大提升了终端代理的学习效率和泛化能力。这不仅丰富了模型对环境动态的理解,也为无监督自我改进提供了新路径,推动AI在复杂交互任务中的应用前景。特别是在无需外部示范的情况下,模型便能自主学习环境响应,具有重要的理论和实践意义。

技术贡献

提出ECHO(环境交叉熵混合目标),创新性地将环境观察预测融入策略梯度训练中,复用模型前向传播,无需额外rollout或教师模型,实现密集监督。该方法在多任务终端环境中验证,显著提升任务成功率和环境动态预测能力,特别是在未见轨迹上表现优异。该技术为强化学习中的环境建模提供了新思路,增强了模型的理解和泛化能力。

新颖性

首次将环境观察作为密集监督信号引入强化学习中的终端代理训练,利用模型自身输出作为预测目标,实现无额外采样的自我监督。这一方法突破了传统稀疏奖励的限制,展现出在复杂环境中自主学习和泛化的潜力,区别于以往仅依赖外部示范或奖励信号的策略。

局限性

  • 当前方法依赖于环境观察的结构化输出,复杂或模糊的环境响应可能影响预测效果。
  • 在极端复杂或高维环境中,模型可能面临泛化不足的问题,训练成本较高。
  • 模型对环境动态的理解仍有限,未来需结合更丰富的环境信息和多模态输入。

未来方向

未来将探索多模态环境信息的融合,提升模型对复杂环境的理解能力。同时,结合模仿学习和强化学习,优化策略的稳定性和样本效率。此外,研究如何在真实世界机器人和交互系统中迁移该方法,推动AI自主学习的实际应用。

AI 总览摘要

本研究提出的ECHO(环境交叉熵混合目标)为终端代理的强化学习带来了新突破。传统的终端代理在复杂环境中面临奖励稀疏、学习效率低的问题,本文通过将环境观察作为密集的监督信号,显著改善了模型对环境动态的理解能力。ECHO在复用模型前向传播的基础上,加入环境观察预测的辅助损失,无需额外rollout或教师模型,便能在训练过程中自我生成目标,形成自适应的学习路径。

在多个终端任务环境中,ECHO表现出优异的性能提升。以Qwen3-8B模型为例,任务成功率从2.70%提升至5.17%,而更大模型Qwen3-14B的成功率也从5.17%跃升至10.79%。此外,ECHO能在未生成轨迹上更准确地模拟环境响应,降低环境token的交叉熵,表明其对环境动态的理解更为深刻。这一能力使模型在未见任务中也能实现自主改进,减少对专家示范的依赖。

该方法的核心创新在于利用模型自身输出作为训练目标,打破了稀疏奖励的限制,开启了无监督自我强化学习的新途径。实验结果显示,ECHO不仅提升了任务成功率,还加快了训练收敛速度,优化了推理效率,减少了超时和交互成本。未来,结合多模态信息和迁移到真实环境,将进一步推动自主学习系统的发展。这项工作为智能体理解复杂环境、实现自主改进提供了理论基础和实践路径,具有广泛的应用前景。

深度分析

研究背景

近年来,强化学习与语言模型结合的终端代理逐渐成为研究热点。早期工作如GPT-4的应用,主要依赖稀疏奖励信号,导致学习效率低下。GRPO(Group-Relative Policy Optimization)提出了基于剪辑优势的策略优化,但仍受限于奖励稀疏的问题。随着环境模拟和自我监督技术的发展,研究者开始探索利用环境观察作为密集信号的方法,提升模型对环境动态的理解。之前的工作多依赖外部示范或奖励,缺乏利用环境响应作为训练信号的系统性方案。本文在此基础上提出ECHO,旨在将环境观察作为密集监督信号,改善终端代理的学习效率和泛化能力,为自主学习提供新路径。

核心问题

传统终端代理在复杂环境中面临奖励稀疏、学习缓慢的问题。现有方法多依赖外部示范或奖励信号,难以充分利用环境反馈信息,导致模型对环境动态的理解不足,限制了其自主学习和泛化能力。如何有效利用环境观察作为密集的训练信号,提升模型对环境响应的预测能力,成为核心难题。特别是在未见轨迹和新任务中,模型的泛化能力不足,限制了其实际应用潜力。

核心创新

本研究的创新点在于提出ECHO,将环境观察作为密集的训练目标,结合策略梯度优化实现自我监督。具体创新包括:1)利用模型自身输出作为观察预测目标,避免额外采样;2)复用前向传播,无需额外计算成本;3)在多任务环境中验证,显著提升任务成功率和环境动态预测能力。这一方法突破了稀疏奖励的限制,为强化学习中的环境建模提供了新思路,增强模型理解和泛化能力。

方法详解

  • �� 采用GRPO作为基础优化框架,结合环境观察预测作为辅助目标。
  • �� 在每次rollout中,模型输出动作和环境响应,利用环境响应作为预测目标,计算交叉熵损失。
  • �� 通过在模型输出的相应位置加入环境观察预测的辅助损失,实现密集监督。
  • �� 复用模型的前向传播,避免额外计算成本,训练过程中同时优化策略和环境动态理解。
  • �� 设置环境观察预测的权重λ,调节策略优化与观察预测的平衡。
  • �� 在多任务终端环境中,验证模型在未见轨迹上的泛化能力和任务成功率提升。

实验设计

采用多任务终端环境(如TerminalBench-2.0)进行评估,比较GRPO与ECHO的性能差异。训练数据包括由GPT-5生成的8870个任务样本,模型在不同规模(8B、14B)上训练,设置λ=0.05。指标包括任务成功率(pass@1)、环境token交叉熵等。通过在未见轨迹上的预测能力验证模型对环境动态的理解。还进行了不同模型初始化(如SFT、GRPO)和对比分析,验证ECHO在泛化和训练效率上的优势。

结果分析

ECHO在多个模型和任务上均表现优异,Qwen3-8B模型的pass@1从2.70%提升到5.17%,Qwen3-14B从5.17%提升到10.79%。环境token的交叉熵显著降低,表明环境动态预测能力增强。未依赖专家示范,模型也能匹配甚至超越基于示范的性能,显示出强大的自主学习能力。训练速度提升,超时率降低,推理效率增强,验证了方法的实用性和有效性。

应用场景

该技术可应用于自动化系统、机器人自主操作、复杂任务自动化等场景,尤其在缺乏大量标注数据或示范的环境中表现出巨大潜力。通过利用环境响应作为密集信号,减少对外部示范的依赖,提升自主学习和适应能力。未来可结合多模态信息,拓展到真实世界的机器人和交互系统,实现更智能的自主操作。

局限与展望

目前方法依赖环境观察的结构化输出,复杂或模糊环境响应可能影响预测效果。模型在极端复杂或高维环境中泛化能力有限,训练成本较高。未来需结合多模态信息和更丰富的环境特征,提升泛化和鲁棒性。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,菜谱就像模型的任务,厨师(模型)需要根据食材(环境信息)做出决定。传统方法就像只告诉厨师“做菜成功或失败”,但没有告诉他为什么失败,也没有指导他如何改进。现在,ECHO就像给厨师提供了每一步的详细反馈,比如食材的变化、火候的掌握等,让厨师能更好理解厨房的反应,从而不断改进自己的厨艺。这样,厨师不仅学会了怎么做菜,还能预测下一步会发生什么,变得越来越聪明。这个方法让厨师在没有外部高手指导的情况下,也能自己学会做出美味的菜肴,逐渐变成厨房里的大厨。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,每次你做出一个动作,游戏会告诉你发生了什么,比如“你赢了”或“你输了”。以前,我们只知道结果,但不知道为什么会输,或者下一次怎么做才能赢。现在,这个新方法就像让游戏告诉你每一步的详细情况,比如你用的武器、遇到的怪物、掉落的宝藏。这样,你就能学会根据环境变化调整策略,不再只是盲目试错。就像你在学习骑自行车,不仅知道摔倒了,还知道自己哪里做错了,下一次可以改正。这个方法让AI像你一样,从每次互动中学会理解环境,变得更聪明、更会预测未来的事情。它不仅能帮你在游戏中变强,还能用在机器人、自动驾驶等很多地方,让机器自己学会应对复杂的世界。

原文摘要

CLI agents are the closest thing language models have to an embodied setting: the model emits commands, the terminal executes them, and the returned stream -- stdout, errors, files, logs, and traces -- records the consequences. We argue that this stream is a supervision signal, but standard agent RL discards it: GRPO-style training updates action tokens with sparse outcome-level rewards while ignoring environment responses already in the rollout. Failed rollouts provide little policy-gradient signal despite containing rich evidence about how the environment responds. We introduce ECHO (Environment Cross-entropy Hybrid Objective), a hybrid objective that combines the standard policy-gradient loss on action tokens with an auxiliary loss that trains the policy to predict environment observation tokens resulting from its own actions. ECHO reuses the same forward pass as GRPO, requires no additional rollouts, and turns terminal feedback into dense supervision for all rollouts. ECHO doubles GRPO pass@1 on TerminalBench-2.0: Qwen3-8B improves from 2.70% to 5.17%, and Qwen3-14B from 5.17% to 10.79%. ECHO also produces policies that better predict terminal dynamics, even on trajectories they did not generate: across held-out rollouts, it sharply reduces environment-token cross-entropy while GRPO alone barely changes it. From base Qwen3-8B, ECHO matches expert-SFT-then-GRPO performance on held-out terminal tasks without expert demonstrations, and recovers roughly half of the expert-SFT initialization benefit on TerminalBench-2.0. In some settings, the environment prediction loss alone enables verifier-free self-improvement, allowing policies to improve on unseen OOD tasks by learning only from environment interactions. Together, these results suggest that environment observations are not merely context for future actions, but a dense, on-policy supervision signal already present in every rollout.

cs.LG cs.CL