Pre-Training for Robots: Offline RL Enables Learning New Tasks from a Handful of Trials

TL;DR

PTR以CQL预训练Bridge Dataset,在真实WidowX机器人上用10–15条示范学习新任务。

cs.RO 🔴 高级 2022-10-11 19 次浏览
Aviral Kumar Anikait Singh Frederik Ebert Mitsuhiko Nakamoto Yanlai Yang Chelsea Finn Sergey Levine
离线强化学习 机器人预训练 保守Q学习 少样本适应 真实机器人

核心发现

方法论

PTR(Pre-Training for Robots)首先在Bridge Dataset的多任务、多厨房演示上进行条件化离线强化学习,再用少量目标任务数据微调。核心算法是Conservative Q-Learning(CQL):通过压低策略分布下动作的Q值、抑制未见动作的过估计,提升离线训练稳定性。系统采用带GroupNorm的ResNet、学习型空间嵌入,并将动作复制注入每个全连接层。

关键结果

  • PTR在真实WidowX机器人上首次展示了利用既有多任务数据、仅凭10–15条目标任务示范学习新任务的能力;目标环境和技能不出现在预训练数据中,仍能通过混合Bridge数据与目标数据获得有效策略。
  • 离线微调时,每个批次以τ=0.8混合Bridge与目标数据;在线微调则混合离线数据和新采集轨迹,并对每个环境转移执行10次梯度更新。论文报告PTR明显超过行为克隆、表示预训练及无预训练RL基线。
  • 消融研究显示,GroupNorm、学习型空间嵌入和逐层动作注入是关键;合适设计使真实机器人最终性能提升超过3.5倍。目标轨迹Q值的近似单调上升可用于选择微调检查点,避免过拟合。

研究意义

该工作缓解了机器人数据昂贵、任务数据稀缺和跨环境泛化不足的长期瓶颈。它表明大规模离线机器人数据不必只用于模仿学习或视觉表征,也能直接训练可迁移的价值函数与策略。对学术界而言,PTR把多任务预训练、离线RL和少样本适应统一起来;对产业而言,它降低了每个新技能所需的人类遥操作成本,并支持从示范或自主试错中快速部署。

技术贡献

PTR并未提出全新的离线RL目标,而是系统化解决了CQL用于大规模视觉机器人预训练时的工程与建模问题。其贡献包括:用GroupNorm替代易导致TD不稳定的BatchNorm;以学习型空间嵌入保留特征图位置;将动作输入每个解码层,防止Q函数只利用状态—动作相关性;通过批次比例τ或β平衡大规模旧数据与少量新数据;以目标轨迹Q值趋势进行交叉验证。

新颖性

新颖性在于把端到端离线RL真正用于真实机器人预训练后的新域适应。相较依赖行为克隆、视觉表征或大量在线交互的方法,PTR用同一套CQL流程完成预训练和微调,并在最多15条示范下学习新任务;论文称其为首个在真实WidowX上达到这一设定的RL方法。

局限性

  • 实验主要假设目标任务和环境仍来自训练分布,且依赖人类成功演示;对于完全陌生的视觉外观、动力学或失败主导的数据,Q值单调性检查和奖励标注启发式可能失效。
  • 目标任务仍需10–15条示范或在线交互,任务ID采用一次性编码,复杂任务关系和开放世界任务组合能力尚未解决。
  • 论文未给出统一的自动检查点指标,且真实机器人训练成本、计算规模和跨机器人迁移仍需进一步评估。

未来方向

未来可研究可组合任务表示、自动奖励推断、连续或语言任务条件化,以及跨机器人和跨形态迁移。还需要建立自动Q值单调性度量、风险敏感离线RL和更强的分布外检测机制,并在更大规模真实数据上评估计算效率与长期自主改进能力。

AI 总览摘要

机器人要学会一个新技能,通常需要大量示范或昂贵的在线试错。行为克隆容易复制动作,却未必理解动作后果;传统离线强化学习又常因数据分布狭窄和未见动作的Q值过高而失败。于是,机器人领域长期缺少类似视觉模型“先预训练、再少样本适应”的可靠方案。

Kumar等人提出PTR,将Bridge Dataset中来自约10个环境、100个任务和约1.2万条示范的多样数据用于CQL预训练,再把少量目标数据混入同一离线RL流程。关键不是更复杂的算法,而是三个结构选择:用GroupNorm稳定视觉Q学习;用学习型空间嵌入保存物体位置;把动作输入每个MLP层,使Q函数真正比较不同动作。微调时通过τ=0.8的批次混合防止目标数据被大数据淹没,也可用β混合自主采集数据。

在真实WidowX机器人上,PTR用10–15条示范学习预训练集中未出现的新任务,并超过行为克隆、视觉表征预训练和无预训练RL基线;设计消融显示正确组件使最终真实性能提高超过3.5倍。它还可在没有示范时通过少量自主试验继续改进。研究的意义不是证明机器人已经通用,而是展示了一条可扩展路线:把昂贵的任务专属数据从“训练全部策略”降为“校准已有技能”。其局限包括分布外环境、奖励启发式、任务ID编码和计算成本,未来仍需更强的任务表示与安全在线学习。

深度分析

研究背景

机器人学习已通过行为克隆、视觉表示学习和在线RL取得进展,但每个新任务仍需大量真实数据。Bridge Dataset提供多厨房、多任务的人类遥操作数据,适合承担“机器人预训练集”的角色。过去方法多学习表征或模仿动作,未必编码动作后果;离线RL理论上更适合,却容易受分布外动作和视觉Q函数不稳定影响。

核心问题

目标是在先验数据不包含目标技能和环境的情况下,利用多任务离线数据与仅10–15条目标示范学习新策略。难点包括数据规模极不平衡、视觉Q函数难以利用动作、BatchNorm导致TD训练发散,以及微调过少无法适应、过多又会遗忘泛化能力。

核心创新

PTR的核心是以同一个条件化CQL模型完成多任务预训练和目标微调。第一,GroupNorm替代BatchNorm以稳定TD学习;第二,学习型空间嵌入避免全局平均池化丢失位置信息;第三,将动作复制到每个全连接层,增强Q函数的动作辨别能力;第四,用τ或β控制旧数据、目标示范和在线数据的比例;第五,用验证轨迹Q值的单调趋势选择检查点。

方法详解

  • �� 预训练:学习Qϕ(s,a;i)与πθ(a|s,i),其中i为一次性任务ID;CQL目标结合TD误差与保守正则,抑制策略动作Q值高于数据动作Q值。
  • �� 策略优化:最大化E[Qϕ]+βH(πθ),并用延迟目标网络稳定更新。
  • �� 视觉编码:ResNet-34、GroupNorm和学习型空间嵌入生成状态特征。
  • �� 动作解码:动作向量注入每个MLP层,任务ID输入解码器。
  • �� 离线微调:以τ=0.8混合Bridge和目标数据;在线微调混合旧数据与滚动数据,每条转移更新10次。
  • �� 奖励:每条成功示范最后3步标注+1,其余为0。

实验设计

实验使用Bridge Dataset及补充任务,在真实WidowX和多个toy kitchen环境测试。比较对象包括行为克隆、表示学习后模仿学习、无预训练RL及相关元RL方法。目标任务通常仅提供10–15条示范,在线设置允许自主收集轨迹。主要超参数为多任务CQL α=10.0、离线混合比例τ=0.8;在线实验使用α=0.5。消融考察网络容量、归一化、空间嵌入和动作注入。

结果分析

PTR在真实机器人上实现了论文所称的首个10条示范级新任务RL学习结果,并在多项比较中超过BC、表示预训练和无预训练方法。作者报告关键设计组合使最终真实性能提升超过3.5倍;ResNet容量增大仍带来收益,甚至ResNet-50也可工作。Q值趋势检查能区分欠训练和过训练检查点:平坦Q值的门打开策略失败,而更单调上升的检查点成功。

应用场景

该框架适合仓储抓取、厨房操作、实验室自动化和柔性装配:先用跨任务历史数据训练通用机器人,再为新物体或新摆放目标采集少量示范。部署前需要视觉观测、可复用机器人动作空间、成功轨迹或安全在线试验,以及相近的环境分布。产业价值在于减少每个新SKU或工位的遥操作数据成本。

局限与展望

PTR仍依赖训练与目标环境具有一定同分布性,不能保证在陌生相机、机器人形态或动力学下有效。一次性任务ID缺乏结构共享,目标任务越多越可能限制组合泛化。奖励只使用示范末尾三步的+1启发式,可能不适合长时延或部分成功。离线RL视觉网络训练计算量较大,未来需自动模型选择、语言条件化、安全探索和跨平台验证。

通俗解读 非专业人士也能看懂

把PTR想成一位已经在许多厨房工作的机器人厨师。它先观看大量成功录像:放土豆、鸡蛋或寿司,使用不同的锅、桌子和摄像机。它不只是背下“手应该怎么动”,还学习“如果现在这样动,之后更可能成功还是失败”。这就是CQL的作用:当录像里没有证明某个动作可靠时,它不会轻易给这个动作高分。

学会这些通用经验后,机器人遇到新菜品,只需看10到15次示范。训练时,大部分时间仍复习旧录像,同时经常加入新菜品录像,避免新任务被旧资料淹没。研究者还让机器人更清楚地记住物体在画面中的位置,并确保它认真比较不同动作,而不是只看当前画面。

如果机器人可以自己尝试,它还能把新尝试加入学习本。结果说明,机器人的“通用经验”确实能减少新技能的教学成本,但它仍更像熟悉相似厨房的厨师,而不是能在任何星球做饭的万能机器人。

简单解释 像给14岁少年讲一样

想象你在玩一个机器人游戏。普通玩法是:每解锁一个新关卡,都要从零教机器人怎么移动,所以要录很多操作视频。PTR的想法是先让机器人玩过很多相似关卡,比如拿杯子、搬水果、把东西放进锅里。它会把这些经验存成“哪些动作通常会带来好结果”的判断。

这里的关键算法叫CQL。它有点像一个谨慎的游戏教练:如果机器人从没见过某种动作,教练不会直接说“这招超强”,而是先给它保守分数,避免机器人被自己的幻想骗到。机器人还会看清东西在画面中的位置,并把“准备做什么动作”一直告诉判断器。

然后出现一个新关卡。研究者只给机器人10到15次示范,比如把寿司放进没见过的金属锅。机器人不是重新开始,而是把旧经验和新示范混合练习。它甚至可以自己试几次,再根据结果进步。很酷吧?不过它仍不一定能处理完全陌生的房间、奇怪的相机或从没见过的机器人身体。

术语表

Conservative Q-Learning(保守Q学习)

一种离线强化学习算法,对数据中未充分支持的动作降低Q值,减少过度乐观估计。它在论文中承担预训练和微调的统一学习器。

PTR以多任务形式使用CQL,并通过保守正则稳定Bridge Dataset训练。

Offline RL(离线强化学习)

只利用固定历史数据学习策略,而不必在训练期间持续与环境交互。它能降低真实机器人试错成本,但受数据覆盖范围限制。

PTR先离线预训练,再用少量目标示范离线微调。

Bridge Dataset

包含多种toy kitchen环境和大量机器人操控示范的多任务数据集。论文概述中涉及约10个环境、100个任务和约1.2万条示范。

它是PTR的主要预训练数据来源。

Q-function(Q函数)

估计在某状态执行某动作后能够获得的长期折扣回报。Q函数为策略选择动作提供价值依据。

PTR用Qϕ(s,a;i)指导任务条件化策略优化。

Group Normalization(组归一化)

在通道组内归一化特征的网络层,不依赖批次统计量。相较BatchNorm,它更适合TD学习中的视觉Q网络。

PTR用它缓解ResNet Q网络发散。

Learned Spatial Embedding(学习型空间嵌入)

用可学习空间权重汇总特征图,从而保留物体位置和布局信息。它不同于容易丢失空间结构的全局平均池化。

该模块用于PTR的ResNet视觉编码器。

开放问题 这项研究留下的未解疑问

  • 1 PTR在相近分布内表现突出,但完全陌生的物体、相机和动力学会否破坏Q值泛化,论文尚未系统回答。
  • 2 任务ID是简单的一次性编码,如何用语言、技能图或因果结构实现可组合任务迁移,仍是开放问题。
  • 3 Q值单调性主要依赖人工观察;可靠、自动且跨数据质量的检查点指标仍待建立。

应用场景

近期应用

柔性抓取与厨房操作

机器人公司可用历史抓取、放置和厨房演示训练PTR,再为新物体或新容器收集10–15条成功示范。前提是机器人、视觉和环境分布相近,可显著减少每项技能的遥操作采集量。

实验室与仓储自动化

实验室或仓库可将不同工位的离线轨迹作为Bridge式数据,针对新试剂盒、包装或摆放位置快速微调。若能安全执行少量滚动试验,β混合在线数据还可继续改进策略。

远期愿景

可迁移的机器人技能基础模型

长期目标是构建跨机器人、跨场景、由语言或任务目标条件化的技能模型。实现这一愿景需要更大规模数据、自动奖励、分布外安全检测和低成本跨平台微调。

原文摘要

Progress in deep learning highlights the tremendous potential of utilizing diverse robotic datasets for attaining effective generalization and makes it enticing to consider leveraging broad datasets for attaining robust generalization in robotic learning as well. However, in practice, we often want to learn a new skill in a new environment that is unlikely to be contained in the prior data. Therefore we ask: how can we leverage existing diverse offline datasets in combination with small amounts of task-specific data to solve new tasks, while still enjoying the generalization benefits of training on large amounts of data? In this paper, we demonstrate that end-to-end offline RL can be an effective approach for doing this, without the need for any representation learning or vision-based pre-training. We present pre-training for robots (PTR), a framework based on offline RL that attempts to effectively learn new tasks by combining pre-training on existing robotic datasets with rapid fine-tuning on a new task, with as few as 10 demonstrations. PTR utilizes an existing offline RL method, conservative Q-learning (CQL), but extends it to include several crucial design decisions that enable PTR to actually work and outperform a variety of prior methods. To our knowledge, PTR is the first RL method that succeeds at learning new tasks in a new domain on a real WidowX robot with as few as 10 task demonstrations, by effectively leveraging an existing dataset of diverse multi-task robot data collected in a variety of toy kitchens. We also demonstrate that PTR can enable effective autonomous fine-tuning and improvement in a handful of trials, without needing any demonstrations. An accompanying overview video can be found in the supplementary material and at thi URL: https://sites.google.com/view/ptr-final/

cs.RO cs.LG