Video PreTraining (VPT): Learning to Act by Watching Unlabeled Online Videos

TL;DR

VPT通过少量标注逆动力学模型,利用海量无标注视频实现Minecraft行为预训练,具备零-shot能力。

cs.LG 🔴 高级 2022-06-24 41 次浏览
Bowen Baker Ilge Akkaya Peter Zhokhov Joost Huizinga Jie Tang Adrien Ecoffet Brandon Houghton Raul Sampedro Jeff Clune
深度学习 模仿学习 视频预训练 强化学习 决策智能

核心发现

方法论

该方法首先用少量人类演示数据训练逆动力学模型(IDM),预测动作与观察的关系。利用IDM对海量无标注视频进行伪标签,随后采用行为克隆(BC)在大规模数据上训练基础模型。模型可通过微调结合强化学习提升复杂任务表现。核心在于IDM的非因果预测能力,提升数据效率,避免探索瓶颈。实验中,模型在Minecraft中实现了从基础工具制造到钻石工具的零-shot和微调性能,表现接近人类水平。

关键结果

  • 在70k小时无标注视频上训练的基础模型,能零-shot完成制作木台、木棒等任务,平均仅需50秒(970动作),超越以往RL方法。微调后,模型能自主制造石器、钻石工具,耗时20分钟(24000动作),达到人类熟练水平。使用RL微调,模型在复杂任务中表现显著提升,成功实现钻石镐的自动制造。
  • 逆动力学模型(IDM)在1962小时标注数据上达90.6%关键点预测准确率,R2值0.97,远优于行为克隆,验证其数据效率。大规模无标注视频伪标签的生成极大提高了模型的泛化能力和任务复杂度应对能力。
  • 微调实验显示,基于基础模型的微调能大幅提升早期游戏行为的完成率,工艺台、木材等指标提升数十倍,模型能自主探索村庄、狩猎等多样行为,表现出复杂行为的学习能力。

研究意义

该研究突破了在无标注大规模视频数据上训练决策模型的瓶颈,为机器人、自动化等领域提供了新思路。通过结合半监督模仿学习,有效利用互联网海量资源,显著降低了数据标注成本,推动通用智能体的实现。模型在复杂、开源环境中的表现,展示了深度学习在真实世界决策任务中的潜力,为未来自主系统的研发提供了理论基础和实践路径。

技术贡献

创新点在于引入逆动力学模型(IDM)作为伪标签生成器,结合行为克隆实现大规模无标注数据的利用。模型架构采用ResNet和残差注意力机制,提升时序信息捕获能力。提出了非因果预测策略,显著提高数据效率。实验中,模型在海量互联网视频上实现了从零到复杂技能的迁移,首次在Minecraft中实现钻石工具的自动制造,验证了半监督预训练在决策任务中的有效性。

新颖性

本研究首次将半监督模仿学习应用于极大规模、无标注的互联网视频数据,突破了传统依赖标注的限制。引入逆动力学模型作为伪标签生成器,避免了探索瓶颈,显著提升学习效率。与以往仅在低复杂度环境中验证的方法不同,本文在复杂的Minecraft环境中实现了从基础到高级技能的自主学习,展现了模型的广泛适应性和强大迁移能力。

局限性

  • 模型在极端复杂任务中的泛化能力仍有限,某些高难度操作需要大量微调。数据过滤依赖关键词搜索,可能存在偏差,影响模型的泛化。训练成本高昂,720个V100GPU持续数天,限制了大规模推广应用。模型对环境变化的适应性不足,未来需增强鲁棒性和自适应能力。

未来方向

未来将探索多模态数据融合,提升模型对环境变化的适应性。计划引入主动探索机制,减少微调需求。还将扩展到真实机器人平台,验证在现实场景中的效果。此外,将优化模型结构,降低训练成本,增强模型的泛化能力,推动自主智能体的广泛应用。

AI 总览摘要

近年来,深度学习在自然语言和计算机视觉领域取得了巨大突破,尤其是通过大规模互联网数据的预训练技术,极大提升了模型的泛化能力。然而,在序列决策任务如机器人控制和游戏中,缺乏高质量标注数据成为瓶颈。传统的强化学习(RL)在复杂环境中训练效率低,探索困难,难以应对高难度任务。本文提出了一种创新的半监督模仿学习方法——视频预训练(VPT),通过少量标注数据训练逆动力学模型(IDM),利用其在海量无标注视频中生成伪标签,从而在Minecraft环境中实现大规模预训练。该方法避免了探索瓶颈,显著提高了数据利用效率。实验显示,模型在零-shot条件下即可完成基础任务,微调后能自主制造复杂工具,包括钻石工具,表现接近人类水平。特别是在用原生人类界面操作时,模型展现出强大的探索和操作能力,突破了以往RL方法的限制。该研究不仅为通用智能体的研发提供了新路径,也为未来在机器人、自动化等领域的应用奠定了基础。未来,结合多模态数据和主动探索机制,将进一步提升模型的适应性和实用性,推动自主系统的广泛落地。

深度分析

研究背景

深度学习在自然语言和视觉任务中通过大规模预训练实现了突破,代表性工作如GPT系列、CLIP等。近年来,模仿学习和强化学习在决策任务中逐渐融合,推动智能体自主学习。尤其是在游戏和机器人控制中,利用互联网海量视频数据进行预训练已成为趋势,但多为有标注数据,缺乏无标注大规模数据的有效利用。Minecraft作为复杂环境,已成为强化学习研究的热点,但大多依赖手工设计的动作空间或有限的任务。现有方法在探索复杂行为、跨任务迁移方面仍有不足,亟需更高效的数据利用策略。

核心问题

在序列决策任务中,缺乏大规模无标注视频的有效利用,导致模型难以自主学习复杂行为。RL方法在高维状态空间中样本效率低,探索困难,难以应对高难度任务。传统模仿学习依赖标注数据,成本高昂且难以扩展。如何利用互联网海量无标注视频,训练具有广泛能力的智能体,成为关键难题。解决方案需兼顾数据效率、探索能力和泛化能力,推动模型在真实复杂环境中的应用。

核心创新

提出逆动力学模型(IDM)作为伪标签生成器,利用少量标注数据训练后,能在海量无标注视频中自动标注动作,大幅提升数据利用效率。引入非因果预测策略,避免探索瓶颈,增强模型在复杂环境中的表现。采用ResNet和残差注意力机制,提升时序信息捕获能力。模型在Minecraft中实现从基础工具到钻石工具的自主学习,首次在如此复杂环境中验证半监督预训练的有效性。该方法突破了传统依赖标注和探索的限制,为大规模无标注数据的利用提供新思路。

方法详解

  • �� 数据收集:通过关键词搜索,筛选出70k小时“干净”Minecraft视频,过滤掉水印和非生存模式内容。• 标注:用少量(1962小时)人类演示数据训练逆动力学模型(IDM),预测动作。• 伪标签生成:利用训练好的IDM对大规模无标注视频进行动作预测,生成伪标签。• 模型训练:采用行为克隆(BC)在伪标签上训练基础模型,避免探索瓶颈。• 微调:结合强化学习(RL)或行为克隆,针对特定任务微调模型,实现复杂行为。• 架构:采用ResNet和残差注意力机制,增强时序信息处理能力。• 训练:在720 V100 GPU上持续数天,优化模型性能。• 评估:在Minecraft中测试模型零-shot和微调效果,监控任务完成率和行为表现。

实验设计

使用70k小时无标注视频作为训练数据,筛选出“干净”段落,训练IDM达到90.6%准确率。模型在Minecraft中实现从采集木材到制造工具的多项任务,零-shot完成基础工艺,微调后能制造石器和钻石工具。对比RL训练,模型在复杂任务中表现优越,能在20分钟内完成钻石镐的制造。通过微调不同数据集,模型行为逐步丰富,表现出强大的迁移和泛化能力。实验还验证了IDM的高效性和伪标签的有效性,显示半监督预训练在复杂决策任务中的潜力。

结果分析

模型在70k小时无标注视频上训练后,能零-shot完成基础任务,平均50秒(970动作)内制造木台和木棒。微调后,模型能自主制造石器、钻石工具,耗时20分钟(24000动作),达到人类水平。IDM在1962小时标注数据上达90.6%准确率,验证其数据效率。模型在复杂探索任务中表现优异,能自主探索村庄、狩猎、采集,展现出强大的行为迁移能力。

核心概念词典

逆动力学模型 (Inverse Dynamics Model)

预测观察序列中每个时间点的动作,非因果预测提高数据效率,减少探索瓶颈。

行为克隆 (Behavioral Cloning)

模仿演示数据中的行为,训练模型复制行为策略,适合大规模伪标签数据。

伪标签 (Pseudo-labels)

由IDM自动生成的动作标签,用于在无标注视频中训练模型,极大扩展数据利用。

半监督学习

结合少量标注数据和大量无标注数据,提升模型学习效率和泛化能力。

零-shot能力

模型在未专门训练的任务上直接表现出良好的行为能力,体现泛化强。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升模型在极端复杂任务中的探索和操作能力,仍需研究更高效的探索机制和模型结构优化。
  • 2 模型在环境变化或新场景中的适应性不足,未来需增强鲁棒性和迁移能力。

原文摘要

Pretraining on noisy, internet-scale datasets has been heavily studied as a technique for training models with broad, general capabilities for text, images, and other modalities. However, for many sequential decision domains such as robotics, video games, and computer use, publicly available data does not contain the labels required to train behavioral priors in the same way. We extend the internet-scale pretraining paradigm to sequential decision domains through semi-supervised imitation learning wherein agents learn to act by watching online unlabeled videos. Specifically, we show that with a small amount of labeled data we can train an inverse dynamics model accurate enough to label a huge unlabeled source of online data -- here, online videos of people playing Minecraft -- from which we can then train a general behavioral prior. Despite using the native human interface (mouse and keyboard at 20Hz), we show that this behavioral prior has nontrivial zero-shot capabilities and that it can be fine-tuned, with both imitation learning and reinforcement learning, to hard-exploration tasks that are impossible to learn from scratch via reinforcement learning. For many tasks our models exhibit human-level performance, and we are the first to report computer agents that can craft diamond tools, which can take proficient humans upwards of 20 minutes (24,000 environment actions) of gameplay to accomplish.

cs.LG cs.AI