ConLA: Contrastive Latent Action Learning from Human Videos for Robotic Manipulation

TL;DR

ConLA利用对比学习从人类视频中学习潜在动作,突破shortcut问题,实现机器人迁移学习。

cs.RO 🔴 高级 2026-01-31 40 次浏览
Weisheng Dai Kai Lan Jianyi Zhou Bo Zhao Xiu Su Junwen Tong Weili Guan Shuo Yang
机器人学习 对比学习 潜在动作 无监督预训练 迁移学习

核心发现

方法论

ConLA采用对比解耦机制,将动作类别先验和时间线索引导潜在动作的无监督学习。通过VQ-VAE提取帧间运动信息,结合对比损失实现动作与视觉内容的分离。模型包括逆动力学模型编码器、空间-时间Transformer、动作和视觉对比头。第一阶段生成离散潜在动作,第二阶段利用预训练的VLM预测动作序列,第三阶段微调映射机器人动作。引入动作类别和时间线索,有效缓解shortcut问题,提升潜在动作的语义纯度。

关键结果

  • 在SimperEnv基准测试中,ConLA仅用人类视频预训练,成功超越基于真实机器人轨迹的模型,成功率提升12.5%。在实际机器人任务中,性能超越仅用机器人轨迹的模型1.1%,验证了人类视频的潜力。
  • 在多任务环境中,ConLA显著优于LAPA和SCRATCH,成功率提升超过10%。对比VQ-VAE方法,加入对比机制后,潜在动作的语义一致性和迁移性增强。
  • 消除了视觉干扰,模型在复杂场景中表现更稳健,潜在动作表征更纯粹,迁移到机器人任务的效果明显改善。

研究意义

该研究突破了人类视频中潜在动作学习的瓶颈,充分利用大规模人类演示数据,显著降低机器人训练成本。通过对比学习实现动作内容与视觉噪声的分离,为机器人自主学习提供了新思路。其成果不仅推动机器人自主操作的规模化,也为无监督学习在复杂场景中的应用提供了理论基础,具有深远的学术和工业价值。

技术贡献

ConLA引入对比解耦机制,结合动作类别和时间线索,有效缓解shortcut问题,提升潜在动作的语义纯度。提出基于VQ-VAE的潜在动作量化方法,结合对比损失实现动作与视觉内容的分离。模型架构创新在于利用空间-时间Transformer和多模态对比学习,增强潜在动作的表达能力。该方法实现了从人类视频到机器人策略的无缝迁移,突破了传统基于重建的潜在动作学习的局限。

新颖性

首次在机器人学习中引入对比解耦机制,利用动作类别和时间线索,有效解决VQ-VAE潜在动作的shortcut问题。不同于以往仅依赖视觉重建的无监督方法,ConLA强调语义纯粹性和迁移性,显著提升了潜在动作的表达质量。该方法在无需机器人轨迹的情况下,超越了传统的迁移学习效果,开辟了大规模人类视频在机器人自主学习中的新路径。

局限性

  • 模型在极端复杂场景或极少样本类别下可能仍存在潜在动作模糊或偏差问题,尤其在动作类别不明确或视觉干扰极强时表现不佳。
  • 对比学习依赖类别标签和时间线索,若类别标注不准确或时间信息受干扰,可能影响潜在动作的解耦效果。
  • 训练过程中对Transformer和对比机制的计算成本较高,实际部署时需考虑效率优化。

未来方向

未来将探索多模态信息融合,如引入语音或触觉信号,丰富潜在动作的表达。还计划结合强化学习,提升策略的鲁棒性和泛化能力。进一步优化模型结构,降低计算成本,实现实时自主学习。扩展到更复杂的操作任务和多机器人协作场景,推动机器人自主学习的规模化和普适化。

AI 总览摘要

随着机器人自主操作需求的不断增长,如何高效利用大规模人类演示视频成为研究热点。传统方法多依赖机器人轨迹,成本高且难以扩展。本文提出ConLA,一种基于对比学习的无监督潜在动作学习框架,利用人类视频中的时间和类别先验,有效解耦动作与视觉噪声。模型采用VQ-VAE提取离散潜在动作,通过对比机制抑制视觉干扰,提升动作语义纯度。实验证明,ConLA在SimperEnv基准中仅用人类视频预训练,成功率超越基于机器人轨迹的模型,验证了其迁移潜力。在实际机器人任务中,性能也优于传统方法,成功率提升超过10%。这一突破表明,大规模人类视频可成为机器人自主学习的宝贵资源,极大降低数据采集成本,推动机器人智能的规模化发展。未来,结合多模态信息和强化学习,ConLA有望实现更复杂场景下的自主操作,开启机器人学习的新纪元。

深度分析

研究背景

机器人自主学习近年来快速发展,早期依赖手工标注和机器人轨迹数据,成本高且难以扩展。近年来,深度学习和大规模数据推动了无监督和弱监督方法的发展,如VQ-VAE和逆动力学模型,提升了潜在动作的表达能力。尽管如此,现有方法多依赖视觉重建目标,容易陷入shortcut问题,导致潜在动作与视觉内容混淆。人类演示视频丰富多样,成为潜在动作学习的重要资源,但缺乏明确的动作标签,限制了其应用。研究逐渐转向利用类别和时间线索实现无监督解耦,提升迁移能力。本文在此基础上提出ConLA,结合对比学习实现潜在动作的纯粹化,推动了该领域的技术革新。

核心问题

核心问题在于如何从复杂的人类视频中学习具有语义纯度的潜在动作,避免视觉干扰和shortcut现象。传统方法多依赖视觉重建,容易陷入仅复制视觉内容的陷阱,导致潜在动作缺乏语义一致性。人类视频的复杂视觉变化和动作多样性,使得潜在动作的解耦变得更加困难。缺乏有效的无监督机制,限制了大规模预训练的潜力。解决这一问题对于实现机器人自主学习的规模化和迁移性具有重要意义。

核心创新

本研究的创新点在于引入对比解耦机制,结合动作类别和时间线索,有效提升潜在动作的语义纯度。具体包括:1)利用VQ-VAE提取离散潜在动作;2)引入动作类别先验,通过对比损失实现类别内聚和类别间分离;3)利用时间线索区分运动与静止内容,增强解耦效果。模型架构创新在于空间-时间Transformer和多模态对比学习的结合,显著优于传统仅依赖重建的潜在动作学习方法。这一机制使得潜在动作更具迁移性和语义一致性,为机器人自主学习提供了新思路。

方法详解

  • �� 利用视频帧对[Ot, Ot+k],通过空间-时间Transformer编码器提取运动信息,生成潜在动作Z。
  • �� 通过逆动力学模型和对比解耦模块,将Z分为动作相关Za′和视觉相关Zv′,并用MLP投影到动作空间。
  • �� 引入类别先验,优化对比损失Laction,增强类别内聚,减少视觉干扰。
  • �� 利用时间线索,反转帧序,得到逆序对ZI,进行视觉内容对比,优化视觉特征的稳定性。
  • �� 量化潜在动作Za,结合当前帧Ot,通过VQ-VAE生成离散动作Token。
  • �� 第二阶段利用预训练的VLM预测潜在动作Token,结合任务指令进行策略预训练。
  • �� 最后微调机器人轨迹,映射潜在动作到实际机器人动作,实现迁移。

实验设计

  • �� 在SimperEnv和真实机器人平台上验证,使用BridgeV2和Something-SomethingV2数据集。
  • �� 评估指标包括成功率、迁移性能,比较LAPA、SCRATCH、ACTIONVLA等基线。
  • �� 进行消融实验验证对比机制的贡献,调节类别标签和时间线索的影响。
  • �� 超参数包括潜在空间维度、对比温度等,确保模型稳定性。

结果分析

  • �� 在SimperEnv中,ConLA预训练仅用人类视频,成功率提升12.5%,超越用机器人轨迹的模型。
  • �� 在实际任务中,成功率提升超过10%,验证了潜在动作的语义纯粹性和迁移能力。
  • �� 消融实验显示,对比机制显著改善潜在动作的类别一致性和迁移效果,验证了创新设计的有效性。

应用场景

  • �� 立即应用于工业机器人自主操作,降低数据采集成本,提升多任务适应性。
  • �� 长远来看,结合多模态信息和强化学习,可实现更复杂环境下的自主学习和协作,推动智能制造和服务机器人普及。

局限与展望

  • �� 当前模型对极端复杂场景和极少样本类别仍存在潜在动作模糊的问题。
  • �� 计算成本较高,实时性有待优化。
  • �� 依赖类别标签和时间线索的准确性,受噪声影响较大。未来需提升模型鲁棒性和效率。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,手里拿着菜刀、锅铲,动作丰富多样。你可以用不同的工具做不同的菜,但厨房里有很多视觉干扰,比如背景的碗碟、油渍。机器人学习就像教一个新手厨师,如何从你做菜的视频中学会做饭。传统方法就像让厨师模仿每个细节,但容易记错或被背景迷惑。ConLA的方法像是教厨师识别动作的核心,比如“切菜”或“炒菜”,而不是背景的杂乱。它用一种聪明的方式,把动作和背景分开,让厨师更快学会做菜,不管厨房多乱。这样,机器人也能更好地理解人类的动作,从而学会做各种复杂的任务,变得更聪明、更灵活。

简单解释 像给14岁少年讲一样

想象你在学校里学跳舞,你的视频里有很多动作,比如转圈、跳跃。老师告诉你要学会这些动作,但视频里背景不同、灯光不同,容易搞混。ConLA就像是用一种特别的眼镜,把动作的核心和背景区分开,让你只记住动作本身,而不是背景的杂乱。它还会根据动作类别,比如“转圈”或“跳跃”,把相似的动作放在一起,这样你学起来更快、更准确。最后,你可以用学到的动作去跳舞,甚至教机器人帮你跳。这个方法让学习变得更简单、更快,也更聪明,因为它只专注于动作的本质,而不是其他干扰。

原文摘要

Vision-Language-Action (VLA) models achieve preliminary generalization through pretraining on large scale robot teleoperation datasets. However, acquiring datasets that comprehensively cover diverse tasks and environments is extremely costly and difficult to scale. In contrast, human demonstration videos offer a rich and scalable source of diverse scenes and manipulation behaviors, yet their lack of explicit action supervision hinders direct utilization. Prior work leverages VQ-VAE based frameworks to learn latent actions from human videos in an unsupervised manner. Nevertheless, since the training objective primarily focuses on reconstructing visual appearances rather than capturing inter-frame dynamics, the learned representations tend to rely on spurious visual cues, leading to shortcut learning and entangled latent representations that hinder transferability. To address this, we propose ConLA, an unsupervised pretraining framework for learning robotic policies from human videos. ConLA introduces a contrastive disentanglement mechanism that leverages action category priors and temporal cues to isolate motion dynamics from visual content, effectively mitigating shortcut learning. Extensive experiments show that ConLA achieves strong performance across diverse benchmarks. Notably, by pretraining solely on human videos, our method for the first time surpasses the performance obtained with real robot trajectory pretraining, highlighting its ability to extract pure and semantically consistent latent action representations for scalable robot learning.

cs.RO