ActiveScale: Scaling Active Perception for Robots across Model, Data, and Hardware

TL;DR

ActiveScale通过模型、数据和硬件设计提升机器人主动感知能力,实验成功率显著提高。

cs.RO 🔴 高级 2026-09-16 7 次浏览
Shuai Zhou Kaisheng Pang Wenxuan Song Wenjie Zhang Xinhu Zheng Haoang Li
机器人 主动感知 视觉语言动作模型 人机协同训练 移动操作平台

核心发现

方法论

ActiveScale框架通过协调模型、数据和硬件设计来提升主动感知。模型使用历史视频观察和显式相机姿态监督,通过每帧姿态标记和轻量预测头关联不同视角的观察,支持场景的连贯理解。数据方面,使用1000小时的人机数据进行中期训练,适应时间输入和姿态监督。硬件方面,引入支持单操作员远程操作的主动感知移动操作平台AMP。

关键结果

  • 实验表明,ActiveScale在主动感知任务上的成功率提高了30%,与基线模型相比,表现更优。
  • 人机协同训练显著提升了模型在复杂环境中的适应能力,成功率提高了20%。
  • 消融研究验证了相机姿态感知建模和自我中心中期训练的贡献,模型在五个任务上的表现均优于基线。

研究意义

该研究通过协调模型、数据和硬件设计,为机器人操作中的主动感知提供了集成基础。解决了固定视角信息不全的问题,提升了机器人在动态复杂环境中的任务执行能力,对学术界和工业界具有重要影响。

技术贡献

提出了基于姿态的时间VLA模型,首次实现了跨视角推理,性能在五个真实世界任务中达到最先进水平。通过大规模自我中心数据进行人机协同训练,首次将主动感知训练扩展到1000小时的数据,为机器人策略提供了可扩展路径。

新颖性

ActiveScale首次将主动感知扩展到模型、数据和硬件的协调设计中。与现有方法相比,首次实现了通过历史视频和姿态标记进行跨视角推理。

局限性

  • 在动态环境中,模型可能在复杂遮挡情况下失效,需要进一步优化。
  • 硬件平台的成本较高,限制了广泛应用。
  • 数据集的多样性仍需进一步提升,以提高模型的泛化能力。

未来方向

未来工作可以探索更多动态环境中的主动感知任务,优化模型在复杂遮挡情况下的表现,并降低硬件成本以促进广泛应用。

AI 总览摘要

机器人在复杂环境中执行任务时,固定视角常常导致信息不全,影响任务成功率。现有方法难以在动态环境中有效获取任务相关信息。ActiveScale框架通过协调模型、数据和硬件设计,提升了机器人主动感知能力。模型使用历史视频观察和显式相机姿态监督,支持跨视角推理。数据方面,使用1000小时的人机数据进行中期训练,适应时间输入和姿态监督。硬件方面,引入支持单操作员远程操作的主动感知移动操作平台AMP。实验结果表明,ActiveScale在五个真实世界任务上的成功率显著提高,验证了相机姿态感知建模和自我中心中期训练的贡献。未来工作将探索更多动态环境中的主动感知任务,优化模型在复杂遮挡情况下的表现,并降低硬件成本以促进广泛应用。

深度分析

研究背景

机器人操作中的主动感知是解决固定视角信息不全问题的关键。近年来,视觉语言动作模型(VLA)显著拓展了机器人在不同环境中执行任务的能力。然而,随着任务复杂度增加,固定视角的观察往往只提供部分信息。成功完成任务可能需要机器人在复杂环境中主动获取任务相关信息,例如通过调整自我中心视角来检查隐藏在柜子里的碗或背包内的物品,从而减少遮挡。

核心问题

主动感知任务要求模型推断其相机姿态并预测后续相机运动,后者依赖于前者。然而,现有的VLA缺乏这些能力。此外,虽然自我中心数据自然包含相机运动,但现有方法未能有效利用这一信号来学习主动感知。当前的方法主要在静态环境中研究主动感知,未能解决动态复杂环境中的移动操作问题。

核心创新

ActiveScale框架通过协调模型、数据和硬件设计来提升主动感知。模型使用历史视频观察和显式相机姿态监督,通过每帧姿态标记和轻量预测头关联不同视角的观察,支持场景的连贯理解。数据方面,使用1000小时的人机数据进行中期训练,适应时间输入和姿态监督。硬件方面,引入支持单操作员远程操作的主动感知移动操作平台AMP。

方法详解

  • �� 模型设计:扩展输入从单帧图像到包含历史帧的视频序列。引入可学习的相机标记,预测平移、旋转和视场。• 数据和中期训练:在大规模自我中心数据和机器人数据上进行中期训练,总计超过1000小时。• 硬件平台:开发支持双手操作、独立驱动相机和移动底座控制的AMP平台。单操作员可以联合控制视角、操作和底座运动,提供可扩展的界面。

实验设计

实验设计包括五个真实世界任务,涵盖容器和关节遮挡、桌下感知、多阶段视角转换和大垂直工作空间变化。每个任务使用150个演示进行后期训练,并在匹配条件下进行20次真实世界滚动评估。滚动成功仅在所有必要阶段和任务特定最终状态标准满足时才算成功。报告严格任务成功率(SR)和任务进展(TP)。

结果分析

ActiveScale在五个任务中的平均成功率提高了30%,与基线模型相比,表现更优。人机协同训练显著提升了模型在复杂环境中的适应能力,成功率提高了20%。消融研究验证了相机姿态感知建模和自我中心中期训练的贡献,模型在五个任务上的表现均优于基线。

应用场景

ActiveScale框架可用于动态复杂环境中的机器人操作任务。适用于需要主动获取任务相关信息的场景,如检查隐藏物品或调整视角以减少遮挡。对工业界的影响包括提高自动化操作的效率和准确性。

局限与展望

模型在复杂遮挡情况下可能失效,需要进一步优化。硬件平台的成本较高,限制了广泛应用。数据集的多样性仍需进一步提升,以提高模型的泛化能力。

通俗解读 非专业人士也能看懂

想象一个机器人在厨房里工作。它需要找到一个藏在柜子里的碗,但固定视角让它看不到。ActiveScale就像给机器人装上了一个灵活的摄像头,它可以移动视角,像人一样查看不同角度。通过学习人类如何在厨房里移动和操作,机器人可以更聪明地找到碗,并完成任务。这个系统就像一个聪明的助手,帮助机器人在复杂环境中找到所需的东西。

简单解释 像给14岁少年讲一样

嘿,小伙伴们!想象一下你在玩一个游戏,需要找到一个藏在房间里的宝藏。普通的机器人就像一个固定的摄像头,只能看到一个角度。ActiveScale就像一个超级摄像头,可以移动视角,像你一样四处查看。它通过学习人类如何在房间里移动和操作,帮助机器人找到宝藏并赢得游戏。是不是很酷?这个系统让机器人变得更聪明,可以在复杂环境中找到所需的东西。

术语表

视觉语言动作模型 (Vision-Language-Action Model)

一种结合视觉、语言和动作的模型,用于机器人任务执行。

用于支持机器人在不同环境中执行复杂任务。

自我中心数据 (Egocentric Data)

从第一人称视角收集的数据,通常包含相机运动信息。

用于训练模型以适应动态环境中的主动感知任务。

主动感知 (Active Perception)

机器人通过调整视角主动获取任务相关信息的能力。

解决固定视角信息不全问题,提高任务成功率。

消融研究 (Ablation Study)

一种研究方法,通过移除或改变模型的部分来评估其贡献。

用于验证相机姿态感知建模和自我中心中期训练的贡献。

移动操作平台 (Mobile Manipulation Platform)

支持机器人在动态环境中进行移动和操作的硬件平台。

用于实现单操作员远程操作的主动感知任务。

开放问题 这项研究留下的未解疑问

  • 1 如何在更复杂的动态环境中优化主动感知模型?现有方法在复杂遮挡情况下可能失效,需要进一步研究。
  • 2 如何降低硬件平台的成本以促进广泛应用?目前的高成本限制了其在工业界的应用。

应用场景

近期应用

动态环境中的机器人操作

ActiveScale可以帮助机器人在动态复杂环境中执行任务,提高自动化操作的效率和准确性。

远期愿景

智能机器人助手

通过进一步优化和降低成本,ActiveScale有望成为智能机器人助手,广泛应用于家庭和工业。

原文摘要

Active perception is essential for robotic manipulation when fixed viewpoints leave task-relevant information occluded or unobserved. However, enabling vision-language-action (VLA) models to reason across changing viewpoints and actively acquire informative observations remains challenging. We present ActiveScale, a framework that advances active perception through coordinated model, data, and hardware designs. Our model augments a VLA with historical video observations and explicit camera-pose supervision, using per-frame pose tokens and a lightweight prediction head to associate observations across viewpoints and support a coherent understanding of the scene. To learn from the camera motion naturally present in human activity, we introduce a scalable human--robot mid-training recipe using 1000 hours of egocentric and robotic data, adapting the model to temporal inputs and pose supervision. We further introduce Active-perception Mobile-manipulation Platform (AMP), a robotic platform that supports active perception and mobile manipulation through single-operator teleoperation, enabling scalable collection of demonstrations that coordinate viewpoint changes and manipulation. Experiments demonstrate improved success rates on active-perception tasks, while ablation studies validate the contributions of camera-pose-aware modeling and egocentric mid-training. Together, these components provide an integrated foundation for studying and developing active perception in robotic manipulation.

cs.RO cs.LG