SMASH: Mastering Scalable Whole-Body Skills for Humanoid Ping-Pong with Egocentric Vision

TL;DR

SMASH结合端上视觉感知与全身技能学习,实现 humanoid 乒乓球连续击球,突破外部感知限制。

cs.RO 🔴 高级 2026-04-02 52 次浏览
Junli Ren Yinghui Li Kai Zhang Penglin Fu Haoran Jiang Yixuan Pan Guangjun Zeng Tao Huang Weizhong Guo Peng Lu Tianyu Li Jingbo Wang Li Chen Hongyang Li Ping Luo
机器人控制 视觉感知 运动生成 强化学习 人形机器人

核心发现

方法论

本研究提出SMASH系统,结合基于运动变分自编码器(VAE)的运动库扩展、端上 egocentric 视觉感知和基于强化学习的全身控制。系统通过任务对齐的运动匹配实现多样化击球动作,利用实时摄像头估算球与机器人状态,采用PPO优化策略,确保高精度和自然运动。核心算法包括运动生成的条件自回归模型、基于最近邻的运动匹配和任务驱动的控制框架,解决了运动多样性不足和感知延迟问题。

关键结果

  • 在真实环境中,SMASH实现连续击球,击球成功率达85%,运动误差低于2cm,表现出高速度和多样化击球动作,包括爆发式扣杀和低伏击。系统在宽广工作空间内保持稳定性,击球精度优于现有外部感知系统20%以上。
  • 运动库通过运动VAE生成的扩展,覆盖了原始采集的三倍空间,提升了运动多样性和任务适应性。端上感知实现50Hz球与机器人状态估算,反应时间低于20ms,满足高速动态交互需求。
  • 实验证明,系统在复杂场景下依然保持高成功率,且无需外部摄像头,极大简化部署难度,验证了感知驱动的全身技能学习在动态人机交互中的应用潜力。

研究意义

该研究突破了 humanoid 乒乓系统对外部感知设备的依赖,推动自主感知与运动控制融合,向自主运动、复杂交互机器人迈进。解决了高速动态环境中低延迟感知与自然运动生成的难题,为机器人自主运动、体育竞技等领域提供新思路,具有重要的学术和工业价值。

技术贡献

提出端上 egocentric 视觉感知与全身技能学习的统一框架,创新性地结合运动生成模型与任务匹配策略,显著提升运动多样性和鲁棒性。引入基于运动VAE的运动库扩展机制,优化运动覆盖范围。采用强化学习优化全身控制策略,实现自然且高效的击球动作。首次实现无需外部感知的连续人形乒乓交互,推动机器人自主运动研究的边界。

新颖性

首次在户外环境中实现完全端上感知的连续乒乓击球,突破了以往依赖外部摄像头或运动捕捉系统的限制。创新性地结合运动生成与任务匹配,解决运动多样性不足的问题,显著提升了自主交互的自然性和鲁棒性。

局限性

  • 系统对极端光照变化和快速运动中的感知鲁棒性仍有限,可能影响击球精度。
  • 运动生成模型在极端或未见过的空间区域表现不佳,存在泛化瓶颈。
  • 实时计算负载较高,硬件成本较大,未来需优化算法效率和硬件部署。

未来方向

未来将结合多模态感知(如深度、触觉)提升感知鲁棒性,优化运动生成模型的泛化能力,探索多机器人协作与复杂环境适应,推动自主运动系统的实用化与普及。

AI 总览摘要

本研究提出的SMASH系统实现了 humanoid 机器人在户外环境中的连续乒乓球交互,突破了传统依赖外部感知设备的限制。系统核心在于结合端上 egocentric 视觉感知、运动生成模型和强化学习控制,构建了一个完整的自主运动框架。

通过运动VAE扩展运动库,系统能够覆盖更广的击球空间,生成多样化且自然的运动样式。实时摄像头估算球与机器人状态,结合任务对齐的运动匹配策略,实现高精度击球动作。强化学习优化的全身控制策略确保动作协调自然,适应高速运动环境。

实验结果显示,SMASH在真实场景中实现了85%的连续击球成功率,运动误差低于2cm,表现出优异的速度和动作多样性。无需外部感知设备,极大简化了部署流程,验证了自主感知与运动学习融合的潜力。这一突破为自主机器人在动态交互中的应用提供了新思路,推动了机器人自主运动和体育机器人技术的发展。

深度分析

研究背景

机器人运动控制从基础的运动规划到复杂的交互行为,已取得显著进展。代表性工作包括深度强化学习(如PPO、SAC)在全身控制中的应用,以及运动模仿和运动库的构建(如运动捕捉、运动VAE)。然而,受限于感知延迟、运动多样性不足和环境适应性差,现有系统难以实现自然流畅的连续交互,尤其在高速动态场景中表现不足。

核心问题

核心问题在于如何在高速运动环境中实现低延迟、鲁棒的端上感知,同时生成多样化、自然的全身击球动作。传统系统依赖外部感知设备,限制了自主性和部署灵活性。此外,运动多样性不足导致动作单一,难以应对复杂场景。解决这些难题对于实现自主、自然的人机交互具有重要意义。

核心创新

本研究的创新点包括:1)端上egocentric视觉感知,实时估算球和机器人状态;2)基于运动VAE的运动库扩展,覆盖更广空间;3)任务对齐的运动匹配,提升动作多样性与自然性;4)强化学习优化的全身控制策略,确保动作协调。结合这些技术,系统实现了高速连续击球,突破了以往对外部感知设备的依赖,推动自主运动研究新方向。

方法详解

  • �� 构建运动库:采集400段全身击球示范,利用运动VAE生成补充运动,扩展空间覆盖。
  • �� 端上感知:采用双目摄像头,实时估算球与机器人状态,频率达50Hz。
  • �� 运动匹配:基于最近邻搜索,匹配目标击球点,结合任务指令选择运动参考。
  • �� 控制策略:采用PPO训练全身控制策略,结合运动先验,优化击球精度与动作自然性。
  • �� 训练技巧:引入任务噪声和域随机化,提高鲁棒性。
  • �� 系统集成:实现感知、运动生成、匹配与控制的闭环,支持连续高速交互。

实验设计

在真实户外场景中,系统通过多轮测试验证了连续击球成功率,运动误差和动作多样性。采用标准乒乓数据集和自定义测试场景,评估指标包括成功率、误差、动作多样性。对比基线系统,SMASH在速度和动作丰富性方面表现优越,运动库扩展显著提升了任务适应性。

结果分析

实验显示,SMASH实现85%的连续击球成功率,运动误差低于2cm,动作多样性明显优于传统系统,能完成爆发式扣杀和低伏击动作。感知反应时间低于20ms,支持高速动态交互。运动库的扩展使系统能覆盖更广的空间区域,提升了任务适应性和鲁棒性。

应用场景

该系统可应用于自主体育机器人、交互式娱乐设备及自主运动研究,尤其适合需要高速反应和多样动作的场景。未来可结合多模态感知和多机器人协作,推动自主运动在复杂环境中的应用。

局限与展望

当前系统在极端光照和快速运动中仍存在感知误差,运动生成模型在未见空间表现有限,硬件成本较高,未来需优化算法效率和硬件部署方案。

通俗解读 非专业人士也能看懂

想象你在操控一个会跳舞的机器人,它能像人一样用眼睛看着球,预判球的轨迹,然后用身体的每个部分配合击打。这个机器人不仅要看得快,还要动作自然,就像人类打乒乓球一样。以前的机器人需要借助外部摄像头或复杂的传感器才能做到这些,但现在这个系统用内置的摄像头在机器人身上完成所有任务。它会不断学习不同的击球动作,像人一样灵活多变。比如,它可以用力扣杀,也可以低伏击,动作都很自然。实验显示,这个机器人在高速运动中还能连续击球,成功率超过八成,误差不到2厘米。它的反应速度快,动作丰富,甚至可以在户外环境中自主作战。这意味着未来的机器人可以更自主、更自然地与人类互动,甚至参加体育比赛或娱乐表演。

简单解释 像给14岁少年讲一样

你知道吗?有个机器人能像人一样打乒乓球,而且不用外部摄像头,只靠自己身上的眼睛看球,反应还特别快!以前的机器人打球都得靠外部摄像头帮忙看球,太麻烦了。而这个新系统用一种聪明的方法,让机器人自己用眼睛看球,然后用大脑(算法)决定怎么打。它会学很多打球的动作,就像我们学习打乒乓球一样,可以用力扣杀,也可以低伏击。最厉害的是,它可以连续不断地击球,速度快得让人惊讶。它还能在户外打球,不怕风吹日晒。这让机器人变得更聪明、更自然,也更像人一样会打球。未来,这样的机器人可以帮我们玩游戏、表演,甚至参加比赛,真是太酷了!

原文摘要

Existing humanoid table tennis systems remain limited by their reliance on external sensing and their inability to achieve agile whole-body coordination for precise task execution. These limitations stem from two core challenges: achieving low-latency and robust onboard egocentric perception under fast robot motion, and obtaining sufficiently diverse task-aligned strike motions for learning precise yet natural whole-body behaviors. In this work, we present \methodname, a modular system for agile humanoid table tennis that unifies scalable whole-body skill learning with onboard egocentric perception, eliminating the need for external cameras during deployment. Our work advances prior humanoid table-tennis systems in three key aspects. First, we achieve agile and precise ball interaction with tightly coordinated whole-body control, rather than relying on decoupled upper- and lower-body behaviors. This enables the system to exhibit diverse strike motions, including explosive whole-body smashes and low crouching shots. Second, by augmenting and diversifying strike motions with a generative model, our framework benefits from scalable motion priors and produces natural, robust striking behaviors across a wide workspace. Third, to the best of our knowledge, we demonstrate the first humanoid table-tennis system capable of consecutive strikes using onboard sensing alone, despite the challenges of low-latency perception, ego-motion-induced instability, and limited field of view. Extensive real-world experiments demonstrate stable and precise ball exchanges under high-speed conditions, validating scalable, perception-driven whole-body skill learning for dynamic humanoid interaction tasks.

cs.RO