KungfuBot: Physics-Based Humanoid Whole-Body Control for Learning Highly-Dynamic Skills

TL;DR

KungfuBot采用物理基础全身控制,训练动态技能,误差显著低于现有方法,成功部署于Unitree G1机器人。

cs.RO 🔴 高级 2025-06-15 104 引用 69 次浏览
Weiji Xie Jinrui Han Jiakun Zheng Huanyu Li Xinzhe Liu Jiyuan Shi Weinan Zhang Chenjia Bai Xuelong Li
机器人控制 深度强化学习 运动模仿 物理约束 动态技能

核心发现

方法论

本文提出的KungfuBot框架结合多步骤运动处理和自适应运动追踪机制,利用双层优化和非对称actor-critic架构实现高动态技能学习。首先,通过基于物理的运动过滤、修正和重定向,从视频中提取符合物理约束的运动序列。然后,采用基于追踪误差的指数奖励函数和bi-level优化,动态调整追踪容差,形成自适应课程机制。最后,利用偏置的actor-critic模型,结合优先信息和奖励向量化,训练全身控制策略。该方法在模拟和实际机器人上均取得优异表现,追踪误差明显低于现有方法,且成功实现复杂动作如功夫和舞蹈。

关键结果

  • 在模拟环境中,PBHC在多项动态动作追踪中,平均误差比现有最优方法低30%以上,例如在高难度动作中Eg-mpbpe误差从233.54mm降至53.25mm,表现出极强的运动逼真度和稳定性。
  • 在实际部署中,PBHC在Unitree G1机器人上实现了稳定、富有表现力的动作,特别是在复杂的功夫和舞蹈动作中,表现出优异的动作一致性和鲁棒性,验证了其良好的sim-to-real迁移能力。
  • 通过引入自适应追踪因子,训练过程中误差逐步降低,追踪精度持续提升,验证了动态调节机制的有效性,显著优于固定参数策略。

研究意义

该研究突破了 humanoid 机器人在高动态动作模仿中的瓶颈,提供了结合物理约束的运动过滤与自适应追踪机制的创新框架,极大提升了机器人运动的逼真度和鲁棒性。其在机器人学习、运动仿真和人机交互等领域具有重要推动作用,为未来复杂技能的自主学习和部署奠定基础。特别是在工业、娱乐和康复机器人等应用场景中,能够实现更自然、更灵活的动作表现,推动机器人技术迈向更高水平。

技术贡献

本文的核心技术创新在于提出结合物理约束的多步骤运动处理流水线,有效过滤和修正运动数据,确保运动的物理可行性。同时,设计了基于追踪误差的指数奖励函数和bi-level优化策略,实现追踪容差的动态调节,增强学习过程中的适应性。引入非对称actor-critic架构,利用优先信息和奖励向量化技术,提高价值估计的精度和训练稳定性。最后,将这些技术集成在一个端到端的深度强化学习框架中,成功实现了高动态技能的学习和迁移。该方法在模拟和实机上均表现出优异的性能,显著优于现有的运动模仿和全身控制方法。

新颖性

本研究首次系统性结合物理基础运动过滤、自适应追踪奖励机制和偏置actor-critic架构,专为高动态动作设计,突破了传统方法只能追踪平滑低速动作的限制。提出的bi-level优化模型和自适应调节机制,为机器人运动学习提供了新的理论基础和工程实现路径,显著提升了运动追踪精度和动作多样性,具有较强的创新性和实用价值。

局限性

  • 该方法在极端动态或复杂环境下仍可能面临运动过滤和追踪误差较大的挑战,特别是在运动数据质量较差或环境干扰较强时,运动过滤的效果可能受限。
  • 训练过程依赖大量模拟数据和复杂的优化步骤,计算成本较高,实际部署时对硬件资源要求较大,限制了其在低成本平台上的应用。
  • 目前主要在单一机器人平台(Unitree G1)验证,泛化到不同硬件或多机器人协作场景仍需进一步研究。

未来方向

未来将探索多模态运动数据融合,提高运动提取的鲁棒性;优化算法以降低计算成本,提升实时性;扩展到多机器人系统,实现协作高动态技能学习;同时结合自主感知与环境理解,增强机器人在复杂环境中的适应能力。还计划引入迁移学习和元学习技术,以实现跨任务和跨平台的高效迁移,推动机器人自主学习的广泛应用。

AI 总览摘要

随着机器人技术的不断发展, humanoid 机器人在模仿人类复杂动作方面面临巨大挑战。传统方法多依赖平滑、低速运动的追踪,难以实现高动态技能如功夫和舞蹈的逼真模仿。本文提出的KungfuBot框架突破了这一瓶颈,通过结合物理基础的运动处理和自适应追踪机制,显著提升了高难度动作的追踪精度和稳定性。

该方法的核心在于两个阶段:第一阶段是运动处理流水线,利用运动提取、物理过滤、接触修正和重定向技术,确保运动数据符合物理约束。第二阶段是基于误差的自适应追踪机制,通过bi-level优化动态调节追踪容差,使学习过程更具弹性和鲁棒性。为提升训练效率和效果,采用了偏置的actor-critic架构,结合奖励向量化和优先信息,增强了价值估计的准确性。

在模拟环境中,PBHC在多项高动态动作中,追踪误差比现有方法低30%以上,例如在复杂动作中Eg-mpbpe误差从233.54mm降至53.25mm。更令人振奋的是,训练完成后,该策略成功迁移到Unitree G1机器人,实现了稳定、富有表现力的动作,验证了其强大的实用潜力。引入自适应追踪因子后,误差逐步降低,动作质量持续提升,展现出极佳的学习适应性。

这项研究不仅推动了机器人运动模仿的前沿,也为未来自主学习高动态技能提供了新的技术路径。其在工业、娱乐、康复等多个领域都具有广泛的应用前景,尤其是在实现更自然、更灵活的人机交互方面具有重要意义。未来,研究将聚焦于多模态数据融合、算法优化和多机器人协作,进一步拓展其应用范围和性能极限。

深度分析

研究背景

机器人运动模仿作为人工智能与机器人学的交叉前沿,经历了从基于模板的运动复制到深度学习驱动的自主控制的演变。早期方法多依赖运动捕捉数据和规则式控制,难以实现自然流畅的动作。近年来,深度强化学习(Deep Reinforcement Learning, DRL)成为主流,代表性工作如DeepMimic、Motion Imitation等,推动了机器人在平滑动作上的表现。然而,高动态动作如武术、舞蹈等仍是难点,主要原因在于运动数据的复杂性、物理限制的约束以及训练样本的多样性不足。运动捕捉数据缺乏物理信息,导致直接模仿难以实现真实感。为解决这些问题,研究者开始结合运动过滤、物理建模和强化学习,探索更符合物理规律的运动生成与追踪技术。

核心问题

尽管已有方法在平滑、低速运动模仿方面取得一定成功,但在高动态、快速变化的动作中表现仍不理想。主要问题包括运动数据的物理不一致性、追踪误差难以控制、运动的多样性不足以及训练过程的稳定性差。传统强化学习方法难以在保证物理合理性的同时,追踪复杂动作,导致误差较大和动作不自然。此外,缺乏动态调节追踪容差的机制,使得模型在面对不同难度动作时表现不一,限制了其在实际应用中的推广。

核心创新

本研究的创新点在于提出结合物理基础运动过滤和自适应追踪奖励的全新框架。首先,利用运动提取、运动过滤和接触修正技术,确保运动数据的物理合理性,解决数据质量问题。其次,设计基于追踪误差的指数奖励函数,并引入bi-level优化模型,动态调节追踪容差,实现对不同难度动作的自适应追踪。再次,采用偏置的actor-critic架构,结合奖励向量化和优先信息,提升训练的稳定性和效率。最后,将这些技术集成在端到端的深度强化学习流程中,有效实现高动态技能的学习和迁移。

方法详解

  • �� 运动提取:利用GVHMR模型,从单目视频中估算SMPL参数(身体形状、关节旋转、全局位移),生成运动序列。• 运动过滤:基于物理指标(如质心(CoM)与压力中心(CoP)距离)筛选出稳定运动,排除不符合物理约束的运动。• 运动修正:通过接触掩码分析脚部接触状态,调整运动中的浮动和漂移,确保运动的物理合理性。• 运动重定向:采用逆运动学(IK)算法,将处理后的运动重定向到机器人模型,确保动作的可执行性。• 追踪奖励设计:定义指数奖励函数,依据追踪误差动态调节容差,形成自适应课程机制。• bi-level优化:在上层优化追踪因子σ,下层训练策略π,最大化最终追踪精度。• Actor-critic架构:引入偏置的多输出价值网络,结合奖励向量化技术,提升训练稳定性。• 训练流程:利用参考状态初始化(RSI)和域随机化实现模拟到实机的迁移,训练策略在模拟中优化后直接部署到Unitree G1机器人。

实验设计

在模拟环境中,使用多样化的高动态动作数据集(包括功夫、跳跃、旋转等动作),通过不同难度级别(易、中、难)进行训练和评估。采用多随机种子,进行1000轮回测试,指标包括全身位置误差、关节位置误差、速度误差等。对比现有方法如OmniH2O、ExBody2,PBHC在追踪误差上显著优越,Eg-mpbpe误差降低30%以上。在实际机器人上,部署训练得到的策略,进行复杂动作演示,验证其鲁棒性和表现力。还通过消融实验验证自适应追踪机制的效果,误差逐步降低,动作逼真度提升。

通俗解读 非专业人士也能看懂

想象你在一家工厂里,工人们每天都在做各种不同的动作,比如搬东西、跳舞、甚至表演武术。工厂的机器人就像是这些工人,他们也需要学习这些动作,但问题是,工厂里的机器人和人类的身体结构完全不同,直接模仿人类的动作会出现很多问题,比如动作不自然、容易摔倒。为了让机器人学会像人一样灵活、自然地做动作,科学家们设计了一套特别的方法。

首先,他们用摄像头拍摄人类的动作,然后用特殊的算法把这些动作转化成机器人能理解的形式。这就像是把人类的舞蹈动作翻译成机器人能跳的舞步。接着,他们会检查这些动作是否符合物理规律,比如是否会让机器人失衡或摔倒。如果发现不合理的动作,就会进行修正,确保动作既漂亮又安全。

然后,科学家们还设计了一种智能系统,能根据机器人追踪动作的准确程度,自动调整学习的难度。就像老师根据学生的表现,调整作业的难度一样。这样,机器人可以逐步学会更复杂、更快的动作。整个学习过程就像是教机器人跳一支复杂的功夫舞,每次跳完后,系统会告诉它哪里还可以做得更好,然后再继续练习。

经过反复训练,机器人不仅能模仿人类的高难度动作,还能在真实的机器人身上表现出来,比如Unitree G1机器人。它可以做出像武术一样的动作,甚至能跳舞、旋转,动作自然流畅。这项技术的意义在于,让机器人变得更聪明、更灵活,将来它们可以在工厂、舞台甚至康复中心帮忙,完成各种复杂任务。虽然目前还存在一些挑战,比如在极端环境下的表现,但这项研究无疑为机器人自主学习高难度动作打开了新的大门。

简单解释 像给14岁少年讲一样

想象你在学校里学舞蹈,你需要跟老师学动作,然后不断练习,直到动作变得漂亮又自然。可是,假如你的身体和老师完全不一样,比如老师很高,你很矮,直接模仿可能会出错,还可能摔倒。科学家们遇到的情况也差不多,他们想让机器人学会像人一样跳舞、打功夫,但机器人和人类的身体结构不同,直接模仿效果不好。

所以,他们设计了一套特别的学习方法。首先,用摄像头拍摄人类的动作,然后用电脑算法把动作转成机器人可以理解的指令,就像把舞蹈动作翻译成机器人能跳的舞步一样。接着,他们会检查这些动作是否合理,比如是否会让机器人失衡或摔倒,如果发现问题,就会帮它修正,确保动作既漂亮又安全。

更厉害的是,他们还设计了一个智能系统,可以根据机器人追踪动作的准确程度,自动调整学习的难度。就像老师知道你跳得还不够好,就会给你一些简单的动作,等你熟练了,再挑战更难的动作。这样,机器人可以逐步学会更复杂、更快的动作。

经过不断的练习,这个机器人不仅能模仿人类的动作,还能在真实的机器人身上表现出来,比如Unitree G1机器人。它可以做出像武术一样的动作,甚至能跳舞、旋转,动作非常自然。这项技术的意义在于,让机器人变得更聪明、更灵活,将来它们可以在工厂、舞台甚至康复中心帮忙,完成各种复杂任务。虽然还存在一些挑战,比如在极端环境下的表现,但这项研究为机器人自主学习高难度动作提供了新的可能。

术语表

Physics-Based Motion Filtering (物理基础运动过滤)

一种利用物理原理筛选运动数据的方法,确保运动符合力学和生物力学规律,避免不合理动作。

用于过滤从视频提取的运动序列,确保其物理合理性。

Bi-level Optimization (双层优化)

一种优化策略,包含两个层级:上层调节参数以最大化外部目标,下层训练策略以最大化内部奖励。

用于动态调节追踪容差,提升学习适应性。

Actor-Critic (演员-评论家)

一种强化学习架构,演员生成动作,评论家估算价值,优化策略。

本文采用偏置的多输出架构,提升训练稳定性。

Reward Vectorization (奖励向量化)

将多个奖励信号分开估算,避免单一标量带来的信息丢失,提升训练效果。

增强价值估算的精度,改善训练稳定性。

SMPL模型 (Skinned Multi-Person Linear Model)

一种参数化人体模型,用于表示人体姿态和形状,便于运动分析和重定向。

从视频中提取运动参数,作为运动模仿的基础。

Inverse Kinematics (逆运动学)

通过已知末端位置反求关节角度的算法,确保运动的可执行性。

用于将运动重定向到机器人模型。

Domain Randomization (域随机化)

在训练中随机变化环境参数,提高模型的泛化能力,增强实机迁移能力。

实现模拟到实机的零样本迁移。

Exponential Reward Function (指数奖励函数)

一种基于误差的奖励函数,随误差变化呈指数衰减,平衡追踪精度与训练稳定性。

设计追踪奖励,调节追踪容差。

Reference State Initialization (参考状态初始化)

从参考运动中随机采样状态,初始化机器人状态,加快训练效率。

用于多阶段训练和提高样本效率。

Motion Retargeting (运动重定向)

将提取或生成的运动数据映射到目标机器人模型,确保动作的可行性。

通过逆运动学实现。

开放问题 这项研究留下的未解疑问

  • 1 尽管本研究在模拟和实机上取得了显著成果,但在极端环境或复杂场景下的运动鲁棒性仍需提升。未来需要结合感知与环境理解,增强模型的适应能力。此外,算法的计算成本较高,实时性仍是挑战。如何在保证运动质量的同时降低计算负担,是未来的重要研究方向。同时,跨平台迁移和多机器人协作的能力仍待验证,推动多模态、多任务的高动态技能学习成为下一步重点。

应用场景

近期应用

高端人机交互娱乐

实现逼真的机器人舞蹈和武术表演,用于舞台演出或虚拟现实交互,提升用户体验。

康复机器人辅助训练

通过模仿高难度动作,辅助康复训练,帮助患者恢复运动能力。

工业机器人复杂任务执行

在制造和装配中,实现高精度、高速的复杂动作,提高生产效率。

远期愿景

自主学习多技能机器人

未来机器人能自主学习多样化高动态技能,适应不同环境和任务,减少人工干预。

人机协作新范式

实现机器人与人类的无缝协作,共同完成复杂任务,推动智能制造和服务机器人发展。

原文摘要

Humanoid robots are promising to acquire various skills by imitating human behaviors. However, existing algorithms are only capable of tracking smooth, low-speed human motions, even with delicate reward and curriculum design. This paper presents a physics-based humanoid control framework, aiming to master highly-dynamic human behaviors such as Kungfu and dancing through multi-steps motion processing and adaptive motion tracking. For motion processing, we design a pipeline to extract, filter out, correct, and retarget motions, while ensuring compliance with physical constraints to the maximum extent. For motion imitation, we formulate a bi-level optimization problem to dynamically adjust the tracking accuracy tolerance based on the current tracking error, creating an adaptive curriculum mechanism. We further construct an asymmetric actor-critic framework for policy training. In experiments, we train whole-body control policies to imitate a set of highly-dynamic motions. Our method achieves significantly lower tracking errors than existing approaches and is successfully deployed on the Unitree G1 robot, demonstrating stable and expressive behaviors. The project page is https://kungfubot.github.io.

cs.RO cs.AI

参考文献 (20)

Perpetual Humanoid Control for Real-time Simulated Avatars

Zhengyi Luo, Jinkun Cao, Alexander W. Winkler 等

2023 323 引用 查看解读 →

SMPL

M. Loper, Naureen Mahmood, J. Romero 等

2015 4358 引用

Learning Agile Robotic Locomotion Skills by Imitating Animals

Xue Bin Peng, Erwin Coumans, Tingnan Zhang 等

2020 680 引用 查看解读 →

AMASS: Archive of Motion Capture As Surface Shapes

Naureen Mahmood, N. Ghorbani, N. Troje 等

2019 1991 引用 查看解读 →

Institutional Review Board

G. Pearson

2020 471 引用

Reducing Footskate in Human Motion Reconstruction with Ground Contact Constraints

Yuliang Zou, Jimei Yang, Duygu Ceylan 等

2020 37 引用

Proximal Policy Optimization Algorithms

John Schulman, Filip Wolski, Prafulla Dhariwal 等

2017 30471 引用 查看解读 →

RT-1: Robotics Transformer for Real-World Control at Scale

Anthony Brohan, Noah Brown, Justice Carbajal 等

2022 2727 引用 查看解读 →

Robust and Versatile Bipedal Jumping Control through Reinforcement Learning

Zhongyu Li, Xue Bin Peng, P. Abbeel 等

2023 83 引用 查看解读 →

3D Human Pose Estimation via Intuitive Physics

Shashank Tripathi, Lea Muller, C. Huang 等

2023 156 引用 查看解读 →

Learning and Deploying Robust Locomotion Policies with Minimal Dynamics Randomization

Luigi Campanaro, Siddhant Gangapurwala, W. Merkt 等

2022 26 引用 查看解读 →

Diffusion Model is an Effective Planner and Data Synthesizer for Multi-Task Reinforcement Learning

Haoran He, Chenjia Bai, Kang Xu 等

2023 162 引用 查看解读 →

Bridging the Sim-to-Real Gap from the Information Bottleneck Perspective

Haoran He, Chenjia Bai, Hang Lai 等

2023 16 引用 查看解读 →

MotionGPT: Human Motion as a Foreign Language

Biao Jiang, Xin Chen, Wen Liu 等

2023 658 引用 查看解读 →

An Introduction to Bilevel Optimization: Foundations and applications in signal processing and machine learning

Yihua Zhang, Prashant Khanduri, Ioannis C. Tsaknakis 等

2023 70 引用 查看解读 →

Learning an Actionable Discrete Diffusion Policy via Large-Scale Actionless Video Pre-Training

Haoran He, Chenjia Bai, Ling Pan 等

2024 37 引用 查看解读 →

Expressive Whole-Body Control for Humanoid Robots

Xuxin Cheng, Yandong Ji, Junming Chen 等

2024 281 引用 查看解读 →

Learning Human-to-Humanoid Real-Time Whole-Body Teleoperation

Tairan He, Zhengyi Luo, Wenli Xiao 等

2024 274 引用 查看解读 →

Move as you Say, Interact as you can: Language-Guided Human Motion Generation with Scene Affordance

Zan Wang, Yixin Chen, Baoxiong Jia 等

2024 107 引用 查看解读 →

MMVP: A Multimodal MoCap Dataset with Vision and Pressure Sensors

He Zhang, Shenghao Ren, Haolei Yuan 等

2024 25 引用 查看解读 →

被引用 (20)

RPG: Robust Policy Gating for Smooth Multi-Skill Transitions in Humanoid Fighting

2026 ⭐ 高影响力 查看解读 →

Chasing Autonomy: Dynamic Retargeting and Control Guided RL for Performant and Controllable Humanoid Running

2026 4 引用 ⭐ 高影响力 查看解读 →

PressMimic: Pressure-Guided Motion Capture and Control for Humanoid Robot Imitation

2026 1 引用 ⭐ 高影响力 查看解读 →

SMASH: Mastering Scalable Whole-Body Skills for Humanoid Ping-Pong with Egocentric Vision

2026 5 引用 查看解读 →

Demystifying Reinforcement Learning Post-Training of Language Models

OmniXtreme: Breaking the Generality Barrier in High-Dynamic Humanoid Control

2026 18 引用 查看解读 →

X-Loco: Towards Generalist Humanoid Locomotion Control via Synergetic Policy Distillation

2026 3 引用 查看解读 →

Pro-HOI: Perceptive Root-guided Humanoid-Object Interaction

2026 6 引用 查看解读 →

Rhythm: Learning Interactive Whole-Body Control for Dual Humanoids

2026 1 引用 查看解读 →

OmniTrack: General Motion Tracking via Physics-Consistent Reference

2026 7 引用 查看解读 →

Flip Stunts on Bicycle Robots using Iterative Motion Imitation

2026 4 引用 查看解读 →

SUGAR: A Scalable Human-Video-Driven Generalizable Humanoid Loco-Manipulation Learning Framework

2026 3 引用 查看解读 →

HEX: Humanoid-Aligned Experts for Cross-Embodiment Whole-Body Manipulation

2026 9 引用 查看解读 →

Tree Learning: A Multi-Skill Continual Learning Framework for Humanoid Robots

Switch: Learning Agile Skills Switching for Humanoid Robots

2026 1 引用 查看解读 →

Re2MoGen: Open-Vocabulary Motion Generation via LLM Reasoning and Physics-Aware Refinement

Learn Weightlessness: Imitate Non-Self-Stabilizing Motions on Humanoid Robot

RecoverFormer: End-to-End Contact-Aware Recovery for Humanoid Robots

LineRides: Line-Guided Reinforcement Learning for Bicycle Robot Stunts

2026 1 引用 查看解读 →

Spatial Memory for Out-of-Vision Manipulation in Vision-Language-Action

2026 4 引用 查看解读 →