HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark
提出HumanScore评估指标,结合153小时多样化运动数据,改善 humanoid 运动追踪的感知一致性。
核心发现
方法论
本文提出了HumanScore,一种基于偏好学习的运动追踪评价指标,结合了12,000对运动样本的偏好数据,通过训练Transformer模型实现。数据集由24名专业运动员在多场景下录制的约153小时光学运动轨迹组成,涵盖日常、动态、交互和地面运动四大类。评估流程包括:• 采集偏好数据:通过人类专家对同步运动轨迹进行偏好判断,形成训练集;• 构建特征:利用多模态特征(关节位置、速度、接触信息等)输入Transformer;• 模型训练:采用Bradley–Terry损失优化偏好预测能力;• 评估:在不同追踪器(GMT、TWIST2、SONIC、Humanoid-GPT)上进行零样本测试,结合传统指标和HumanScore进行比较。
关键结果
- HumanScore在多个运动类别中与人类偏好高度一致,平均对比准确率达90.8%,优于传统的MPJPE(平均误差0.8049弧度)和成功率(最高94.4%);在动态和复杂交互运动中表现尤为优越,显著揭示了脚滑、支撑不稳等物理Artifact;
- 在不同追踪器中,Humanoid-GPT整体表现优异,成功率达94.4%,HumanScore得分54.7,优于其他方法;此外,HumanScore在长时间运动中能捕捉到细微的稳定性和接触质量的差异,验证了其感知一致性。
- 通过消融实验,发现引入未来参考信息和接触特征显著提升模型对复杂运动的感知能力,特别是在地面运动和高动态运动中,模型的偏好预测准确率提升了约10%。
研究意义
本研究突破了传统运动追踪评价的局限,将人类感知引入指标设计,解决了仅依赖关节误差无法反映运动自然性和稳定性的问题。通过大规模、多样化的运动数据集,提供了更全面的性能基准,为未来机器人运动控制、虚拟人类模拟和增强现实等应用奠定基础。同时,HumanScore的引入推动了偏好学习在机器人运动评估中的应用,促使算法更贴合人类感知,从而实现更自然、更可信的运动表现。
技术贡献
技术创新主要体现在:• 构建大规模、多类别的运动数据集,涵盖多场景、多动作类型;• 提出基于Transformer的偏好学习模型,结合多模态特征实现运动偏好预测;• 设计偏好对比训练机制,优化模型对接触、稳定性等感知指标的敏感性;• 提供标准化评估流程和多维指标体系,促进不同追踪器的公平比较。该框架结合深度学习、偏好学习和运动分析,显著提升了运动追踪的感知一致性。
新颖性
本研究的创新点在于首次将偏好学习引入运动追踪评价,结合大规模多场景运动数据,提出HumanScore指标,超越传统的关节误差和成功率指标,能够捕捉运动中的细微物理Artifact。相较于现有的运动数据集(如AMASS、PHUMA),本数据集在类别划分和文本标签方面更细粒度,且专注于运动的感知质量。这种结合偏好学习与多样化数据的评估体系,为机器人运动控制提供了更符合人类感知的性能指标。
局限性
- 当前模型主要基于光学运动捕捉数据,可能在真实硬件或不同传感条件下表现不佳;
- 偏好数据由专家标注,可能存在主观偏差,影响模型的普适性;
- 模型对极端运动或异常运动的感知能力仍有限,未来需结合更多场景和样本进行优化。
未来方向
未来将扩展偏好模型到实际机器人硬件,结合自主学习和在线反馈机制,提升运动的自然性和稳定性。同时,探索多模态感知(如视觉、触觉)对运动偏好的影响,推动感知与控制的深度融合。此外,计划引入强化学习优化运动策略,使机器人运动不仅符合偏好,还能适应环境变化,实现自主适应和优化。
AI 总览摘要
在机器人运动控制和虚拟人类模拟领域,运动追踪的评估一直是核心难题。传统指标如关节位置误差(MPJPE)虽然在技术上易于计算,但难以反映运动的自然性、稳定性和物理合理性。人们在观看运动视频时,更关注运动的平衡、接触的真实感以及动作的流畅性。这种感知差异导致现有评估方法在实际应用中表现出较大偏差,限制了运动控制算法的进一步优化。
为解决这一问题,Dairu Liu等人提出了HumanScore,一种基于偏好学习的运动追踪评价指标。该指标通过收集24名专业运动员在多场景下录制的约153小时运动数据,结合人类专家对同步运动轨迹的偏好判断,训练了一个Transformer模型,实现对运动质量的偏好预测。该模型利用多模态特征(包括关节位置、速度、接触信息等)输入,结合Bradley–Terry损失优化偏好匹配能力,能够捕捉运动中的细微差别。
实验结果显示,HumanScore在多个运动类别中与人类偏好高度一致,偏好预测准确率达90.8%,远超传统的关节误差指标。特别是在高动态和复杂交互运动中,HumanScore能有效揭示脚滑、支撑不稳等物理Artifact,反映出运动的真实感和稳定性。与现有的运动数据集(如AMASS、PHUMA)相比,该数据集在类别划分和标签细节方面更具针对性,为运动追踪提供了更全面的评估平台。
该研究的意义在于,将人类感知引入运动追踪评价,推动机器人运动控制向更自然、更符合人类偏好的方向发展。通过大规模、多类别的运动数据集和偏好模型,未来机器人可以实现更自然的动作表现,增强人机交互的可信度。此外,该方法也为虚拟现实、动画制作等领域提供了新的评估工具,促进多模态感知与控制的深度融合。未来工作将集中在将偏好模型应用到实际硬件中,结合自主学习和环境适应,推动机器人运动的自主优化与提升。
深度分析
研究背景
机器人运动控制技术经历了从基于规则的运动规划到深度学习驱动的自主控制的演变。早期方法如运动模板匹配和有限状态机,难以应对复杂、多变的运动场景。近年来,深度学习模型如DeepMimic、PHC、UHM等推动了运动生成与追踪的发展,通过模仿学习实现了更自然的动作表现。特别是AMASS、PHUMA等大规模运动数据集,为模型提供了丰富的训练资源。然而,现有方法多依赖于关节位置误差作为性能指标,忽视了运动的物理合理性和人类感知的稳定性。尽管如此,运动追踪在虚拟人、机器人控制、虚拟现实等应用中的重要性不断提升,推动了对更全面、更感知一致的评估体系的需求。
核心问题
现有运动追踪评价主要依赖于关节位置误差(如MPJPE),但无法反映运动的稳定性、接触的自然性和整体的感知质量。尤其是在复杂接触、动态变化和长时间运动中,传统指标难以捕捉脚滑、支撑不稳、动作不连贯等物理Artifact,导致评估结果与人类主观感知偏差较大。此外,现有数据集规模有限,类别单一,难以全面反映运动的多样性和复杂性。这些问题限制了运动控制算法的优化方向,亟需引入更符合人类感知的评价指标和更丰富的运动数据。
核心创新
本研究的核心创新在于:• 引入偏好学习机制,通过人类专家对运动轨迹的偏好判断,训练偏好预测模型;• 构建大规模、多类别的运动数据集,涵盖日常、动态、交互和地面运动,提供多样化的评估场景;• 设计基于Transformer的偏好模型,结合多模态特征,提升对运动细节的感知能力;• 提出标准化的评估流程,将偏好指标融入运动追踪评价体系,显著改善感知一致性。这些创新使得运动评估更贴合人类感知,推动机器人运动控制向更自然、更稳定的方向发展。
方法详解
- �� 数据采集:由24名专业运动员在多场景下录制光学运动轨迹,涵盖日常、动态、交互和地面运动,确保多样性和复杂性;• 数据预处理:对运动数据进行清洗、标注类别和文本标签,剔除异常片段,确保数据质量;• 特征提取:利用多模态特征(关节位置、速度、接触状态等)构建输入向量;• 偏好数据采集:通过专家对同步运动轨迹进行偏好判断,形成偏好对比样本;• 模型训练:采用Transformer架构,输入特征序列,利用Bradley–Terry损失优化偏好预测能力;• 评估流程:在不同追踪器上执行标准化测试,结合传统指标和HumanScore进行性能对比。
实验设计
实验采用由24名专业运动员录制的153小时运动数据,涵盖四大类别。对比的追踪器包括GMT、TWIST2、SONIC和Humanoid-GPT。评估指标包括传统的成功率(Succ)、MPJPE和新提出的HumanScore。模型训练采用偏好数据的80%作为训练集,20%作为测试集,确保偏好模型的泛化能力。此外,进行了消融实验,验证引入未来参考和接触特征对模型性能的影响。所有追踪器在统一平台上进行零样本测试,确保公平性。通过多场景、多指标的评估体系,全面衡量运动追踪的感知一致性和物理合理性。
结果分析
实验结果显示,HumanScore在偏好一致性方面表现优异,偏好匹配率达90.8%,显著优于MPJPE和传统成功率。在高动态和交互运动中,HumanScore能有效揭示脚滑、支撑不稳等物理Artifact,反映运动的真实感。Humanoid-GPT在整体成功率(94.4%)和偏好得分(54.7)上领先其他追踪器,表现出更高的稳定性和自然性。消融实验表明,引入接触特征和未来参考信息能提升偏好预测的准确性,尤其在复杂运动场景中效果更明显。这些结果验证了HumanScore在运动感知评估中的优越性和实用性。
应用场景
该评估体系可广泛应用于机器人运动控制、虚拟人模拟、动画制作和虚拟现实等领域,为算法优化提供更符合人类感知的性能指标。未来,结合偏好模型与自主学习,机器人可以实现更自然、更稳定的运动表现,增强人机交互的可信度。同时,该方法也可用于运动康复、虚拟培训等场景,提升运动的真实性和效果。
局限与展望
目前模型主要基于光学运动捕捉数据,可能在实际硬件环境中表现不佳;偏好数据由专家标注,存在主观偏差,影响模型的普适性;在极端运动或异常状态下,模型的感知能力仍有限,未来需要引入更多样化的样本和场景进行优化。
通俗解读 非专业人士也能看懂
想象你在看一场舞蹈表演,舞者的动作是否自然、稳健,取决于很多细节,比如脚是否滑动、身体是否平衡、动作是否流畅。传统的评判方法就像用尺子量关节的角度误差,虽然可以告诉你舞者的动作和原始舞步有多接近,但不能反映出舞蹈是否优雅自然。本文提出的HumanScore就像请专业舞评家用心感受每个动作的流畅和稳定性,训练出一个可以自动判断舞蹈质量的“舞评机器人”。这个机器人通过观看大量专业舞者的表演,学习到哪些细节让舞蹈看起来更自然、更有力量。它不仅能评估普通动作,还能识别出脚滑、失衡等细节问题,帮助机器人学会跳得更像人类,动作更自然。这个方法就像给机器人装上了“人类感知的眼睛”,让它的运动表现变得更真实、更令人信服。
简单解释 像给14岁少年讲一样
你知道吗?当你看一段舞蹈或运动视频时,你会觉得某些动作很自然、流畅,而另一些看起来不太对劲,比如脚滑或者身体不平衡。传统的方法就像用尺子量关节的角度,告诉你动作和理想动作的差距,但不能告诉你动作是否好看或自然。这个研究就像请了很多专业舞者和运动员,告诉我们什么样的动作看起来更自然,然后训练一个聪明的机器人,让它学会用“眼睛”去判断动作的好坏。这个机器人看了很多运动视频,学会了哪些细节让动作更自然,比如脚步的平稳、身体的平衡、动作的连贯。它可以帮助机器人跳舞、走路甚至打篮球,都变得更像人类一样自然。这样一来,机器人和虚拟人物就能跳得更漂亮、更真实,大家看着也会觉得更舒服、更喜欢。这个方法让机器人的动作变得更像我们人类的动作,变得更自然、更可信。
术语表
偏好学习 (Preference Learning)
一种通过人类偏好数据训练模型的方法,使模型能够预测人类对不同运动轨迹的喜好程度。技术上通过偏好对比和损失函数优化实现,应用于运动质量评估。
在本文中,偏好学习用于训练HumanScore偏好模型,反映人类对运动自然性和稳定性的偏好。
Bradley–Terry损失 (Bradley–Terry Loss)
一种用于偏好对比学习的损失函数,最大化偏好样本的概率,确保模型能正确预测偏好关系。
用于训练偏好模型,使其能准确判断哪个运动轨迹更符合人类偏好。
Transformer模型
一种基于自注意力机制的深度学习架构,擅长处理序列数据,广泛应用于自然语言处理和时序特征分析。
在本文中,Transformer用于编码运动特征,学习运动偏好的潜在关系。
光学运动捕捉 (Optical Motion Capture)
利用多摄像头系统捕捉人体运动的高精度技术,生成三维运动轨迹。
数据集中的运动轨迹由24名专业运动员通过光学捕捉系统采集。
MPJPE (Mean Per Joint Position Error)
衡量关节位置误差的指标,计算预测关节位置与真实位置的平均距离。
传统评估指标,用于衡量运动追踪的关节位置精度。
HumanScore
基于偏好学习的运动质量评价指标,结合人类偏好数据,反映运动的自然性、稳定性和接触合理性。
本文提出的核心指标,用于替代传统的关节误差,提升感知一致性。
多模态特征 (Multimodal Features)
结合多种感知信息(如位置、速度、接触状态)形成的特征向量,用于丰富模型输入。
模型输入包括关节位置、速度、接触信息等多模态特征。
运动类别 (Motion Families)
根据运动的不同特性划分的类别,如日常、动态、交互和地面运动。
数据集中的运动被划分为四大类别,便于细粒度评估。
偏好对比 (Preference Pair)
两个运动样本的比较,表示人类更偏好哪个样本。
训练偏好模型的基础数据形式。
零样本评估 (Zero-Shot Evaluation)
模型在未见过的测试数据上进行性能评估,验证其泛化能力。
本文中,追踪器在未训练的运动样本上进行偏好预测。
运动重定向 (Motion Retargeting)
将人类运动映射到机器人或虚拟角色的运动表达中,保持动作的自然性和物理合理性。
使用GMR算法实现运动的目标角色迁移。
接触Artifact (Contact Artifact)
运动中出现的脚滑、支撑不稳等不自然的物理现象。
模型能有效识别和反映这些Artifact。
运动类别标签 (Motion Category Labels)
为每段运动标注的类别标签,用于分类和分析。
数据集中的运动都带有文本标签和类别信息。
偏好指标 (Preference Metrics)
反映人类偏好的运动质量评价指标。
HumanScore即为偏好指标的具体实现。
运动感知一致性 (Perceptual Consistency)
运动评估与人类感知的匹配程度。
本文强调通过偏好学习提升感知一致性。
运动场景多样性 (Motion Scene Diversity)
不同运动类别和场景的丰富程度。
数据集在类别和场景上具有高度多样性。
开放问题 这项研究留下的未解疑问
- 1 尽管HumanScore在模拟环境中表现优异,但其在实际机器人硬件上的适应性和鲁棒性仍需验证。未来需结合真实硬件环境,研究偏好模型的迁移能力和在线适应机制。
- 2 偏好数据由专家标注,可能存在主观偏差,如何引入多样化的偏好来源(如大众偏好)以提升模型的普适性,是未来的重要方向。
- 3 模型对极端运动或异常状态的感知能力有限,未来应扩展样本库,增强模型在极端场景下的表现。
- 4 目前偏好模型主要基于光学运动捕捉数据,未来应结合多模态感知(如视觉、触觉)信息,提升运动评估的全面性。
- 5 运动追踪的实时性和计算成本仍需优化,以满足实际机器人控制的需求,未来可探索模型压缩和加速技术。
应用场景
近期应用
机器人运动控制优化
利用HumanScore作为训练目标,提升机器人运动的自然性和稳定性,适用于服务机器人、工业机器人等场景。
虚拟人动画评估
在虚拟现实和动画制作中,自动评估虚拟角色的动作自然度,提升虚拟场景的沉浸感和真实感。
运动康复与训练
结合偏好模型,设计更符合人类感知的康复训练动作,帮助运动障碍患者恢复自然运动能力。
远期愿景
自主运动优化系统
未来机器人可以自主学习偏好,动态调整运动策略,实现自主适应复杂环境和任务,推动智能机器人普及。
跨模态感知融合
结合视觉、触觉等多模态信息,构建更全面的运动感知体系,推动机器人运动的智能化和人性化。
原文摘要
Humanoid motion tracking is central to teleoperation and whole-body imitation, yet evaluation often disagrees with what people perceive in videos. Kinematic errors average per-frame pose differences but miss the physical artifacts that matter most, particularly unstable support and incorrect contacts such as foot skating and mistimed touch-downs. Meanwhile, widely used test suites are small and lack the diversity needed to stress contact-rich, long-horizon behaviors. We introduce HumanTracker to make humanoid tracking evaluation both perceptually aligned and scalable. The HumanTracker benchmark contains approximately 153 hours of optical motion trajectories from multiple professional performers, organized into four motion families with text labels for fine-grained diagnosis. We further propose HumanScore, a preference-aligned metric trained on 12K motion pairs containing 24K motions. Across representative state-of-the-art trackers, HumanScore better predicts human preferences and reveals contact and stability failures that kinematic metrics often miss.
参考文献 (20)
GMT: General Motion Tracking for Humanoid Whole-Body Control
Zixuan Chen, Mazeyu Ji, Xuxin Cheng 等
SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control
Zhengyi Luo, Ye Yuan, Tingwu Wang 等
Humanoid-GPT: Scaling Data and Structure for Zero-Shot Motion Tracking
Zekun Qi, Xu-Chuan Chen, Dai-En Liu 等
UniTracker: Learning Universal Whole-Body Motion Tracker for Humanoid Robots
Kangning Yin, Weishuai Zeng, Ke Fan 等
OmniH2O: Universal and Dexterous Human-to-Humanoid Whole-Body Teleoperation and Learning
Tairan He, Zhengyi Luo, Xialin He 等
Collision-Free Humanoid Traversal in Cluttered Indoor Scenes
Han Xue, Sikai Liang, Zhikai Zhang 等
Training language models to follow instructions with human feedback
Long Ouyang, Jeff Wu, Xu Jiang 等
TWIST: Teleoperated Whole-Body Imitation System
Yanjie Ze, Zixuan Chen, J. P. Ara'ujo 等
Towards Motion Turing Test: Evaluating Human-Likeness in Humanoid Robots
Mingzhe Li, Mengyin Liu, Zekai Wu 等
A Cross-Dataset Study for Text-based 3D Human Motion Retrieval
L'eore Bensabath, Mathis Petrovich, Gul Varol
RoboCLIP: One Demonstration is Enough to Learn Robot Policies
S. Sontakke, Jesse Zhang, S'ebastien M. R. Arnold 等
Conference on Computer Vision and Pattern Recognition
Cordelia Schmid, Stefano Soatto, Carlo Tomasi
RANK ANALYSIS OF INCOMPLETE BLOCK DESIGNS THE METHOD OF PAIRED COMPARISONS
R. Bradley, M. E. Terry
Motion-X++: A Large-Scale Multimodal 3D Whole-body Human Motion Dataset
Yuhong Zhang, Jing-de Lin, Ailing Zeng 等
AMASS: Archive of Motion Capture As Surface Shapes
Naureen Mahmood, N. Ghorbani, N. Troje 等
Switch-JustDance: Benchmarking Whole Body Motion Tracking Policies Using a Commercial Console Game
Jeonghwan Kim, Wontaek Kim, Yidan Lu 等
Exploring Text-to-Motion Generation with Human Preference
Jenny Sheng, Matthieu Lin, Andrew Zhao 等
KungfuBot: Physics-Based Humanoid Whole-Body Control for Learning Highly-Dynamic Skills
Weiji Xie, Jinrui Han, Jiakun Zheng 等