Skeleton-to-Image Encoding: Enabling Skeleton Representation Learning via Vision-Pretrained Models

TL;DR

提出Skeleton-to-Image编码(S2I),利用预训练视觉模型实现异构骨架数据的自监督学习。

cs.CV 🔴 高级 2026-03-06 22 次浏览
Siyuan Yang Jun Liu Hao Cheng Chong Wang Shijian Lu Hedvig Kjellstrom Weisi Lin Alex C. Kot
骨架动作识别 自监督学习 视觉预训练 跨模态 表示学习

核心发现

方法论

本研究提出将3D骨架序列通过分割关节为五个身体部分(躯干、左臂、右臂、左腿、右腿),按结构排序后,沿时间堆叠形成空间-时间特征图,并插值调整至224×224像素,转化为图像样式数据。利用此编码,将骨架数据与大规模预训练视觉模型(如MAE、DiffMAE)结合,进行自监督预训练。该方法无需设计专用骨架模型架构,便于跨格式、多源骨架数据的统一表示。通过在NTU-60、NTU-120和PKU-MMD数据集上进行大量实验,验证了S2I在骨架表示学习中的有效性和泛化能力。

关键结果

  • 在NTU-60数据集的交叉主体(C-sub)任务中,使用预训练图像模型进行线性探测达到了52.0%的准确率,微调后提升至82.8%;采用骨架预训练的MAE模型在同一任务中达到了90.4%的性能。跨格式评估中,S2I显著优于传统骨架模型,展现出良好的迁移能力。
  • 在NTU-120和PKU-MMD数据集上,S2I结合预训练模型实现了优异的性能,尤其在跨数据源和异构骨架格式的场景中表现出强大鲁棒性。多模态融合实验表明,S2I能有效增强多模态动作识别的表现。
  • 通过消融实验验证了不同骨架分割策略(如关节、运动、骨架)对性能的影响,显示分割策略对模型鲁棒性和泛化能力具有关键作用。

研究意义

本研究突破了骨架数据与视觉预训练模型的融合瓶颈,为多模态动作识别提供了统一、格式无关的表示框架。该方法极大地降低了多源异构骨架数据的适应难度,推动了骨架动作识别向大规模预训练和跨模态融合方向发展。通过迁移学习,有望在实际应用中实现更高效、更鲁棒的人体动作理解,促进智能监控、虚拟现实等行业的技术革新。

技术贡献

提出S2I编码策略,将稀疏骨架序列转化为密集的图像样式数据,兼容大规模预训练视觉模型。创新性地实现了跨格式骨架数据的统一表示,突破了传统模型对骨架格式的依赖。结合MAE和DiffMAE等自监督预训练机制,显著提升骨架表示的泛化能力和迁移性能,为多模态学习提供了新途径。

新颖性

首次提出将骨架序列转化为图像样式数据,利用预训练视觉模型进行自监督学习,解决骨架数据异构性和缺乏大规模标注的问题。相较于传统基于图或序列的骨架模型,S2I提供了格式无关的统一接口,极大扩展了骨架表示的适用范围。

局限性

  • 当前方法依赖于骨架关节的语义划分,可能在极端姿态或遮挡情况下表现不佳。
  • 插值处理可能引入信息损失,影响细粒度动作识别性能。
  • 模型在极端复杂动作或多人体场景中的泛化能力仍需验证。

未来方向

未来将探索多模态融合策略,结合RGB、深度等信息提升识别效果。还计划优化骨架分割和插值算法,增强模型对复杂场景的适应性。此外,将考虑引入动态图像生成技术,丰富骨架表示的表达能力。

AI 总览摘要

随着深度学习和大规模预训练模型的发展,人体动作识别迎来了新的机遇。传统骨架动作识别方法多依赖于特定格式的骨架数据,难以实现跨数据源和异构骨架的泛化。本文提出Skeleton-to-Image编码(S2I),通过将骨架序列转化为图像样式数据,巧妙利用预训练视觉模型的丰富知识,实现骨架数据的统一表示。该方法首先将关节划分为五个身体部分,按结构排序后,沿时间堆叠形成空间-时间特征图,并插值调整至标准尺寸。如此一来,骨架数据便可作为图像输入,直接利用MAE、DiffMAE等预训练模型进行自监督预训练。实验结果显示,S2I在NTU-60、NTU-120和PKU-MMD等多个数据集上表现优异,尤其在跨格式和跨源场景中具有强大鲁棒性。该技术的核心创新在于实现了骨架数据与视觉模型的无缝对接,突破了传统方法对骨架格式的依赖,为多模态动作识别提供了新思路。未来,结合多模态信息和优化骨架分割策略,有望推动人体动作理解迈向更高水平。整体而言,S2I代表了骨架动作识别向大规模预训练和跨模态融合的重要迈进,为智能监控、虚拟现实等应用提供了坚实基础。

深度分析

研究背景

人体动作识别作为计算机视觉的重要任务,经历了从传统手工特征到深度学习的演变。早期方法多采用RNN、CNN或图卷积网络(GCN)对骨架序列进行建模,取得一定成果。近年来,Transformer架构的引入进一步提升了长距离依赖建模能力。代表性工作如ST-GCN、MS-G3D、骨架Transformer等,强调结构化建模和多模态融合。然而,这些方法普遍依赖于固定骨架格式,难以应对多源异构数据。与此同时,预训练模型如Vision Transformer(ViT)和Mask Autoencoders(MAE)在图像任务中表现出色,但缺乏有效的骨架数据适配策略。骨架数据的稀疏性和多样性限制了其与视觉预训练模型的结合,成为当前研究的瓶颈。解决这一问题,成为推动骨架动作识别普及和应用的关键。

核心问题

现有骨架动作识别方法多依赖于特定骨架格式,导致模型难以跨数据源迁移。骨架数据的稀疏性和结构多样性,使得模型在面对不同采集设备或关节定义时表现不佳。此外,缺乏大规模标注数据限制了模型的泛化能力。如何将丰富的视觉预训练知识迁移到骨架领域,成为亟需解决的问题。传统方法多设计专用骨架网络,缺乏通用性和扩展性,限制了多源、多模态融合的潜力。

核心创新

本研究的核心创新在于提出Skeleton-to-Image编码(S2I),将稀疏骨架序列转化为密集的图像样式数据,兼容大规模预训练视觉模型。具体包括:• 关节分割:将骨架划分为五个身体部分,保持结构关系;• 空间-时间堆叠:沿时间维度堆叠关节坐标,形成空间-时间特征图;• 图像插值:调整至224×224像素,确保模型输入一致性。该方法无需设计专用骨架模型,便于跨格式、多源数据的统一预训练。结合MAE和DiffMAE进行自监督学习,有效提升骨架表示的迁移能力。此创新突破了传统骨架模型的局限,为多模态融合和大规模预训练提供了新途径。

方法详解

  • �� 输入:原始3D骨架序列(T×J×3);• 分割:将关节划分为五个身体部分,按结构排序;• 空间堆叠:沿时间维度堆叠关节坐标,形成T×J×3的空间-时间特征图;• 转换:将x、y、z坐标映射到RGB通道,形成T×J×3的伪图像;• 插值:对空间和时间维度进行线性插值,调整至224×224像素;• 预训练:利用MAE、DiffMAE等模型进行自监督预训练;• 迁移:在下游动作识别任务中进行微调或线性探测。

实验设计

在NTU-60、NTU-120和PKU-MMD数据集上,采用标准交叉主体和交叉视角协议,比较不同预训练策略和骨架格式的迁移效果。实验中,使用ViT-B架构,调节掩码比例、骨架分割策略,验证不同设置对性能的影响。通过消融分析,确认S2I在跨格式和异构数据场景中的优势。模型性能以准确率和F1-score衡量,结果显示预训练模型在迁移学习中表现优异,显著优于传统骨架模型。

结果分析

S2I结合预训练模型在NTU-60 C-sub任务中,线性探测达52.0%,微调后提升至82.8%;骨架预训练模型(如MAE)在同任务中达到90.4%。跨格式评估中,S2I表现出优越的鲁棒性,尤其在不同骨架布局和数据源间迁移效果显著优于传统方法。多模态融合实验显示,S2I能有效增强多模态动作识别性能,验证了其广泛适用性。

应用场景

该技术适用于智能监控、虚拟现实、人体动作分析等场景,特别是在多源、多模态数据融合需求强烈的应用中。通过统一的表示方式,简化了模型设计和数据预处理流程,降低了部署难度。未来结合深度学习和生成模型,有望实现更高效的动作理解和交互体验。

局限与展望

当前方法依赖于关节语义划分,可能在极端姿态或遮挡情况下表现不佳。插值处理可能引入信息损失,影响细粒度识别。模型在复杂多人体场景中的泛化能力尚需验证。未来需优化骨架分割策略和插值算法,提升鲁棒性和适应性。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,所有食材都放在不同的碗里。每次做菜,你需要把食材按照一定顺序放好,比如先放蔬菜,再放肉,最后放调料。现在,如果你有很多不同的厨房,每个厨房的食材摆放方式都不一样,但你还是希望用同样的菜谱做菜。这个研究就像是把不同厨房的食材都整理成一样的“菜谱卡片”,让你不用担心厨房的不同,只要看这张卡片就知道怎么做菜。它把复杂的骨架动作变成了简单的图片,让电脑也能像看图片一样理解动作。这样,无论骨架数据来自哪个设备或格式,都可以用一样的方法学习和识别动作,就像用同一份菜谱做不同厨房的菜一样方便。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你的角色可以做各种动作,比如跳跃、跑步、挥手,但每次游戏里的动作都用不同的方式描述。有的用骨架线条,有的用点点,格式都不一样。这个研究就像是发明了一种神奇的相机,把所有不同的动作都拍成一张漂亮的照片,不管它们来自哪个游戏或哪个设备。这样,电脑就可以用一模一样的“照片”来学习动作,不用担心格式不同的问题。研究还发现,把骨架动作变成图片后,电脑用它学会的动作识别比以前更快、更准,就像用一张万能的照片识别各种动作一样厉害。这项技术可以帮助监控系统更聪明,甚至让虚拟人物更自然地模仿人类动作。未来,这种方法还能让不同设备之间更好地交流,带来更酷的虚拟现实体验!

原文摘要

Recent advances in large-scale pretrained vision models have demonstrated impressive capabilities across a wide range of downstream tasks, including cross-modal and multi-modal scenarios. However, their direct application to 3D human skeleton data remains challenging due to fundamental differences in data format. Moreover, the scarcity of large-scale skeleton datasets and the need to incorporate skeleton data into multi-modal action recognition without introducing additional model branches present significant research opportunities. To address these challenges, we introduce Skeleton-to-Image Encoding (S2I), a novel representation that transforms skeleton sequences into image-like data by partitioning and arranging joints based on body-part semantics and resizing to standardized image dimensions. This encoding enables, for the first time, the use of powerful vision-pretrained models for self-supervised skeleton representation learning, effectively transferring rich visual-domain knowledge to skeleton analysis. While existing skeleton methods often design models tailored to specific, homogeneous skeleton formats, they overlook the structural heterogeneity that naturally arises from diverse data sources. In contrast, our S2I representation offers a unified image-like format that naturally accommodates heterogeneous skeleton data. Extensive experiments on NTU-60, NTU-120, and PKU-MMD demonstrate the effectiveness and generalizability of our method for self-supervised skeleton representation learning, including under challenging cross-format evaluation settings.

cs.CV cs.AI