LS-HAR: Language Supervised Human Action Recognition with Salient Fusion, Construction Sites as a Use-Case

TL;DR

LS-HAR结合语言引导骨架和视觉特征,利用Salient Fusion提升施工现场人类动作识别准确率。

cs.CV 🔴 高级 2024-10-03 25 次浏览
Mohammad Mahdavian Mohammad Loni Ted Samuelsson Mo Chen
人类动作识别 多模态融合 语言监督 Transformer 施工场景

核心发现

方法论

本研究提出LS-HAR框架,结合骨架和视觉模态,利用预训练的语言模型引导特征提取。采用可学习提示(prompt)条件化骨架编码器,增强骨架特征的语义表达。融合机制采用基于注意力和Transformer的Salient Fusion模块,优先强调关键帧和身体关节,有效缓解高维特征的冗余。引入VolvoConstAct数据集,结合NTU-RGB+D、NTU-RGB+D 120和NW-UCLA进行验证,整体性能优异。

关键结果

  • 在NTU-RGB+D XSub任务中,准确率提升至89.5%,比SOTA方法高出1%。在NTU-RGB+D 120上,达到82.3%,优于对比模型。VolvoConstAct数据集上,识别精度达85%,验证模型在真实施工场景中的鲁棒性。
  • Salient Fusion显著提升多模态信息的利用效率,特别是在关键帧和关节的强调上。预训练语言模型引导骨架特征,增强了模型对动作语义的理解。多数据集验证表明,该方法具有良好的泛化能力。
  • 通过消融实验,验证可学习提示和Salient Fusion的贡献,提示引导骨架编码器的效果优于静态提示,融合机制优于简单拼接或加权平均。

研究意义

该研究突破了多模态人类动作识别的瓶颈,特别是在复杂施工环境中。引入语言监督和Salient Fusion机制,有效提升识别准确率,为自动化施工机器提供了可靠的动作理解基础。其在实际应用中,有助于提升施工安全性和效率,推动机器人自主操作的发展。

技术贡献

创新点在于引入基于预训练语言模型的提示机制,指导骨架特征学习。提出Salient Fusion模块,结合注意力和Transformer,动态优先关键特征。构建面向施工场景的VolvoConstAct数据集,丰富多模态数据资源。整体架构实现端到端训练,提升多模态融合效果,具有较强的实用性和扩展性。

新颖性

首次将语言模型作为全局语义引导,结合Salient Fusion机制应用于施工场景的多模态HAR。提出动态可学习提示条件化骨架编码,突破传统静态提示限制。引入专用施工场景数据集,填补行业数据空白,推动场景特定动作识别研究。

局限性

  • 模型在极端遮挡或环境极端变化时仍存在识别误差,主要因多模态信息受环境干扰影响较大。
  • 对大规模数据和复杂场景的泛化能力尚需进一步验证,尤其是在多动作同时发生的复杂场景中。
  • 训练成本较高,模型参数较多,实时应用仍需优化模型压缩和推理速度。

未来方向

未来将结合多传感器信息(如深度、声音)进一步提升鲁棒性,探索弱监督和少样本学习策略,降低数据依赖。同时,计划将模型部署于实际施工机器人中,验证其在真实环境中的应用效果,推动行业自动化升级。

AI 总览摘要

人类动作识别(HAR)在自动驾驶、安防和工业自动化中扮演着关键角色。传统方法多依赖单一模态,如骨架或视频,难以应对复杂环境中的多变场景。近年来,Transformer和深度学习架构推动了多模态融合技术的发展,但仍面临特征冗余和语义理解不足的问题。本研究提出LS-HAR框架,结合预训练的语言模型引导骨架特征学习,并利用Salient Fusion机制动态优先关键帧和关节信息,有效提升多模态融合效果。核心创新在于引入可学习提示(prompt)条件化骨架编码器,增强语义表达能力,结合Transformer的注意力机制实现高效融合。通过在新构建的施工场景数据集VolvoConstAct和公开数据集上的实验,验证了该方法在准确率和鲁棒性上的优越表现。结果显示,在NTU-RGB+D XSub任务中达89.5%的准确率,比SOTA提升1%;在施工场景中识别精度达85%,验证了模型的实际应用潜力。这一技术突破为自动化施工、工业机器人提供了强有力的动作理解支撑,有望推动行业智能化升级。未来,将结合多传感器信息,优化模型实时性和泛化能力,推动其在更复杂环境中的应用。

深度分析

研究背景

人类动作识别(HAR)经历了从单一视觉特征到多模态融合的演变。早期方法多使用手工特征或浅层学习模型,难以应对复杂场景。近年来,深度学习架构如CNN、GCN和Transformer显著提升了性能。特别是Skeleton-based方法通过骨架关节捕获动作动态,Video-based方法利用丰富的场景信息,融合两者成为趋势。近年来,结合预训练语言模型(如CLIP)引入语义指导,进一步丰富模型理解能力。行业应用如安防、智能监控和工业自动化,推动了多模态融合技术的发展。

核心问题

施工现场环境复杂,光线不足、遮挡频繁,传统HAR模型在此类场景中的表现有限。多模态数据融合面临高维特征冗余、关键帧提取困难、动作语义理解不足等挑战。此外,缺乏专用施工场景数据集,限制模型的泛化能力和实用性。如何在复杂环境中实现高效、鲁棒的动作识别,成为行业亟待解决的问题。

核心创新

本研究提出LS-HAR框架,创新点包括:1)引入预训练语言模型作为全局语义引导,增强骨架特征的语义表达;2)设计可学习提示(prompt)条件化骨架编码器,动态调整特征表示;3)提出Salient Fusion模块,结合注意力和Transformer机制,优先强调关键帧和关节信息,提升多模态融合效率;4)构建施工场景专用数据集VolvoConstAct,丰富多模态数据资源,支持行业应用。这些创新有效解决了传统方法在复杂环境中的不足,显著提升识别性能。

方法详解

  • �� 输入:RGB视频序列和对应的3D骨架数据。
  • �� 骨架编码:采用图卷积(GC)结合多尺度时序卷积(MTC)提取骨架特征。
  • �� 视觉编码:利用预训练的ViT(如ViT-B/16)提取图像特征,结合时序Transformer捕获动态信息。
  • �� 语言引导:使用预训练的文本编码器(如CLIP)和可学习提示(prompt),条件化骨架特征,增强语义理解。
  • �� 跨模态融合:通过细粒度下采样和交叉注意力机制,突出关键帧和关节,融合骨架与视觉特征,生成动作预测。
  • �� 损失函数:结合对比损失(Lcont)和分类损失(Lcls),优化模型端到端训练。

实验设计

使用NTU-RGB+D、NTU-RGB+D 120和NW-UCLA等公开数据集,以及新构建的VolvoConstAct。模型在不同任务(XSub、XView、XSet)中进行评估,采用准确率和F1-score指标。训练细节包括:使用AdamW优化器,批次大小16,学习率5×10^-6(预训练参数)和5×10^-5(其他参数),训练55轮(NW-UCLA为20轮)。通过消融实验验证提示机制和Salient Fusion的贡献。模型在多数据集上表现优异,优于多数SOTA方法。

结果分析

在NTU-RGB+D XSub任务中,准确率达89.5%,比最优SOTA高出1%;在NTU-RGB+D 120,达到82.3%;在施工场景数据集VolvoConstAct中识别精度达85%。Salient Fusion显著提升多模态信息利用效率,预训练语言模型增强语义理解。消融实验显示,提示机制和Salient Fusion对性能提升作用明显,验证了模型设计的有效性。

应用场景

该技术可应用于施工现场的自动化机械控制,实现工人动作识别与指令传达,提升安全性和效率。也适用于工业机器人、安防监控等场景,提供高精度、多模态动作理解。未来可结合多传感器数据,优化模型实时性,推动行业智能化升级。

局限与展望

模型在极端遮挡和复杂背景下仍存在误识别风险,受环境干扰影响较大。对大规模、多动作场景的泛化能力有限,训练成本较高,实时应用需优化模型压缩和推理速度。未来需加强模型鲁棒性和适应性,拓展多场景应用能力。

通俗解读 非专业人士也能看懂

想象你在一个工厂里工作,工厂里有很多机器和工人。工人需要告诉机器做什么,比如挥手、点头或手势。以前,机器只能靠简单的规则判断工人的动作,但有时工人动作复杂,机器难以理解。现在,科学家设计了一套聪明的系统,就像给机器装上了“眼睛”和“耳朵”,还能听懂工人的手势和动作。这个系统还会用一种叫“语言模型”的“聪明大脑”来帮忙理解动作背后的意思。它会看工人的动作,关注重要的关节和关键帧,就像你在视频中只看最重要的画面一样。通过训练,这个系统变得越来越聪明,能在嘈杂的工地环境中准确识别工人的动作,比如“停下”、“转向”或“挥手告别”。这就像给工厂配备了一个智能助手,不仅能看懂工人,还能帮忙控制机器,提高工作效率和安全性。未来,这个系统还能学会更多动作,帮助机器人更好地与人合作,真正实现工厂的自动化和智能化。

简单解释 像给14岁少年讲一样

想象你在学校里玩一个游戏,你的朋友用手势告诉你做什么,比如挥手说再见,或者点头说“我明白了”。以前,你只能靠猜测来理解,但现在,有个超级聪明的机器人可以看你的动作,还能听你说的话,知道你在做什么。它就像一个非常聪明的助手,能在你做动作时,马上告诉你“你在挥手”,或者“你在点头”。这个机器人用了一种特别的“脑袋”——叫“语言模型”,它可以理解你说的话和动作的意思。它还会特别关注你身体的关键部分,比如手、头和腿,就像你在看电影时只注意最重要的画面一样。通过不断学习,这个机器人变得越来越聪明,能在嘈杂的环境中也能准确识别你的动作。未来,这样的机器人可以帮老师管理课堂,或者帮工厂里的机器人理解工人的动作,让工作变得更安全、更快。这就像你有了一个超级聪明的朋友,随时准备帮你理解和做事情!

原文摘要

Detecting human actions is a crucial task for autonomous robots and vehicles, often requiring the integration of various data modalities for improved accuracy. In this study, we introduce a novel approach to Human Action Recognition (HAR) using language supervision named LS-HAR based on skeleton and visual cues. Our method leverages a language model to guide the feature extraction process in the skeleton encoder. Specifically, we employ learnable prompts for the language model conditioned on the skeleton modality to optimize feature representation. Furthermore, we propose a fusion mechanism that combines dual-modality features using a salient fusion module, incorporating attention and transformer mechanisms to address the modalities' high dimensionality. This fusion process prioritizes informative video frames and body joints, enhancing the recognition accuracy of human actions. Additionally, we introduce a new dataset tailored for real-world robotic applications in construction sites, featuring visual, skeleton, and depth data modalities, named VolvoConstAct. This dataset serves to facilitate the training and evaluation of machine learning models to instruct autonomous construction machines for performing necessary tasks in real-world construction sites. To evaluate our approach, we conduct experiments on our dataset as well as three widely used public datasets: NTU-RGB+D, NTU-RGB+D 120, and NW-UCLA. Results reveal that our proposed method achieves promising performance across all datasets, demonstrating its robustness and potential for various applications. The code, dataset, and demonstration of real-machine experiments are available at: https://mmahdavian.github.io/ls_har/

cs.CV cs.RO