GMoT: Gated Motion-Aware Tokenization for Fine-Grained Micro-Gesture Video Reasoning with Multimodal LLMs

TL;DR

提出GMoT模块,通过运动感知和门控机制提升微表情视频推理性能,达成67.32% Top-1准确率。

cs.CV 🔴 高级 2026-07-15 57 次浏览
Taorui Wang Wei Xia Hui Ma Zijia Song Jiayu Zhang Zeheng Wang Yong Xu Zitong Yu
多模态大模型 微表情识别 时序运动建模 门控机制 微动作推理

核心发现

方法论

本文提出GMoT模块,结合空间加权池化、邻帧差分和自适应门控,显式提取微动作的稀疏运动证据。利用空间显著性评分器动态突出动作区域,邻帧差分捕获精确运动能量,并通过语义门控融合到视觉流中。训练采用四阶段策略,包括预热、微动作域适应、链式推理训练和奖励引导策略优化,辅以半监督注释生成专注解码。模型在iMiGUE和SMG数据集上分别达67.32%和73.11%的Top-1准确率,超越基线Qwen3-VL-8B +6.80和+3.11点。引入身体区域对齐召回(BRG)作为解剖区域的代理指标,并实现跨域迁移验证。

关键结果

  • GMoT显著提升微动作识别的准确率,iMiGUE达67.32%,SMG达73.11%,优于传统的空间池化和时序差分方法。通过消融实验验证空间显著性评分器和邻帧差分的贡献,模型对微动作的敏感性增强。奖励引导训练策略有效减少模型的虚假推理和偏差,提升解释的可靠性。模型在标签保持的噪声和跨域迁移中表现稳定,显示出良好的泛化能力。
  • 在微动作推理中,GMoT引入的身体区域对齐召回(BRG)指标,反映模型对解剖区域的准确定位能力,提升了模型的可解释性。与纯视觉模型相比,结合运动证据的模型在微动作细节捕获方面具有明显优势,特别是在动态微表情识别任务中表现优异。
  • 通过逐步训练策略,模型在链式推理和证据融合方面实现了优化,验证了多阶段训练对微动作识别的重要性。实验还显示,GMoT在标签腐蚀和小样本场景下依然保持较高性能,证明其鲁棒性。

研究意义

本研究突破了多模态大模型在微动作识别中的瓶颈,显式引入运动感知机制,有效捕获瞬态、局部的微动作特征。通过证据驱动的推理框架,提升模型的可解释性和可靠性,为微表情、心理状态分析等应用提供了技术支撑。模型在多个微动作识别任务中表现优异,推动了微行为理解的研究进展,具有广泛的工业和学术价值。

技术贡献

本文提出GMoT模块,创新性结合空间显著性评分、邻帧差分和门控融合,显著增强模型对微动作的敏感性。采用多阶段训练策略,结合半监督注释和奖励引导,有效提升推理能力和证据可追溯性。引入身体区域对齐召回(BRG)指标,丰富模型评估体系。整体架构兼容预训练模型,提升微动作细粒度识别的准确性和解释性,推动多模态视频理解的边界。

新颖性

本研究首次系统性引入运动感知的门控机制到多模态大模型中,显式提取稀疏微动作证据,结合多阶段训练优化推理路径。与传统空间池化或全局注意不同,GMoT强调局部区域的动态变化,显著提升微动作识别的细粒度能力。此方法在微表情和微动作识别领域具有开创性,填补了模型对瞬态微动作理解的空白。

局限性

  • 模型对极端复杂背景或遮挡条件下的微动作识别仍存在困难,主要由于运动证据提取受限于空间显著性评分器的准确性。
  • 训练过程较为复杂,涉及多阶段策略和奖励设计,计算成本较高,难以实时部署。
  • 对微动作类别的细粒度区分依赖于高质量的注释和数据集,泛化能力在少样本或新类别上仍需验证。

未来方向

未来将探索更高效的运动证据提取机制,结合自监督学习提升模型泛化能力。同时,计划扩展到多模态融合中,结合语音、文本等信息增强微动作理解。还将研究模型在实际场景中的鲁棒性和实时性,推动微表情识别在心理健康、安防等行业的应用落地。

AI 总览摘要

微表情和微动作的识别一直是行为分析中的难点,因其瞬时、局部且微妙的运动特征常被静态背景和静止姿势所掩盖。现有多模态大模型(MLLMs)虽然在视频理解方面表现出色,但在捕捉细微运动方面仍显不足,主要受限于空间池化和全局注意机制对微动作的稀疏性和瞬时性捕获能力有限。为此,本文提出GMoT(Gated Motion-Aware Tokenization)模块,通过显式提取运动证据,结合空间显著性评分和邻帧差分,动态突出动作区域并生成紧凑的运动感知标记。该模块通过门控机制融合运动信息,有效增强模型对微动作的敏感性。训练策略采用四阶段设计,从预热、微动作域适应、链式推理训练到奖励引导优化,逐步提升模型的推理能力和证据可追溯性。在iMiGUE和SMG两个微动作数据集上,GMoT模型分别达到了67.32%和73.11%的Top-1准确率,超越了基线模型显著改善微动作识别的性能。引入身体区域对齐召回(BRG)指标,增强模型的可解释性和解剖区域定位能力。实验结果表明,该方法不仅在单一域内表现优异,还在标签腐蚀和跨域迁移中保持鲁棒性,为微行为理解提供了新的技术路径。这一研究推动了多模态视频理解向更细粒度、更具解释性的方向发展,为情感识别、心理分析、安防监控等应用提供了有力的技术支撑。未来,作者计划结合自监督学习和多模态融合,进一步提升模型的泛化能力和实用性,推动微动作识别技术的产业化落地。

深度分析

研究背景

微表情和微动作作为人类非语言交流的重要组成部分,近年来受到广泛关注。早期研究主要依赖于RGB视频和骨架信息,采用空间卷积和时序模型(如LSTM、Transformer)捕获微动作特征。代表性工作包括3D-CNN、图卷积网络(GCN)以及多模态融合方法,但在瞬态、局部微动作的细粒度识别上仍存在不足。随着大规模数据集和深度学习的发展,基于预训练模型的多模态大模型(如Qwen3-VL)逐渐成为主流,提升了整体理解能力。然而,这些模型在微动作细节捕获方面仍受限于全局注意和空间池化机制,难以有效识别瞬时微表情。近年来,强调局部区域动态变化和证据驱动的推理成为研究热点,推动了微动作识别的技术革新。

核心问题

微动作识别面临的核心挑战在于其瞬时性和局部性,运动信号稀疏且易被背景噪声干扰。现有多模态大模型多依赖密集帧级特征提取,导致微细运动信号被稀释或遗漏,影响识别准确性。此外,模型缺乏对运动证据的显式建模,难以实现证据可追溯和解释。训练过程中,单纯追求分类准确率容易导致虚假推理和偏差,限制模型在实际应用中的鲁棒性。如何有效提取微动作的稀疏运动信息,并融合到预训练模型中,成为亟待解决的问题。

核心创新

本文提出GMoT模块,创新性地结合空间显著性评分、邻帧差分和门控融合机制,显式提取微动作的稀疏运动证据。空间评分器动态突出动作区域,邻帧差分捕获瞬时运动能量,门控机制确保运动信息的稳健融合,避免干扰静态背景。训练方面,采用多阶段策略,包括预热、微动作域适应、链式推理和奖励引导,逐步优化模型推理路径。引入身体区域对齐召回(BRG)指标,提升模型的可解释性。整体架构兼容预训练模型,显著改善微动作的细粒度识别和证据追溯能力。这些创新为微动作理解提供了新思路。

方法详解

  • �� 预处理:利用预训练视觉编码器将视频帧转化为patch tokens。
  • �� 空间显著性评分:线性投影每个patch,应用softmax获得权重,动态加权聚合特征。
  • �� 邻帧差分:计算相邻帧差异的平均幅值和符号差,形成两个运动流。
  • �� 运动标记:将两个差分流拼接,投影成紧凑的运动感知标记。
  • �� 门控融合:用sigmoid门控将运动标记融合到原始视觉特征,初始化为接近关闭状态以保持稳定。
  • �� 训练策略:分四阶段,包括预热(冻结模型训练GMoT)、微动作域适应(微调识别任务)、链式推理(生成可解释描述)、奖励引导(优化推理路径和证据追溯)。
  • �� 评估:在iMiGUE和SMG数据集上进行准确率、BRG召回和跨域迁移测试,验证模型性能和鲁棒性。

实验设计

采用iMiGUE和SMG两个微动作数据集,分别进行训练和测试。模型基于Qwen3-VL预训练架构,加入GMoT模块。评估指标包括Top-1准确率、BRG召回率和跨域迁移性能。通过消融实验验证空间显著性评分器、邻帧差分和门控机制的贡献。参数设置包括学习率、批次大小和训练轮数,确保模型收敛。对比多种基线模型,验证GMoT在微动作识别中的优越性。

结果分析

GMoT模型在iMiGUE达67.32%,SMG达73.11%的Top-1准确率,超越Qwen3-VL基线+6.80和+3.11点。引入BRG指标,模型对微动作的解剖区域定位能力显著提升。消融研究显示空间评分器和邻帧差分对性能提升贡献最大。奖励策略有效减少虚假推理,模型在标签腐蚀和跨域迁移中表现稳定。整体验证了GMoT在微动作细粒度识别中的优越性和鲁棒性。

应用场景

该方法适用于微表情分析、心理状态检测、安防监控等场景,特别是在需要细粒度动作识别和解释的应用中。依赖高质量数据和注释,能显著提升微动作的识别准确性和可解释性。未来结合多模态信息(如语音、文本)可进一步增强系统的智能水平,推动行业应用落地。

局限与展望

模型对极端复杂背景或遮挡条件下的微动作识别仍存在困难,主要由于运动证据提取受限于空间显著性评分器的准确性。训练复杂,计算成本高,难以实时部署。对类别的细粒度区分依赖高质量标注,泛化能力在少样本或新类别上仍需验证。未来需优化模型效率和鲁棒性。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,微动作就像是你不经意间的小动作,比如轻轻搓手、皱眉或舔嘴唇。这些动作非常细微,只有在非常专注或用心观察时才能发现。传统的相机或视频分析就像用放大镜看整个厨房,很多微动作都被背景和大动作淹没了。本文提出的方法就像给放大镜装了一个智能识别器,它能专门找到那些微小的动作区域,快速捕捉到这些瞬间的变化。通过特殊的“门”机制,模型可以决定哪些运动证据值得关注,把这些微动作变得更清晰、更容易被识别。这样一来,无论是情感分析还是心理状态检测,都能更准确、更细腻地理解人的微表情和微动作,就像用放大镜看细节一样清楚。

简单解释 像给14岁少年讲一样

想象你在学校里偷偷观察朋友的微小动作,比如轻轻皱眉或嘴角抽动。这些动作虽然很细微,但能透露很多情绪。可是普通的视频分析就像用普通相机拍照,很多细节都被背景和大动作盖住了。这个研究就像给视频装上了一个聪明的“放大镜”,它可以专门找到那些微小的动作区域,然后用特殊的“门”机制决定哪些运动证据最重要。这样一来,模型就能更好地捕捉到这些瞬间的细节,理解朋友的真实情绪。通过多阶段训练和奖励机制,模型学会了如何专注于微动作,避免被虚假的线索误导。最终,这项技术能帮助心理医生、安防人员更准确地识别微表情,甚至在社交媒体上分析人们的真实想法,就像拥有了一个超强的“微动作侦探”一样。

原文摘要

Micro-gesture recognition demands the detection of fleeting, spatially localized movements that are frequently overwhelmed by dominant static appearances and background noise. While Multimodal Large Language Models (MLLMs) excel at general video understanding, they inherently struggle with subtle kinematics and often rely on static posture priors. To this end, we propose GMoT, a Gated Motion-Aware Tokenization module that explicitly distills sparse kinematic evidence into a compact sequence prior to temporal modeling. GMoT dynamically spotlights action-relevant regions via spatially weighted pooling, extracts adjacent-frame temporal differencing to capture precise motion energy, and adaptively fuses these cues into the visual stream using a conservatively initialized semantic gate. To transition from simple classification to evidence-grounded reasoning, we further introduce a progressive reward-guided policy refinement paradigm, supported by a semi-supervised annotation pipeline that generates anatomically focused captions. Beyond achieving the best Top-1 accuracy among the compared methods on iMiGUE (67.32\%) and SMG (73.11\%), improving the Qwen3-VL-8B baseline by +6.80 and +3.11 points, our framework introduces Body-Region Grounding (BRG) Recall as an anatomical-grounding proxy conditioned on correct predictions, together with an overlapping-label cross-domain transfer protocol between iMiGUE and SMG. Extensive evaluations demonstrate that our GMoT-augmented model improves in-domain accuracy, retains clear gains under label-preserving corruptions, and improves accuracy-oriented cross-domain transfer under explicit small-split caveats while maintaining high anatomical grounding in its generated rationales.

cs.CV cs.AI