What can a cook in Italy teach a mechanic in India? Action Recognition Generalisation Over Scenarios and Locations

TL;DR

提出ARGO1M数据集和CIR方法,实现跨场景、地点动作识别的泛化,优于现有方法。

cs.CV 🔴 高级 2023-06-15 50 次浏览
Chiara Plizzari Toby Perrett Barbara Caputo Dima Damen
动作识别 域泛化 跨场景 视频分析 深度学习

核心发现

方法论

本文引入ARGO1M数据集,包含110万视频片段,覆盖10个场景和13个地点。提出Cross-Instance Reconstruction(CIR)方法,通过将每个视频表示为来自其他域视频的加权重建,结合视频文本配对,学习域泛化特征。训练中采用对比学习和分类损失,利用视频编码器(如SlowFast)和预训练的CLIP文本编码器,优化重建和分类性能。测试时仅用视频编码器和分类器,无需文本或域标签,验证模型在未见场景和地点的泛化能力。

关键结果

  • 在ARGO1M的10个测试拆分中,CIR平均提升准确率2.1%,最高达4.9%,显著优于基线和其他域泛化方法。特别是在难度较高的场景(如Knitting in India)中,表现提升更明显,验证了方法的鲁棒性。
  • 在不使用域标签的情况下,CIR仍优于对比方法,说明其依赖文本配对和重建机制有效增强了模型的泛化能力。 ablation研究显示,视频文本配对和重建目标对性能提升贡献最大。
  • 不同重建策略(如交叉注意力和分类重建)均提升性能,结合两者效果最佳,验证多任务训练的优势。

研究意义

该研究突破了动作识别在场景和地点变化下的泛化瓶颈,为实际应用中的跨域识别提供新思路。ARGO1M作为最大规模的场景地点多样性视频数据集,为未来多场景、多地点的动作识别研究奠定基础。CIR方法利用跨实例重建和文本信息,有望推动多模态学习和域适应技术的发展,增强模型在真实复杂环境中的鲁棒性。这对智能监控、机器人、增强现实等行业具有重要意义,推动其向更智能、更普适的方向发展。

技术贡献

本文提出的CIR方法创新性地将视频表示作为其他域视频的加权重建,结合视频文本配对,显著提升域泛化能力。引入基于交叉实例注意力的重建机制,结合对比学习和分类目标,形成多任务优化框架。ARGO1M数据集涵盖多场景、多地点,规模达110万,填补了视频域泛化数据集的空白。实验中,CIR在所有测试拆分中均优于现有最先进方法,验证了其有效性和鲁棒性,为多模态、多域学习提供新范式。

新颖性

首次提出结合视频文本配对的跨实例重建机制,用于动作识别的域泛化。ARGO1M数据集是最大规模的场景地点多样性视频数据集,突破了以往仅关注视觉域偏移的局限。该方法不依赖域标签,利用多模态信息实现更强的泛化能力,区别于传统的分布匹配或对抗训练策略。

局限性

  • 模型对极端场景变化或文本描述不准确时的鲁棒性仍需验证,可能影响泛化效果。
  • 训练过程复杂,依赖预训练模型和多任务优化,计算成本较高,难以在资源有限环境中部署。
  • 目前主要在动作识别任务中验证,泛化到其他任务(如行为预测)仍需进一步研究。

未来方向

未来将探索多模态信息融合的更深层次机制,提升在极端场景下的鲁棒性。计划扩展ARGO1M数据集,涵盖更多场景和语言,验证模型的跨文化适应性。同时,将结合强化学习和自监督策略,推动模型在实际应用中的自主学习能力,向更智能的跨域动作识别迈进。

AI 总览摘要

动作识别的场景和地点变换带来了巨大挑战,传统模型在未见环境中表现不佳。本文提出ARGO1M数据集,涵盖10个场景和13个地点,成为最大规模的多域视频数据集。针对跨域泛化难题,作者设计了CIR方法,通过将每个视频表示为来自其他域视频的加权重建,结合视频文本配对,学习具有强泛化能力的特征。该机制利用对比学习和分类目标,优化多任务训练,显著提升模型在未见场景和地点的识别准确率。在ARGO1M的10个测试拆分中,CIR平均提升2.1%的准确率,最高达4.9%,优于所有对比方法。实验还验证了文本配对和重建目标的重要性,展示了多模态信息融合在域泛化中的潜力。该研究不仅推动了动作识别技术的发展,也为多场景、多地点的应用提供了理论基础。未来,作者计划扩展数据集规模,结合强化学习和自监督策略,进一步增强模型的鲁棒性和适应性,为智能监控、机器人等行业带来深远影响。

深度分析

研究背景

近年来,动作识别技术取得显著进展,深度学习模型如SlowFast、I3D等在多个公开数据集上表现优异。然而,模型在实际应用中面临场景和地点的巨大变化,导致性能显著下降。现有研究多关注视觉域偏移(如ImageNet风格变化、合成到真实的迁移),但对场景和地点的变化关注不足。数据集如UCF-HMDB、Kinetics虽提供丰富样本,但缺乏跨场景、多地点的多样性。Ego4D等新兴数据集引入第一人称视角,为动作识别提供新视角,但仍未充分解决场景地点变化的泛化问题。此前的域适应方法如DANN、MMD、CORAL在视觉任务中取得一定效果,但在视频动作识别中的应用有限。近年来,结合多模态信息(如视频与文本)的方法逐渐兴起,旨在提升模型的泛化能力。本文基于此背景,提出更大规模、多场景、多地点的视频数据集ARGO1M,旨在推动跨场景、地点动作识别的研究。

核心问题

核心问题在于,现有动作识别模型在面对未见场景和地点时表现不佳,受限于训练数据的域偏差。具体表现为模型在训练集之外的环境中准确率大幅下降,尤其是在场景和地点同时变化时。传统方法多依赖域标签或分布匹配,难以应对复杂的跨域变化。如何学习一种具有强泛化能力的特征表示,既能捕捉动作的本质,又能适应不同的背景和工具变化,是当前亟待解决的难题。此外,缺乏大规模、多样化的跨场景、多地点视频数据集,限制了研究的深入推进。

核心创新

本研究的创新点主要体现在两个方面:第一,提出ARGO1M数据集,涵盖10个场景和13个地点,规模达110万视频片段,为动作识别的跨域研究提供了丰富资源。第二,设计CIR方法,通过将每个视频表示为来自其他域视频的加权重建,结合视频文本配对,学习具有域泛化能力的特征。具体机制包括:• 利用交叉实例注意力机制,计算视频间的相似度,进行加权重建;• 结合对比学习,利用文本描述引导重建,增强语义一致性;• 采用多任务训练框架,同时优化重建和分类目标,提升泛化能力。这一机制区别于传统的分布匹配和对抗训练,强调多模态信息的融合和实例重建的多样性。

方法详解

  • �� 输入:每个训练样本为视频片段v、文本描述t和动作标签y。• 编码:用SlowFast提取视频特征f(v),用CLIP文本编码器g(t)提取文本特征。• 重建:学习两个投影头Q、K,将f(v)投影为查询和键,计算相似度cij,通过softmax得到权重,进行加权重建⊕vi。• 损失:采用对比学习的Lr→t和Lt→r,推动重建与文本描述的语义一致性,同时用交叉熵损失Lc训练动作分类器h。• 训练:多任务优化,结合重建和分类目标,调整超参数λ1、λ2。• 测试:只用编码器f和分类器h,输入测试视频,无需文本或域标签,验证泛化能力。

实验设计

  • �� 数据:ARGO1M,包含110万视频片段,10个场景,13个地点,60个动作类别,分为10个测试拆分。• 基线:ERM、CORAL、DANN、MMD、Mixup、BoDA、DoPrompt等。• 评估指标:Top-1准确率。• 超参数:批次128,训练50轮,学习率2e-4,λ1=1,λ2=0.5。• 进行消融实验,验证重建目标、注意力机制和多模态融合的贡献。

结果分析

  • �� CIR在所有10个测试拆分中均优于对比方法,平均提升2.1%,最高达4.9%。• 在难度较高的拆分(如Knitting in India)中,性能提升更明显,验证鲁棒性。• 不依赖域标签,利用文本配对实现跨域泛化,优于传统分布匹配策略。• 消融实验显示,文本配对和多任务训练是性能提升的关键因素。

应用场景

  • �� 立即应用:智能监控、机器人视觉、增强现实等场景中的跨域动作识别。• 长远愿景:推动多模态、多场景、多地点的泛化模型,实现在复杂环境中的自主学习和适应能力,助力智能系统普及。

局限与展望

  • �� 对极端场景变化或文本描述不准确的鲁棒性仍需验证。• 训练复杂,计算成本较高,难以在资源有限环境部署。• 目前主要验证在动作识别任务,泛化到其他任务仍需探索。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,不同国家的厨师用不同的工具、食材和背景,但他们都在做“切菜”这个动作。传统的电脑模型就像只认识某个厨师用的刀和厨房环境,遇到不同国家的厨房就认不出来了。本文就像教电脑理解“切菜”的本质,不管用什么工具、在哪个厨房。它用一种特别的方法,把每个视频都像用别的厨房的厨师帮忙“重建”一样,把不同厨房的场景拼在一起,让电脑学会只看动作本身。这样,不管是在印度还是意大利,电脑都能认出“切菜”。这就像教一个厨师不只记住刀的品牌,而是记住“切菜”的动作本身,不管厨房在哪里、用什么工具。通过用文字描述动作,还能帮电脑更好理解动作的意义。最终,这个方法让电脑变得更聪明,能在各种不同环境中都认出动作,就像人一样灵活。

简单解释 像给14岁少年讲一样

想象你在学校学跳舞,不同的老师教不同的动作,但你总能认出“跳舞”这个动作。现在,想让电脑也学会这个本领就很难,因为每次环境不同,动作可能看起来不一样。这个研究就像教电脑理解“跳舞”的本质,不管在哪个舞台、用什么音乐。科学家们用一种特别的办法,把每个跳舞的视频都像是用别的舞台帮忙“拼凑”一样,把不同的环境拼在一起,让电脑学会只看动作本身。这样,不管是在家里还是在学校,电脑都能认出“跳舞”。他们还用文字描述动作,帮助电脑更懂意思。最后,电脑变得更聪明,能在各种不同的场景中都认出动作,就像我们一样灵活。这就像你在不同的学校都能认出老师在教什么舞蹈一样,超级厉害!

原文摘要

We propose and address a new generalisation problem: can a model trained for action recognition successfully classify actions when they are performed within a previously unseen scenario and in a previously unseen location? To answer this question, we introduce the Action Recognition Generalisation Over scenarios and locations dataset (ARGO1M), which contains 1.1M video clips from the large-scale Ego4D dataset, across 10 scenarios and 13 locations. We demonstrate recognition models struggle to generalise over 10 proposed test splits, each of an unseen scenario in an unseen location. We thus propose CIR, a method to represent each video as a Cross-Instance Reconstruction of videos from other domains. Reconstructions are paired with text narrations to guide the learning of a domain generalisable representation. We provide extensive analysis and ablations on ARGO1M that show CIR outperforms prior domain generalisation works on all test splits. Code and data: https://chiaraplizz.github.io/what-can-a-cook/.

cs.CV