SparseTT: Visual Tracking with Sparse Transformers

TL;DR

提出SparseTT,用稀疏Transformer提升目标追踪精度,达40FPS,训练时间缩短75%。

cs.CV 🔴 高级 2022-05-08 29 次浏览
Zhihong Fu Zehua Fu Qingjie Liu Wenrui Cai Yunhong Wang
视觉追踪 Transformer 稀疏注意力 目标检测 深度学习

核心发现

方法论

本文提出基于稀疏Transformer的视觉追踪框架,核心包括目标关注网络和双头预测器。目标关注网络采用编码-解码结构,通过稀疏多头自注意力机制(SMSA)聚焦搜索区域中最相关信息,抑制背景干扰。双头预测器由分类和回归两个分支组成,提升前背景判别和边界框精度。训练采用多源数据集,结合焦点损失和IoU损失,优化端到端模型。该方法在不依赖在线更新的情况下,实现40FPS的实时性能,训练时间比TransT缩短75%。

关键结果

  • 在LaSOT、GOT-10k、TrackingNet和UAV123数据集上,成功率和精度指标均优于现有SOTA方法,成功率提升约2个百分点,精度提升约3个百分点。特别是在目标变形、遮挡和尺度变化场景中表现优异,显著优于TransT和TrDiMP。训练时间缩短至原来的25%,验证了模型的高效性。

研究意义

该研究突破了Transformer在视觉追踪中的全局注意力局限,通过稀疏机制增强对目标的关注,有效抑制背景干扰,提升追踪精度。其高效训练和实时性能,为工业应用提供了可行方案,推动目标追踪技术向更高准确率和速度迈进,具有重要理论和实践价值。

技术贡献

提出稀疏Transformer结构,结合多头自注意力与稀疏机制,显著改善目标边界模糊问题。引入双头预测器,增强分类与回归性能。设计端到端训练流程,减少训练时间,提升模型泛化能力。整体架构兼顾精度与速度,为未来追踪算法提供新思路。

新颖性

首次将稀疏Transformer引入视觉追踪任务,有效解决全局自注意力对目标关注不足的问题。结合双头预测器优化边界框和分类,创新性地实现高效、准确的端到端追踪。相较于传统交叉相关或全局Transformer,提出的稀疏机制更具针对性和实用性。

局限性

  • 模型在极端遮挡或快速运动场景下仍存在追踪失败风险,主要由于稀疏注意力可能忽略部分重要信息。
  • 对稀疏参数K的敏感性较高,需根据场景调整,影响泛化能力。
  • 在极大尺度变化或复杂背景中,仍需进一步优化背景抑制能力。

未来方向

未来将探索多尺度稀疏注意力机制,增强模型对尺度变化的适应性。同时,结合在线学习策略,提升模型在长时序中的鲁棒性。还计划引入多模态信息,丰富目标特征,进一步提升追踪性能。

AI 总览摘要

目标追踪作为计算机视觉中的核心任务,面临背景干扰、目标变形和尺度变化等挑战。现有方法多依赖全局自注意力机制,虽具强大表达能力,但容易被背景干扰,导致追踪精度下降。本文提出SparseTT,一种基于稀疏Transformer的追踪框架,核心在于利用稀疏多头自注意力机制(SMSA)聚焦搜索区域中最相关信息,有效抑制背景干扰。该机制通过仅关注最相似的像素点,增强目标的辨识能力。结合编码-解码结构的目标关注网络,模型能更精准地捕捉目标特征。为提升分类和边界回归性能,设计了双头预测器,端到端训练,显著缩短训练时间,达到40FPS实时性能。大量实验证明,该方法在LaSOT、GOT-10k、TrackingNet和UAV123等数据集上超越SOTA,特别在目标变形、遮挡和尺度变化场景中表现优异。训练时间比TransT缩短75%,验证了其高效性和实用性。该研究不仅提升了目标追踪的精度,也为未来深度学习模型在复杂场景中的应用提供了新思路,具有重要的理论和工程意义。

深度分析

研究背景

视觉追踪作为计算机视觉中的基础任务,经历了从相关滤波、深度学习到Transformer的演变。早期方法如Siamese网络依赖相似性匹配,受背景干扰限制较大。近年来,Transformer引入后,通过全局自注意力提升表达能力,但全局机制容易被背景干扰,导致边界模糊。现有研究如TransT和DTT尝试用Transformer替代相关操作,但仍存在背景干扰和训练成本高的问题。随着深度模型的普及,追踪算法追求更高的精度和速度,迫切需要更有效的机制解决背景干扰和目标变形的挑战。

核心问题

核心问题在于Transformer的全局自注意力机制无法有效聚焦目标,反而被背景信息干扰,导致边界模糊和追踪失误。尤其在目标变形、遮挡和尺度变化场景中,传统方法难以保持高精度。如何设计机制强化目标关注、抑制背景干扰,成为提升追踪性能的关键。现有方法多依赖复杂模型或在线更新,训练成本高,难以满足实时需求。

核心创新

创新点包括:1)引入稀疏多头自注意力机制(SMSA),只关注最相似像素点,增强目标辨识;2)设计编码-解码结构的目标关注网络,提升目标特征表达;3)采用双头预测器,分别优化分类和边界回归,提升整体精度;4)端到端训练流程,显著缩短训练时间。相比传统全局Transformer,稀疏机制更具针对性,有效抑制背景干扰,提升追踪鲁棒性。

方法详解

  • �� 特征提取:采用共享的Swin Transformer骨干提取搜索区域和目标模板特征。• 目标关注网络:由编码器和解码器组成,编码器利用多头自注意力(MSA)编码目标模板特征,解码器结合稀疏多头自注意力(SMSA)和交叉注意力(MCA)对搜索区域特征进行解码,生成目标关注特征。• 稀疏自注意力:在每个像素点只关注K个最相似像素点,抑制背景干扰。• 双头预测器:分类分支融合FC和卷积特征,回归仅用卷积特征,端到端训练。• 损失函数:结合焦点损失和IoU损失,优化模型性能。

实验设计

  • �� 数据集:使用TrackingNet、LaSOT、GOT-10k、UAV123等多源数据集,进行大规模训练。• 评估指标:成功率、精度、归一化精度。• 超参数:编码器/解码器层数均为2,稀疏参数K=32,训练采用AdamW优化器,批次32,学习率1e-4,训练约60小时。• 消融实验:验证编码层数、解码层数、稀疏参数对性能的影响。

结果分析

  • �� 在LaSOT、GOT-10k、TrackingNet、UAV123上,成功率和精度指标均优于TransT,成功率提升约2%,精度提升3%。• 在目标变形、遮挡、尺度变化场景中表现尤为出色,显著优于对比方法。• 训练时间缩短至原来的25%,验证了模型高效性。• Ablation研究显示,稀疏参数K=32最优,编码层数为2效果最佳。

应用场景

  • �� 适用于无人机监控、自动驾驶、视频监控等场景,能在复杂环境中实现高精度实时追踪。• 需要预训练模型和多源数据支持,具备一定硬件条件。• 未来可结合多模态信息,提升多场景适应性。

局限与展望

  • �� 在极端遮挡或快速运动场景中仍存在追踪失败风险,稀疏注意力可能忽略部分重要信息。• 参数敏感性较高,需场景调优。• 在极大尺度变化或复杂背景中,背景抑制能力仍需提升。

通俗解读 非专业人士也能看懂

想象你在一个工厂里工作,工厂里有很多不同的机器和工人。你要找到某个特定的机器,但工厂很大,背景也很复杂。有些机器看起来很像,背景里也有很多噪音。传统的方法就像用放大镜盯着整个工厂,虽然能看到很多细节,但很容易被背景干扰,找错目标。本文提出的方法像是用一个特别的“聚焦镜”,只关注目标机器最重要的部分,忽略那些干扰信息。这个“聚焦镜”通过只关注最相似的几个点,帮助你更快、更准地找到目标。这样一来,不管工厂里机器变形、遮挡还是背景复杂,都能更准确地找到目标机器。整个系统还像是装了两个眼睛,一个专门判断目标是否在前,一个专门画出目标的边界。这样不仅找得更准,还能快很多,几乎可以实时操作。这个新方法让工厂的工作变得更高效,也为未来更智能的工厂管理打下基础。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的寻宝游戏,你要找到隐藏在一堆东西里的宝藏。以前的方法就像用望远镜看整个房间,虽然能看到很多东西,但很容易被背景的其他东西迷惑,找不到宝藏。现在,这个新方法像是用一只特别的“魔法手”,只抓住和宝藏最像的几个线索,不管房间里有多少杂乱的东西,都能更快更准地找到宝藏。它还像装了两个“聪明的眼睛”,一个帮你判断宝藏是不是在前面,一个帮你画出宝藏的轮廓。这样一来,不管宝藏变形、被遮挡,或者房间很乱,都能找到得更好。这个方法特别快,几乎可以实时告诉你宝藏在哪里,比以前的方法快得多,也更准确。就像你用这个“魔法手”玩游戏,胜算大大增加啦!未来,这种技术还能帮机器人更聪明地找到东西,变得更厉害!

原文摘要

Transformers have been successfully applied to the visual tracking task and significantly promote tracking performance. The self-attention mechanism designed to model long-range dependencies is the key to the success of Transformers. However, self-attention lacks focusing on the most relevant information in the search regions, making it easy to be distracted by background. In this paper, we relieve this issue with a sparse attention mechanism by focusing the most relevant information in the search regions, which enables a much accurate tracking. Furthermore, we introduce a double-head predictor to boost the accuracy of foreground-background classification and regression of target bounding boxes, which further improve the tracking performance. Extensive experiments show that, without bells and whistles, our method significantly outperforms the state-of-the-art approaches on LaSOT, GOT-10k, TrackingNet, and UAV123, while running at 40 FPS. Notably, the training time of our method is reduced by 75% compared to that of TransT. The source code and models are available at https://github.com/fzh0917/SparseTT.

cs.CV