Instant 3D Object Tracking with Applications in Augmented Reality

TL;DR

提出无需校准的端到端3D目标追踪系统,基于深度学习和平面追踪实现移动设备实时追踪。

cs.CV 🔴 高级 2020-06-24 38 次浏览
Adel Ahmadyan Tingbo Hou Jianing Wei Liangkai Zhang Artsiom Ablavatski Matthias Grundmann
3D追踪 增强现实 深度学习 移动设备 实时性能

核心发现

方法论

系统结合深度神经网络(基于MobileNetV2架构)进行目标检测与初始3D姿态估计,输出3D边界框。随后,利用EPnP算法将边界框顶点投影到图像平面,采用平面追踪器持续追踪2D关键点,结合相对尺度的9自由度(9-DoF)追踪实现连续的3D姿态估计。整个流程在CPU和GPU上高效协作,确保在移动设备上实现26帧每秒的实时性能。

关键结果

  • 检测网络在3D IoU阈值为0.5时达成0.59的平均精度,模型大小仅5.54MB,能在三星S20设备GPU上以26.5FPS实现检测,追踪部分以30FPS以上在CPU上运行,验证了系统的高效性和实用性。
  • 在多目标场景中,系统成功实现多目标的连续追踪,且在不同类别(鞋子、椅子)上表现出良好的鲁棒性,显著优于传统基于几何或单纯深度学习的方法。
  • 通过消融实验,验证了检测+追踪的结合策略在减少抖动、提升稳定性方面优于纯检测或纯追踪方案,特别在动态场景中表现出优越性能。

研究意义

该系统突破了移动端3D追踪的瓶颈,无需复杂校准或模型,极大降低了AR应用的门槛,为虚拟试穿、虚拟装饰等场景提供了实时、精准的解决方案。其端到端、无需预先模型的特性,推动了AR硬件和软件的普及,具有广泛的产业应用潜力。

技术贡献

创新点在于结合深度学习的目标检测与EPnP几何估计,利用平面追踪器实现连续追踪,避免复杂初始化。系统实现了无需预先校准、支持类别泛化的端到端流程,充分利用CPU与GPU资源,达成高帧率和低延迟,显著优于现有多模态或多视角方案。

新颖性

首次提出基于单目RGB图像的无需校准的端到端3D目标追踪系统,结合深度学习检测与平面几何追踪,突破了传统依赖深度传感器或复杂初始化的限制,实现在移动设备上的实时性能。

局限性

  • 系统假设目标在追踪过程中保持平面,若目标发生旋转或滚转,可能导致追踪失败。
  • 对对称或具有复杂几何结构的对象,可能出现姿态不唯一或误差增加的问题。
  • 在快速运动或遮挡严重的场景中,追踪鲁棒性仍有待提升。

未来方向

未来将结合多帧信息与深度学习优化平面追踪的鲁棒性,扩展对非平面目标的支持,提升在复杂环境中的适应性。同时,计划引入多模态传感器融合,增强系统的泛化能力。

AI 总览摘要

在增强现实(AR)应用中,实时准确的3D目标追踪是核心技术之一。传统方法多依赖深度传感器或复杂初始化,限制了其在移动设备上的普及。本文提出一种无需校准、端到端的3D追踪系统,结合深度学习目标检测与几何追踪技术,实现对单目RGB图像中目标的连续追踪。

系统首先利用基于MobileNetV2的神经网络检测目标,估算其初始3D边界框,随后通过EPnP算法将边界框顶点投影到图像平面,利用平面追踪器持续追踪2D关键点,结合相对尺度实现连续的9自由度(9-DoF)追踪。整个流程在移动设备上高效运行,检测部分达26FPS,追踪部分超过30FPS。

实验结果显示,该系统在鞋子、椅子等类别上获得0.59的平均3D IoU,模型体积小巧(5.54MB),在实际设备上实现实时性能,验证了其在虚拟试穿、虚拟装饰等场景中的应用潜力。系统无需预先模型或复杂校准,极大降低了AR硬件门槛,推动了行业普及。

此外,结合多目标追踪能力,系统表现出良好的鲁棒性和稳定性,特别在动态环境中优于传统方案。未来,作者计划增强对非平面目标的支持,提升抗遮挡能力,并融合多模态传感器信息,推动AR技术的进一步发展。

深度分析

研究背景

近年来,AR技术快速发展,目标追踪作为其核心技术之一,经历了从基于几何的传统方法到深度学习的革新。早期方法如光流和特征匹配在静态场景表现良好,但在动态环境中鲁棒性不足。深度学习引入后,目标检测与姿态估计取得突破,但多依赖深度传感器或复杂初始化。现有单目追踪多为2D或有限3D,难以实现实时、无校准的全自由度追踪。代表性工作包括DeepIM、PoseCNN等,但在移动端应用仍受限。本文旨在突破这些限制,提供一种高效、无需校准的3D追踪方案,满足AR在移动设备上的实时需求。

核心问题

核心问题在于如何在无需预先校准或复杂初始化的条件下,实现对单目RGB图像中目标的连续、准确的3D追踪。传统方法多依赖深度传感器或多视角信息,成本高且难以普及。单目追踪面临尺度模糊、姿态不唯一、遮挡干扰等挑战,尤其在移动设备上受限于算力和能耗。如何结合深度学习检测与几何估计,确保追踪的鲁棒性和实时性,是当前亟待解决的问题。

核心创新

创新点包括:1)提出无需校准的端到端系统,结合深度学习检测与EPnP几何估计,实现目标的初始3D姿态估计;2)利用平面追踪器持续追踪2D关键点,结合相对尺度实现连续9-DoF追踪;3)高效利用CPU和GPU资源,确保在移动设备上实现26FPS的实时性能。这一方案突破了传统依赖深度传感器和复杂初始化的限制,显著简化了系统架构。

方法详解

  • �� 输入:单帧RGB图像。• 目标检测:利用基于MobileNetV2的多任务网络预测目标类别、边界框和形状信息(如分割掩码)。• 初始3D姿态:通过检测输出的边界框,利用高斯拟合获得目标中心位置,结合边界框顶点投影,使用EPnP估算目标的3D位置和尺度。• 关键点投影:计算边界框的8个顶点和中心点,将其投影到图像平面。• 追踪:采用平面追踪器持续追踪这9个2D点,结合相对尺度的9-DoF追踪模型,保持目标的连续追踪。• 3D重建:每帧将2D点反投影回3D空间,利用EPnP算法更新目标的3D边界框和姿态。• 结合检测与追踪:通过区域重叠判断,融合检测和追踪结果,提升稳定性。

实验设计

采用自建鞋子和椅子数据集,评估检测精度和追踪鲁棒性。对比传统几何追踪和纯深度学习方法,验证检测+追踪方案在动态场景中的优势。指标包括3D IoU、帧率和鲁棒性。在不同光照、遮挡和快速运动条件下进行测试,确保系统稳定性。超参数方面,模型训练采用多任务损失,追踪采用相对尺度模型,确保实时性和准确性。

结果分析

检测模型在3D IoU阈值0.5时达到0.59的平均精度,模型体积仅5.54MB,能在移动GPU上以26.5FPS运行。追踪部分在多目标场景中表现出良好的连续性和鲁棒性,尤其在动态环境中优于传统方法。消融实验显示,结合检测与追踪显著减少抖动,提高稳定性,验证了方案的有效性。

应用场景

该系统适用于虚拟试穿、虚拟家具摆放、增强现实游戏等场景。只需普通摄像头,无需预先模型或校准,便可实现实时追踪。其高效性和类别泛化能力,为移动端AR应用提供了广阔的商业潜力,降低了技术门槛,推动行业普及。

局限与展望

系统假设目标在追踪过程中保持平面,若目标发生旋转或滚转,可能导致追踪失败。对对称或复杂几何结构的对象,可能出现姿态不唯一或误差增加的问题。在快速运动或遮挡严重的场景中,鲁棒性仍需提升。未来需解决非平面目标、多目标同时追踪等挑战。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,要不断观察锅里的食材。传统方法像用手电筒照明,能看到食材但不能知道它的具体位置和大小。现在,这个系统像装了一个智能摄像头,能自动识别锅里的食材,并且知道它们在空间中的位置、大小和方向。它不用提前告诉系统食材长什么样,也不用复杂的校准,只用一台普通手机就能做到。系统先用AI识别目标,然后用几何方法估算它的空间位置,接着用平面追踪器持续跟踪它的运动。这样,无论你在厨房里走动多快,系统都能实时跟踪食材的变化,就像有个聪明的助手帮你盯着锅里的食物一样。这个技术可以用在虚拟试衣、家具摆放等场景,让虚拟内容和真实物体完美结合,带来更自然的AR体验。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你的手机可以看见你房间里的玩具,然后帮你把虚拟的机器人放在玩具旁边,好像它们真的在一起一样。这就像手机变成了一个超级聪明的眼睛,能看见房间里的东西,并且知道它们在空间里的位置和方向。这个系统不用特殊的设备,只用普通的手机摄像头,就能做到。它先用一个聪明的程序找出你想追踪的东西,比如一把椅子,然后用数学方法估算出椅子在房间里的具体位置和大小。接着,它会一直跟踪椅子,确保虚拟的东西可以和真实物体完美结合。这样,你可以用手机做虚拟试穿、摆放家具,甚至玩增强现实游戏,体验更真实、更有趣的虚拟世界。这个技术让AR变得更简单、更快,也更适合普通人使用。

术语表

3D边界框(3D Bounding Box)

在三维空间中,用长宽高和姿态描述目标的包围盒,代表目标的空间位置和大小。

用于初始化目标的空间位置和尺度。

EPnP(Efficient Perspective-n-Point)

一种快速求解相机姿态的几何算法,通过已知3D点和对应2D投影点估算相机位置与方向。

用于从边界框顶点投影中估算目标的3D姿态。

平面追踪器(Planar Tracker)

基于图像平面特征持续追踪目标的二维关键点,保持目标在视频中的连续性。

实现目标在连续帧中的稳定追踪。

9-DoF(九自由度)

目标的三维位置(3个自由度)、姿态(3个自由度)和尺度(3个自由度),描述目标在空间中的完整运动状态。

实现目标的全自由度追踪。

深度神经网络(Deep Neural Network)

由多层神经元组成的模型,用于学习复杂的特征表示,广泛应用于目标检测和姿态估计。

实现目标的初始检测和姿态估计。

开放问题 这项研究留下的未解疑问

  • 1 在复杂环境中,目标遮挡或快速运动对追踪的影响仍未充分解决,如何提升鲁棒性和连续性是未来的关键问题。
  • 2 系统在非平面目标或多目标同时追踪方面的能力仍有限,需进一步研究多目标协同追踪算法。

应用场景

近期应用

虚拟试衣

用户只需用手机摄像头扫描身体,系统实时追踪身体姿态,虚拟服装可以自然贴合,提升购物体验。

虚拟家具摆放

在房间中用手机扫描空间,系统追踪家具位置,实现虚拟家具的自然摆放和交互,方便家居设计。

远期愿景

智能制造与机器人导航

结合高精度追踪技术,实现工业现场的自动化操作与机器人路径规划,提升生产效率。

原文摘要

Tracking object poses in 3D is a crucial building block for Augmented Reality applications. We propose an instant motion tracking system that tracks an object's pose in space (represented by its 3D bounding box) in real-time on mobile devices. Our system does not require any prior sensory calibration or initialization to function. We employ a deep neural network to detect objects and estimate their initial 3D pose. Then the estimated pose is tracked using a robust planar tracker. Our tracker is capable of performing relative-scale 9-DoF tracking in real-time on mobile devices. By combining use of CPU and GPU efficiently, we achieve 26-FPS+ performance on mobile devices.

cs.CV