Diver Interest via Pointing in Three Dimensions: 3D Pointing Reconstruction for Diver-AUV Communication

TL;DR

DIP-3D利用稀疏三维点云和人体姿态实现潜水员指向目标的三维定位,提升多目标识别能力。

cs.RO 🔴 高级 2023-10-18 55 次浏览
Chelsey Edge Demetrious Kutzke Megdalia Bromhal Junaed Sattar
水下机器人 三维视觉 人体姿态估计 点云重建 人机交互

核心发现

方法论

该方法结合稀疏立体三角测量与人体姿态估计,通过检测潜水员手臂关键点(腕、肘、肩)实现指向向量的空间延伸。利用SIFT特征匹配和Lowe比值测试筛选候选目标,再通过重投影矩阵将2D关键点转为3D坐标,最后计算目标点到指向线的垂直距离,确定目标位置。此流程在多目标场景下有效区分目标,增强指向信息的空间表达。

关键结果

  • 在闭水实验中,DIP-3D在距离误差方面平均为119.95像素,指向目标识别准确率达85%以上。多目标场景下,系统能正确识别 diver 指向的目标,误差在可接受范围内。通过人类标注对比,平均偏差45.9像素,验证了方法的实用性。实验中,系统在0.857 fps下运行,满足水下机器人实时需求。
  • 在不同距离(2-3米)场景中,目标识别准确率显著高于远距离(超过3米),反映距离估计的限制。消除误检的关键在于过滤不合理的姿态和深度值,确保目标定位的可靠性。
  • 消融实验显示,稀疏三角测量优于密集匹配,极大减轻了海水折射和光照变化带来的匹配误差,提升了目标定位的稳定性。

研究意义

该研究突破了水下复杂环境中多目标指向识别的瓶颈,为人机自然交互提供了技术基础。通过结合人体姿态和距离信息,提升了潜水员与AUV协作的自然性和准确性,有望推动水下机器人在维护、考古和生态监测中的应用。此技术解决了传统视觉系统在低光、折射和特征稀疏条件下的局限,为未来自主导航和目标识别奠定基础。

技术贡献

创新点在于引入稀疏立体三角测量结合人体姿态估计,提出一种模块化的三维目标定位框架。该方法利用SIFT特征匹配和重投影矩阵实现2D到3D的转换,结合目标距离筛选机制,有效区分多目标场景中的指向目标。不同于传统密集匹配,该方案在海水折射和光照变化中表现出更高鲁棒性,为水下视觉任务提供了新思路。

新颖性

首次在水下环境中融合稀疏三角测量与人体姿态估计实现三维指向目标定位,解决了多目标识别中的距离模糊问题。该方法突破了现有2D指向识别的局限,增强了水下人机交互的自然性和准确性,填补了水下视觉中距离估计的空白,为复杂场景下的自主目标识别提供新路径。

局限性

  • 系统对潜水员姿态检测依赖较强,非标准姿势(如交叉手臂)可能导致误识别,需改进姿态估计模型以适应多样姿势。
  • 深度估计在远距离(超过3米)时精度下降,影响目标定位的准确性,未来需优化多视角配置或引入深度学习增强模型。
  • 实时性能受限于硬件计算能力,当前0.857 fps在复杂场景下仍有提升空间,需硬件优化或算法加速。

未来方向

未来将结合深度学习提升姿态估计鲁棒性,扩展多目标识别能力,增强系统在复杂水下环境中的适应性。同时,研究将引入多视角融合与深度学习模型,提升距离估算精度,推动自主导航与目标识别的深度集成,为水下机器人实现更智能的人机协作奠定基础。

AI 总览摘要

水下人机交互一直是海洋机器人领域的难题,尤其在多目标识别与自然指向沟通方面。传统视觉方法在低光、折射和特征稀疏环境中表现不佳,限制了潜水员与自主水下车辆(AUV)之间的有效合作。本文提出的DIP-3D方法,结合稀疏立体三角测量与人体姿态估计,创新性地实现了潜水员指向目标的三维定位。系统利用SIFT特征匹配和重投影矩阵,将二维关键点转换为三维空间坐标,计算目标点到指向线的垂直距离,从而准确识别潜水员指向的目标。在闭水实验中,系统在距离误差和目标识别准确率方面表现优异,平均误差119.95像素,识别准确率超过85%。该技术突破了水下多目标识别的瓶颈,为实现更自然、更高效的人机协作提供了技术支撑。未来,结合深度学习优化姿态估计和多视角融合,将进一步提升系统的鲁棒性和应用范围。该研究为水下机器人在维护、考古和生态监测中的应用提供了坚实基础,推动水下自主导航与智能交互迈向新阶段。

深度分析

研究背景

水下机器人技术经过数十年的发展,从最早的遥控潜水器到自主水下车辆(AUV),在海洋勘测、生态监测等领域发挥重要作用。传统视觉系统在水下环境中受限于光照不足、折射和特征稀疏,导致目标检测和距离估计困难。近年来,人体姿态估计和稀疏点云重建成为研究热点,代表算法如MediaPipe Pose、SIFT等被引入水下场景,但在复杂环境下鲁棒性不足。多目标识别和自然交互仍是挑战,尤其在多目标场景中区分目标距离和空间关系,限制了人机交互的自然性和效率。

核心问题

核心问题在于水下环境中多目标识别的距离模糊和姿态估计的鲁棒性不足。传统密集匹配方法在折射和光照变化中误差大,难以实现精确距离估算。潜水员指向目标的空间定位受限于二维图像信息,难以区分多个目标,影响人机交互的自然性和准确性。解决这一问题对于提升水下自主导航、目标识别和人机合作具有重要意义,但技术难点在于海水折射、低光照和多样姿势。

核心创新

本研究的创新在于引入稀疏三角测量结合人体姿态估计,形成一种模块化的三维目标定位框架。具体包括:• 利用MediaPipe Pose检测潜水员手臂关键点(腕、肘、肩);• 采用SIFT特征匹配筛选候选目标,增强鲁棒性;• 通过重投影矩阵将2D关键点转换为3D空间坐标;• 计算目标点到指向线的垂直距离,识别目标。此方案在多目标场景中表现出优异的距离区分能力,突破了传统密集匹配的局限。

方法详解

  • �� 采集潜水员姿态和目标候选的双目图像,进行2D关键点检测;• 利用SIFT特征匹配筛选候选目标,确保匹配质量;• 通过已校准的重投影矩阵,将2D关键点转为3D空间坐标;• 构建指向向量,延伸至空间中;• 计算每个候选目标到指向线的垂直距离,筛选出最可能的目标;• 最后,将目标的3D位置投影回二维图像,指导AUV自主运动。

实验设计

在闭水环境中,利用标定的立体相机系统采集数据,设置不同距离(2-3米)场景,验证目标识别准确率和距离误差。采用人工标注作为参考,评估算法在多目标场景中的表现。对比密集匹配和稀疏三角测量的效果,分析误差来源。系统在0.857 fps下运行,满足水下实时需求。通过人类标注和自动检测结果的对比,验证了算法的有效性和鲁棒性。

结果分析

系统在闭水实验中实现了平均119.95像素的距离误差,目标识别准确率超过85%。在不同距离场景中,识别效果明显优于传统方法,尤其在2米以内误差更低。稀疏三角测量有效减轻了海水折射带来的匹配误差,验证了其在复杂水下环境中的优势。人类标注对比显示,系统能较准确捕捉潜水员指向方向,偏差在45.9像素左右,表明其实用性强。

应用场景

该技术可应用于水下维护、考古、生态监测等场景,支持潜水员与AUV的自然交互。只需潜水员手势指向,AUV即可自主识别目标位置,减少人工操作,提高效率。系统对水下环境的适应性强,未来可结合深度学习提升姿态估计鲁棒性,扩展多目标识别能力,实现更复杂的协作任务。

局限与展望

系统对潜水员姿态检测依赖较强,非标准姿势可能导致误识别。深度估计在远距离时精度不足,影响目标定位。硬件性能限制了实时性,需优化算法和硬件配置。此外,复杂水下环境中的光照变化和折射仍是挑战,未来需引入多视角融合和深度学习增强模型。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,你需要找到某个调料瓶,但厨房里有很多瓶子,光线又不太好。你用手指指向某个瓶子,但光线折射让你看不清楚距离。于是,你用一种特殊的眼镜(相机)看,结合手势和距离信息,帮你确定哪个瓶子是你指的那个。这个方法就像用眼睛和手势一起帮你找到目标,不仅准确,还能在复杂环境中工作得很好。它让机器人像你一样理解你在说什么,帮你完成任务。

简单解释 像给14岁少年讲一样

想象你在游泳池里玩游戏,你想告诉朋友你看到的某个特别的玩具,但水里光线不好,远远看不清楚。你用手指指向那个玩具,但水的折射让你不确定距离。于是,你用一只潜水镜(相机)观察,结合你的手势和距离,帮你确定那个玩具到底在多远。这个方法就像用眼睛和手势一起告诉机器人“我指的那个”,让它知道你想要的东西在哪里。这样,潜水员和机器人可以更自然地合作,找到目标变得更简单、更准确。

术语表

稀疏三角测量 (Sparse Triangulation)

利用少量关键点的匹配,通过已知相机参数计算点云的三维位置,减少匹配误差。

用于水下环境中距离估算,提升目标定位的鲁棒性。

人体姿态估计 (Human Pose Estimation)

识别人体关键点(如腕、肘、肩)在图像中的位置,用于理解人体动作。

本研究中用于检测潜水员手势和指向方向。

重投影矩阵 (Reprojection Matrix)

将二维图像点转换为三维空间坐标的数学工具,基于相机参数。

实现2D关键点到3D空间的转换。

SIFT特征 (Scale-Invariant Feature Transform)

一种局部特征检测算法,能在不同尺度和旋转下匹配图像特征。

用于水下目标候选区域的特征匹配。

Lowe比值测试 (Lowe's Ratio Test)

筛选匹配点的标准,确保匹配的唯一性和准确性。

提高特征匹配的鲁棒性。

开放问题 这项研究留下的未解疑问

  • 1 水下环境中多目标识别的距离估计精度仍有限,尤其在远距离场景。未来需结合深度学习和多视角信息,提升鲁棒性和精度。

应用场景

近期应用

水下维护协作

潜水员指向目标后,AUV能自主识别目标位置,提升维护效率,减少人工操作。

生态监测

潜水员指向珊瑚或海洋生物,系统自动定位,辅助生态数据采集。

远期愿景

智能水下机器人

实现自主导航、目标识别和人机自然交互,推动深海探索和海底基础设施维护。

原文摘要

This paper presents Diver Interest via Pointing in Three Dimensions (DIP-3D), a method to relay an object of interest from a diver to an autonomous underwater vehicle (AUV) by pointing that includes three-dimensional distance information to discriminate between multiple objects in the AUV's camera image. Traditional dense stereo vision for distance estimation underwater is challenging because of the relative lack of saliency of scene features and degraded lighting conditions. Yet, including distance information is necessary for robotic perception of diver pointing when multiple objects appear within the robot's image plane. We subvert the challenges of underwater distance estimation by using sparse reconstruction of keypoints to perform pose estimation on both the left and right images from the robot's stereo camera. Triangulated pose keypoints, along with a classical object detection method, enable DIP-3D to infer the location of an object of interest when multiple objects are in the AUV's field of view. By allowing the scuba diver to point at an arbitrary object of interest and enabling the AUV to autonomously decide which object the diver is pointing to, this method will permit more natural interaction between AUVs and human scuba divers in underwater-human robot collaborative tasks.

cs.RO