Self-supervised Learning for Dense Depth Estimation in Monocular Endoscopy

TL;DR

提出基于自监督的单目内窥深度估计方法,无需预先建模,利用SfM生成稀疏但精确的深度监督,达成亚毫米误差。

cs.CV 🔴 高级 2018-06-25 65 次浏览
Xingtong Liu Ayushi Sinha Mathias Unberath Masaru Ishii Gregory Hager Russell H. Taylor Austin Reiter
深度估计 自监督学习 内窥镜 多视几何 神经网络

核心发现

方法论

本文提出一种基于双支路Siamese网络的深度估计框架,结合SfM(Structure from Motion)生成的稀疏深度和相对相机姿态作为自监督信号。网络包含深度尺度调整层和深度变换层,利用稀疏深度掩码和相机运动一致性损失实现无标注训练。训练过程中,网络通过最小化尺度不变加权损失和深度一致性损失,学习到高精度的密集深度图。该方法无需手动标注、标定或CT配准,完全自动化,适应不同患者和设备。

关键结果

  • 在两名患者的鼻窦内窥数据上,深度重建误差达0.84mm和0.63mm的平均残差,优于传统稀疏重建。实验显示,利用SfM的改进直接提升深度估计精度,亚毫米级误差满足临床导航需求。模型在不同场景中表现出良好的泛化能力,验证了方法的实用性。
  • 通过定量对比,深度估计误差明显低于基于单一图像的无监督方法,验证了多视几何信息的有效利用。消融实验表明,尺度不变损失和深度一致性损失对性能提升起关键作用。
  • 在不同患者和不同解剖区域的测试中,模型表现出稳健性,显示出潜在的临床应用价值。

研究意义

该研究突破了内窥镜深度估计的瓶颈,实现无需人工标注和CT配准的高精度深度重建,为微创手术导航提供了可靠的技术基础。利用现有视频数据自动训练模型,极大降低了部署门槛,推动了内窥镜三维重建和导航系统的临床转化。未来,随着SfM和SLAM技术的不断优化,该方法有望实现更高的重建密度和精度,促进个性化手术方案的制定。

技术贡献

提出一种结合稀疏多视几何信息的自监督深度学习框架,创新性引入尺度不变损失和深度一致性损失,有效解决单目深度估计中的尺度模糊问题。网络架构灵活,可替换为不同的深度估计模型,具有良好的扩展性。该方法充分利用SfM生成的稀疏深度和相机姿态,实现无需手动标注的高精度深度重建,为深度学习在内窥镜中的应用提供新思路。

新颖性

本研究首次将稀疏多视几何重建与自监督深度学习结合,避免了传统依赖密集标注的限制。引入尺度不变损失解决尺度模糊问题,利用相对相机运动实现深度一致性,显著提升了单目深度估计的精度和鲁棒性。这在内窥镜应用中具有重要创新意义,填补了无标注深度重建的技术空白。

局限性

  • 依赖SfM或SLAM的稀疏重建质量,若重建失败或误差较大,模型性能将受到影响。极端缺乏特征区域(如黏液反射或阴影)可能导致重建失效。模型泛化能力有限,需在多患者、多设备数据上验证。
  • 训练过程中对相机内参要求较高,实际应用中可能需额外校准。模型对极端光照变化和非Lambertian表面表现仍有限制。未来需结合多模态信息提升鲁棒性。

未来方向

未来将扩展多帧深度估计架构,增强模型对动态场景的适应性。结合更大规模、多源数据集,提升模型泛化能力。探索自动检测重建失败区域的方法,结合实时SLAM优化深度估计。还计划将模型应用于其他内窥镜类型和解剖区域,推动临床实际应用。

AI 总览摘要

微创手术中的导航依赖于精确的三维重建,然而传统方法多依赖手动标注或CT配准,成本高且操作繁琐。本文提出一种基于自监督学习的单目内窥深度估计方法,利用多视几何信息实现无需人工干预的高精度深度重建。核心技术包括结合SfM生成的稀疏深度和相对相机姿态,通过尺度不变损失和深度一致性损失训练神经网络,获得亚毫米误差的深度图。

该方法在两名患者的鼻窦内窥数据上验证,平均残差低至0.84mm和0.63mm,显著优于传统稀疏重建。实验结果表明,利用多视几何信息可以有效克服单目深度估计中的尺度模糊问题,实现高精度、鲁棒的深度重建。

这一技术突破为微创手术导航提供了强大支持,未来可在更大范围内推广应用。其自动化、无需标注的特性大幅降低了临床门槛,推动内窥镜三维重建走向普及。尽管当前依赖SfM重建质量,未来随着SLAM和深度学习技术的持续发展,模型的精度和适应性有望进一步提升,为微创手术的精准化和个性化奠定坚实基础。

深度分析

研究背景

内窥镜在微创手术中的应用日益普及,但其二维图像缺乏深度信息,限制了导航的精度。传统深度估计多依赖硬件设备如立体相机或手动标注,成本高且操作繁琐。近年来,深度学习在场景深度估计中取得突破,但在内窥镜场景中面临数据稀缺、非Lambertian反射等挑战。多视几何方法如SfM和SLAM能提供稀疏的三维重建,但精度不足,难以满足临床需求。本文旨在利用多视几何信息实现无标注的高精度深度估计,推动微创手术导航技术发展。

核心问题

核心问题在于如何在无标注、无CT配准的情况下,从单目内窥镜视频中获得高精度的深度信息。现有方法多依赖稠密标注或硬件设备,成本高且不适应临床环境。多视几何重建虽能提供稀疏深度,但缺乏密集性和鲁棒性,难以实现精确导航。如何利用稀疏的多视几何信息训练深度网络,解决尺度模糊和数据稀疏问题,是当前的技术难点。

核心创新

本研究创新点在于:1) 结合SfM生成的稀疏深度与相对相机姿态,作为自监督信号训练深度网络;2) 引入尺度不变损失,有效解决尺度模糊问题,使模型能学习深度比例关系;3) 设计深度一致性损失,确保不同视角间深度的空间一致性。这些创新使得无需人工标注即可实现亚毫米级深度重建,极大推动了内窥镜深度学习应用的边界。

方法详解

  • �� 利用SfM或SLAM方法,从内窥镜视频中自动生成稀疏三维点云和相对相机姿态。• 将稀疏点云投影到图像平面,生成稀疏深度图和软掩码,作为训练目标。• 构建双支路Siamese网络,包含深度尺度调整层和深度变换层,用于对两个视角的深度进行一致性约束。• 设计尺度不变加权损失,忽略无深度值区域,解决尺度模糊问题。• 引入深度一致性损失,确保不同视角深度的空间一致性。• 训练过程中,结合稀疏深度和相机运动信息,优化网络参数,获得高精度深度图。

实验设计

使用两名患者的鼻窦内窥视频,采集22段短视频,分为训练和验证集。模型在不同场景下进行测试,比较稀疏SfM重建与深度网络输出的点云,利用CT进行配准,计算残差误差。超参数包括学习率1e-4,损失权重2e-4。采用多场景验证,确保模型鲁棒性。消融实验验证尺度不变损失和深度一致性损失的贡献。结果显示,平均残差低于1mm,满足临床导航需求。

结果分析

模型在两名患者的测试场景中,平均残差分别为0.84mm和0.63mm,优于传统稀疏重建。深度估计的误差显著低于单纯无监督方法,验证多视几何信息的有效性。消融实验表明,尺度不变损失和深度一致性损失对性能提升至关重要。模型表现出良好的泛化能力,适应不同解剖区域和患者,显示出临床应用潜力。

应用场景

该方法可应用于微创手术中的导航系统,利用现有内窥镜视频自动生成高精度三维模型,无需额外硬件或手动标注。适合在复杂解剖结构中实现精准导航,减少手术风险。未来可结合实时SLAM实现动态场景的深度估计,为机器人辅助手术提供支持。

局限与展望

依赖SfM或SLAM的重建质量,若重建失败或误差较大,模型性能受限。极端反射或阴影区域可能导致重建失效。模型对光照变化和非Lambertian表面表现有限,需结合多模态信息提升鲁棒性。未来需解决重建失败自动检测和多源数据融合问题,扩大适用范围。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,食材、调料和厨具就像内窥镜中的图像和深度信息。传统方法就像用手工记录每样食材的具体位置,非常繁琐且容易出错。而这项新技术像是用一台智能相机,通过观察厨房中的多个角度,自动学习每样食材的准确位置和深度,不需要你手动标记。它利用厨房中不同角度的照片,结合厨师的动作,训练出一台“聪明的厨师助手”,可以在你还没告诉它具体位置时,就帮你准确找到每样食材。这样一来,厨房变得更智能,做饭也更快更准。这个比喻说明了如何用多视角信息训练深度模型,达到无需人工干预的高精度效果。

简单解释 像给14岁少年讲一样

想象你在玩一个超级酷的游戏,你的任务是找到隐藏在房间里的宝藏,但你只能用一台相机看。每次你转头看不同的角度,你都能看到一些线索,但没有直接告诉你宝藏在哪里。现在,这个新方法就像是让游戏中的智能机器人,通过观察房间的多个角度,自己学习宝藏的藏法。它不用你告诉它宝藏在哪里,只靠观察和一些线索,就能学会判断宝藏的位置。它还会记住每次观察的角度和距离,确保每次都能找到宝藏,甚至比人类更快更准。这个机器人就像是内窥镜中的深度“侦探”,用聪明的算法帮医生在手术中找到关键的结构,避免误伤。是不是很酷?它让复杂的手术变得更安全、更精准,就像你在游戏中变成了超级侦探一样!

原文摘要

We present a self-supervised approach to training convolutional neural networks for dense depth estimation from monocular endoscopy data without a priori modeling of anatomy or shading. Our method only requires sequential data from monocular endoscopic videos and a multi-view stereo reconstruction method, e.g. structure from motion, that supervises learning in a sparse but accurate manner. Consequently, our method requires neither manual interaction, such as scaling or labeling, nor patient CT in the training and application phases. We demonstrate the performance of our method on sinus endoscopy data from two patients and validate depth prediction quantitatively using corresponding patient CT scans where we found submillimeter residual errors.

cs.CV