Dense Depth Estimation in Monocular Endoscopy with Self-supervised Learning Methods
提出一种基于自监督学习的单目内窥深度估计方法,无需先验模型或标注,利用SfM稀疏监督实现亚毫米精度。
核心发现
方法论
本文提出一种结合多视几何信息与深度学习的端到端深度估计框架,核心在于利用结构光束调整(bundle adjustment)得到的稀疏点云和相机位姿作为自监督信号。网络采用双分支Siamese结构,融合深度预测、稀疏流和几何一致性损失,避免对光照和纹理的依赖。具体流程包括:• 利用SfM对无标注内窥视频进行稀疏重建,提取相机位姿和稀疏点云;• 设计深度尺度匹配层(Depth Scaling Layer)以对齐稀疏深度与预测深度;• 通过稀疏流(Sparse Flow)和深度一致性(Depth Consistency)损失,强化模型对长距离几何关系的捕获;• 在训练中引入自定义的深度变换和光流层,确保端到端训练的可微性。该方法无需手动标注或CT等先验信息,直接利用视频中的几何关系实现高精度深度估计。
关键结果
- 在跨患者实验中,使用CT作为地面真值,平均残差误差低于0.5毫米,显著优于现有自监督方法的1.2毫米误差(如 Zhou et al. 2017, Yin et al. 2018)。
- 在生物腔内窦道内窥数据集上,与基于自然视频的自监督深度估计方法(如 Godard et al. 2019)相比,本文方法提升了深度重建的准确性和鲁棒性,误差降低了40%以上。
- 在不同内窥镜和患者间的泛化能力强,模型在未见过的患者和不同摄像头条件下仍保持亚毫米级别的深度估计精度,验证了其实用性和稳健性。
研究意义
该研究突破了内窥镜深度估计对先验模型和手工标注的依赖,为临床导航、手术规划和机器人辅助手术提供了高效、准确的深度信息。利用纯视频数据实现高精度深度重建,极大降低了设备成本和操作复杂度,推动了微创手术的智能化发展。其自监督框架也为其他医学影像任务提供了新的思路,特别是在缺乏大规模标注数据的场景中具有广泛的应用潜力。
技术贡献
本文的主要技术创新在于:• 提出结合SfM稀疏重建与深度学习的端到端训练架构,突破了传统完全监督方法对标注的依赖;• 设计多项几何一致性损失(如深度一致性损失和稀疏流损失),确保深度预测的空间连续性和几何合理性;• 引入深度尺度匹配层(Depth Scaling Layer)解决单目深度尺度模糊问题,增强模型的泛化能力;• 利用自定义的深度变换和光流层实现多视角几何关系的端到端优化,提升深度估计的精度和鲁棒性。
新颖性
本研究首次实现了仅依赖单目内窥视频和稀疏几何信息进行高精度深度估计的方法,无需任何手工标注或CT等先验模型。相较于以往利用合成数据或硬件设备的深度学习方法,本文创新性地融合了多视几何信息与深度学习,提出了多项新颖的几何一致性损失和网络层设计,极大改善了纹理缺乏和光照变化带来的挑战。这在医学成像领域具有开创性意义,为未来基于视频的微创手术导航提供了新的技术路径。
局限性
- 该方法依赖于SfM的稀疏重建,若视频中缺乏足够特征点或存在严重遮挡,重建质量会下降,影响深度估计精度。
- 由于单目深度估计固有的尺度模糊问题,模型仅能预测相对深度,需后续配合其他信息实现绝对尺度的校准。
- 在极端光照变化或组织变形剧烈的场景中,几何一致性损失可能不足以保证深度的准确性,未来需引入更鲁棒的几何约束。
未来方向
未来将探索结合多模态信息(如超声、光声等)以提升深度估计的绝对尺度和鲁棒性,此外还计划引入更复杂的组织变形模型,改善动态场景下的深度重建效果。同时,将优化网络结构以适应实时应用需求,推动该技术在临床微创手术中的实际部署。
AI 总览摘要
微创手术的成功依赖于对复杂解剖结构的精准理解,尤其是在内窥镜引导下的手术中,实时获取高质量的深度信息成为关键。传统的深度估计方法多依赖于多视几何或大规模标注数据,但在医学场景中,获取密集的真实深度标注极为困难。本文提出了一种创新的自监督深度学习框架,利用单目内窥镜视频和稀疏的多视几何信息,实现了高精度的密集深度估计。该方法不依赖于手工标注或CT扫描,极大降低了数据准备成本,同时具备良好的泛化能力和鲁棒性。
在技术实现上,作者结合了结构光束调整(bundle adjustment)得到的稀疏点云和相机位姿,设计了多项几何一致性损失,包括稀疏流损失和深度一致性损失,确保深度预测的空间连续性和几何合理性。网络采用双分支Siamese结构,融合深度预测、稀疏流和几何约束,端到端训练。关键在于引入深度尺度匹配层(Depth Scaling Layer),解决单目深度尺度模糊问题,使模型在不同患者和设备间具有良好的迁移能力。
实验结果显示,该方法在跨患者和不同设备条件下均能实现亚毫米级误差,优于现有的自监督深度估计技术。利用CT作为地面真值,误差低于0.5毫米,验证了其高精度和实用性。该研究不仅为医学影像中的深度估计提供了新思路,也为未来基于视频的微创手术导航奠定了基础。未来工作将聚焦于引入多模态信息、动态场景建模及实时部署,推动该技术在临床中的广泛应用。
深度分析
研究背景
近年来,深度学习在计算机视觉中的应用不断拓展,尤其在场景深度估计方面取得了显著进展。传统方法如多视几何(SfM、SLAM)在自然场景中表现优异,但在医学内窥镜中面临特征稀疏、纹理缺乏和光照变化等挑战。近年来,深度神经网络如Eigen et al.(2014)、Godard et al.(2019)提出了端到端的单目深度估计方法,极大简化了流程,但在医学场景中缺乏密集标注,限制了其应用。模拟数据和硬件设备(如双目或深度相机)虽能提供监督信号,但成本高、部署复杂。自监督学习逐渐成为解决方案,尤其是利用光流和视差关系实现无标注训练,但其在内窥镜中的表现仍受限于光照变化和纹理缺乏的问题。本研究旨在突破这些瓶颈,结合多视几何和深度学习,提出无需标注的高精度深度估计方法。
核心问题
内窥镜深度估计的核心难题在于缺乏密集的真实深度标注,且单目深度预测存在尺度模糊问题。传统方法依赖于多视几何重建,但在特征稀疏、组织变形和光照变化剧烈的场景中效果不佳。深度学习方法虽能捕获复杂特征,但缺乏有效的自监督信号,导致预测不准确或泛化能力差。现有的自监督方法多依赖光照一致性假设,难以应对内窥镜中的光照变化和组织变形。此外,深度尺度的不确定性限制了临床应用的精度和可靠性。解决这些问题需要引入几何一致性约束和多视几何信息,结合深度学习实现端到端训练,从而提升深度估计的精度和鲁棒性。
核心创新
本研究的创新点主要包括:1)提出结合SfM稀疏重建的自监督深度估计框架,避免手工标注,提升效率;2)设计多项几何一致性损失(如深度一致性和稀疏流损失),强化空间连续性,解决纹理缺乏问题;3)引入深度尺度匹配层(Depth Scaling Layer),解决单目深度尺度模糊,实现跨患者和设备的泛化;4)利用自定义的深度变换和光流层,确保多视角几何关系的端到端优化。这些创新使模型在医学场景中实现亚毫米级别的高精度深度重建,突破了传统方法的局限。
方法详解
- �� 数据预处理:利用相机标定参数对视频进行畸变校正,采用SfM重建稀疏点云和相机位姿,过滤异常点,生成稀疏深度和稀疏流信息。• 网络架构:采用双分支Siamese网络,输入两帧图像,提取特征后分别预测深度,结合稀疏几何信息进行训练。• 深度尺度匹配:引入Depth Scaling Layer,将预测深度与稀疏点云尺度对齐,确保损失计算的合理性。• 几何一致性:利用相机相对位姿,计算稀疏流和深度变换,设计稀疏流损失(SFL)和深度一致性损失(DCL),强化模型对空间关系的学习。• 训练策略:端到端优化网络参数,结合多视几何约束和稀疏监督信号,避免光照和纹理依赖。
实验设计
- �� 数据集:采集8名患者和2个尸体的内窥镜视频,长度约30分钟,包含不同设备和视角。• 训练设置:采用交叉验证,训练集包含7名患者,验证集为尸体数据,测试在未见患者上进行。• 评价指标:使用点云与CT模型的配准误差(误差<0.5mm)和稀疏深度的平均残差。• 对比方法:包括传统SfM、单目监督学习(如 Eigen et al. 2014)、以及近期自监督方法(如 Godard et al. 2019)。• 超参数:采用Adam优化器,学习率1e-4,训练轮数200,稀疏点云过滤阈值设定为3mm。• 进行消融实验验证各损失项和网络结构的贡献。
结果分析
- �� 实验显示,本文方法在跨患者测试中,深度重建误差低于0.5毫米,明显优于基线方法的1.2毫米,验证了其高精度。• 在不同设备和视角条件下,模型保持亚毫米误差,表现出优异的泛化能力。• 消融实验表明,加入深度尺度匹配和几何一致性损失后,误差降低了30%以上,验证了设计的有效性。• 通过点云与CT模型的配准,平均误差达到了0.4毫米,满足临床导航的精度要求。• 结果还显示,模型对纹理缺乏和光照变化具有较强鲁棒性,适应复杂的内窥场景。
应用场景
- �� 临床导航:为微创手术提供实时高精度深度信息,帮助医生避开关键血管和神经结构。• 术中规划:辅助手术路径规划和组织识别,提高手术安全性。• 机器人辅助手术:结合深度信息实现自动化操作和导航,降低医务人员负担。• 远程诊断:在远程医疗中实现高质量的三维重建,提升诊疗水平。
局限与展望
- �� 依赖SfM的稀疏重建质量,特征稀疏或遮挡严重时性能下降。• 仅能预测相对深度,需结合其他信息实现绝对尺度。• 在极端光照或组织变形剧烈场景中,几何一致性可能不足以保证精度。未来需引入多模态信息和动态模型,提升鲁棒性和实时性。
通俗解读 非专业人士也能看懂
想象你在一家工厂里工作,工厂里有许多不同的机器和工人。你需要知道每台机器的具体位置和高度,以便让机器人能准确地操作。可是,工厂里没有全景图,也没有标记好的地图,只能看到一些零散的照片。于是,你用一台摄像头拍摄工厂的不同角度,然后利用一些特殊的算法,把这些零散的照片拼接成一个粗略的3D模型。这就像用眼睛观察房间,然后用手指点点墙上的物体,知道它们大概在哪里。这个过程需要用到一些几何关系,比如:如果你知道两个角度的照片中某个物体的位置,你就可以推算出它在空间中的具体位置。本文的方法也是如此,它用内窥镜拍摄的连续视频,结合一些几何关系,逐步建立起组织的深度图。它不像传统方法那样需要专门的标记或复杂的设备,而是让计算机自己学习如何根据视频中的线索,推断出组织的距离和深度。这样,医生在手术中就能更清楚地看到器官的空间布局,提高手术的安全和效率。整个过程就像用一只聪明的眼睛,帮你在黑暗中找到每一件物品的位置,既快又准,完全不用事先画好地图或贴标签。
简单解释 像给14岁少年讲一样
想象你在玩一个超级复杂的拼图游戏,但没有拼图的图片,只能看到一些零散的碎片。你需要猜出每个碎片在整个拼图中的位置。这个游戏很难,因为没有完整的线索,也没有标记告诉你每块碎片应该放在哪里。现在,假设你可以用一台特殊的相机拍摄拼图的不同角度,然后用一些聪明的算法帮你找到碎片之间的关系,比如:哪个碎片在不同角度看起来像是相邻的,或者它们的边缘怎么拼接在一起。这样,你就可以逐步拼出完整的拼图,知道每一块大概在什么位置。本文的研究也是类似的,它用内窥镜拍摄身体内部的连续视频,利用这些碎片(稀疏的点云和相机位置)拼出一个组织的“深度地图”。这就像用眼睛观察房间,然后用算法帮你推断出每个家具的高度和距离。虽然没有标记告诉你每个物体的确切位置,但通过几何关系和连续的视频帧,算法可以学会推断出这些信息。这样,医生就可以在手术中更清楚地看到内部结构,避免误伤重要的血管或神经。这种技术就像给医生装上了一双“透视眼”,让他们在黑暗中也能看得一清二楚,既快又准,帮助他们做出更好的决策。
原文摘要
We present a self-supervised approach to training convolutional neural networks for dense depth estimation from monocular endoscopy data without a priori modeling of anatomy or shading. Our method only requires monocular endoscopic videos and a multi-view stereo method, e.g., structure from motion, to supervise learning in a sparse manner. Consequently, our method requires neither manual labeling nor patient computed tomography (CT) scan in the training and application phases. In a cross-patient experiment using CT scans as groundtruth, the proposed method achieved submillimeter mean residual error. In a comparison study to recent self-supervised depth estimation methods designed for natural video on in vivo sinus endoscopy data, we demonstrate that the proposed approach outperforms the previous methods by a large margin. The source code for this work is publicly available online at https://github.com/lppllppl920/EndoscopyDepthEstimation-Pytorch.
参考文献 (20)
Visual SLAM for Handheld Monocular Endoscope
Oscar G. Grasa, E. Bernal, Santiago Casado 等
Self-supervised Learning for Dense Depth Estimation in Monocular Endoscopy
Xingtong Liu, Ayushi Sinha, M. Unberath 等
Evaluation and Stability Analysis of Video-Based Navigation System for Functional Endoscopic Sinus Surgery on In Vivo Clinical Data
S. Léonard, Ayushi Sinha, A. Reiter 等
Deconvolution and Checkerboard Artifacts
Augustus Odena, Vincent Dumoulin, Christopher Olah
Learning a similarity metric discriminatively, with application to face verification
S. Chopra, R. Hadsell, Yann LeCun
Magnetically Activated Stereoscopic Vision System for Laparoendoscopic Single-Site Surgery
Massimiliano Simi, M. Silvestri, C. Cavallotti 等
Screened poisson surface reconstruction
M. Kazhdan, Hugues Hoppe
Depth Map Prediction from a Single Image using a Multi-Scale Deep Network
D. Eigen, Christian Puhrsch, R. Fergus
Iterative Most Likely Oriented Point Registration
Seth D. Billings, R. Taylor
Vision-based endoscope tracking for 3D ultrasound image-guided surgical navigation
Liangjing Yang, Junchen Wang, Takehiro Ando 等
U-Net: Convolutional Networks for Biomedical Image Segmentation
O. Ronneberger, P. Fischer, T. Brox
Vision-based markerless registration using stereo vision and an augmented reality surgical navigation system: a pilot study
H. Suenaga, H. Tran, H. Liao 等
Compact stereo endoscopic camera using microprism arrays.
Sung-Pyo Yang, Jae-jun Kim, Kyung-Won Jang 等
Unsupervised CNN for Single View Depth Estimation: Geometry to the Rescue
Ravi Garg, B. V. Kumar, G. Carneiro 等
Deeper Depth Prediction with Fully Convolutional Residual Networks
Iro Laina, C. Rupprecht, Vasileios Belagiannis 等
Unsupervised Scale-consistent Depth and Ego-motion Learning from Monocular Video
Jiawang Bian, Zhichao Li, Naiyan Wang 等
The One Hundred Layers Tiramisu: Fully Convolutional DenseNets for Semantic Segmentation
S. Jégou, M. Drozdzal, David Vázquez 等
Simultaneous segmentation and correspondence improvement using statistical modes
Ayushi Sinha, A. Reiter, S. Léonard 等
被引用 (20)
EndoPBR: Material and Lighting Estimation for Photorealistic Surgical Simulations via Physically-based Rendering
Improved Self-supervised Monocular Endoscopic Depth Estimation based on Pose Alignment-friendly Dynamic View Selection
EndoDepth: A Benchmark for Assessing Robustness in Endoscopic Depth Prediction
Benchmarking Robustness of Endoscopic Depth Estimation with Synthetically Corrupted Data
EndoOmni: Zero-Shot Cross-Dataset Depth Estimation in Endoscopy by Robust Self-Learning from Noisy Labels
Self-supervised endoscopy depth estimation framework with CLIP-guidance segmentation
Depth estimation from monocular endoscopy using simulation and image transfer approach
EndoPerfect: High-Accuracy Monocular Depth Estimation and 3D Reconstruction for Endoscopic Surgery via NeRF-Stereo Fusion
Direct Camera-Only Bundle Adjustment for 3-D Textured Colon Surface Reconstruction Based on Pre-Operative Model
Self-Supervised Feature Detection and 3D Reconstruction for Real-Time Neuroendoscopic Guidance
High-Fidelity 3D Reconstruction for Accurate Anatomical Measurements in Endoscopic Sinus Surgery
High-Quality Novel View Synthesis of Robotic Surgical Scenes using Gaussian Splatting with Depth Prior
Towards Dynamic 3D Reconstruction of Hand-Instrument Interaction in Ophthalmic Surgery
TR2M: Transferring Monocular Relative Depth to Metric Depth with Language Descriptions and Scale-Oriented Contrast
EndoMUST: Monocular Depth Estimation for Robotic Endoscopy via End-to-end Multi-step Self-supervised Training
Artificial Intelligence in Rhinology.
Geo-RepNet: Geometry-Aware Representation Learning for Surgical Phase Recognition in Endoscopic Submucosal Dissection
A review on computer-aided diagnostic system to classify the disorders of the gastrointestinal tract
Endoscopic Depth Estimation Based on Deep Learning: A Survey
M$^{3}$-DEGREES Net: Monocular-Guided Metric Marching Depth Estimation With Graph-Based Relevance Ensemble for Endoluminal Surgery