核心发现
方法论
EndoOmni采用教师-学生架构,教师模型先在大规模标注数据上训练,生成伪标签,学生模型在多源数据上学习。引入基于置信度的加权尺度平移不变损失(WSSI),结合深度标签和教师预测置信度,抑制噪声影响。模型通过自我学习增强泛化能力,利用多数据源实现零样本跨域深度估计。具体算法包括SSI损失、伪标签一致性和置信度估算,确保训练鲁棒性。
关键结果
- 在Hamlyn数据集上,EndoOmni实现绝对相对误差(AbsRel)为0.125,优于现有方法33%;在SERV-CT数据集上,AbsRel为0.053,超越SOTA 34%;在未见数据上,模型表现出优异的零样本泛化能力,显著优于传统单域训练模型。
- 在微调到指标深度任务时,模型在Hamlyn和支气管镜数据集上均保持优越性能,AbsRel分别为0.127和0.345,验证了其作为深度估计基础模型的潜力。
- 消融实验表明,置信度引导的加权损失显著提升模型鲁棒性,减少噪声干扰,增强对难区域的学习能力。
研究意义
该研究突破了医学图像深度估计中数据稀缺和噪声问题的瓶颈,通过引入自我学习和置信度机制,实现跨域零样本泛化,为内窥镜导航、三维重建和增强现实等应用提供了强有力的基础模型。其方法可推广至其他医学影像任务,推动深度学习在临床中的广泛应用。
技术贡献
提出基于教师-学生架构的自我学习框架,结合置信度估算的鲁棒训练策略,创新性引入WSSI损失,有效抑制噪声干扰。模型利用大规模多源数据实现跨域泛化,首次在内窥镜深度估计中实现零样本跨域性能显著提升,为深度估计提供新思路。
新颖性
本研究首次提出面向内窥镜的零样本跨域深度估计基础模型,结合置信度引导的鲁棒训练策略,突破了医疗影像中数据稀缺和噪声的限制,显著优于现有单域和迁移学习方法。
局限性
- 模型在极端噪声或严重遮挡区域仍存在误差,需进一步优化置信度估算机制。
- 训练依赖大规模多源数据集,数据采集与标注成本较高,限制模型的普适性。
- 模型在极端复杂场景(如血管狭窄、出血等)下的表现仍需验证,未来需结合多模态信息提升鲁棒性。
未来方向
未来将探索多模态融合技术,结合超声、光学成像等信息,提升深度估计的准确性。还将研究自我监督与迁移学习结合的策略,减少对大规模标注数据的依赖,推动模型在临床实际中的应用落地。
AI 总览摘要
内窥镜深度估计是实现精准导航、三维重建和增强现实的关键技术,但受限于医疗数据的稀缺和标签噪声,现有方法多局限于单一域,难以实现跨域泛化。本文提出EndoOmni,一种基于教师-学生架构的零样本跨数据集深度估计基础模型,通过引入置信度引导的鲁棒自我学习机制,有效利用大规模多源数据,显著提升模型的泛化能力。
该方法利用教师模型在标注数据上训练,生成伪标签并估算置信度,指导学生模型在未标注数据上学习。创新性地设计了加权尺度平移不变损失(WSSI),结合深度标签和伪标签置信度,抑制噪声干扰,增强难区域学习能力。大量实验表明,EndoOmni在Hamlyn和SERV-CT数据集上,绝对相对误差分别达0.125和0.053,超越现有方法33%和34%。模型在未见数据上的优异表现,验证了其跨域泛化潜力。
此外,模型在微调到指标深度任务时,仍保持优异性能,显示其作为深度估计基础模型的价值。该研究不仅解决了医学深度估计中的数据和噪声难题,也为未来多模态融合和临床应用提供了坚实基础。未来工作将聚焦多模态信息融合和迁移学习,推动模型在实际场景中的广泛应用。
深度分析
研究背景
深度估计在医学影像中具有重要意义,早期多采用基于立体匹配、Shape from Shading等方法,受限于数据标注困难。近年来,深度学习推动了单幅图像深度估计的发展,代表性方法如MiDaS、DPT等实现了跨数据集的迁移能力,但在医学场景中仍面临数据稀缺和标签噪声问题。基础模型如Depth Anything等在自然图像中表现优异,但在内窥镜中泛化不足,亟需专门针对医疗数据的鲁棒方法。
核心问题
医学内窥镜深度估计面临两大难题:一是标注数据极其稀缺,二是标签质量低,导致模型难以泛化到未见场景。传统方法多依赖少量高质量标注,难以应对实际临床中的多样性和复杂性。现有迁移学习和合成数据方法效果有限,亟需一种能充分利用大规模多源数据、同时抑制噪声影响的深度估计模型。
核心创新
本研究提出EndoOmni,结合教师-学生架构实现零样本跨域深度估计,创新点包括:
- �� 置信度引导的鲁棒训练机制,有效抑制噪声影响,提升模型稳定性;
- �� 加权尺度平移不变损失(WSSI),动态调整学习权重,强调高置信度区域;
- �� 利用大规模多源数据集,增强模型泛化能力,首次实现内窥镜深度估计的零样本跨域性能突破。
方法详解
- �� 训练教师模型:在标注数据上采用SSI损失(公式1-4)训练深度预测。
- �� 生成伪标签:教师模型在未标注数据上预测深度,结合置信度(公式5-8)筛选高质量伪标签。
- �� 学生模型训练:在多源数据上,利用伪标签和置信度引导,采用WSSI(公式6-10)进行鲁棒优化。
- �� 损失设计:结合深度标签和伪标签的置信度,动态调整梯度贡献,减少噪声干扰。
- �� 评估:在Hamlyn、SERV-CT等数据集上进行零样本和微调性能验证,采用AbsRel、RMSE等指标。
实验设计
采用大规模多源数据集,包括公开和自采集的标注及未标注数据,训练教师模型后,学生模型在不同场景下进行零样本测试。对比SOTA方法,验证模型在绝对相对误差、RMSE等指标上的优越性。还通过消融实验验证置信度引导机制的有效性,分析不同损失设计对鲁棒性的影响。
结果分析
在Hamlyn数据集,EndoOmni实现AbsRel为0.125,优于现有方法33%;在SERV-CT数据集,AbsRel为0.053,超越SOTA 34%;未见数据上表现出强泛化能力。微调指标深度任务时,模型在Hamlyn和支气管镜数据集上,AbsRel分别为0.127和0.345,验证其基础模型潜力。消融实验显示,置信度引导的损失显著提升鲁棒性,减少噪声干扰。
应用场景
模型可应用于内窥镜导航、三维重建、增强现实等场景,依赖大规模多源数据和强大计算资源。未来可结合多模态信息,提升临床实用性,推动智能手术的发展。
局限与展望
模型在极端噪声或遮挡场景仍存在误差,数据采集成本高,标注难度大,未来需优化置信度估算和模型效率,增强在复杂环境中的表现。
通俗解读 非专业人士也能看懂
想象你在厨房做菜,很多食材都需要提前准备和标记,但有时候标签不准确或食材不新鲜。你用一种聪明的方法,先用一个厨师(教师)观察所有食材,判断哪些是新鲜的,哪些可能有问题。然后,你(学生)根据厨师的判断,学习如何挑选和处理食材。你还会用一种特殊的眼镜(置信度机制),帮助你更好地识别可靠的食材,避免被误导。这样,你就能在不同厨房(数据域)都做出好菜。这种方法让你在面对不同厨房时,都能做出美味佳肴,不怕标签不准或食材有误。
简单解释 像给14岁少年讲一样
想象你在玩一个超级复杂的游戏,里面有很多关卡和任务。有时候,游戏里的提示(标签)不太准,可能会误导你。你有一个聪明的哥哥(老师),他在玩游戏时会告诉你哪些提示是靠谱的,哪些可能有问题。你跟着哥哥学,学会用他的提示来指导自己。你还会用一种特殊的眼镜(置信度机制),观察哥哥的提示是否一直一致,如果一直靠谱,就相信,否则就要小心。这样,你就能在不同的关卡都表现得很好,即使遇到新场景也不怕。这就像EndoOmni用聪明的方法,让机器在不同的内窥镜图像中都能准确估算深度,帮医生更好地做手术。
原文摘要
Single-image depth estimation is essential for endoscopy tasks such as localization, reconstruction, and augmented reality. Most existing methods in surgical scenes focus on in-domain depth estimation, limiting their real-world applicability. This constraint stems from the scarcity and inferior labeling quality of medical data for training. In this work, we present EndoOmni, the first foundation model for zero-shot cross-domain depth estimation for endoscopy. To harness the potential of diverse training data, we refine the advanced self-learning paradigm that employs a teacher model to generate pseudo-labels, guiding a student model trained on large-scale labeled and unlabeled data. To address training disturbance caused by inherent noise in depth labels, we propose a robust training framework that leverages both depth labels and estimated confidence from the teacher model to jointly guide the student model training. Moreover, we propose a weighted scale-and-shift invariant loss to adaptively adjust learning weights based on label confidence, thus imposing learning bias towards cleaner label pixels while reducing the influence of highly noisy pixels. Experiments on zero-shot relative depth estimation show that our EndoOmni improves state-of-the-art methods in medical imaging for 33\% and existing foundation models for 34\% in terms of absolute relative error on specific datasets. Furthermore, our model provides strong initialization for fine-tuning metric depth estimation, maintaining superior performance in both in-domain and out-of-domain scenarios. The source code is publicly available at https://github.com/TianCuteQY/EndoOmni.