Revisiting Cross-View Completion: Self-Supervised Pre-Training via Reconstruction Error Comparison

TL;DR

Gekko通过比较交叉视图重建误差提升3D特征,无需3D标注,超越CroCo。

cs.CV 🔴 高级 2026-09-02 73 次浏览
Thibaut Loiseau Guillaume Bourmaud Vincent Lepetit
自监督学习 三维视觉 多视图重建 深度学习 特征表示

核心发现

方法论

Gekko采用三次前向传播:一是基于遮挡掩码和参考视图进行交叉视图补全,二是仅用目标视图进行掩码自编码,三是预测交叉视图与自编码误差的相对提升。网络架构基于ViT,加入额外输出通道以预测相对提升,利用误差差异作为无监督的共视性代理。训练过程中,模型无需深度或相机参数,直接从视频或图像对中学习。该方法通过误差的相对改善,显著提升在零样本对应、相对姿态估计和点云回归任务中的性能。

关键结果

  • 在ETH3D上,Gekko的编码器特征的零样本对应误差AEPE降低22%,解码器误差降低21%,超越CroCo基线,显示其特征更具几何表达能力。
  • 在ScanNet-1500数据集,Gekko在最严格的相对姿态阈值下,精度提升至6倍,低覆盖场景中表现尤为优异,点云回归误差降低22%。
  • 模型在无需3D标注的情况下,从原始视频中训练,匹配了手工标注数据的性能,且学习到的额外通道可作为共视性检测器,泛化能力强。

研究意义

该研究突破了传统依赖深度或相机参数的自监督方法限制,提出无需3D标注的共视性代理,极大简化了多视图几何学习流程。其在多任务中的优异表现推动了无监督3D理解的实际应用,尤其适用于大规模未标注视频数据,具有广泛的工业和科研潜力。

技术贡献

Gekko创新性地引入相对误差提升作为共视性指标,结合多任务学习框架,提升特征的几何表达能力。架构保持CroCo一致,仅增加预测通道,实现公平对比。提出从原始视频直接训练,避免繁琐的3D预处理,增强模型的实用性和泛化能力。

新颖性

首次将交叉视图重建误差的相对改善作为无监督共视性代理,突破了以深度或相机参数为基础的传统方法限制。该方法在无需任何3D标注的情况下,显著提升多视图几何理解的性能,展现了创新的自监督信号设计。

局限性

  • 当前方法对遮挡和重复结构敏感,误差提升的代理在复杂场景中可能不够鲁棒。
  • 模型训练仍依赖大量视频数据,计算成本较高,泛化到极端场景仍需验证。
  • 对多视图扩展尚未充分探索,单对场景的效果可能受限于数据多样性。

未来方向

未来将探索多视图扩展,结合动态场景和更复杂的遮挡模型,提升共视性检测的鲁棒性。还计划引入多尺度特征和自适应权重机制,增强在复杂环境中的表现。同时,结合强化学习优化误差预测,提高几何推理的准确性。

AI 总览摘要

在三维视觉任务中,准确理解场景的几何关系一直是核心挑战。传统方法依赖深度标注或相机参数,成本高昂且难以扩展。近年来,自监督学习成为突破口,尤其是基于多视图重建的技术。CroCo等模型通过掩码自编码和交叉视图补全,学习到强大的特征,但在非共视区域缺乏有效信号,限制了性能提升。

本文提出Gekko,一种创新的自监督预训练框架,通过比较交叉视图重建误差与单视图自编码误差的相对改善,提供了无监督的共视性代理。该方法利用ViT架构,加入预测相对误差提升的输出通道,训练过程中无需深度或相机参数,直接从视频或图像对中学习。实验结果显示,Gekko在ETH3D、ScanNet等多个数据集上,显著优于CroCo,零样本对应误差降低22%,相对姿态估计精度提升至6倍,点云回归误差降低22%。

该方法的核心创新在于利用误差的相对改善作为几何关系的代理,突破了传统依赖深度或标注的限制。其在无需3D标注的条件下,学习到具有强泛化能力的特征,推动了无监督3D理解的实际应用。未来,结合多视图扩展和动态场景,将进一步提升模型的鲁棒性和适应性。这一研究为大规模未标注视频数据的几何学习提供了新思路,具有深远的学术和工业价值。

深度分析

研究背景

三维视觉的发展经历了从深度学习到自监督的演变。早期依赖深度传感器和标注数据,成本高昂,限制了规模。近年来,基于多视图几何的自监督方法如CroCo、Muskie等,通过掩码自编码和视图匹配,学习到丰富的特征,但多依赖深度或相机参数,限制了应用范围。随着大规模未标注视频的普及,研究逐渐转向无需标注的几何学习,强调利用视图关系中的隐含信息。本文在此基础上,提出利用误差相对改善作为共视性代理,突破了传统限制,推动了无监督3D理解的边界。

核心问题

现有多视图自监督方法多依赖深度或相机参数,限制了数据的广泛适用性。非共视区域缺乏有效的几何信号,导致特征表达不足,影响后续任务性能。如何在没有深度标注的情况下,准确捕捉视图间的几何关系,成为核心难题。尤其是在低重叠或遮挡复杂场景中,传统方法表现不佳,亟需更鲁棒的无监督信号。

核心创新

本文提出利用交叉视图补全误差相对改善作为共视性代理,创新性在于:1)引入误差比值预测,提供密集的几何关系信号;2)在架构上保持CroCo一致,仅增加预测通道,确保公平性;3)实现从原始视频直接训练,省去繁琐的3D预处理。这些创新突破了传统依赖深度或标注的局限,为无监督几何学习提供了新途径。

方法详解

  • �� 输入:一对场景图像(目标和参考视图)。
  • �� 第一次前向:用遮挡掩码和参考视图进行交叉视图补全,输出重建图像。
  • �� 第二次前向:仅用目标视图进行掩码自编码,输出重建图像。
  • �� 第三次前向:预测交叉视图补全误差与自编码误差的相对改善,输出相应的地图。
  • �� 网络架构:基于ViT,加入额外预测通道,保持CroCo架构。
  • �� 损失函数:结合三项任务的误差,特别是相对改善的预测误差,优化模型。
  • �� 训练:从未标注视频中直接学习,无需深度或相机参数,利用误差的相对改善作为几何信号。

实验设计

  • �� 数据:在ScanNet、ETH3D、DL3DV等数据集上预训练和测试。• 任务:零样本对应、相对姿态估计、点云回归。• 评估指标:AEPE、角度距离、点云误差。• 设置:保持架构一致,比较CroCo和Gekko的性能。• 还进行了消融实验,验证误差预测通道的贡献。

结果分析

  • �� Gekko在ETH3D上,编码器AEPE降低22%,解码器降低21%,优于CroCo。• 在ScanNet-1500,姿态估计精度提升至6倍,低覆盖场景表现尤为突出。• 训练无需3D标注,直接从视频学习,泛化能力强。• 额外通道作为共视性检测器,效果优异,泛化到未见场景。

应用场景

  • �� 适用于自主导航、三维重建、增强现实等场景,尤其在缺乏标注的环境中。• 可从原始视频中直接训练,降低数据准备成本。• 未来结合多视图和动态场景,推动无人机、机器人等领域的应用。

局限与展望

  • �� 对遮挡和重复结构敏感,误差代理在复杂场景中可能失效。• 训练成本较高,依赖大量视频数据。• 多视图扩展尚未充分验证,场景复杂度增加可能影响性能。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,手边有食材、厨具和食谱。传统方法像是你用食谱上的图片去找食材,依赖详细的说明和标注。而Gekko就像是你通过观察不同的厨具和食材的关系,自己逐步学会辨认它们。它不需要提前知道每个食材的具体信息,只通过比较不同视角下的差异,判断哪些食材是一样的,哪些是不同的。这样,即使没有详细的标签,你也能学会在厨房中找到需要的食材,做出美味的菜肴。这种方法让学习变得更自然、更高效,也更适合大规模的厨房(数据)环境。

简单解释 像给14岁少年讲一样

想象你在玩一个拼图游戏,你有两幅拼图(两个视角),但有些拼块被遮住了。传统的方法就像只看一幅拼图,试图拼出完整的图像,但如果有遮挡,拼图就难以完成。现在,Gekko就像是你用两幅拼图的差异来判断哪些拼块是匹配的,哪些被遮挡了。它通过比较两幅拼图的不同,学会了哪些部分是可以互相对应的,即使没有完整的拼图信息。这样,你可以更快、更准确地拼出完整的图像,即使有遮挡或重复的部分。这个方法让拼图变得更聪明,也能用在很多复杂的场景中,比如机器人导航或3D建模,帮助机器更好理解空间关系。

原文摘要

Self-supervised pre-training via cross-view completion learns strong features for 3D vision from co-visible regions of image pairs. However, the reference view provides little information for reconstructing non-co-visible patches, implicitly yielding a monocular training signal in these regions. We introduce Gekko, which turns this limitation into a useful signal. The relative improvement of the cross-view reconstruction error over a masked-autoencoder error is a self-supervised proxy for co-visibility: large improvements indicate co-visible regions, negligible ones non-co-visible areas. Gekko is a network, trained from scratch, that jointly performs cross-view completion, masked autoencoding, and per-pixel prediction of this relative improvement, providing an additional binocular signal for all masked regions without any ground-truth 3D annotation. Under identical architectures and training data, Gekko consistently outperforms CroCo on zero-shot correspondence estimation, relative pose estimation, and pointmap regression, with up to 6 times higher accuracy at the strictest relative-pose threshold and a 22% drop in end-point error on ETH3D. The extra channel it learns is itself a strong co-visibility detector on unseen scenes, and Gekko's frozen features outperform released cross-view backbones of comparable or larger size. It can also be trained directly from raw videos with a simple stride-based curriculum, removing the cumbersome 3D preprocessing prior methods require while matching models trained on curated data. Code and pre-trained models are publicly available.

cs.CV