Shape-of-You: Fused Gromov-Wasserstein Optimal Transport for Semantic Correspondence in-the-Wild

TL;DR

本文提出Shape-of-You(SoY)框架,利用融合Gromov-Wasserstein(FGW)优化实现无标注语义对应,达成SOTA性能。

cs.CV 🔴 高级 2026-03-12 42 次浏览
Jiin Im Sisung Liu Je Hyeong Hong
语义对应 最优传输 Gromov-Wasserstein 3D基础模型 无监督学习

核心发现

方法论

本研究将无标注语义对应问题转化为融合Gromov-Wasserstein(FGW)优化问题,结合特征相似性和结构一致性。利用预训练3D模型定义空间中的结构信息,通过锚点线性化近似FGW,生成结构一致但噪声较大的伪标签。引入软目标损失融合伪标签与网络预测,增强鲁棒性。整体流程包括:1)基于3D模型提取几何信息,2)多阶段优化匹配关系,3)训练轻量级适配器网络实现推理。

关键结果

  • 在SPair-71k和AP-10k数据集上,SoY分别达到[email protected] 67.9%和68.0%,超越现有方法(如ASIC、DINOv2+SD),显著提升几何模糊场景下的匹配准确率。
  • 引入几何结构约束后,匹配的结构一致性提升了2.3%到7.0%,验证了结构信息在解决对称和重复特征引起的几何歧义中的关键作用。
  • 软目标损失增强了模型对伪标签噪声的容忍度,提升了训练稳定性和泛化能力,尤其在复杂场景中表现优异。

研究意义

该方法突破了依赖几何标注的限制,为无监督语义对应提供新思路,极大降低数据标注成本。通过结合3D几何信息,解决2D外观特征在复杂场景中的歧义问题,推动语义理解在实际应用中的落地。其在自动标注、内容编辑、机器人等领域具有广泛潜力,开启了无标注、结构感知的语义匹配新篇章。

技术贡献

创新点在于将FGW引入无标注语义对应,结合3D模型定义空间结构,提出锚点线性化近似算法,显著降低计算复杂度。引入软目标损失,增强模型鲁棒性,突破传统仅依赖局部特征匹配的局限。整体框架实现端到端训练,兼顾结构一致性与噪声容忍,为未来结构感知匹配提供理论基础。

新颖性

首次将融合Gromov-Wasserstein优化应用于无标注语义对应,结合3D几何信息解决对称和重复特征引起的歧义。相较于以往仅依赖2D外观特征或局部匹配的技术,提出结构-特征联合优化新范式,显著提升匹配质量和鲁棒性。

局限性

  • 算法在极端遮挡或部分可见场景中仍存在误匹配风险,主要因几何信息不足或模型误差。
  • 高维几何特征提取依赖预训练3D模型,计算成本较高,限制实时应用。
  • 锚点线性化虽降低复杂度,但在复杂几何变形时可能影响结构一致性。

未来方向

未来将探索多尺度几何信息融合,提升对复杂变形和遮挡的鲁棒性。结合学习型几何表示,优化锚点选择策略,进一步降低计算成本。计划扩展到多模态数据和动态场景,推动无监督语义匹配在实际场景中的广泛应用。

AI 总览摘要

在计算机视觉中,语义对应任务旨在实现不同实例间的像素级匹配,应用于目标识别、姿态估计等。现有方法多依赖标注或几何信息,成本高且难以扩展。近年来,基于深度学习的特征提取模型如DINO极大提升了无标注匹配能力,但仍受限于局部特征和二维外观信息,难以解决对称和重复特征引发的几何歧义。

为突破这一瓶颈,本文提出Shape-of-You(SoY)框架,将语义匹配问题转化为融合Gromov-Wasserstein(FGW)优化问题,结合3D几何信息定义空间结构。通过锚点线性化近似FGW,生成结构一致的伪标签,训练鲁棒的匹配网络。该方法在SPair-71k和AP-10k数据集上均取得了优异表现,[email protected]分别达67.9%和68.0%,优于现有技术。

核心创新在于将空间结构引入无监督匹配,利用3D模型定义几何关系,结合优化算法实现高效近似。引入软目标损失,有效缓解伪标签噪声,提升训练稳定性。这一突破不仅降低了对几何标注的依赖,也为复杂场景中的语义匹配提供了新思路。未来,结合多尺度几何和动态场景,将推动无监督结构感知匹配的广泛应用,开启语义理解新纪元。

深度分析

研究背景

语义对应是计算机视觉中的基础任务,旨在实现不同实例间的像素级匹配。早期方法依赖手工特征或几何标注,效果有限。近年来,深度学习模型如DINO、CLIP提升了特征表达能力,但仍受限于局部特征和二维外观信息,难以解决对称、重复特征引发的几何歧义。无监督方法逐渐兴起,利用预训练模型生成伪标签,但存在结构一致性不足的问题。Gromov-Wasserstein(GW)作为结构匹配工具,已在点云和图匹配中展现潜力,但在高维特征空间中计算复杂。本文结合3D几何模型,提出融合FGW的结构优化方案,填补了二维特征与三维几何信息融合的空白,推动了无监督语义匹配的发展。

核心问题

核心问题在于如何在无标注条件下,结合特征相似性与空间结构,实现高精度、鲁棒的语义对应。现有方法多依赖局部特征匹配,忽视全局结构,易受对称和重复特征干扰。引入几何信息虽能缓解歧义,但计算成本高,且在复杂场景中效果有限。如何设计一种高效、结构感知的匹配框架,成为亟待解决的难题。这不仅关系到标注成本,也影响实际应用中的匹配质量。

核心创新

本研究的创新点包括:1)将融合Gromov-Wasserstein(FGW)优化引入无标注语义匹配,结合特征相似性与空间结构;2)利用预训练3D模型定义空间中的几何关系,解决二维特征的歧义问题;3)提出锚点线性化算法,显著降低FGW的计算复杂度,实现端到端训练;4)引入软目标损失,增强模型对伪标签噪声的容忍度。这些创新共同推动了结构感知无监督匹配的实现,为未来多模态、多场景应用奠定基础。

方法详解

  • �� 采用预训练3D模型(VGGT)提取空间几何信息,将二维图像Lift到三维点云空间。
  • �� 将图像划分为区域块,提取对应的语义特征(如DINO)和几何坐标。
  • �� 初步通过无监督的非平衡最优传输(UOT)算法,基于特征相似性生成伪标签。
  • �� 选取高置信锚点对,利用空间几何信息定义结构距离矩阵。
  • �� 通过锚点线性化近似Gromov-Wasserstein(GW)距离,减少计算复杂度。
  • �� 将语义相似性成本与几何结构成本融合,形成最终优化目标。
  • �� 迭代优化传输计划,逐步提升结构一致性。
  • �� 使用软目标损失结合网络预测,训练鲁棒的匹配网络。
  • �� 最终在测试中通过最近邻匹配实现快速推理。

实验设计

采用SPair-71k和AP-10k两个公开数据集,评估匹配精度([email protected])和结构一致性。对比ASIC、DINOv2+SD等方法,验证在复杂几何场景下的优越性。通过消融实验分析锚点数量、几何信息引入对性能的影响。调优超参数α(结构与特征平衡)和锚点数目,确保模型在不同场景下的泛化能力。评估指标包括平均准确率、类别差异和几何歧义鲁棒性。

结果分析

在SPair-71k上,SoY达到67.9%的[email protected],优于对比方法(ASIC 39.9%、DINOv2+SD 63.5%)。引入几何结构后,匹配准确率提升2.3%至7.0%,验证结构信息的重要性。在AP-10k动物数据集,性能提升明显,特别在几何模糊区域表现优异。消融实验显示锚点数量和几何信息引入对性能影响显著,验证了方法的有效性和鲁棒性。

应用场景

该技术可应用于自动标注、三维重建、机器人导航和内容编辑等场景。无需几何标注,降低数据准备成本,适合大规模场景。结合实时优化算法,可实现动态场景中的结构感知匹配,为智能机器人和增强现实提供基础支持。未来可扩展到多模态融合和视频序列匹配,推动行业智能化升级。

局限与展望

目前算法在极端遮挡和部分可见场景中仍存在误差,主要因几何信息不足或模型误差。高维几何特征提取依赖预训练模型,计算成本较高,限制实时性。锚点线性化在复杂变形中可能影响结构保持,未来需优化锚点选择策略和模型效率。整体框架仍需在大规模、多模态、多场景中验证其泛化能力。

通俗解读 非专业人士也能看懂

想象你在整理一堆不同的拼图,每个拼图代表一张图片。传统方法就像只看拼图的颜色和图案,试图找到相似的拼块,但有时候颜色相似的拼块其实在不同位置,容易搞错。本文的方法像是用3D模型帮你理解每个拼块在空间中的真实位置和结构关系。通过一些特别的“锚点”,你可以更准确地把拼块拼回原来的样子,即使它们在不同角度或位置。这样一来,即使拼图中有重复的图案或对称的部分,也能正确匹配。整个过程就像用一个智能的拼图助手,既看表面颜色,又理解空间结构,帮你拼出最完整、最准确的拼图。这个技术可以用在自动识别不同图片中的相似部分,比如在自动标注、虚拟现实或机器人导航中,都能大大提高效率和准确性。

简单解释 像给14岁少年讲一样

想象你在玩拼图游戏,但有时候拼图上的颜色和图案很像,搞得你很难知道哪个拼块应该放哪里。传统的方法就像只看颜色,容易搞错。现在,这个新方法就像用一台超级聪明的机器人帮你,它不仅看颜色,还能理解每个拼块在空间中的位置和形状。它会用一些特别的“标记”来记住拼块的空间关系,就像用线把相关的拼块连接起来。这样,即使拼图上有很多重复的图案或对称的部分,它也能正确地把拼块拼在一起,不会搞错。这个机器人还会不断学习,变得越来越聪明,帮你拼出最完整、最漂亮的拼图。这个技术未来可以用在自动识别图片中的物体、虚拟现实游戏,甚至让机器人更聪明地导航和操作。是不是很酷?

原文摘要

Semantic correspondence is essential for handling diverse in-the-wild images lacking explicit correspondence annotations. While recent 2D foundation models offer powerful features, adapting them for unsupervised learning via nearest-neighbor pseudo-labels has key limitations: it operates locally, ignoring structural relationships, and consequently its reliance on 2D appearance fails to resolve geometric ambiguities arising from symmetries or repetitive features. In this work, we address this by reformulating pseudo-label generation as a Fused Gromov-Wasserstein (FGW) problem, which jointly optimizes inter-feature similarity and intra-structural consistency. Our framework, Shape-of-You (SoY), leverages a 3D foundation model to define this intra-structure in the geometric space, resolving abovementioned ambiguity. However, since FGW is a computationally prohibitive quadratic problem, we approximate it through anchor-based linearization. The resulting probabilistic transport plan provides a structurally consistent but noisy supervisory signal. Thus, we introduce a soft-target loss dynamically blending guidance from this plan with network predictions to build a learning framework robust to this noise. SoY achieves state-of-the-art performance on SPair-71k and AP-10k datasets, establishing a new benchmark in semantic correspondence without explicit geometric annotations. Code is available at Shape-of-You.

cs.CV cs.LG