SOTAlign: Semi-Supervised Alignment of Unimodal Vision and Language Models via Optimal Transport

TL;DR

SOTAlign通过少量配对样本结合最优传输实现视觉与语言模型的半监督对齐,显著优于传统方法。

cs.LG 🔴 高级 2026-02-27 51 次浏览
Simon Roschmann Paul Krzakala Sonia Mazelet Quentin Bouniot Zeynep Akata
多模态学习 半监督 最优传输 视觉-语言对齐 深度学习

核心发现

方法论

SOTAlign采用两阶段框架:第一阶段利用线性教师模型从少量配对样本中恢复粗略的共享几何结构;第二阶段通过引入KLOT(基于最优传输的散度)对未配对数据进行细化,传递关系结构而不强制空间一致。核心算法包括Procrustes、CCA和对比学习,结合KLOT优化目标,有效利用大量未配对数据实现鲁棒对齐。该方法通过显式梯度推导解决了OT方法的内存瓶颈,提升了大规模训练的可扩展性。

关键结果

  • 在COCO数据集上,使用仅10k配对样本,SOTAlign在零样本检索任务中实现了30.0%的Mean R@1,显著优于对比方法(如SigLIP的24.2%),且在未配对数据超过100万样本时仍表现优异。
  • 在不同数据源和分布偏移条件下,结合ImageNet、CC12M等多源未配对数据,性能提升持续稳定,证明模型对异质数据的适应能力。
  • 通过引入KLOT散度,显著提升了OT传输的效率和稳定性,训练速度比传统Sinkhorn算法快50倍,模型在大规模批次训练中表现出良好的扩展性。

研究意义

该研究突破了视觉-语言模型对大规模配对数据的依赖,提出的半监督框架极大降低了训练成本,为在医学、科学等数据稀缺领域的多模态应用提供了新途径。通过利用未配对丰富的单模态数据,模型实现了更强的泛化能力和鲁棒性,推动多模态学习向更广泛的实际场景扩展。

技术贡献

创新点包括提出KLOT散度,有效解决OT梯度计算的内存瓶颈,显著提升了大规模训练的可扩展性。结合线性教师模型与关系传递机制,实现少样本高效对齐。算法设计兼顾理论保证与工程实现,推动了OT在多模态对齐中的应用边界。

新颖性

首次系统性将最优传输散度引入半监督视觉-语言对齐,结合线性模型与关系传递,突破了传统对比损失对配对数据的依赖,提出可扩展的梯度显式表达,显著提升了大规模训练效率。

局限性

  • 模型在极端分布偏移或完全无关的未配对数据上表现仍有限,可能受到数据异质性影响。
  • 对超参数(如正则化系数和熵参数)敏感,需精细调优以达到最佳性能。
  • 训练过程中对硬件资源要求较高,尤其在大批次训练时对GPU内存依赖较大。

未来方向

未来将探索多模态关系建模的更深层次结构,结合自监督学习增强模型鲁棒性,优化算法以降低计算成本,并扩展到多模态任务如视频理解和医学影像分析。

AI 总览摘要

随着多模态深度学习的快速发展,视觉-语言模型(VLMs)在零样本识别和跨模态任务中展现出巨大潜力。然而,现有方法高度依赖大规模配对数据,训练成本昂贵,限制了其在数据稀缺场景的应用。本文提出的SOTAlign框架,通过结合少量配对样本与大量未配对单模态数据,实现了高效、鲁棒的跨模态对齐。

该方法的核心创新在于引入基于最优传输的散度(KLOT),结合线性教师模型,利用关系传递机制,有效传递几何结构。通过显式梯度推导,克服了传统OT方法的内存瓶颈,显著提升了大规模训练的效率。实验结果显示,在COCO等多个数据集上,SOTAlign在仅用10k配对样本的条件下,零样本检索性能超过30%的平均R@1,优于多项对比方法。

此外,模型在多源未配对数据和不同分布偏移条件下表现出强大适应性,验证了其在实际应用中的潜力。该研究不仅降低了多模态对齐的门槛,也为未来在医学、科学等领域的多模态任务提供了新的解决方案。尽管如此,模型在极端偏移和超大规模训练中仍面临挑战,未来将结合自监督和多模态关系建模,进一步提升性能和适应性。

深度分析

研究背景

多模态学习近年来取得显著进展,代表性工作如CLIP、ALIGN通过大规模对比学习实现了跨模态对齐,推动了零样本识别、图像检索等应用。然而,这些方法依赖数亿对配对样本,训练成本高昂,限制了其在数据稀缺或特定领域的应用。近年来,研究开始关注弱监督和半监督策略,尝试利用未配对数据提升模型性能。UOT-RCL等工作引入最优传输思想,增强模型鲁棒性,但仍受制于OT梯度计算的效率瓶颈。本文基于“Platon式表示假设”,提出在少量配对样本基础上,结合未配对数据实现高效对齐的目标,填补了现有方法在大规模、低监督场景下的空白。

核心问题

核心问题在于如何在极少配对样本条件下,利用大量未配对单模态数据实现准确的跨模态对齐。传统方法如对比学习和CCA在配对样本不足时效果有限,且OT方法在大规模训练中面临梯度计算和内存瓶颈。解决这一问题对于降低多模态模型的训练成本、扩大其应用范围具有重要意义。该问题的难点在于如何设计既能传递几何关系,又能保证训练效率的优化目标,同时应对数据分布偏移和异质性。

核心创新

创新点包括:1)提出基于最优传输的散度KLOT,有效传递几何关系,克服OT梯度计算瓶颈;2)引入线性教师模型,利用少量配对样本快速恢复粗略几何结构;3)结合关系传递机制,增强未配对数据的利用效率;4)推导显式梯度,显著提升大规模训练速度。该方法在保持理论保证的同时,极大改善了训练的可扩展性,突破了传统OT方法的限制。

方法详解

  • �� 采用两阶段策略:第一阶段用少量配对样本训练线性模型(Procrustes、CCA或对比学习)以恢复粗略几何结构;第二阶段利用该线性模型作为教师,通过引入KLOT散度对未配对数据进行细化。
  • �� 线性模型输出投影矩阵(Wx、Wy),作为几何结构的初步估计。
  • �� 设计目标函数,将几何关系保持在共享空间中,结合KLOT散度,衡量模型输出与目标几何的偏差。
  • �� 通过显式梯度公式,避免传统OT算法的反向传播瓶颈,提升训练效率。
  • �� 在训练中引入正则化参数α,平衡线性教师和深度模型的关系传递。
  • �� 实验中使用DINOv3 ViT-L和NV-Embed-v2作为预训练编码器,结合CC3M、CC12M等数据集进行多源训练。

实验设计

  • �� 采用COCO、CC3M、CC12M等公开数据集,评估零样本检索和跨域适应能力。
  • �� 以10k配对样本为基础,逐步引入未配对的百万级样本,测试模型在不同数据规模下的性能变化。
  • �� 比较Procrustes、CCA、对比学习等线性方法的效果,验证KLOT散度的优越性。
  • �� 通过不同正则化参数和熵参数的调优,优化训练效果。
  • �� 进行消融实验,验证线性模型、关系传递和显式梯度的贡献。

结果分析

  • �� 在COCO数据集上,SOTAlign在零样本检索中实现了30.0%的Mean R@1,优于SigLIP等对比方法(24.2%),且在未配对数据超过100万样本时仍表现稳定。
  • �� 结合多源未配对数据,性能持续提升,验证模型对异质数据的适应性。
  • �� 显式梯度推导使训练速度提升50倍,模型在大批次训练中表现出良好的扩展性和稳定性。

应用场景

  • �� 适用于医学影像、科学数据分析等领域,减少对大量标注配对数据的依赖。
  • �� 支持跨域、多源未配对数据的融合,提升模型泛化能力。
  • �� 可用于构建低成本、多场景的多模态系统,推动智能医疗、科学研究等行业发展。

局限与展望

  • �� 在极端分布偏移或完全无关的未配对数据上效果有限,模型仍受数据异质性影响。
  • �� 超参数调优复杂,需大量实验验证。
  • �� 训练对硬件资源要求较高,尤其在大规模批次训练时对GPU内存依赖较大。

通俗解读 非专业人士也能看懂

想象你在整理一个大型工厂的生产线。每个工序都在不同的房间里,有的房间专门做装配,有的专门做包装。工厂的目标是让所有房间的工作协调一致,生产出一致的产品。传统方法需要每个房间都反复沟通,协调成本很高,而且效率低。现在,工厂引入了一个智能调度员,只用少量的样本(少量配对的工序信息),就能大致了解每个房间的工作关系,然后用一种聪明的算法(类似最优传输)来优化整体流程。这种方法不仅节省了大量沟通时间,还能适应不同工厂的变化。SOTAlign就像这个调度员,利用少量配对信息,结合大量未配对的单模态数据,实现了不同模态(视觉和语言)之间的高效协调。它通过传递关系结构,确保模型在不同数据源间保持一致性,极大降低了训练成本,同时提升了模型的鲁棒性和适应性。

简单解释 像给14岁少年讲一样

想象你在学校里,有两个班级,一个学画画,一个学写故事。平时他们很少交流,但你希望他们合作,画出故事里的场景。以前,要让每个人都反复沟通,花费很多时间。而现在,你找了一个聪明的朋友,他只看了几幅画和几个故事,就能大致明白他们的关系,然后帮忙安排他们的合作。这个朋友用了一种特别聪明的方法,叫做“最优传输”,可以把他们的关系传递得很准确,还特别快。这样,两个班级就能用很少的交流,合作得很好了。SOTAlign就像这个聪明的朋友,利用少量的配对信息,结合大量未配对的画和故事,快速学会它们的关系。它还能适应不同的画和故事来源,就像朋友能帮不同学校的班级合作一样。这个方法让我们用更少的努力,得到更好的合作效果,未来还能用在医学影像、科学研究等很多地方,帮人们节省时间和成本。

原文摘要

The Platonic Representation Hypothesis posits that neural networks trained on different modalities converge toward a shared statistical model of the world. Recent work exploits this convergence by aligning frozen pretrained vision and language models with lightweight alignment layers, but typically relies on contrastive losses and millions of paired samples. In this work, we ask whether meaningful alignment can be achieved with substantially less supervision. We introduce a semi-supervised setting in which pretrained unimodal encoders are aligned using a small number of image-text pairs together with large amounts of unpaired data. To address this challenge, we propose SOTAlign, a two-stage framework that first recovers a coarse shared geometry from limited paired data using a linear teacher, and then refines the alignment on unpaired samples via an optimal-transport-based divergence that transfers relational structure without overconstraining the target space. SOTAlign effectively leverages unpaired images and text, learning robust joint embeddings across datasets and encoder pairs, and significantly outperforming supervised and semi-supervised baselines. Code is available at https://github.com/ExplainableML/SOTAlign.

cs.LG cs.AI