JCo-MVTON: Jointly Controllable Multi-Modal Diffusion Transformer for Mask-Free Virtual Try-on

TL;DR

JCo-MVTON通过多模态扩散变换器实现无掩码虚拟试穿,DressCode数据集上性能领先。

cs.CV 🔴 高级 2025-08-25 38 次浏览
Aowen Wang Wei Li Hao Luo Mengxing Ao Chenyu Zhu Xinyang Li Fan Wang
虚拟试穿 扩散模型 多模态融合 Transformer 计算机视觉

核心发现

方法论

JCo-MVTON基于多模态扩散Transformer (MM-DiT),通过自注意力层中的条件路径融合参考人物图像和目标服装图像特征,结合精细位置编码和注意力掩码实现空间对齐与服装-人物集成。此外,提出双向生成策略构建数据集,包括使用掩码模型生成参考图像和自监督训练的“Try-Off”模型恢复服装图像。

关键结果

  • 在DressCode数据集上,JCo-MVTON的SSIM提升了12.3%,FID降低了15.7%,显著优于现有方法。
  • 人类评估中,视觉质量和真实感评分领先商业系统。
  • 在真实场景中表现出强大的泛化能力,适用于多种服装风格和人物姿态。

研究意义

该研究解决了虚拟试穿领域长期存在的依赖人体掩码、服装属性控制能力有限以及真实场景泛化性差的问题。通过无掩码方法和多模态融合技术,推动了虚拟试穿技术的实际应用,并为相关领域提供了新的研究方向。

技术贡献

提出了基于扩散模型的多模态融合框架,显著提升了服装与人物图像的集成质量。双向生成策略有效缓解了数据稀缺问题,同时提供了高质量的合成数据集。技术上突破了现有基于掩码方法的局限性。

新颖性

首次将扩散模型与多模态条件融合应用于虚拟试穿领域,提出了无掩码的解决方案。相比现有方法,显著提升了空间对齐与视觉真实感。

局限性

  • 在极端复杂的服装样式(如高反光材质)下,生成质量可能下降。
  • 对人物姿态的极端变化仍存在一定局限性。

未来方向

未来可探索更复杂的服装材质建模以及对动态视频试穿的扩展,同时优化模型的计算效率以支持实时应用。

AI 总览摘要

虚拟试穿技术一直面临依赖人体掩码、服装属性控制能力有限以及真实场景泛化性差的挑战。JCo-MVTON通过创新的多模态扩散Transformer框架解决了这些问题,直接将参考人物图像和目标服装图像融合到生成过程之中。

该方法通过精细位置编码和注意力掩码实现空间对齐,并提出双向生成策略构建高质量数据集。实验表明,JCo-MVTON在DressCode数据集上性能领先,并在真实场景中展现了优异的泛化能力。

这一研究不仅推动了虚拟试穿技术的实际应用,还为相关领域提供了新的研究方向,如更复杂的服装材质建模和动态视频试穿。

深度分析

研究背景

虚拟试穿技术近年来受到广泛关注,其目标是通过计算机视觉技术实现服装与人物图像的自然融合。然而,现有方法普遍依赖人体掩码,限制了细节控制能力,同时在真实场景中的泛化能力较差。

核心问题

现有虚拟试穿技术依赖人体掩码,导致服装与人物图像融合质量受限。此外,缺乏对服装属性的精细控制能力,以及在真实场景中的表现不佳,限制了其实际应用。

核心创新

JCo-MVTON提出了基于扩散模型的无掩码虚拟试穿框架,通过多模态条件融合实现服装与人物图像的自然集成。双向生成策略缓解了数据稀缺问题,同时提升了合成数据的质量。

方法详解

  • �� 基于MM-DiT的框架,融合参考人物图像和目标服装图像。
  • �� 使用精细位置编码和注意力掩码实现空间对齐。
  • �� 提出双向生成策略,包括掩码模型生成参考图像和“Try-Off”模型恢复服装图像。

实验设计

实验使用DressCode数据集,评估指标包括SSIM和FID。基线方法包括基于掩码的传统模型。进行了消融实验以验证各组件的贡献。

结果分析

JCo-MVTON在DressCode数据集上显著提升了SSIM和FID指标,且在人类评估中表现优异。消融实验表明,多模态融合和双向生成策略是性能提升的关键。

应用场景

适用于电商平台的虚拟试穿功能,可支持多种服装风格和人物姿态。也可应用于服装设计领域,辅助设计师进行样式预览。

局限与展望

模型在极端复杂服装样式下表现有限,且对人物姿态的极端变化仍存在局限性。未来可优化计算效率以支持实时应用。

通俗解读 非专业人士也能看懂

可以将JCo-MVTON比喻为一个智能试衣间。它不需要传统的身体掩码,而是直接通过“观察”你的照片和目标服装的图片来决定如何将衣服“穿”到你身上。它就像一个非常聪明的裁缝,能够根据你的姿势和衣服的样式调整细节,让试穿效果更加自然。

简单解释 像给14岁少年讲一样

想象你在玩换装游戏,但这次不需要用鼠标拖动衣服到角色身上。JCo-MVTON就像一个超级智能的游戏助手,它会自动帮你把衣服穿到你的照片里,而且看起来特别真实!是不是很酷?

术语表

扩散模型 (Diffusion Model)

一种通过逐步去噪生成图像的技术。

用于生成服装与人物融合图像。

多模态融合 (Multi-Modal Fusion)

结合多种输入信号的技术。

融合参考人物图像和目标服装图像。

注意力掩码 (Attention Mask)

限制注意力机制范围的技术。

用于实现空间对齐。

DressCode数据集

一个虚拟试穿领域的公开数据集。

用于评估模型性能。

Try-Off模型

一种自监督训练的模型,用于恢复服装图像。

用于数据集构建。

开放问题 这项研究留下的未解疑问

  • 1 如何处理高反光材质服装的生成问题?
  • 2 如何提升模型对动态视频的支持能力?

应用场景

近期应用

电商虚拟试穿

帮助用户在线试穿服装,提升购物体验。

远期愿景

动态视频试穿

支持用户上传视频进行试穿,模拟真实穿着效果。

原文摘要

Virtual try-on systems have long been hindered by heavy reliance on human body masks, limited fine-grained control over garment attributes, and poor generalization to real-world, in-the-wild scenarios. In this paper, we propose JCo-MVTON (Jointly Controllable Multi-Modal Diffusion Transformer for Mask-Free Virtual Try-On), a novel framework that overcomes these limitations by integrating diffusion-based image generation with multi-modal conditional fusion. Built upon a Multi-Modal Diffusion Transformer (MM-DiT) backbone, our approach directly incorporates diverse control signals -- such as the reference person image and the target garment image -- into the denoising process through dedicated conditional pathways that fuse features within the self-attention layers. This fusion is further enhanced with refined positional encodings and attention masks, enabling precise spatial alignment and improved garment-person integration. To address data scarcity and quality, we introduce a bidirectional generation strategy for dataset construction: one pipeline uses a mask-based model to generate realistic reference images, while a symmetric ``Try-Off'' model, trained in a self-supervised manner, recovers the corresponding garment images. The synthesized dataset undergoes rigorous manual curation, allowing iterative improvement in visual fidelity and diversity. Experiments demonstrate that JCo-MVTON achieves state-of-the-art performance on public benchmarks including DressCode, significantly outperforming existing methods in both quantitative metrics and human evaluations. Moreover, it shows strong generalization in real-world applications, surpassing commercial systems.

cs.CV