Multimodal Image Colorization: Quantifying the Impact of Text-Conditioned Guidance on Grayscale-to-Color Translation

TL;DR

通过对比U-Net和Stable Diffusion 1.5架构,研究文本条件对灰度图像上色的影响,PSNR提升5.6%-5.8%,LPIPS降低7.6%-11.3%。

cs.GR 🔴 高级 2026-06-17 57 次浏览
Colten Reissmann Hugo Garrido-Lestache Belinchon
多模态 图像上色 文本条件 深度学习 U-Net

核心发现

方法论

本文通过对比U-Net和Stable Diffusion 1.5两种架构,分别在有无CLIP文本条件的情况下进行灰度图像上色实验。研究采用Open Image Preferences v1数据集,使用PSNR、SSIM、LPIPS和色彩度等指标评估模型性能。实验在NVIDIA DGX-1集群上运行,确保了高效的训练和评估。

关键结果

  • U-Net模型中,加入文本条件后,PSNR提升5.6%(19.13→20.21),SSIM提升1.2%,LPIPS降低7.6%(0.376→0.348),色彩度提升36.6%。
  • Stable Diffusion模型中,加入文本条件后,PSNR提升5.8%(19.65→20.79),SSIM提升1.5%,LPIPS降低11.3%(0.236→0.209),色彩度提升0.6%。
  • 文本条件对U-Net的提升更显著,尤其在色彩度上增加了36.6%,而Stable Diffusion的色彩度提升有限,表明预训练模型对颜色语义已有较强的先验。

研究意义

该研究通过严格的消融实验,首次定量评估了文本条件在灰度图像上色中的作用。结果表明,文本条件不仅能显著提高像素级指标(如PSNR和SSIM),还能改善感知质量(LPIPS)和色彩表现力。这为多模态生成任务提供了新的研究方向,特别是对于缺乏颜色先验的模型,文本条件能显著弥补信息缺失的不足。

技术贡献

本文的技术贡献在于通过控制变量实验,清晰地量化了文本条件对灰度图像上色的具体贡献,排除了其他架构改动的干扰。此外,研究采用了U-Net和Stable Diffusion两种不同规模的架构,验证了文本条件的普适性。通过引入CLIP作为文本编码器,研究展示了跨模态注意力机制在上色任务中的潜力。

新颖性

与现有方法相比,本研究的创新点在于通过严格的消融实验,单独评估了文本条件对上色任务的影响,而非将其与其他架构改动混为一谈。这种方法为未来多模态生成研究提供了重要的参考。

局限性

  • 实验仅使用了Open Image Preferences v1数据集,可能无法泛化到其他领域。
  • U-Net模型的分辨率较低(256×256),需插值到512×512进行评估,可能影响结果。
  • 未进行用户研究,仅依赖自动化指标评估感知质量。

未来方向

未来研究可探索更高的CFG引导比例以优化文本信号的影响,同时在更大规模和多样化的数据集上验证方法的泛化性。此外,可通过用户研究进一步评估感知质量,并分析不同图像类别中文本条件的具体作用。

AI 总览摘要

灰度图像上色在历史照片修复、医学影像和艺术创作中具有重要应用。然而,由于灰度值无法唯一确定原始颜色,自动上色任务存在多解性问题。为解决这一挑战,研究者提出通过文本条件提供额外的语义信息,减少颜色歧义。

本文对比了U-Net和Stable Diffusion 1.5两种架构,分别在有无CLIP文本条件的情况下进行灰度图像上色实验。实验采用Open Image Preferences v1数据集,使用PSNR、SSIM、LPIPS和色彩度等指标评估性能。结果显示,文本条件在两种架构中均显著提高了上色质量,尤其对U-Net的提升更为显著。

尽管如此,研究也指出了方法的局限性,例如对数据集的依赖性以及对用户感知质量的评估不足。未来研究可探索更高的CFG引导比例、更大规模的数据集以及更细化的类别分析,以进一步提升文本条件在上色任务中的应用潜力。

深度分析

研究背景

灰度图像上色是计算机视觉中的经典问题,广泛应用于历史照片修复、医学影像和艺术创作。传统方法多基于CNN,通过预测CIE-Lab色彩空间的ab通道实现上色。然而,这些方法在处理多解性问题时表现有限,生成的颜色往往缺乏生动性或语义一致性。

核心问题

灰度图像上色的核心挑战在于多解性:同一灰度图像可能对应多种合理的颜色组合。现有方法难以在保持结构一致性的同时生成语义正确且感知质量高的颜色。

核心创新

本文的核心创新在于通过严格的消融实验,单独评估文本条件对上色任务的影响。研究采用CLIP作为文本编码器,将文本嵌入与图像特征通过跨模态注意力机制结合,显著提升了上色质量。

方法详解

  • �� 数据集:使用Open Image Preferences v1,包含7,459对灰度-彩色图像及文本描述。
  • �� 模型:对比U-Net和Stable Diffusion 1.5架构,分别在有无文本条件下进行实验。
  • �� 训练:U-Net使用MSE损失,Stable Diffusion采用𝜖-MSE和Min-SNR加权策略。
  • �� 评估:通过PSNR、SSIM、LPIPS和色彩度指标量化性能。

实验设计

实验在NVIDIA DGX-1集群上运行,U-Net模型以256×256分辨率训练,Stable Diffusion以512×512分辨率训练。所有模型在相同数据集和分割下进行训练和测试,确保结果的可比性。

结果分析

实验结果显示,文本条件在两种架构中均显著提升了上色质量。U-Net的PSNR提升5.6%,色彩度增加36.6%;Stable Diffusion的LPIPS降低11.3%,但色彩度提升有限。

应用场景

该方法可用于历史照片修复、医学影像增强和艺术创作等场景,尤其在需要语义一致性和颜色生动性的任务中表现突出。

局限与展望

方法依赖于特定数据集,可能无法泛化至其他领域。此外,U-Net的分辨率较低,需通过插值提高至512×512进行评估,可能影响结果。

通俗解读 非专业人士也能看懂

想象你有一张老照片,只有黑白色。传统方法就像用一套固定的规则给照片上色,比如看到树就涂绿,看到天空就涂蓝。但问题是,有些东西的颜色是无法从黑白图中直接看出来的,比如一辆车是红的还是蓝的。这时,研究者想到用文字描述来帮忙,比如告诉模型“这是一辆红色的车”。这样模型就能根据描述更准确地上色。

简单解释 像给14岁少年讲一样

想象你在玩一款游戏,里面有很多灰色的物品,你需要给它们上色。可是有些东西,比如一辆车,你不知道它是红的还是蓝的。这时,游戏会给你提示,比如“这是辆红色的车”,你就能准确地选对颜色了。这篇论文就是在研究怎么用文字提示,让电脑也能像你一样聪明地给图片上色!

术语表

PSNR (峰值信噪比)

衡量图像重建质量的指标,值越高表示质量越好。

用于评估生成图像与真实图像的像素级相似度。

SSIM (结构相似性)

衡量图像结构相似性的指标,值越高表示结构保留越好。

用于评估生成图像的结构保真度。

LPIPS (感知相似性)

基于深度学习的感知质量指标,值越低表示感知质量越高。

用于评估生成图像与真实图像的感知差异。

CLIP

一种通过对图像和文本对进行对比学习训练的模型,用于生成对齐的视觉和文本特征。

作为文本条件的编码器,用于生成文本嵌入。

Stable Diffusion

一种基于扩散模型的高分辨率图像生成框架,能够生成高质量的图像。

本文中用于灰度图像上色的高级架构。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模和多样化的数据集上验证文本条件的泛化性?
  • 2 如何优化CFG引导比例以在文本信号和灰度一致性之间取得平衡?

应用场景

近期应用

历史照片修复

通过文本描述恢复历史照片的真实颜色,提升视觉效果和历史价值。

医学影像增强

为医学扫描图像添加颜色,帮助医生更直观地诊断疾病。

远期愿景

多模态生成艺术

结合文本和图像生成技术,推动数字艺术和虚拟现实的创新。

原文摘要

Grayscale images are commonly found in historical photography restoration, medical imaging, and artistic media. However, automatically applying color to these images remains a significant challenge in computer vision because many plausible colorizations can correspond to the same grayscale input. In this work, we quantify the effect of text conditioning on pixel-level and perceptual metrics for grayscale-to-color image models. Specifically, we compare two architectures, a U-Net and Stable Diffusion 1.5, each tested with and without CLIP text conditioning while holding all other variables constant. Our results show that text conditioning improves PSNR by 5.6%, SSIM by 1.2%, and colorfulness by 36.6%, while reducing LPIPS by 7.6% in the U-Net tier. In the Stable Diffusion tier, text conditioning improves PSNR by 5.8%, SSIM by 1.5%, and colorfulness by 0.6%, while reducing LPIPS by 11.3%. These results indicate that text conditioning provides consistent, measurable improvements to colorization quality across both architecture scales.

cs.GR cs.CL cs.CV cs.LG