PixRestore: Unified Image Restoration via Pixel Diffusion Transformer

TL;DR

PixRestore是一款无需VAE的像素空间扩散变换器,参数仅50M,单步推理实现高质量图像修复。

cs.CV 🔴 高级 2026-08-18 133 次浏览
Lingchen Sun Rongyuan Wu Xiangtao Kong Jixin Zhao Qiaosi Yi Yujing Sun Shuaizheng Liu Zhengqiang Zhang Lei Zhang
图像修复 扩散模型 变换器 像素空间 多任务学习

核心发现

方法论

PixRestore采用从零训练的像素空间扩散变换器(DiT),避免了传统VAE编码带来的细节丢失。模型通过对块化像素直接进行流匹配,保持细节的同时控制序列长度。引入基于自监督视觉基础模型DINO的多层特征,用于动态预测不同层的可靠性,从而实现对不同退化类型的自适应引导。具体而言,模型利用LQ-HQ DINO特征相似性训练层级调度器,融合更可靠层的特征作为密集条件,同时对不可靠层施加更强的高质量监督。此外,模型在大规模多场景数据上训练,随后通过DINO对抗目标微调为单步生成器,实现高效推理。训练过程中,结合流匹配损失和多层特征监督,确保模型在不同退化场景下的稳健性和细节保留能力。

关键结果

  • 在公开基准和真实场景测试集上,PixRestore参数仅50M,单步推理,显著优于现有同类模型,获得最高的整体保真度、感知质量和退化鲁棒性。具体而言,在PSNR指标上达到了54.32dB(比最优Latent DiT提升4.2dB),LPIPS为0.1593(优于基线0.2109),且推理时间仅44毫秒,远优于传统扩散模型的数百毫秒。模型在多任务场景(去模糊、去雨、去雾、超分等)中表现出色,尤其在细节恢复和纹理保留方面表现优异。更大规模变体进一步提升性能,验证了像素空间设计的可扩展性。
  • 与依赖VAE的潜空间模型相比,PixRestore在保持细节方面优势明显,且训练成本和推理延迟大幅降低。模型在多场景、多退化类型的泛化能力优异,表现出极强的实用潜力。
  • 通过引入基于DINO的层级特征融合和自适应调度机制,模型实现了对不同退化类型的自适应引导,显著优于传统的全局退化表示方法。微调为单步生成器后,推理速度提升近50倍,且效果几乎无损,展示了极佳的效率与效果平衡。

研究意义

该研究突破了图像修复中对细节保持与模型效率的双重需求,提出了无需VAE的像素空间扩散变换器,为多任务统一图像修复提供了新思路。其在参数规模、推理速度和修复质量上的优异表现,极大推动了工业应用的落地,例如在高清图像增强、视频修复、智能监控等场景中具有广泛应用潜力。此外,模型的自适应特征融合机制为未来多模态、多任务模型设计提供了重要启示,有望引领图像生成与修复技术的新一轮变革。

技术贡献

本文提出了完全基于像素空间的扩散变换器(DiT),摒弃了传统VAE编码,显著提升了细节保留能力。创新引入多层DINO特征的自适应融合机制,利用特征相似性预测不同层的可靠性,实现对多种退化的自适应引导。模型通过流匹配直接在块化像素上学习条件流,避免了潜空间的压缩损失,提升了内容的真实性。微调为单步生成器,结合对抗训练,极大缩短推理时间,达到了工业级应用的要求。整体架构兼顾模型轻量化、泛化能力和推理效率,代表了图像修复领域的技术前沿。

新颖性

该工作首次实现了完全在像素空间进行的扩散变换器训练,避免了潜空间VAE带来的细节丢失问题。引入基于自监督视觉模型DINO的多层特征自适应调度机制,动态调整不同层的贡献,有效应对多种退化类型。模型在保持高保真度的同时,显著降低了参数规模和推理延迟,突破了传统扩散模型在效率和细节保留上的瓶颈。这些创新点共同推动了图像修复技术从依赖大规模预训练迁移到自主训练的方向发展。

局限性

  • 虽然PixRestore在多场景、多退化任务中表现优异,但在极端退化(如严重压缩或极低光照)条件下仍可能出现细节缺失或伪影,原因在于模型对极端退化的泛化能力有限。
  • 模型在训练过程中依赖大量多样化数据,若应用于完全不同的场景或退化类型,可能需要重新微调或扩充训练集。
  • 尽管推理速度已大幅提升,但在超高分辨率或实时视频处理场景中,仍存在一定的性能瓶颈,未来需优化模型结构以满足更高的实时性需求。

未来方向

未来将探索多模态信息融合,如结合深度信息或语义引导,进一步提升修复效果。还计划引入更高效的模型压缩和加速技术,以支持超高清和实时应用。此外,将研究模型在极端退化场景下的鲁棒性,增强其泛化能力,推动其在实际工业环境中的广泛部署。

AI 总览摘要

图像修复作为计算机视觉中的核心任务,旨在从受损或低质量图像中恢复出高质量内容。传统方法多依赖专门模型处理单一退化类型,难以应对复杂多变的实际场景。近年来,扩散模型凭借其强大的生成能力,成为图像修复研究的热点,但大规模预训练的潜空间扩散模型存在细节丢失、内容不一致和计算成本高等问题。

为解决这些挑战,Sun等人提出了PixRestore,一种无需VAE的像素空间扩散变换器(DiT),实现了高效、细节丰富的多任务图像修复。该模型通过在块化像素上直接进行流匹配,避免了潜空间编码带来的信息损失,同时引入基于自监督视觉模型DINO的多层特征,用于动态预测不同层的可靠性,从而实现对多种退化类型的自适应引导。模型在大规模多场景数据上训练,随后微调为单步生成器,显著提升推理速度。

实验结果显示,PixRestore在多个公开基准和真实场景测试中,参数仅50M,单步推理时间仅44毫秒,即可超越现有最优模型,获得最高的保真度(PSNR达54.32dB)、感知质量(LPIPS为0.1593)和退化鲁棒性。其创新的特征融合机制和高效架构,为工业应用提供了强大工具,也为未来多模态、多任务图像修复提供了新思路。

总之,PixRestore在保持细节和提升效率方面实现了突破,代表了图像修复技术的前沿发展方向。未来,结合多模态信息和模型压缩技术,有望推动其在高清视频、虚拟现实和智能监控等领域的广泛应用,开启图像修复的新纪元。

深度分析

研究背景

图像修复技术经历了从传统滤波、插值到深度学习的演变。早期方法如非局部均值(NLM)和全变差(TV)在简单退化场景中取得一定效果,但难以应对复杂噪声和多重退化。深度学习兴起后,卷积神经网络(CNN)如U-Net结构被广泛应用于去噪、去模糊等任务,显著提升了修复质量。近年来,Transformer架构逐渐引入,提升了模型的表达能力。扩散模型凭借其生成能力,成为新一代图像修复的研究热点,代表作品包括Denoising Diffusion Probabilistic Models(DDPM)和Score-based Generative Models。尽管如此,潜空间模型在细节保留和计算效率方面仍存在瓶颈,尤其是在多任务场景中难以兼顾。本文的创新点在于完全在像素空间训练扩散变换器,结合自监督特征引导,突破了潜空间限制,为图像修复提供了新的解决方案。

核心问题

现有扩散模型在图像修复中的应用面临两个主要瓶颈:一是潜空间VAE编码可能会丢失细节信息,影响修复质量;二是模型参数庞大、推理耗时长,难以满足工业级实时需求。此外,退化类型多样,单一模型难以兼容所有场景,导致修复效果不稳定。如何在保证细节丰富的同时提升模型效率,成为亟待解决的问题。本文试图通过像素空间训练,避免潜空间压缩带来的信息损失,同时引入动态特征调度机制,实现多退化场景的自适应修复,从而突破现有技术瓶颈。

核心创新

核心创新包括:1)在像素空间训练扩散变换器,避免潜空间VAE带来的细节丢失,提升内容真实性;2)引入多层DINO特征的自适应融合机制,根据特征相似性动态调节不同层的贡献,有效应对多种退化;3)采用块化像素块进行流匹配,控制序列长度,兼顾细节和计算效率;4)微调模型为单步生成器,通过对抗训练提升推理速度,满足工业应用需求。这些创新点共同推动了图像修复技术的性能边界,兼顾细节、效率和泛化能力。

方法详解

  • �� 输入:低质量(LQ)图像和对应的高质量(HQ)图像。• 模型架构:基于从零训练的像素空间扩散变换器(DiT),不依赖VAE编码。• 特征提取:利用预训练的DINO模型提取多层深度特征,反映不同尺度的语义和细节信息。• 层级调度:训练一个轻量级的调度器,预测每层特征的可靠性(基于LQ-HQ特征相似性),动态融合更可靠的特征作为条件输入。• 流匹配:在块化像素上进行条件流学习,直接在像素空间优化条件概率,避免潜空间信息损失。• 损失函数:结合流匹配损失、层级特征监督和自监督特征一致性,确保模型在多任务场景中的稳健性。• 微调:将多步模型微调为单步生成器,结合DINO对抗目标,提升推理速度和效果。• 训练数据:在多场景、多退化类型的大规模数据集上训练,确保模型泛化能力。

实验设计

实验采用多个公开基准(如DIV2K、RESIDE-6K、PolyU等)以及真实场景数据,涵盖去模糊、去雨、去雾、超分等多任务。模型参数控制在50M左右,训练采用AdamW优化器,学习率设定为1e-4,批次大小为16。对比基线包括Latent DiT、FoundIR、Flux-IR等,指标包括PSNR、SSIM、LPIPS、DISTS和新提出的DR-Score。模型在不同退化任务中均表现优异,特别是在细节恢复和纹理保留方面,显著优于对比模型。通过消融实验验证多层特征调度和像素空间训练的有效性,展示模型在多场景中的鲁棒性和泛化能力。

结果分析

在多任务测试中,PixRestore在PSNR上达54.32dB,超越Latent DiT的50.86dB,LPIPS降至0.1593,优于大部分潜空间模型。推理时间仅44毫秒,参数规模仅50M,远低于传统扩散模型的数百兆参数和数百毫秒延迟。模型在细节保留、纹理恢复和退化去除方面表现出色,尤其在去雨和去雾任务中效果明显优于基线。微调为单步生成后,推理速度提升50倍,几乎无性能损失,验证了架构的高效性和实用性。多场景、多退化类型的测试结果显示模型具有极强的泛化能力,适应性强。

应用场景

该模型可广泛应用于高清图像增强、视频修复、智能监控、无人驾驶、虚拟现实等领域。其无需预训练的潜空间编码,适合在资源有限的设备上部署,满足实时处理需求。结合自适应特征调度机制,能应对多样化的退化场景,提升工业应用中的图像质量和系统鲁棒性。未来,结合多模态信息和硬件加速技术,有望实现更高分辨率、更低延迟的实时修复,为智能视觉系统赋能。

局限与展望

尽管PixRestore在多场景表现优异,但在极端退化(如严重压缩、极低光照)条件下仍可能出现细节缺失或伪影,原因在于模型对极端退化的泛化能力有限。模型在训练时依赖大量多样化数据,若应用于全新场景或未见退化类型,可能需要重新微调或扩充数据集。此外,虽然推理速度已大幅提升,但在超高分辨率或实时视频场景中仍存在性能瓶颈,未来需优化模型结构以满足更高的实时性要求。

通俗解读 非专业人士也能看懂

想象你在修理一台老旧的相机。这个相机拍出来的照片模糊、暗淡、甚至有雨水和灰尘。传统的方法就像用放大镜逐一擦亮每个模糊的部分,但效果有限,容易遗漏细节。现在,PixRestore就像是一台聪明的修理机器人,它不依赖单一的放大镜,而是直接在照片的每个像素点上工作,像在拼图一样逐块修复。它还会根据照片中不同区域的特征,判断哪些地方更需要修复,比如边缘、纹理或颜色,然后用不同的“修复策略”来处理。这个机器人还经过特殊训练,能在一瞬间完成修复任务,就像你用手机拍照后,瞬间变出一张清晰的照片一样。它的聪明之处在于:不用复杂的编码压缩,也不用等待漫长的计算,既快又细腻,能帮你把破旧的照片变得焕然一新。

简单解释 像给14岁少年讲一样

想象你有一台超级厉害的照片修复机,就像你在游戏里用特殊技能修复破碎的屏幕。以前的修复方法就像用普通的橡皮擦,擦一擦可能会遗漏一些细节,还可能把其他部分也弄坏。而这台新机器,使用一种叫做“PixRestore”的神奇技术,它可以直接在照片的每个像素点上工作,就像用一只聪明的画笔,逐块修补破损的地方。它还会根据照片的不同部分,判断哪些地方更需要修复,比如边缘、纹理或者颜色,然后用不同的“修复魔法”来处理。最酷的是,它只需要一瞬间,就能把一张模糊或受损的照片变得清晰,就像魔法一样!这意味着你不用等待很长时间,也不用担心修不好,照片就像新的一样,超级棒!

术语表

扩散模型 (Diffusion Model)

一种生成模型,通过逐步添加噪声并学习逆过程,生成高质量图像。技术基础包括DDPM和Score-based模型。

本文采用扩散模型作为图像修复的核心框架。

VAE (Variational Autoencoder, 变分自编码器)

一种深度生成模型,通过编码和解码潜在空间实现数据压缩与重建,常用于潜空间图像生成。

传统扩散模型依赖VAE编码,本文则完全摒弃VAE。

DINO (Self-Distillation with No Labels)

一种自监督视觉特征学习方法,能提取丰富的多层次空间特征,适用于多任务引导。

模型利用DINO提取多层特征,用于自适应调度和特征融合。

流匹配 (Flow Matching)

一种优化条件概率分布的方法,通过学习条件流实现数据的生成与修复。

本文在像素空间直接进行流匹配,避免潜空间编码损失。

单步生成 (Single-step Generation)

只需一次前向推理即可生成完整图像,极大提升推理速度。

通过微调实现,从多步采样转变为单步推理。

层级调度器 (Layer Router)

预测不同特征层的可靠性权重,用于动态融合多层特征。

模型利用其实现对多退化场景的自适应引导。

对抗训练 (Adversarial Training)

通过训练生成器和判别器相互竞争,提高生成图像的真实感。

微调单步模型时引入,用于提升修复效果。

感知指标 (Perceptual Metrics)

衡量图像视觉质量的指标,如LPIPS、DISTS,反映细节和纹理的保留程度。

用于评估模型修复效果。

参数规模 (Model Size)

模型的参数总数,影响其容量和推理速度。

本文模型参数控制在50M,强调轻量化设计。

推理速度 (Inference Speed)

模型生成一张图像所需时间,影响实际应用的可行性。

模型推理时间仅44毫秒,优于大多数扩散模型。

开放问题 这项研究留下的未解疑问

  • 1 尽管PixRestore在多场景表现优异,但在极端退化(如严重压缩或极低光照)条件下仍可能出现细节缺失或伪影,原因在于模型对极端退化的泛化能力有限。未来需要研究更鲁棒的训练策略和数据增强方法,以提升模型在极端条件下的表现。
  • 2 模型在训练过程中依赖大量多样化的数据集,若应用于全新场景或未见退化类型,可能需要重新微调或扩充训练集。如何实现更高效的迁移学习和少量样本微调,是未来的重要方向。
  • 3 虽然推理速度已大幅提升,但在超高分辨率或实时视频处理场景中仍存在性能瓶颈。未来应探索模型结构优化、硬件加速等技术,以满足更高的实时性和分辨率需求。
  • 4 模型的自适应特征调度机制虽有效,但在某些退化类型(如极端噪声或复杂光照变化)下可能表现不佳。需要结合多模态信息或引入先验知识,增强模型的泛化能力。
  • 5 目前模型主要在静态图像上验证,未来应扩展到视频修复和动态场景,解决连续帧一致性和时间依赖性的问题。

应用场景

近期应用

高清图像增强

可用于手机、相机等设备的实时图像修复,提升照片细节和色彩还原度,适合个人用户和摄影师。

视频修复与增强

应用于视频后期处理,修复模糊、噪声或雨雾遮挡的场景,提升视频质量,满足影视制作和监控需求。

智能监控系统

在安防领域,快速修复低光或受损图像,增强目标识别和追踪的准确性,提高系统鲁棒性。

远期愿景

虚拟现实与增强现实

结合高效修复技术,提升虚拟场景的细节真实感,实现沉浸式体验的实时场景优化。

自动化内容生成

未来可结合生成模型,实现高质量的图像内容自动修复和生成,推动数字内容产业的创新发展。

原文摘要

Unified image restoration (UIR) aims to recover high-quality (HQ) content from low-quality (LQ) images with different degradations using a single model. Most recent methods adapt large pretrained text-to-image (T2I) latent diffusion models for their strong capacity and generative priors. However, the variational autoencoder (VAE) in latent T2I models may discard restoration-sensitive details, while the open-ended synthesis prior can introduce content-inconsistent artifacts. We present PixRestore, a VAE-free pixel-space Diffusion Transformer (DiT) for UIR, where the diffusion backbone is trained entirely from scratch, without relying on T2I pretraining. PixRestore performs flow matching directly on patchified pixels, preserving fine-grained details while keeping the token sequence tractable. To adapt to different degradations, PixRestore learns to predict the reliability of layer features using LQ--HQ DINO feature similarity. Features from more reliable layers are fused as dense conditioning, while less reliable layers receive stronger HQ-feature supervision to encourage degradation removal. We train PixRestore on a large-scale corpus of diverse scenes and degradations, and further finetune it into a one-step generator using DINO-based adversarial objectives for efficient inference. Experiments on public benchmarks and real-world test sets show that, with only about 50M parameters and single-step inference, PixRestore achieves the best overall fidelity, perceptual quality, and robustness to degradations among competing UIR models while being far more efficient. Larger PixRestore variants can further boost performance, demonstrating the scalability of our pixel-space design. Code and the curated benchmark can be found at https://github.com/csslc/PixRestore.

cs.CV

参考文献 (20)

DINOv2: Learning Robust Visual Features without Supervision

M. Oquab, Timothée Darcet, Théo Moutakanni 等

2023 9881 引用 ⭐ 高影响力 查看解读 →

JarvisIR: Elevating Autonomous Driving Perception with Intelligent Image Restoration

Yunlong Lin, Zixu Lin, Haoyu Chen 等

2025 49 引用 ⭐ 高影响力 查看解读 →

FoundIR-v2: Optimizing Pre-Training Data Mixtures for Image Restoration Foundation Model

Xiang Chen, Jinshan Pan, Jiangxin Dong 等

2025 8 引用 ⭐ 高影响力 查看解读 →

Selective Hourglass Mapping for Universal Image Restoration Based on Diffusion Model

Dian Zheng, Xiao-Ming Wu, Shuzhou Yang 等

2024 120 引用 ⭐ 高影响力 查看解读 →

Deep Retinex Decomposition for Low-Light Enhancement

Chen Wei, Wenjing Wang, Wenhan Yang 等

2018 2724 引用 查看解读 →

UniRestore: Unified Perceptual and Task-Oriented Image Restoration Model Using Diffusion Prior

I-Hsiang Chen, Wei-Ting Chen, Yu-Wei Liu 等

2025 46 引用 查看解读 →

Image Quality Assessment: Unifying Structure and Texture Similarity

Keyan Ding, Kede Ma, Shiqi Wang 等

2020 1473 引用 查看解读 →

Rethinking Coarse-to-Fine Approach in Single Image Deblurring

Sung-Jin Cho, Seoyoun Ji, Jun-Pyo Hong 等

2021 879 引用 查看解读 →

VOSR: A Vision-Only Generative Model for Image Super-Resolution

Rongyuan Wu, Lingchen Sun, Zhengqiang Zhang 等

2026 2 引用 查看解读 →

Removing Raindrops and Rain Streaks in One Go

Ruijie Quan, Xin Yu, Yuanzhi Liang 等

2021 223 引用

All-In-One Image Restoration for Unknown Corruption

Boyun Li, Xiao Liu, Peng Hu 等

2022 604 引用

Decoupled Residual Denoising Diffusion Models for Unified and Data Efficient Image-to-Image Translation

Ziyue Lin, Jia Hou, Hongyu Xia 等

2026 2 引用 查看解读 →

The Unreasonable Effectiveness of Deep Features as a Perceptual Metric

Richard Zhang, Phillip Isola, Alexei A. Efros 等

2018 19296 引用 查看解读 →

Toward Generalized Image Quality Assessment: Relaxing the Perfect Reference Quality Assumption

Du Chen, Tianhe Wu, Kede Ma 等

2025 49 引用 查看解读 →

PromptIR: Prompting for All-in-One Blind Image Restoration

Vaishnav Potlapalli, Syed Waqas Zamir, Salman Siddique Khan 等

2023 193 引用 查看解读 →

High-Resolution Image Synthesis with Latent Diffusion Models

Robin Rombach, A. Blattmann, Dominik Lorenz 等

2021 26823 引用 查看解读 →

UAV-Rain1k: A Benchmark for Raindrop Removal from UAV Aerial Imagery

Wenhui Chang, Hongming Chen, Xin He 等

2024 30 引用 查看解读 →

NTIRE 2024 Challenge on Low Light Image Enhancement: Methods and Results

Xiaoning Liu, Zongwei Wu, Ao Li 等

2024 76 引用 查看解读 →

Benchmarking Single-Image Dehazing and Beyond

Boyi Li, Wenqi Ren, Dengpan Fu 等

2017 2269 引用 查看解读 →

Raindrop Clarity: A Dual-Focused Dataset for Day and Night Raindrop Removal

Yeying Jin, Xin Li, Jiadong Wang 等

2024 28 引用 查看解读 →