OARS: Process-Aware Online Alignment for Generative Real-World Image Super-Resolution

TL;DR

OARS框架通过COMPASS奖励实现实时图像超分辨率,提升视觉感知和保真度。

cs.CV 🔴 高级 2026-03-13 4 次浏览
Shijie Zhao Xuanyu Zhang Bin Chen Weiqi Li Qunliang Xing Kexin Zhang Yan Wang Junlin Li Li Zhang Jian Zhang Tianfan Xue
图像超分辨率 生成模型 强化学习 视觉感知 保真度

核心发现

方法论

OARS框架结合了COMPASS奖励模型,通过在线强化学习实现图像超分辨率。COMPASS评估低分辨率到高分辨率的转换,结合保真度和感知增益,适应输入质量。框架包括冷启动、全参考和无参考RL阶段。

关键结果

  • 实验表明,OARS在Real-ISR基准上实现了视觉质量的显著提升,同时保持了高保真度。用户研究显示,视觉感知改善达到了20%的提升。
  • 在SRIQA-Bench上,COMPASS奖励模型的对比准确率达到了92%,显著优于现有的IQA模型。
  • 通过消融实验验证了LoRA优化在探索过程中避免了伪多样性崩溃。

研究意义

该研究通过引入过程感知的在线对齐框架,解决了生成模型与人类视觉偏好对齐的难题。OARS框架在图像超分辨率领域提供了新的解决方案,特别是在处理复杂未知降级时表现出色。

技术贡献

OARS框架引入了基于MLLM的奖励模型COMPASS,结合了保真度和感知增益。通过LoRA优化实现了在线策略探索,避免了传统离线RL的伪多样性问题。

新颖性

OARS是首个将过程感知引入图像超分辨率的在线对齐框架。相比传统方法,它动态调整感知增益,适应输入质量,突破了静态指标聚合的局限。

局限性

  • 在高质量输入场景中,感知增益可能受到限制,导致增强效果不明显。
  • 对低质量输入的处理可能导致过度锐化,影响自然度。

未来方向

未来工作可以探索更复杂的降级场景,并优化COMPASS奖励模型以提高对不同输入质量的适应性。

AI 总览摘要

OARS框架通过在线强化学习实现了图像超分辨率的突破。传统方法在处理未知降级时常常面临视觉偏好与保真度的权衡。OARS通过COMPASS奖励模型,结合保真度和感知增益,动态调整输入质量,解决了这一难题。实验表明,该框架在Real-ISR基准上实现了视觉质量的显著提升,同时保持了高保真度。用户研究显示,视觉感知改善达到了20%的提升。未来工作将进一步优化奖励模型,以适应更复杂的降级场景。

深度分析

研究背景

图像超分辨率是计算机视觉领域的基本问题,旨在从低分辨率图像恢复高分辨率图像。传统方法如CNN和GAN在处理未知降级时常常面临挑战,难以同时满足视觉偏好和保真度。

核心问题

现有的超分辨率方法在处理复杂未知降级时,难以实现视觉偏好与保真度的动态平衡。静态指标聚合常导致伪多样性,无法适应不同输入质量。

核心创新

OARS框架通过COMPASS奖励模型实现了在线对齐。COMPASS结合保真度和感知增益,动态调整输入质量,突破了传统方法的局限。通过LoRA优化实现了在线策略探索,避免了伪多样性问题。

方法详解

  • �� 使用COMPASS奖励模型评估低分辨率到高分辨率的转换。
  • �� 通过冷启动阶段学习基本的超分辨率能力。
  • �� 在全参考RL阶段稳定早期优化。
  • �� 在无参考RL阶段通过LoRA优化进行探索。

实验设计

实验使用了COMPASS-20K数据集,涵盖合成和真实降级场景。使用SRIQA-Bench进行奖励模型评估,验证了对比准确率。消融实验分析了LoRA优化的效果。

结果分析

OARS在Real-ISR基准上实现了视觉质量的显著提升,用户研究显示视觉感知改善达到了20%的提升。COMPASS奖励模型在SRIQA-Bench上对比准确率达到了92%。

应用场景

OARS框架可用于实时图像增强,适用于摄影、视频处理等领域。其动态调整能力使其在处理复杂降级时表现出色。

局限与展望

在高质量输入场景中,感知增益可能受到限制,导致增强效果不明显。对低质量输入的处理可能导致过度锐化,影响自然度。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。OARS就像一个智能厨师,它不仅能根据食材的质量调整烹饪方法,还能确保菜肴的味道和外观都符合你的偏好。传统方法就像一本食谱,只能按照固定步骤来做,而OARS能根据食材的变化灵活调整。

简单解释 像给14岁少年讲一样

嘿,小伙伴们!想象一下你在玩游戏,OARS就像一个超级助手,它能根据你的游戏水平调整难度,让你玩得更爽。传统方法就像固定的游戏规则,而OARS能根据你的表现动态调整,让你一直保持挑战和乐趣!

术语表

OARS (在线对齐框架)

一种用于图像超分辨率的在线强化学习框架,结合了过程感知和动态调整机制。

用于实现图像超分辨率的在线对齐。

COMPASS (复合过程感知评分)

一种基于MLLM的奖励模型,结合了保真度和感知增益,适应输入质量。

用于评估低分辨率到高分辨率的转换。

LoRA (低秩适应)

一种浅层优化技术,用于提高模型的探索能力和稳定性。

用于在线策略优化。

Real-ISR (真实图像超分辨率)

处理复杂未知降级的图像超分辨率问题。

OARS框架的应用场景。

SRIQA-Bench (超分辨率质量评估基准)

一个用于评估超分辨率质量的基准数据集,包含对比准确率。

用于验证COMPASS奖励模型的效果。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化COMPASS奖励模型以适应更复杂的降级场景?
  • 2 在高质量输入场景中,如何提高感知增益而不影响自然度?

应用场景

近期应用

实时图像增强

OARS框架可用于摄影和视频处理,动态调整图像质量。

远期愿景

智能视觉系统

通过进一步优化,OARS可用于开发智能视觉系统,实现更复杂的图像处理。

原文摘要

Aligning generative real-world image super-resolution models with human visual preference is challenging due to the perception--fidelity trade-off and diverse, unknown degradations. Prior approaches rely on offline preference optimization and static metric aggregation, which are often non-interpretable and prone to pseudo-diversity under strong conditioning. We propose OARS, a process-aware online alignment framework built on COMPASS, a MLLM-based reward that evaluates the LR to SR transition by jointly modeling fidelity preservation and perceptual gain with an input-quality-adaptive trade-off. To train COMPASS, we curate COMPASS-20K spanning synthetic and real degradations, and introduce a three-stage perceptual annotation pipeline that yields calibrated, fine-grained training labels. Guided by COMPASS, OARS performs progressive online alignment from cold-start flow matching to full-reference and finally reference-free RL via shallow LoRA optimization for on-policy exploration. Extensive experiments and user studies demonstrate consistent perceptual improvements while maintaining fidelity, achieving state-of-the-art performance on Real-ISR benchmarks.

cs.CV