Guiding a Diffusion Model with a Bad Version of Itself
提出自我引导的扩散模型方法,利用性能较差的模型提升图像质量,ImageNet生成FID达1.01。
Tero Karras, Miika Aittala, Tuomas Kynkäänniemi 等
提出自我引导的扩散模型方法,利用性能较差的模型提升图像质量,ImageNet生成FID达1.01。
Tero Karras, Miika Aittala, Tuomas Kynkäänniemi 等
SpatialRGPT通过3D场景图和深度融合显著提升VLM的空间推理能力。
An-Chieh Cheng, Hongxu Yin, Yang Fu 等
本论文提出针对空中影像的视觉地点识别(VPR)评估方法,强调地图切片的缩放与重叠优化。
Ivan Moskalenko, Anastasiia Kornilova, Gonzalo Ferrer
Video-MME通过多模态视频评估,涵盖6大领域、900视频,评估多模态大模型性能。
Chaoyou Fu, Yuhan Dai, Yongdong Luo 等
提出CV-VAE,兼容Stable Diffusion图像VAE的连续视频潜空间,提升帧生成能力。
Sijie Zhao, Yong Zhang, Xiaodong Cun 等
EMAG方法通过考虑自运动,提升了手部预测的准确性,在Ego4D和EPIC-Kitchens 55数据集上分别提高了1.7%和7.0%。
Masashi Hatano, Ryo Hachiuma, Hideo Saito
SparseDrive通过稀疏场景表示实现端到端自动驾驶,显著降低碰撞率71.4%。
Wenchao Sun, Xuewu Lin, Yining Shi 等
VideoTree利用树状结构实现长视频的自适应层次表示,提升推理准确率至61.1%。
Ziyang Wang, Shoubin Yu, Elias Stengel-Eskin 等
提出ICTM算法,利用流模型近似MAP,解决高维线性逆问题,性能优于现有流匹配方法。
Yasi Zhang, Peiyu Yu, Yaxuan Zhu 等
T2V-Turbo通过混合奖励反馈突破视频一致性模型的质量瓶颈,4步生成优于50步DDIM。
Jiachen Li, Weixi Feng, Tsu-Jui Fu 等
EffoVPR利用DINOv2自注意力层特征实现零-shot和微调下的高效视觉地点识别,达成SOTA性能。
Issar Tzachor, Boaz Lerner, Matan Levy 等
提出MoSca:基于4D运动脚手架的动态高斯融合系统,能从野外随意单目视频中重建并合成新视角,利用高斯点云优化实现高性能。
Jiahui Lei, Yijia Weng, Adam Harley 等
MambaLLIE通过全局-局部状态空间设计,显著提升低光图像增强性能,PSNR提升至30.12。
Jiangwei Weng, Zhiqiang Yan, Ying Tai 等
LucidPPN通过分离颜色和其他视觉特征,提升了用户对计算机视觉模型的理解。
Mateusz Pach, Dawid Rymarczyk, Koryna Lewandowska 等
FIFO-Diffusion利用预训练扩散模型实现无限长视频生成,无需额外训练。
Jihwan Kim, Junoh Kang, Jinyoung Choi 等
提出结合点云、NeRF等的3D-LLMs,提升空间理解能力。
Xianzheng Ma, Brandon Smart, Yash Bhalgat 等
BoQ采用可学习全局查询,利用交叉注意力提升视觉地点识别性能,超越SOTA,速度快且效率高。
Amar Ali-Bey, Brahim Chaib-draa, Philippe Giguère
该综述以RGB、光流、CNN、RNN与GCN分类视频表示,但未报告统一数据集数值。
Elham Ravanbakhsh, Yongqing Liang, J. Ramanujam 等
提出Diff-IP2D,基于扩散模型同时预测手部轨迹与物体意向,显著优于SOTA方法。
Junyi Ma, Jingyi Xu, Xieyuanli Chen 等
MANTIS通过指令微调提升多图像视觉语言能力,平均提升13点。
Dongfu Jiang, Xuan He, Huaye Zeng 等