AvatarMe++: Facial Shape and BRDF Inference with Photorealistic Rendering-Aware GANs
AvatarMe++用可微渲染GAN从单张野外图像重建可直接渲染的高分辨率脸部几何与BRDF。
Alexandros Lattas, Stylianos Moschoglou, Stylianos Ploumpis 等
AvatarMe++用可微渲染GAN从单张野外图像重建可直接渲染的高分辨率脸部几何与BRDF。
Alexandros Lattas, Stylianos Moschoglou, Stylianos Ploumpis 等
利用DINO-ViT深层特征作为密集视觉描述符,实现无监督语义分割与对应。
Shir Amir, Yossi Gandelsman, Shai Bagon 等
Plenoxels以稀疏体素+球谐函数替代NeRF,训练快约100倍且画质不降。
Alex Yu, Sara Fridovich-Keil, Matthew Tancik 等
通过测试时局部转换器(TLC)提升图像修复性能,GoPro数据集上单图像去模糊PSNR从32.92 dB提升至33.57 dB。
Xiaojie Chu, Liangyu Chen, Chengpeng Chen 等
Ref-NeRF通过反射方向重参数化,显著提升了场景中的镜面反射真实感。
Dor Verbin, Peter Hedman, Ben Mildenhall 等
ProtoPool模型通过可微分的原型分配实现可解释的图像分类,在CUB-200-2011和Stanford Cars数据集上表现优异。
Dawid Rymarczyk, Łukasz Struski, Michał Górszczak 等
提出Mask2Former,基于masked attention的通用图像分割架构,在四个公开数据集上刷新多项SOTA,性能优于专用模型。
Bowen Cheng, Ishan Misra, Alexander G. Schwing 等
MViTv2通过相对位置嵌入和残差池化,提升多尺度视觉Transformer在图像、视频和检测中的性能,达成88.8% ImageNet准确率。
Yanghao Li, Chao-Yuan Wu, Haoqi Fan 等
Dream Fields结合NeRF与CLIP,实现无监督文本引导的3D对象生成。
Ajay Jain, Ben Mildenhall, Jonathan T. Barron 等
MonoScene提出单目RGB图像的3D语义场景重建,采用2D/3D UNet架构,引入FLoSP和3D CRP,显著优于现有方法。
Anh-Quan Cao, Raoul de Charette
提出Diffusion Autoencoders,结合可解码的高层语义与细节重建,显著提升图像表示与操作能力。
Konpat Preechakul, Nattanat Chatthee, Suttisak Wizadwongsa 等
VQ-Diffusion模型结合VQ-VAE和DDPM,实现文本到图像生成,速度提升15倍。
Shuyang Gu, Dong Chen, Jianmin Bao 等
提出Blended Diffusion实现基于文本的局部图像编辑,结合CLIP和DDPM,确保背景保持自然。
Omri Avrahami, Dani Lischinski, Ohad Fried
提出OOD-CV基准,评估模型在姿态、纹理等单一干扰因素的OOD鲁棒性,显示现有方法效果有限。
Bingchen Zhao, Shaozuo Yu, Wufei Ma 等
GMFlow以全局匹配替代局部回归,在Sintel上以1次细化达到EPE 1.08,优于31次细化RAFT。
Haofei Xu, Jing Zhang, Jianfei Cai 等
VIOLET采用端到端视频-语言Transformer,结合Masked Visual-token Modeling提升视频理解,达到多项任务SOTA。
Tsu-Jui Fu, Linjie Li, Zhe Gan 等
EvDistill用双向重建与跨模态蒸馏,在无标注事件上实现DDD17 58.02% mIoU。
Lin Wang, Yujeong Chae, Sung-Hoon Yoon 等
提出mip-NeRF 360,结合非线性参数化与在线蒸馏,显著提升无界场景的渲染质量与效率。
Jonathan T. Barron, Ben Mildenhall, Dor Verbin 等
RedCaps利用Reddit数据,构建1200万图文对,提升视觉与语言模型表现。
Karan Desai, Gaurav Kaul, Zubin Aysola 等
DyTox通过动态令牌扩展实现持续学习,在ImageNet1000上表现优异。
Arthur Douillard, Alexandre Ramé, Guillaume Couairon 等