Unified Discrete Diffusion for Simultaneous Vision-Language Generation
UniD3模型通过统一离散扩散实现多模态生成,性能媲美SOTA。
Minghui Hu, Chuanxia Zheng, Heliang Zheng 等
UniD3模型通过统一离散扩散实现多模态生成,性能媲美SOTA。
Minghui Hu, Chuanxia Zheng, Heliang Zheng 等
本文提出RbA方法,通过区域级分类和“被所有类别拒绝”评分,有效检测未知区域,提升性能。
Nazir Nayal, Mısra Yavuz, João F. Henriques 等
CoMFormer结合变换器架构,实现持续学习中的语义与全景分割,显著优于现有方法,减少遗忘,提升新旧类别学习效果。
Fabio Cermelli, Matthieu Cord, Arthur Douillard
提出语义补全学习(SCL)提升全球-局部跨模态对齐,显著改善视觉-语言预训练性能。
Yatai Ji, Rongcheng Tu, Jie Jiang 等
提出LVDM,利用低维潜空间实现高保真长视频生成,超越Pixel空间模型。
Yingqing He, Tianyu Yang, Yong Zhang 等
提出无需训练的“插入式”扩散特征,用于文本引导的图像转换,保持语义布局。
Narek Tumanyan, Michal Geyer, Shai Bagon 等
EDICT通过耦合变换实现精确反演,显著提升真实图像重建误差比DDIM低一半。
Bram Wallace, Akash Gokul, Nikhil Naik
InstructPix2Pix结合GPT-3与Stable Diffusion,生成数十万配对数据,实现基于指令的图像编辑。
Tim Brooks, Aleksander Holynski, Alexei A. Efros
提出Null-text反演技术,实现基于引导扩散模型的真实图像高保真编辑。
Ron Mokady, Amir Hertz, Kfir Aberman 等
提出Latent-NeRF结合形状引导与扩散模型,实现高效3D形状与纹理生成。
Gal Metzer, Elad Richardson, Or Patashnik 等
提出统一的深度匹配模型,结合Transformer实现光流、立体匹配与深度估计,显著提升性能。
Haofei Xu, Jing Zhang, Jianfei Cai 等
引入6.5TB规模的DiffusionDB,分析文本提示与生成模型关系,揭示模型误差与潜在滥用。
Zijie J. Wang, Evan Montoya, David Munechika 等
提出ID-unaware深度伪造检测模型,缓解隐式身份泄露,提升跨数据集泛化能力。
Shichao Dong, Jin Wang, Renhe Ji 等
提出EMF指标和新数据集,评估单目动态视图合成在无多视信号下性能下降1-2dB。
Hang Gao, Ruilong Li, Shubham Tulsiani 等
NeuPhysics通过单目视频学习3D几何和物理参数,实现可编辑的动态场景重建。
Yi-Ling Qiao, Alexander Gao, Ming C. Lin
提出HUMANISE数据集及基于scene-and-language的生成模型,实现3D场景中多样、语义一致的人体运动生成。
Zan Wang, Yixin Chen, Tengyu Liu 等
Imagic方法利用扩散模型实现单张真实图像的复杂文本引导编辑。
Bahjat Kawar, Shiran Zada, Oran Lang 等
提出弱监督多粒度地图学习方法,提升室内导航中的环境理解和目标定位,成功率提升4%。
Peihao Chen, Dongyu Ji, Kunyang Lin 等
提出MAP模型,通过概率分布编码实现多模态不确定性建模,提升多任务性能。
Yatai Ji, Junjie Wang, Yuan Gong 等
提出Mask-adapted CLIP,通过掩码区域微调提升开放词汇语义分割性能,达成29.6% mIoU。
Feng Liang, Bichen Wu, Xiaoliang Dai 等