Attend-and-Excite: Attention-Based Semantic Guidance for Text-to-Image Diffusion Models
提出Attend-and-Excite,通过注意力引导提升文本到图像生成的语义一致性。
Hila Chefer, Yuval Alaluf, Yael Vinker 等
提出Attend-and-Excite,通过注意力引导提升文本到图像生成的语义一致性。
Hila Chefer, Yuval Alaluf, Yael Vinker 等
BLIP-2利用冻结的图像编码器和大语言模型,通过两阶段训练的Q-Former实现高效跨模态对齐,零-shot性能显著提升。
Junnan Li, Dongxu Li, Silvio Savarese 等
提出3DShape2VecSet,将点云和表面模型编码为神经场,提升3D生成与重建性能。
Biao Zhang, Jiapeng Tang, Matthias Niessner 等
提出端到端高分辨率图像扩散模型,调整噪声调度和架构缩放,达到SOTA性能。
Emiel Hoogeboom, Jonathan Heek, Tim Salimans
HexPlane通过六个空间-时间特征平面实现动态场景的高效显式表示,训练速度提升百倍。
Ang Cao, Justin Johnson
通过掩码级识别提高异常感知分割性能,显著减少语义边界处的误报。
Matej Grcić, Josip Šarić, Siniša Šegvić
提出联合字幕定位与生成(CGG)框架,显著提升开放词汇实例分割性能,novel类别提升6.8% mAP。
Jianzong Wu, Xiangtai Li, Henghui Ding 等
Muse:基于掩码生成Transformer实现高效文本到图像生成,FID达6.06。
Huiwen Chang, Han Zhang, Jarred Barber 等
基于预训练图像扩散模型,提出一键调优的视频生成方法Tune-A-Video,实现单个文本-视频样本的高质量视频合成。
Jay Zhangjie Wu, Yixiao Ge, Xintao Wang 等
Objaverse 1.0收集了超过80万高质量、多类别的3D模型,配有详细描述,用于推动3D生成、细粒度分类和AI导航等应用。
Matt Deitke, Dustin Schwenk, Jordi Salvador 等
Imagen Editor结合级联扩散模型和EditBench基准,提升文本引导图像修复。
Su Wang, Chitwan Saharia, Ceslee Montgomery 等
ISVOS融合实例理解与记忆匹配,DAVIS17验证集J&F达87.1%。
Junke Wang, Dongdong Chen, Zuxuan Wu 等
BEVBert引入空间感知的多模态地图预训练,显著提升VLN性能。
Dong An, Yuankai Qi, Yangguang Li 等
提出层次多模态Transformer Hi-VT5,处理多页文档问答,达成85.95%的准确率。
Rubèn Tito, Dimosthenis Karatzas, Ernest Valveny
InternVideo结合生成与判别自监督学习,达成Kinetics-400 91.1%准确率,覆盖39个视频任务。
Yi Wang, Kunchang Li, Yizhuo Li 等
CoupAlign结合句子-掩码与词像素对齐,提升图像指示分割精度,oIoU提升约2%。
Zicheng Zhang, Yi Zhu, Jianzhuang Liu 等
ObjectStitch利用条件扩散模型实现无标注的生成式对象合成,提升图像真实感。
Yizhi Song, Zhifei Zhang, Zhe Lin 等
Super-CLEVR通过分离视觉复杂性等因素,提升VQA模型的域鲁棒性,P-NSVQA在三项指标上表现最佳。
Zhuowan Li, Xingrui Wang, Elias Stengel-Eskin 等
提出基于预训练视觉-语言模型的点云多视图描述,提升3D场景开放词汇理解,性能提升25.8%-44.7%。
Runyu Ding, Jihan Yang, Chuhui Xue 等
OpenScene利用CLIP空间实现零样本3D场景理解,支持开放词汇查询。
Songyou Peng, Kyle Genova, Chiyu "Max" Jiang 等