GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions
GODIVA用三维稀疏注意力+VQ-VAE,在Howto100M上实现开放域文本生成视频,RM达93.48。
Chenfei Wu, Lun Huang, Qianxi Zhang 等
GODIVA用三维稀疏注意力+VQ-VAE,在Howto100M上实现开放域文本生成视频,RM达93.48。
Chenfei Wu, Lun Huang, Qianxi Zhang 等
提出基于层状神经表示的可编辑大规模动态场景自由视点视频生成方法,采用ST-NeRF实现空间-时间一致性。
Jiakai Zhang, Xinhang Liu, Xinyi Ye 等
提出P3M-10k数据集和P3M-Net模型,实现隐私保护肖像抠图,面向无脸识别场景。
Jizhizi Li, Sihan Ma, Jing Zhang 等
ViLD通过视觉和语言知识蒸馏,实现了基于文本描述的开放词汇目标检测,达成16.1 mask AP_r。
Xiuye Gu, Tsung-Yi Lin, Weicheng Kuo 等
提出一种利用密集相关体积估计RGB图像对极端旋转的方法,成功处理无重叠图像。
Ruojin Cai, Bharath Hariharan, Noah Snavely 等
MDETR以文本调制检测,凭1.3M图文对实现开放词汇视觉定位。
Aishwarya Kamath, Mannat Singh, Yann LeCun 等
提出InfographicVQA数据集,结合Transformer模型实现对信息图的多模态理解,评估表现较差。
Minesh Mathew, Viraj Bagal, Rubèn Pérez Tito 等
提出基于时空特征聚合的深度视频抠像框架,显著优于传统方法。
Yanan Sun, Guanzhi Wang, Qiao Gu 等
提出H2O数据集及基于图卷积网络的双手与物体3D姿态与交互识别方法。
Taein Kwon, Bugra Tekin, Jan Stuhmer 等
FIERY模型基于单目摄像头实现鸟瞰图未来实例预测,准确率优于基线,支持多模态轨迹预测。
Anthony Hu, Zak Murez, Nikhil Mohan 等
引入Waymo开放运动数据集,支持多目标交互运动预测,含570小时高质量标注。
Scott Ettinger, Shuyang Cheng, Benjamin Caine 等
UNISURF结合隐式表面与辐射场,实现无掩码高质量多视角重建。
Michael Oechsle, Songyou Peng, Andreas Geiger
提出TransFuser,通过注意力机制融合图像与LiDAR信息,提升自动驾驶性能,Collision减少76%。
Aditya Prakash, Kashyap Chitta, Andreas Geiger
提出CLIPScore,无需参考图像描述即可自动评估,最高相关性达74%。
Jack Hessel, Ari Holtzman, Maxwell Forbes 等
提出GridToPix,利用格子世界训练终点奖励策略,显著提升Embodied AI任务表现。
Unnat Jain, Iou-Jen Liu, Svetlana Lazebnik 等
通过跨域距离一致性损失和锚点策略,解决少样本图像生成中的过拟合问题。
Utkarsh Ojha, Yijun Li, Jingwan Lu 等
ReCo在语义分割中引入区域对比学习,极少标注即可实现高质量分割。
Shikun Liu, Shuaifeng Zhi, Edward Johns 等
提出了一种新的表面卷积运算器Field Convolution,提升了几何处理任务的准确率。
Thomas W. Mitchel, Vladimir G. Kim, Michael Kazhdan
提出Point-Voxel Diffusion (PVD),结合扩散模型与点体混合表示,实现高保真3D形状生成与多模态补全。
Linqi Zhou, Yilun Du, Jiajun Wu
GPV-1以共享视觉语言架构统一多任务,在COCO上VQA达62.5、CIDEr-D达1.023。
Tanmay Gupta, Amita Kamath, Aniruddha Kembhavi 等