Real-time Deep Dynamic Characters
提出基于深度学习的实时动态3D人体模型,利用弱监督学习实现高细节的形状、运动和动态纹理。
Marc Habermann, Lingjie Liu, Weipeng Xu 等
提出基于深度学习的实时动态3D人体模型,利用弱监督学习实现高细节的形状、运动和动态纹理。
Marc Habermann, Lingjie Liu, Weipeng Xu 等
基于“世界在轨”假设的模型驱动自主驾驶方法,利用预录日志实现25%性能提升,数据量减少40倍。
Dian Chen, Vladlen Koltun, Philipp Krähenbühl
本文通过扩展XLM-R模型至3.5B和10.7B参数,显著提升跨语理解性能,超越前沿模型。
Naman Goyal, Jingfei Du, Myle Ott 等
GODIVA用三维稀疏注意力+VQ-VAE,在Howto100M上实现开放域文本生成视频,RM达93.48。
Chenfei Wu, Lun Huang, Qianxi Zhang 等
提出基于层状神经表示的可编辑大规模动态场景自由视点视频生成方法,采用ST-NeRF实现空间-时间一致性。
Jiakai Zhang, Xinhang Liu, Xinyi Ye 等
提出P3M-10k数据集和P3M-Net模型,实现隐私保护肖像抠图,面向无脸识别场景。
Jizhizi Li, Sihan Ma, Jing Zhang 等
ViLD通过视觉和语言知识蒸馏,实现了基于文本描述的开放词汇目标检测,达成16.1 mask AP_r。
Xiuye Gu, Tsung-Yi Lin, Weicheng Kuo 等
提出8个奖励函数的检验方法,揭示自主驾驶奖励设计中的普遍缺陷。
W. Bradley Knox, Alessandro Allievi, Holger Banzhaf 等
提出一种利用密集相关体积估计RGB图像对极端旋转的方法,成功处理无重叠图像。
Ruojin Cai, Bharath Hariharan, Noah Snavely 等
提出FRANK基准,基于语义与语篇错误分类,评估抽象摘要的事实一致性。
Artidoro Pagnoni, Vidhisha Balachandran, Yulia Tsvetkov
MDETR以文本调制检测,凭1.3M图文对实现开放词汇视觉定位。
Aishwarya Kamath, Mannat Singh, Yann LeCun 等
提出InfographicVQA数据集,结合Transformer模型实现对信息图的多模态理解,评估表现较差。
Minesh Mathew, Viraj Bagal, Rubèn Pérez Tito 等
提出基于重要采样的PINNs训练加速方法,显著提升收敛速度和效率。
Mohammad Amin Nabian, Rini Jasmine Gladstone, Hadi Meidani
提出DeepImpact,通过语义影响评分提升倒排索引效率与效果,提升17%。
Antonio Mallia, Omar Khattab, Nicola Tonellotto 等
提出基于时空特征聚合的深度视频抠像框架,显著优于传统方法。
Yanan Sun, Guanzhi Wang, Qiao Gu 等
通过多任务学习实现无重置强化学习,成功学习复杂灵巧操作。
Abhishek Gupta, Justin Yu, Tony Z. Zhao 等
提出H2O数据集及基于图卷积网络的双手与物体3D姿态与交互识别方法。
Taein Kwon, Bugra Tekin, Jan Stuhmer 等
提出可迁移的深度学习框架,结合GFNet与Mosaic预测器,解决未见域的偏微分方程。
Hengjie Wang, Robert Planas, Aparna Chandramowlishwaran 等
提出数据推断方法,利用模型对训练数据的记忆特性,验证模型是否窃取原始数据,准确率超过99%。
Pratyush Maini, Mohammad Yaghini, Nicolas Papernot
FIERY模型基于单目摄像头实现鸟瞰图未来实例预测,准确率优于基线,支持多模态轨迹预测。
Anthony Hu, Zak Murez, Nikhil Mohan 等