排序: 最新 热门 引用
cs.CV 2106.13230

Video Swin Transformer

提出Video Swin Transformer,利用局部注意力机制,实现视频识别准确率84.9%(Kinetics-400),模型参数仅28.2M。

Ze Liu, Jia Ning, Yue Cao 等

2021-06-25 47
cs.CV 2106.05974

Scaling Vision with Sparse Mixture of Experts

提出稀疏混合专家Vision MoE,匹配最先进密集模型性能,参数达150亿,推理计算减半。

Carlos Riquelme, Joan Puigcerver, Basil Mustafa 等

2021-06-11 34
cs.CV 2105.01794

Real-time Deep Dynamic Characters

提出基于深度学习的实时动态3D人体模型,利用弱监督学习实现高细节的形状、运动和动态纹理。

Marc Habermann, Lingjie Liu, Weipeng Xu 等

2021-05-05 31