Cascade R-CNN: Delving into High Quality Object Detection
提出Cascade R-CNN,通过多阶段训练提升高质量目标检测性能,显著优于单模型方法。
Zhaowei Cai, Nuno Vasconcelos
提出Cascade R-CNN,通过多阶段训练提升高质量目标检测性能,显著优于单模型方法。
Zhaowei Cai, Nuno Vasconcelos
提出图蒸馏方法,利用特权模态提升动作检测性能,在NTU RGB+D和PKU-MMD上表现优异。
Zelun Luo, Jun-Ting Hsieh, Lu Jiang 等
研究表明,使用Kinetics数据集训练的深度3D CNNs可重现2D CNNs和ImageNet的成功,ResNeXt-101在Kinetics上达78.4%准确率。
Kensho Hara, Hirokatsu Kataoka, Yutaka Satoh
ARTNet通过SMART模块在Kinetics等数据集上实现视频分类性能提升。
Limin Wang, Wei Li, Wen Li 等
提出基于B样条的SplineCNN,用连续核函数实现高效几何深度学习。
Matthias Fey, Jan Eric Lenssen, Frank Weichert 等
提出Temporal Relation Network(TRN)模型,能在视频多尺度时间依赖中实现有效推理,显著提升动作识别性能。
Bolei Zhou, Alex Andonian, Aude Oliva 等
UnFlow通过双向Census损失实现无监督光流学习,在KITTI上超越有监督方法。
Simon Meister, Junhwa Hur, Stefan Roth
提出近似梯度的神经网格渲染器,实现单图3D网格重建与编辑。
Hiroharu Kato, Yoshitaka Ushiku, Tatsuya Harada
提出基于Matterport3D的视觉-语言导航框架,使用Seq2Seq模型实现室内自然语言指令理解。
Peter Anderson, Qi Wu, Damien Teney 等
数学证明感知-失真权衡,GAN接近边界,提出新评价方法。
Yochai Blau, Tomer Michaeli
Relation Network(RN)用于少样学习,通过端到端训练学习深度距离度量,显著提升识别性能。
Flood Sung, Yongxin Yang, Li Zhang 等
提出了一种新的CNN架构,通过深度监督学习特征来提高单目密集重建的匹配精度。
Chamara Saroj Weerasekera, Ravi Garg, Yasir Latif 等
NISP通过传播最终响应的重要性评分,有效剪枝深度卷积网络,提升速度与压缩比,几乎无精度损失。
Ruichi Yu, Ang Li, Chun-Fu Chen 等
Grad-CAM++:通过二阶导数增强CNN可解释性,提升多目标定位和细节表现。
Aditya Chattopadhyay, Anirban Sarkar, Prantik Howlader 等
提出了深度拉普拉斯金字塔网络,实现快速准确的图像超分辨率。
Wei-Sheng Lai, Jia-Bin Huang, Narendra Ahuja 等
提出FiLM:特征线性调制,用于视觉推理,在CLEVR上误差降低至2.3%,显著优于现有方法。
Ethan Perez, Florian Strub, Harm de Vries 等
AffordanceNet采用端到端深度学习,结合目标检测与像素级意图识别,达成150ms/图的实时性能。
Thanh-Toan Do, Anh Nguyen, Ian Reid
Matterport3D利用高精度全景RGB-D数据,支持关键点匹配、视图重叠预测等多任务,包含10,800全景视图。
Angel Chang, Angela Dai, Thomas Funkhouser 等
卷积神经网络在医学图像分析中的应用综述,提升了分割和分类精度。
Syed Muhammad Anwar, Muhammad Majid, Adnan Qayyum 等
利用Sentinel-2多光谱影像,提出EuroSAT数据集,采用ResNet-50实现土地利用分类,准确率达98.57%。
Patrick Helber, Benjamin Bischke, Andreas Dengel 等