The Kinetics Human Action Video Dataset
提出Kinetics数据集,包含400类人类动作,采用深度学习训练,揭示偏差与性能基线。
Will Kay, Joao Carreira, Karen Simonyan 等
提出Kinetics数据集,包含400类人类动作,采用深度学习训练,揭示偏差与性能基线。
Will Kay, Joao Carreira, Karen Simonyan 等
提出一种自监督Siamese学习框架,用于机器人手术中的深度估计,Siamese网络在SSI上达到0.604。
Menglong Ye, Edward Johns, Ankur Handa 等
研究比较人类与深度学习在视觉失真下的识别性能,发现DNN在失真图像上表现不如人类。
Samuel Dodge, Lina Karam
提出ChestX-ray8数据库,结合弱监督多标签分类与定位实现肺部疾病自动识别。
Xiaosong Wang, Yifan Peng, Le Lu 等
提出CTRL模型实现基于自然语言的动作时间定位,显著优于现有方法,提升IoU和召回率。
Jiyang Gao, Chen Sun, Zhenheng Yang 等
提出密集事件字幕模型,结合多尺度提议和上下文信息,显著提升视频事件检测与描述效果。
Ranjay Krishna, Kenji Hata, Frederic Ren 等
提出一种从视频中无监督学习深度和自运动的方法,在KITTI数据集上实现与监督方法相当的性能。
Tinghui Zhou, Matthew Brown, Noah Snavely 等
提出残差注意力网络,在CIFAR-10上错误率3.90%,提升0.6%准确率。
Fei Wang, Mengqing Jiang, Chen Qian 等
提出可微分光线一致性(DRC)用于单视图3D重建,结合多视图监督,提升模型性能。
Shubham Tulsiani, Tinghui Zhou, Alexei A. Efros 等
Network Dissection用Broden与IoU量化CNN单元语义;随机旋转使可解释检测器减少80%。
David Bau, Bolei Zhou, Aditya Khosla 等
基于深度可分离卷积的MobileNets模型,通过宽度和分辨率调节实现高效轻量化,达到ImageNet准确率70.6%,参数4.2M。
Andrew G. Howard, Menglong Zhu, Bo Chen 等
AnchorNet:弱监督学习几何敏感特征,提升语义匹配性能。
David Novotny, Diane Larlus, Andrea Vedaldi
Soft-NMS通过分数衰减优化目标检测,提升mAP达1.7%,无需额外训练。
Navaneeth Bodla, Bharat Singh, Rama Chellappa 等
IRCNN以HQS嵌入CNN去噪先验,在BSD68上σ=25达29.15 dB,并统一支持去模糊与超分辨率。
Kai Zhang, Wangmeng Zuo, Shuhang Gu 等
提出基于动态实例网络的像素级实例分割方法,显著提升高IoU阈值下的性能。
Anurag Arnab, Philip H. S Torr
提出了一种结合三元组模型和全局结构的深度度量学习方法,在CUB-200-2011和Cars196数据集上取得了新突破。
Ben Harwood, Vijay Kumar B G, Gustavo Carneiro 等
提出分层表面预测框架(HSP),实现256x256x256高分辨率体素网格预测。
Christian Häne, Shubham Tulsiani, Jitendra Malik
提出ProcNets模型,基于大规模YouCook2数据集,实现无需标签的长视频程序段自动划分,显著优于基线。
Luowei Zhou, Chenliang Xu, Jason J. Corso
结合深度外观特征的SORT,显著降低45%的身份切换,提升长时遮挡追踪能力。
Nicolai Wojke, Alex Bewley, Dietrich Paulus
提出一种基于深度学习的图像抠图算法,显著提升复杂场景下的α通道预测精度。
Ning Xu, Brian Price, Scott Cohen 等