Do We Train on Test Data? Purging CIFAR of Near-Duplicates
Barz与Denzler用CNN检索清除近重复,发现CIFAR测试准确率被高估约9%–14%。
Björn Barz, Joachim Denzler
Barz与Denzler用CNN检索清除近重复,发现CIFAR测试准确率被高估约9%–14%。
Björn Barz, Joachim Denzler
利用FaceForensics++数据集和深度学习方法,提出面部伪造检测新框架,准确率超越人类。
Andreas Rössler, Davide Cozzolino, Luisa Verdoliva 等
MONet利用端到端VAE和循环注意力实现无监督场景分解,能识别物体与背景。
Christopher P. Burgess, Loic Matthey, Nicholas Watters 等
提出混合任务级联(HTC)框架,通过多任务交互和空间上下文增强,实现MSCOCO上38.4%的Mask AP,优于传统方法。
Kai Chen, Jiangmiao Pang, Jiaqi Wang 等
DeepSDF通过学习连续Signed Distance Functions实现高质量3D形状表示与插值。
Jeong Joon Park, Peter Florence, Julian Straub 等
UPSNet通过像素分类实现全景分割,在Cityscapes上达到最先进性能。
Yuwen Xiong, Renjie Liao, Hengshuang Zhao 等
提出Panoptic FPN,将Mask R-CNN扩展为单一网络,兼顾实例与语义分割,性能优异。
Alexander Kirillov, Ross Girshick, Kaiming He 等
通过图像域到曲面的覆盖映射,快速将CNN模型应用于球面信号学习,取得领先性能。
Niv Haim, Nimrod Segol, Heli Ben-Hamu 等
提出pseudo-LiDAR,将图像深度映射转化为点云,显著提升KITTI数据集中基于图像的3D目标检测准确率,从22%提升至74%。
Yan Wang, Wei-Lun Chao, Divyansh Garg 等
CROSR方法通过分类和重构学习提升开放集识别,超越现有模型。
Ryota Yoshihashi, Wen Shao, Rei Kawakami 等
PointRCNN采用两阶段策略,直接从点云生成高质量3D目标框,显著优于现有方法。
Shaoshuai Shi, Xiaogang Wang, Hongsheng Li
PartNet:包含573,585个细粒度层级3D部件,推动3D形状理解。
Kaichun Mo, Shilin Zhu, Angel X. Chang 等
提出基于Transformer的动作识别模型,利用高分辨率人脸手部关注实现25.0%的mAP。
Rohit Girdhar, João Carreira, Carl Doersch 等
提出场景图自动编码器(SGAE),结合语言偏置提升图像描述质量,单模型达127.8 CIDEr-D。
Xu Yang, Kaihua Tang, Hanwang Zhang 等
提出基于 attraction field 的区域分割表示,用深度卷积网络实现鲁棒线段检测,性能提升4.5%。
Nan Xue, Song Bai, Fudong Wang 等
提出M3SDA方法,通过动态对齐特征分布的矩来实现多源域适应,在DomainNet数据集上验证有效。
Xingchao Peng, Qinxun Bai, Xide Xia 等
使用子尺度像素网络和多维放大生成高保真图像,在CelebAHQ和ImageNet上实现最先进的结果。
Jacob Menick, Nal Kalchbrenner
提出Touchdown任务,结合Google街景实现自然语言导航与空间推理,数据集含9326例指令。
Howard Chen, Alane Suhr, Dipendra Misra 等
利用扩张时序卷积和半监督训练实现视频中3D人体姿态估计,误差减少11%。
Dario Pavllo, Christoph Feichtenhofer, David Grangier 等
提出MeshNet,基于面单元学习3D网格形状表征,解决网格复杂性与不规则性。
Yutong Feng, Yifan Feng, Haoxuan You 等