Pix2Vox++: Multi-scale Context-aware 3D Object Reconstruction from Single and Multiple Images
Pix2Vox++利用多尺度上下文融合实现单多视角3D重建,准确率优于SOTA。
Haozhe Xie, Hongxun Yao, Shengping Zhang 等
Pix2Vox++利用多尺度上下文融合实现单多视角3D重建,准确率优于SOTA。
Haozhe Xie, Hongxun Yao, Shengping Zhang 等
提出CenterPoint,基于点的3D目标检测与追踪,单模型达65.5 NDS。
Tianwei Yin, Xingyi Zhou, Philipp Krähenbühl
BlazePose是一种轻量级卷积神经网络,用于移动设备实时人体姿态估计,输出33个关键点,帧率超30fps。
Valentin Bazarevsky, Ivan Grishchenko, Karthik Raveendran 等
提出SwAV无监督学习算法,通过对簇分配对比实现视觉特征学习,达成ImageNet 75.3%准确率。
Mathilde Caron, Ishan Misra, Julien Mairal 等
提出基于Transformer的视觉常识学习方法,提升场景图生成的鲁棒性和语义合理性。
Alireza Zareian, Zhecan Wang, Haoxuan You 等
提出自适应判别器增强机制,在有限数据下稳定训练GAN,FID从5.59降至2.42。
Tero Karras, Miika Aittala, Janne Hellsten 等
MeshWalker通过随机游走直接从三角网格学习3D形状,提升分类与语义分割性能。
Alon Lahav, Ayellet Tal
提出视觉Transformer(VT),用少量语义Token提升图像识别精度4.6-7点,减少FLOPs6.5倍。
Bichen Wu, Chenfeng Xu, Xiaoliang Dai 等
U²-Net采用双层嵌套U结构,无需预训练骨干,提升多尺度特征捕获,达成优异的SOD性能。
Xuebin Qin, Zichen Zhang, Chenyang Huang 等
提出基于对抗训练的在线监测器ATOM,有效预测3D人体姿态网络GraphCMR的输出误差,提升检测准确率。
Arjun Gupta, Luca Carlone
提出原型对比学习(PCL),结合聚类与对比损失,显著提升低资源迁移性能。
Junnan Li, Pan Zhou, Caiming Xiong 等
CoReNet通过单张RGB图像实现多物体3D场景重建,提升精度。
Stefan Popov, Pablo Bauszat, Vittorio Ferrari
RTCnet融合雷达目标与3D雷达立方体,单帧检测F1达0.70/0.56。
Andras Palffy, Jiaao Dong, Julian F. P. Kooij 等
提出基于CNN和RNN的深度伪造检测方法,在DFDC数据集上获得优异表现。
Daniel Mas Montserrat, Hanxiang Hao, S. K. Yarlagadda 等
提出单视图多层平面图像(MPI)生成方法,训练依赖尺度不变的视图合成,取得优异深度估计和新视点合成效果。
Richard Tucker, Noah Snavely
深度学习中的捷径学习问题,影响模型在复杂场景中的泛化能力。
Robert Geirhos, Jörn-Henrik Jacobsen, Claudio Michaelis 等
提出DISTS模型,结合结构与纹理相似性,显著提升图像质量评估的对纹理重采样的容忍度。
Keyan Ding, Kede Ma, Shiqi Wang 等
TVOS以时空特征传播标签,DAVIS 2017验证集J&F达72.3%,速度37帧/秒。
Yizhuo Zhang, Zhirong Wu, Houwen Peng 等
提出基于PointNet和GCN的3D场景图回归方法,构建了含丰富语义关系的3D场景图数据集3DSSG。
Johanna Wald, Helisa Dhamo, Nassir Navab 等
提出连续环境中的视觉-语言导航(VLN-CE)任务,摒弃传统导航图假设,利用深度学习模型实现长距离低级动作控制,显著降低性能指标。
Jacob Krantz, Erik Wijmans, Arjun Majumdar 等