MODNet: Real-Time Trimap-Free Portrait Matting via Objective Decomposition
MODNet为实时无Trimap人像抠图,采用目标分解优化,速度达67fps。
Zhanghan Ke, Jiayu Sun, Kaican Li 等
MODNet为实时无Trimap人像抠图,采用目标分解优化,速度达67fps。
Zhanghan Ke, Jiayu Sun, Kaican Li 等
使用局部深度隐函数进行语义场景补全,超越KITTI基准的几何IoU。
Christoph B. Rist, David Emmerichs, Markus Enzweiler 等
利用卷积自编码器和DBSCAN检测并剔除超标标签,提升数据质量。
Yunhao Yang, Andrew Whinston
Hypersim利用艺术家创作的高逼真场景,生成77,400张带详细像素标签的室内场景图,显著提升场景理解性能。
Mike Roberts, Jason Ramapuram, Anurag Ranjan 等
Point Transformer利用多头注意力机制和SortNet实现点云的Permutation不变性,提取局部和全局特征。
Nico Engel, Vasileios Belagiannis, Klaus Dietmayer
结合RGB与点云数据,利用2D检测模型提升3D目标识别,基于nuScenes数据集实现多类别检测。
Yilin Wang, Jiayi Ye
提出Vision Transformer(ViT),直接对图像块进行自注意力,训练在大规模数据集上超越ResNet。
Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov 等
SCOP通过科学控制引入虚假特征,显著提升ResNet-101参数压缩率至57.8%,FLOPs减少60.2%,仅0.01%精度损失。
Yehui Tang, Yunhe Wang, Yixing Xu 等
提出基于自监督学习的几何特征发现框架,利用可解释注意机制实现车辆再识别,达成SOTA性能。
Ming Li, Xinming Huang, Ziming Zhang
提出RxR多语种VLN数据集,结合密集时空定位,显著提升多模态导航性能。
Alexander Ku, Peter Anderson, Roma Patel 等
NeRF++通过倒球面参数化和双重场景建模,提升大规模无界场景的视图合成精度。
Kai Zhang, Gernot Riegler, Noah Snavely 等
提出AdAGeo结合注意力机制与少样本无监督域适应,提升跨域视觉场所识别性能,使用仅5张目标图像实现13%以上提升。
Gabriele Moreno Berton, Valerio Paolicelli, Carlo Masone 等
提出GRF,基于多视图像学习连续3D辐射场,实现高质量场景重建。
Alex Trevithick, Bo Yang
提出基于字素的标注方案,创建了包含411k样本的孟加拉文手写字素数据集。
Samiul Alam, Tahsin Reasat, Asif Shahriyar Sushmit 等
本文提出基于符合预测的置信集方法,利用正则化改进了模型尾部概率校准,显著缩小预测集规模。
Anastasios Angelopoulos, Stephen Bates, Jitendra Malik 等
PP-OCR是一种超轻量级OCR系统,中文模型仅3.5M,识别6622字符。
Yuning Du, Chenxia Li, Ruoyu Guo 等
提出3D-FUTURE,包含5,000室内场景,近万个高细节3D家具模型,支持多任务研究。
Huan Fu, Rongfei Jia, Lin Gao 等
提出网络解剖框架,系统识别深度网络中单元语义,揭示对象检测与生成机制。
David Bau, Jun-Yan Zhu, Hendrik Strobelt 等
AB3DMOT采用3D卡尔曼滤波和匈牙利算法,实现在KITTI数据集上的速度达207.4 FPS,性能优异。
Xinshuo Weng, Jianren Wang, David Held 等
提出Lift-Splat-Shoot架构,利用多视角图像隐式反投影到3D,提升场景理解与运动规划能力。
Jonah Philion, Sanja Fidler