3D Shape Generation with Grid-based Implicit Functions
提出基于网格的隐函数GAN方法,显著提升3D形状生成质量。
Moritz Ibing, Isaak Lim, Leif Kobbelt
提出基于网格的隐函数GAN方法,显著提升3D形状生成质量。
Moritz Ibing, Isaak Lim, Leif Kobbelt
提出HDMapNet,基于摄像头和LiDAR的在线高精度地图构建框架,提升50%以上性能。
Qi Li, Yue Wang, Yilun Wang 等
提出了一种用于视觉Transformer的后训练量化算法,在ImageNet上使用DeiT-B模型实现了81.29%的Top-1准确率。
Zhenhua Liu, Yunhe Wang, Kai Han 等
提出Video Swin Transformer,利用局部注意力机制,实现视频识别准确率84.9%(Kinetics-400),模型参数仅28.2M。
Ze Liu, Jia Ning, Yue Cao 等
本综述分析了基于激光雷达和图像的3D目标检测算法,涵盖数据集、性能指标及未来方向。
Rui Qian, Xin Lai, Xirong Li
NeuS通过引入偏差无关的体积渲染和神经符号距离场实现高精度多视角场景重建,超越SOTA。
Peng Wang, Lingjie Liu, Yuan Liu 等
HR-NAS结合轻量级Transformer与多尺度搜索空间,优化高分辨率密集预测网络。
Mingyu Ding, Xiaochen Lian, Linjie Yang 等
提出稀疏混合专家Vision MoE,匹配最先进密集模型性能,参数达150亿,推理计算减半。
Carlos Riquelme, Joan Puigcerver, Basil Mustafa 等
SimpleView方法在ModelNet40上表现优异,参数量仅为PointNet++的一半。
Ankit Goyal, Hei Law, Bowei Liu 等
STCN以L2相似度提升记忆覆盖,在DAVIS达85.4 J&F、20.2 FPS。
Ho Kei Cheng, Yu-Wing Tai, Chi-Keung Tang
提出RobustNav框架,评估导航智能体在视觉和动力学腐蚀下的性能,发现性能显著下降,需进一步研究。
Prithvijit Chattopadhyay, Judy Hoffman, Roozbeh Mottaghi 等
利用预训练2D模型实现3D点云理解,通过权重复制和微调达成高性能。
Chenfeng Xu, Shijia Yang, Tomer Galanti 等
Patch Slimming按层删减冗余视觉块,使ViT-Ti在ImageNet上减少53.8% FLOPs,仅损失0.1%准确率。
Yehui Tang, Kai Han, Yunhe Wang 等
提出交叉伪监督(CPS)用于半监督语义分割,提升Cityscapes和PASCAL VOC 2012性能。
Xiaokang Chen, Yuhui Yuan, Gang Zeng 等
提出基于示例的开放集全景分割网络(EOPSN),在COCO数据集上实现未知类别识别,PQ达37.7%。
Jaedong Hwang, Seoung Wug Oh, Joon-Young Lee 等
提出NExT-QA,基于多任务视频问答,重点在因果与时间推理,模型表现不足,推动深层理解。
Junbin Xiao, Xindi Shang, Angela Yao 等
VPN++通过知识蒸馏结合RGB与3D姿态,提升日常活动识别速度与鲁棒性。
Srijan Das, Rui Dai, Di Yang 等
DCT-NeRF学轨迹场,稳态重建动态新视角
Chaoyang Wang, Ben Eckart, Simon Lucey 等
本研究揭示ProtoPNet在潜在空间相似性与输入空间差异导致的可解释性缺陷,实验显示噪声和JPEG压缩会误导模型。
Adrian Hoffmann, Claudio Fanconi, Rahul Rade 等
提出基于深度学习的实时动态3D人体模型,利用弱监督学习实现高细节的形状、运动和动态纹理。
Marc Habermann, Lingjie Liu, Weipeng Xu 等