MVF-Net: Multi-View 3D Face Morphable Model Regression
MVF-Net以多视图对齐约束回归3DMM,MICC最低误差达1.220。
Fanzi Wu, Linchao Bao, Yajing Chen 等
MVF-Net以多视图对齐约束回归3DMM,MICC最低误差达1.220。
Fanzi Wu, Linchao Bao, Yajing Chen 等
本研究提出深层GCN架构,借鉴残差、密集连接和空洞卷积,成功训练56层模型,点云语义分割性能提升3.7%。
Guohao Li, Matthias Müller, Ali Thabet 等
Fishyscapes基准测试评估城市驾驶语义分割中的异常检测,揭示现有方法的盲点。
Hermann Blum, Paul-Edouard Sarlin, Juan Nieto 等
VideoBERT结合视频与语音序列的双向建模,实现无监督高层语义理解。
Chen Sun, Austin Myers, Carl Vondrick 等
FCOS:无锚点一阶段检测器,单模型AP达44.7%,结构简洁高效。
Zhi Tian, Chunhua Shen, Hao Chen 等
Habitat平台结合高性能模拟器与API,提升 embodied AI 在点目标导航中的表现,显示学习优于SLAM。
Manolis Savva, Abhishek Kadian, Oleksandr Maksymets 等
C2AE使用类条件自编码器进行开放集识别,在多个数据集上显著优于现有方法。
Poojan Oza, Vishal M Patel
HYPE以人类辨真错误率评估生成真实性;FFHQ上StyleGAN截断采样达27.6%。
Sharon Zhou, Mitchell L. Gordon, Ranjay Krishna 等
STM以时空记忆读取实现高效视频分割,DAVIS-2016达J=88.7。
Seoung Wug Oh, Joon-Young Lee, Ning Xu 等
提出Example Transfer Network (ETN),通过权重机制解决部分领域适配中的负迁移问题,在Office-31等基准数据集上取得SOTA表现。
Zhangjie Cao, Kaichao You, Mingsheng Long 等
RNAN以局部与非局部混合注意力提升复原,Urban100去噪σ=70达27.45 dB。
Yulun Zhang, Kunpeng Li, Kai Li 等
提出SPADE方法,通过空间自适应归一化提高语义图像合成的视觉逼真度和布局对齐。
Taesung Park, Ming-Yu Liu, Ting-Chun Wang 等
选择性核网络(SKNet)通过动态选择机制提升CNN性能,在ImageNet上表现优于现有模型。
Xiang Li, Wenhai Wang, Xiaolin Hu 等
提出一种3D姿态生成模型,预测室内环境中的人类姿态,优于现有方法。
Xueting Li, Sifei Liu, Kihwan Kim 等
Spiking-YOLO通过脉冲神经网络实现节能的目标检测,能耗比Tiny YOLO低280倍。
Seijoon Kim, Seongsik Park, Byunggook Na 等
提出基于分组相关的立体匹配网络(GwcNet),利用分组相关构建高效成本体,提升精度与效率。
Xiaoyang Guo, Kai Yang, Wukui Yang 等
提出DDR网络,提升3D语义场景完成精度5.9%,参数减少79%。
Jie Li, Yu Liu, Dong Gong 等
提出基于门控循环单元(GRU)的递归多视角立体网络(R-MVSNet),显著降低高分辨率场景的内存消耗。
Yao Yao, Zixin Luo, Shiwei Li 等
提出一种基于自监督学习的单目内窥深度估计方法,无需先验模型或标注,利用SfM稀疏监督实现亚毫米精度。
Xingtong Liu, Ayushi Sinha, Masaru Ishii 等
提出BigEarthNet,包含590,326多标签Sentinel-2图像,显著优于ImageNet预训练模型。
Gencer Sumbul, Marcela Charfuelan, Begüm Demir 等