Safety-Enhanced Autonomous Driving Using Interpretable Sensor Fusion Transformer
提出InterFuser,融合多模态多视角传感器,提升自主驾驶安全性,达CARLA排行榜第一。
Hao Shao, Letian Wang, RuoBing Chen 等
提出InterFuser,融合多模态多视角传感器,提升自主驾驶安全性,达CARLA排行榜第一。
Hao Shao, Letian Wang, RuoBing Chen 等
利用CLIP模型进行图像感知评估,取得高相关性。
Jianyi Wang, Kelvin C. K. Chan, Chen Change Loy
提出MHST模型结合多模态信息实现复杂文档理解,基于TAT-DQA数据集,显著优于基线。
Fengbin Zhu, Wenqiang Lei, Fuli Feng 等
提出基于4D卷积Swin Transformer的成本聚合网络VAT,用于少样本分割,显著提升性能。
Sunghwan Hong, Seokju Cho, Jisu Nam 等
提出RAVOS,结合深度运动建模,实现视频目标分割,达86.1 J&F,42 FPS。
Bo Miao, Mohammed Bennamoun, Yongsheng Gao 等
提出ST-P3端到端视觉自主驾驶模型,融合空间-时间特征,显著提升性能。
Shengchao Hu, Li Chen, Penghao Wu 等
XMem结合多层次记忆模型实现长视频目标分割,显著优于现有方法。
Ho Kei Cheng, Alexander G. Schwing
提出MSBReg,结合延迟参数嵌入、多视角、奇异值和布朗运动实现自监督学习,显著提升图像分类性能。
Suhong Moon, Domas Buracas, Seunghyun Park 等
提出双决策机制显著提升开放集全景分割的未知类别识别性能,达30%以上提升。
Hai-Ming Xu, Hao Chen, Lingqiao Liu 等
提出基于信息追踪的可解释预测模型,利用变分自编码器和MCMC选择最具信息量的查询,增强模型透明度。
Aditya Chattopadhyay, Stewart Slocum, Benjamin D. Haeffele 等
基于动态神经辐射场的单视点多模态软组织三维重建,显著优于现有方法。
Yuehao Wang, Yonghao Long, Siu Hin Fan 等
提出HO-GCN模型结合物体动态描述符,预测人-大物体交互未来状态,提升泛化能力。
Weilin Wan, Lei Yang, Lingjie Liu 等
BEVDepth通过显式深度监督显著提升多视角3D检测的深度估计,达60.9% NDS。
Yinhao Li, Zheng Ge, Guanyi Yu 等
提出VectorMapNet,端到端预测稀疏多段线实现高清地图向量化,超越SOTA 14.2 mAP。
Yicheng Liu, Tianyuan Yuan, Yue Wang 等
UNIFIED-IO通过将多模态输入输出序列化为离散词汇,实现一架构支持视觉、语言及多模态任务,训练于90余数据集。
Jiasen Lu, Christopher Clark, Rowan Zellers 等
提出结合轨迹规划与控制预测的端到端自动驾驶基线,单摄像头下在CARLA排行榜第一,性能优异。
Penghao Wu, Xiaosong Jia, Li Chen 等
RaMViD用随机掩码扩散,BAIR/Kinetics-600创SOTA。
Tobias Höppe, Arash Mehrjou, Stefan Bauer 等
提出PIDNet,结合PID控制思想,采用三分支架构实现实时语义分割,精度优于同速模型。
Jiacong Xu, Zixiang Xiong, Shankar P. Bhattacharyya
本文提出扩散模型设计空间框架,优化采样与训练,提升CIFAR-10 FID至1.79,采样速度快至35次评估。
Tero Karras, Miika Aittala, Timo Aila 等
TransFuser利用多尺度Transformer融合图像与LiDAR,显著提升复杂场景中的自主驾驶性能。
Kashyap Chitta, Aditya Prakash, Bernhard Jaeger 等