Explain Me the Painting: Multi-Topic Knowledgeable Art Description Generation
提出多主题知识增强的艺术描述生成框架,结合ResNet、BERT和Wikipedia实现多角度详细描述。
Zechen Bai, Yuta Nakashima, Noa Garcia
提出多主题知识增强的艺术描述生成框架,结合ResNet、BERT和Wikipedia实现多角度详细描述。
Zechen Bai, Yuta Nakashima, Noa Garcia
提出NEAT,通过注意力映射实现端到端自主驾驶中的场景理解与路径预测。
Kashyap Chitta, Aditya Prakash, Andreas Geiger
提出CO3D数据集与NerFormer,推动真实场景3D重建与新视角合成。
Jeremy Reizenstein, Roman Shapovalov, Philipp Henzler 等
提出一种基于NeRF的自校准算法,显著提升相机参数估计精度和渲染质量。
Yoonwoo Jeong, Seokjun Ahn, Christopher Choy 等
提出基于对比学习的视频跨模态跨域适应框架,利用RGB与光流特征正则化,显著提升UCF-HMDB和EPIC-Kitchens性能。
Donghyun Kim, Yi-Hsuan Tsai, Bingbing Zhuang 等
DROID-SLAM结合深度学习与经典优化,基于Dense Bundle Adjustment实现高精度、鲁棒的单目、双目及RGB-D视觉SLAM。
Zachary Teed, Jia Deng
DenseTNT是一种端到端无锚点的轨迹预测模型,利用密集目标集实现最优性能,获Argoverse和Waymo第一。
Junru Gu, Chen Sun, Hang Zhao
PoinTr采用几何感知Transformer实现点云补全,显著优于SOTA方法。
Xumin Yu, Yongming Rao, Ziyi Wang 等
StructDepth利用室内结构正则化(曼哈顿模型和共面约束)提升单目深度估计性能。
Boying Li, Yuan Huang, Zeyu Liu 等
SAMP方法通过cVAE和A*算法实现场景感知的人体运动预测,生成多样化的动作风格。
Mohamed Hassan, Duygu Ceylan, Ruben Villegas 等
提出基于强化学习的自动驾驶专家“Roach”,在CARLA中超越Autopilot,提升端到端模仿学习性能。
Zhejun Zhang, Alexander Liniger, Dengxin Dai 等
提出基于边界重点的3D点云重建框架,显著优于现有方法。
Guiju Ping, Mahdi Abolfazli Esfahani, Han Wang
MUSIQ利用多尺度Transformer处理原生图像,超越CNN固定尺寸限制,达成SOTA性能。
Junjie Ke, Qifei Wang, Yilin Wang 等
提出Mobile-Former,结合MobileNet与Transformer,利用少量可学习Token实现高效全球交互。
Yinpeng Chen, Xiyang Dai, Dongdong Chen 等
提出MIMO-UNet,结合多尺度输入和多输出,提升单幅图像去模糊的速度与精度。
Sung-Jin Cho, Seo-Won Ji, Jun-Pyo Hong 等
通过局部对抗攻击学习,ObsNet在语义分割中实现快速准确的OOD检测。
Victor Besnier, Andrei Bursuc, David Picard 等
SDEdit利用扩散模型逆向去噪实现无需任务特定训练的图像引导合成与编辑,性能优于GAN方法。
Chenlin Meng, Yutong He, Yang Song 等
UIBert通过五个预训练任务在无标签数据上训练,提升UI理解准确率达9.26%。
Chongyang Bai, Xiaoxue Zang, Ying Xu 等
提出基于压缩视频的运动向量引导的半监督视频目标分割加速框架,最高实现3.5倍速度提升。
Kai Xu, Angela Yao
提出残差对数似然估计(RLE)提升人体姿态回归性能,MSCOCO提升12.4mAP。
Jiefeng Li, Siyuan Bian, Ailing Zeng 等