CLOTH3D: Clothed 3D Humans
提出CLOTH3D数据集与GCVAE模型,模拟多样化3D服装动态。
Hugo Bertiche, Meysam Madadi, Sergio Escalera
提出CLOTH3D数据集与GCVAE模型,模拟多样化3D服装动态。
Hugo Bertiche, Meysam Madadi, Sergio Escalera
StarGAN v2在多个域上实现多样化图像合成,显著优于基线。
Yunjey Choi, Youngjung Uh, Jaejun Yoo 等
ALFRED基准通过25k指令和互动环境,挑战复杂家庭任务的视觉-语言理解。
Mohit Shridhar, Jesse Thomason, Daniel Gordon 等
通过重设计归一化和正向渐进训练,显著提升StyleGAN图像质量,减少水滴状伪影,模型更易逆向。
Tero Karras, Samuli Laine, Miika Aittala 等
PQ-NET通过序列化部件生成3D形状,支持自动编码、插值和单视图重建。
Rundi Wu, Yixin Zhuang, Kai Xu 等
Panoptic-DeepLab: 一种简单、强大且快速的全景分割基线,Cityscapes上PQ达65.5%。
Bowen Cheng, Maxwell D. Collins, Yukun Zhu 等
提出BlendedMVS数据集,结合3D重建与图像融合,提升多视Stereo模型泛化能力。
Yao Yao, Zixin Luo, Shiwei Li 等
提出了一种基于卷积神经网络的主动学习方法,显著提高了行人检测精度。
Hamed H. Aghdam, Abel Gonzalez-Garcia, Joost van de Weijer 等
使用无标签数据进行深度主动学习,提升图像分类准确率。
Oriane Siméoni, Mateusz Budnik, Yannis Avrithis 等
提出Momentum Contrast (MoCo),通过动态字典和动量编码实现无监督视觉表征,在线训练中达到优异性能。
Kaiming He, Haoqi Fan, Yuxin Wu 等
EVF通过快速编码观察轨迹实现新对象视觉动态的快速适应,显著降低预测误差。
Lin Yen-Chen, Maria Bauza, Phillip Isola
提出DD-PPO,分布式强化学习方法,实现128GPU近线性扩展,训练25亿步,几乎解决点目标导航任务。
Erik Wijmans, Abhishek Kadian, Ari Morcos 等
本研究提出解耦表示学习与分类器的方法,利用简单采样实现长尾识别,超越复杂模型,ImageNet-LT等数据集表现优异。
Bingyi Kang, Saining Xie, Marcus Rohrbach 等
DexPilot通过观察裸手实现23自由度机器人系统的低成本视觉遥操作。
Ankur Handa, Karl Van Wyk, Wei Yang 等
提出3D场景图结构,结合深度学习检测与多视角一致性,实现建筑空间的全景语义理解。
Iro Armeni, Zhi-Yang He, JunYoung Gwak 等
提出基于注意力机制的深度面部伪造检测方法,显著提升检测准确率。
Hao Dang, Feng Liu, Joel Stehouwer 等
提出一种基于双编码器的图像Matting方法,实现前景和Alpha同时估计,在合成与真实数据上均优异。
Qiqi Hou, Feng Liu
提出动态图注意力网络(DGA)实现多步视觉推理,显著优于SOTA,支持复杂表达理解。
Sibei Yang, Guanbin Li, Yizhou Yu
FreiHAND数据集通过多视角和半自动标注方法提升3D手部姿态和形状估计的泛化能力。
Christian Zimmermann, Duygu Ceylan, Jimei Yang 等
提出一种端到端训练的多模态多目标追踪框架(mmMOT),融合点云与图像信息,提升鲁棒性与准确率。
Wenwei Zhang, Hui Zhou, Shuyang Sun 等