Holistic++ Scene Understanding: Single-view 3D Holistic Scene Parsing and Human Pose Estimation with Human-Object Interaction and Physical Commonsense
提出Holistic++框架,通过MCMC优化单视图图像中的3D场景解析和人体姿态估计,显著提升性能。
Yixin Chen, Siyuan Huang, Tao Yuan 等
提出Holistic++框架,通过MCMC优化单视图图像中的3D场景解析和人体姿态估计,显著提升性能。
Yixin Chen, Siyuan Huang, Tao Yuan 等
提出PlotQA,包含2.89千万问答对,解决真实场景中图表的复杂推理问题。
Nitesh Methani, Pritha Ganguly, Mitesh M. Khapra 等
提出SPair-71k数据集,包含7万多对多样视角变换的语义匹配图像,推动语义对应研究。
Juhong Min, Jongmin Lee, Jean Ponce 等
PROX方法利用3D场景约束显著降低3D人体姿态估计误差。
Mohamed Hassan, Vasileios Choutas, Dimitrios Tzionas 等
提出分层强化学习框架,通过子任务控制器和元控制器实现人类坐椅动作合成,成功率达31.61%。
Yu-Wei Chao, Jimei Yang, Weifeng Chen 等
AutoGAN通过NAS优化GAN架构,在CIFAR-10上实现12.42的FID分数。
Xinyu Gong, Shiyu Chang, Yifan Jiang 等
Pixel2Mesh++通过多视角变形网络(MDN)结合图卷积,利用多图像信息生成高质量3D网格,显著优于单视图方法。
Chao Wen, Yinda Zhang, Zhuwen Li 等
提出MIND模块结合深度强化学习提升EmbodiedQA的环境理解与规划能力。
Juncheng Li, Siliang Tang, Fei Wu 等
DIODE利用激光扫描实现室内外高密度深度图,突破单域局限。
Igor Vasiljevic, Nick Kolkin, Shanyi Zhang 等
提出Structured3D数据集,自动提取多结构信息,提升室内场景3D理解性能。
Jia Zheng, Junfei Zhang, Jing Li 等
提出输出与特征蒸馏及冻结编码器,在VOC上将增量分割mIoU提升至71.6%。
Umberto Michieli, Pietro Zanuttigh
提出InterFaceGAN,通过线性变换解码潜在空间,实现面部属性的可控编辑。
Yujun Shen, Jinjin Gu, Xiaoou Tang 等
提出多尺度局部平面引导层,显著提升单目深度估计精度,在NYU Depth V2和KITTI数据集上超越现有方法。
Jin Han Lee, Myung-Kyu Han, Dong Wook Ko 等
提出基于人类标注的时间打乱方法,识别需要时间信息的动作类别,构建“时间类别”数据集。
Laura Sevilla-Lara, Shengxin Zha, Zhicheng Yan 等
提出Gated-SCNN,结合门控机制的双流网络,提升城市街景分割的边界和小物体识别,mIoU提升2%,F-score提升4%。
Towaki Takikawa, David Acuna, Varun Jampani 等
提出基于多数据集混合的鲁棒单目深度估计方法,利用尺度和偏移不变损失,在五个不同数据集上实现零样本跨数据集迁移,显著优于现有方法。
René Ranftl, Katrin Lasinger, David Hafner 等
提出LV-Net,结合两流金字塔和嵌套编码器-解码器,专为光学遥感图像显著目标检测。
Chongyi Li, Runmin Cong, Junhui Hou 等
本研究提出基于RGBD的多模态端到端自主驾驶模型,早融合方案优于单一模态。
Yi Xiao, Felipe Codevilla, Akhil Gurram 等
提出场景表示网络(SRNs),通过连续函数实现3D几何与外观的端到端训练,无需深度标签。
Vincent Sitzmann, Michael Zollhöfer, Gordon Wetzstein
3D-BoNet直接预测点云3D边界框和实例掩码,效率提升10倍,超越ScanNet和S3DIS基准。
Bo Yang, Jianan Wang, Ronald Clark 等