End-to-end Learning of Driving Models from Large-scale Video Datasets
提出基于FCN-LSTM的端到端驾驶模型,从大规模众包视频数据学习未来车辆运动分布。
Huazhe Xu, Yang Gao, Fisher Yu 等
提出基于FCN-LSTM的端到端驾驶模型,从大规模众包视频数据学习未来车辆运动分布。
Huazhe Xu, Yang Gao, Fisher Yu 等
DeepBach模型通过伪Gibbs采样生成巴赫风格的合唱音乐。
Gaëtan Hadjeres, François Pachet, Frank Nielsen
提出平衡VQA数据集,利用相似图像实现视觉理解提升,显著降低模型偏见。
Yash Goyal, Tejas Khot, Douglas Summers-Stay 等
EWC用Fisher约束重要权重,MNIST与Atari均显著缓解遗忘。
James Kirkpatrick, Razvan Pascanu, Neil Rabinowitz 等
SyncSpecCNN通过谱域参数化实现3D模型点分类,达成多项任务的最优性能。
Li Yi, Hao Su, Xingwen Guo 等
提出点集生成网络(PointSetNet)用于单图3D重建,采用Earth Mover's Distance和多样性采样,显著优于SOTA。
Haoqiang Fan, Hao Su, Leonidas Guibas
引入交互网络模型,基于图结构实现对象关系推理,能模拟复杂物理系统。
Peter W. Battaglia, Razvan Pascanu, Matthew Lai 等
3D-EPN结合形状合成技术,实现高精度3D形状补全。
Angela Dai, Charles Ruizhongtai Qi, Matthias Nießner
提出浅层残差网络架构,显著优于ResNet-200,提升图像识别与分割性能。
Zifeng Wu, Chunhua Shen, Anton van den Hengel
NewsQA采用四阶段数据采集,包含超10万问答对,强调推理能力,显著超越简单匹配。
Adam Trischler, Tong Wang, Xingdi Yuan 等
提出基于DenseNet的全卷积语义分割模型,参数少、性能优,达成CamVid和Gatech数据集的最佳结果。
Simon Jégou, Michal Drozdzal, David Vazquez 等
几何深度学习将卷积神经网络扩展到非欧几里得域,如图和流形。
Michael M. Bronstein, Joan Bruna, Yann LeCun 等
提出GuessWhat?!,结合视觉理解与多轮对话,构建150K游戏数据集,推动视觉问答与对话系统发展。
Harm de Vries, Florian Strub, Sarath Chandar 等
提出MV3D网络,通过融合LIDAR点云和RGB图像,实现KITTI数据集3D检测精度提升30%。
Xiaozhi Chen, Huimin Ma, Ji Wan 等
iCaRL结合邻近均值分类与样本回放,实现连续增量学习,显著缓解灾难性遗忘。
Sylvestre-Alvise Rebuffi, Alexander Kolesnikov, Georg Sperl 等
提出深度特征流框架,仅在稀疏关键帧进行卷积计算,显著提升视频识别速度。
Xizhou Zhu, Yuwen Xiong, Jifeng Dai 等
提出条件对抗网络(cGAN)用于图像转换,结合U-Net和PatchGAN,显著提升生成质量。
Phillip Isola, Jun-Yan Zhu, Tinghui Zhou 等
提出Temporal GAN(TGAN),结合时间生成器与图像生成器,利用奇异值裁剪实现稳定训练。
Masaki Saito, Eiichi Matsumoto, Shunta Saito
基于深度学习的海事视频目标检测与追踪,采用背景减除和多传感融合,提升精度达85%。
D. K. Prasad, D. Rajan, L. Rachmawati 等
DSAC通过可微化RANSAC提升相机定位精度7.3%。
Eric Brachmann, Alexander Krull, Sebastian Nowozin 等