Free-form Video Inpainting with 3D Gated Convolution and Temporal PatchGAN
本文提出基于3D门控卷积和时序PatchGAN的自由形态视频修复模型,显著提升了视频的空间细节和时间一致性。
Ya-Liang Chang, Zhe Yu Liu, Kuan-Ying Lee 等
本文提出基于3D门控卷积和时序PatchGAN的自由形态视频修复模型,显著提升了视频的空间细节和时间一致性。
Ya-Liang Chang, Zhe Yu Liu, Kuan-Ying Lee 等
提出Nucleus Sampling,结合概率分布尾部截断,有效改善神经文本生成的多样性与连贯性。
Ari Holtzman, Jan Buys, Li Du 等
PullNet结合迭代检索与图卷积网络,实现多跳问答,显著优于先前方法。
Haitian Sun, Tania Bedrax-Weiss, William W. Cohen
Social Ways以Info-GAN生成多模态轨迹,在ETH上达0.39/0.64的ADE/FDE。
Javad Amirian, Jean-Bernard Hayet, Julien Pettre
提出深层影响扩散模型DiffNet,模拟社交网络中递归影响传播,提升推荐性能13%以上。
Le Wu, Peijie Sun, Yanjie Fu 等
行为克隆在复杂自动驾驶场景中表现优异,但存在泛化和数据偏差等限制。
Felipe Codevilla, Eder Santana, Antonio M. López 等
提出TextVQA数据集与LoRRA模型,实现图像文本理解与推理,显著优于SOTA。
Amanpreet Singh, Vivek Natarajan, Meet Shah 等
SpecAugment通过时间扭曲和频率掩码显著提升端到端语音识别性能,达成LibriSpeech 6.8% WER。
Daniel S. Park, William Chan, Yu Zhang 等
KPConv提出灵活可变形的点云卷积,在ModelNet40上达到92.9%准确率。
Hugues Thomas, Charles R. Qi, Jean-Emmanuel Deschaud 等
提出基于稀疏张量的4D时空卷积网络,显著提升3D视频感知性能。
Christopher Choy, JunYoung Gwak, Silvio Savarese
提出基于事件相机的深度估计算法,提升精度达85%,实现微秒级实时处理。
Guillermo Gallego, Tobi Delbruck, Garrick Orchard 等
提出基于递归网络的事件转视频方法,提升图像质量超20%,实现事件数据的自然视频重建。
Henri Rebecq, René Ranftl, Vladlen Koltun 等
SAGPool通过自注意力机制提升图分类性能,在D&D数据集上提高了5%。
Junhyun Lee, Inyeop Lee, Jaewoo Kang
ContactDB通过热成像分析和预测抓握接触,包含3750个3D网格和375K帧RGB-D+热图像。
Samarth Brahmbhatt, Cusuh Ham, Charles C. Kemp 等
BERT4Rec利用双向Transformer和Cloze任务建模用户行为序列,显著优于SOTA模型。
Fei Sun, Jun Liu, Jian Wu 等
提出GA-Net,通过半全局和局部引导聚合层,显著提升立体匹配精度,减少计算成本。
Feihu Zhang, Victor Prisacariu, Ruigang Yang 等
使用3D形变模型和生成对抗网络的面部去遮挡方法,提升了面部重建的准确性。
Xiaowei Yuan, In Kyu Park
提出Graph Wavelet Neural Network (GWNN),通过图小波变换实现高效图卷积,在Cora等数据集上提升准确率。
Bingbing Xu, Huawei Shen, Qi Cao 等
ObMan与可微接触损失实现RGB手物联合重建,并提升抓取物理质量。
Yana Hasson, Gül Varol, Dimitrios Tzionas 等
本研究提出序列到序列模型的成员推断攻击框架,实验证明模型在特定条件下泄露私有数据。
Sorami Hisamoto, Matt Post, Kevin Duh