Free View Synthesis
提出一种基于深度学习的自由视角合成方法,无需场景优化,在Tanks与Temples等数据集上显著优于现有技术。
Gernot Riegler, Vladlen Koltun
提出一种基于深度学习的自由视角合成方法,无需场景优化,在Tanks与Temples等数据集上显著优于现有技术。
Gernot Riegler, Vladlen Koltun
TransNet V2以多尺度3D网络和帧相似度特征实现快速镜头切换检测,ClipShots F1达77.9%。
Tomáš Souček, Jakub Lokoč
I2L-MeshNet以1D lixel热图预测网格坐标,在Human3.6M上达55.7mm MPJPE。
Gyeongsik Moon, Kyoung Mu Lee
NeRF-W通过引入外观变化和瞬态对象建模,提升了在野外照片集中的场景重建精度,PSNR提升至29.08。
Ricardo Martin-Brualla, Noha Radwan, Mehdi S. M. Sajjadi 等
pSp框架通过StyleGAN实现图像到图像翻译,直接嵌入W+空间。
Elad Richardson, Yuval Alaluf, Or Patashnik 等
LEMMA数据集提供多视角学习多智能体多任务活动的基准,支持目标导向行为与时间推理研究。
Baoxiong Jia, Yixin Chen, Siyuan Huang 等
基于Lie代数的条件变分自编码器生成多样化3D人类动作序列。
Chuan Guo, Xinxin Zuo, Sen Wang 等
提出G-MC与G-TLS两种鲁棒估计框架,证明其在最坏情况下难以逼近,开发无调优算法并验证多机器人感知应用。
Pasquale Antonante, Vasileios Tzoumas, Heng Yang 等
Face2Face利用非刚性模型实现实时单目视频面部表情迁移,达到高逼真度。
Justus Thies, Michael Zollhöfer, Marc Stamminger 等
HITNet采用多分辨率层次迭代细化,无需3D卷积,实现实时高精度立体匹配。
Vladimir Tankovich, Christian Häne, Yinda Zhang 等
REC利用CNN-LSTM和图模型实现目标定位,关键数据包括RefCOCO+的准确率达75%。
Yanyuan Qiao, Chaorui Deng, Qi Wu
提出F3-Net利用频域线索实现面部伪造检测,低质量媒体性能显著优于SOTA。
Yuyang Qian, Guojun Yin, Lu Sheng 等
PyTorch3D通过模块化、差异化渲染器显著提升3D深度学习效率,处理异构数据。
Nikhila Ravi, Jeremy Reizenstein, David Novotny 等
提出eSL-Net,结合稀疏学习模型,实现高质量事件相机图像重建,性能提升7-12dB。
Bishan Wang, Jingwei He, Lei Yu 等
提出LayerPrune框架,通过层剪枝实现比滤波器剪枝更高的延迟优化,准确率保持在类似水平,优于手工设计架构。
Sara Elkerdawy, Mostafa Elhoushi, Abhineet Singh 等
提出三阶段框架结合场景上下文预测长期人类运动,显著提高准确性。
Zhe Cao, Hang Gao, Karttikeya Mangalam 等
Swapping Autoencoder通过结构和纹理编码实现高效图像编辑,提升了生成质量和速度。
Taesung Park, Jun-Yan Zhu, Oliver Wang 等
提出目标导向语义探索系统,结合显式语义地图与长远策略,显著提升未见环境中的目标导航性能。
Devendra Singh Chaplot, Dhiraj Gandhi, Abhinav Gupta 等
使用fSIM-NET预测3D物体功能,结合iGEN-NET生成交互场景。
Ruizhen Hu, Zihao Yan, Jingwen Zhang 等
提出无需校准的端到端3D目标追踪系统,基于深度学习和平面追踪实现移动设备实时追踪。
Adel Ahmadyan, Tingbo Hou, Jianing Wei 等