CTNeRF: Cross-Time Transformer for Dynamic Neural Radiance Field from Monocular Video
CTNeRF结合时频域特征聚合,提升动态场景单目视频的高质量新视角生成。
Xingyu Miao, Yang Bai, Haoran Duan 等
CTNeRF结合时频域特征聚合,提升动态场景单目视频的高质量新视角生成。
Xingyu Miao, Yang Bai, Haoran Duan 等
利用Marabou验证Airbus跑道目标分类DNN的鲁棒性,发现对噪声最敏感。
Yizhak Elboher, Raya Elsaleh, Omri Isac 等
提出GUESS框架,利用逐步抽象的多尺度骨架和级联潜扩散模型实现文本引导的人体动作生成。
Xuehao Gao, Yang Yang, Zhenyu Xie 等
VideoStudio利用LLM生成多场景脚本,结合扩散模型实现内容一致的多场景视频,显著优于SOTA方法。
Fuchen Long, Zhaofan Qiu, Ting Yao 等
LLoVi利用短时视觉描述和大模型实现长视频问答,达成50.3%准确率。
Ce Zhang, Taixi Lu, Md Mohaiminul Islam 等
Segment3D利用SAM自动生成高质量3D掩码,实现无标注的细粒度类别无关3D场景分割,性能优于传统方法。
Rui Huang, Songyou Peng, Ayca Takmaz 等
Q-Align通过离散文本等级训练LMMs,实现图像、视频质量评估的最新性能。
Haoning Wu, Zicheng Zhang, Weixia Zhang 等
提出DL3DV-10K大规模场景数据集,支持深度学习3D视觉,涵盖6510场景,含多样复杂属性。
Lu Ling, Yichen Sheng, Zhi Tu 等
VIEScore利用多模态大语言模型实现可解释的条件图像评估,最高相关性达0.4。
Max Ku, Dongfu Jiang, Cong Wei 等
InternVL将6亿参数视觉模型与大语言模型对齐,达成32项基准任务的SOTA性能。
Zhe Chen, Jiannan Wu, Wenhai Wang 等
DriveLM结合图结构视觉问答(GVQA)实现端到端自主驾驶,利用nuScenes和CARLA数据集,提升零样本泛化能力。
Chonghao Sima, Katrin Renz, Kashyap Chitta 等
VideoPoet使用解码器Transformer架构实现零样本视频生成,生成高质量动作。
Dan Kondratyuk, Lijun Yu, Xiuye Gu 等
基于GPT-4的多模态智能代理,能在50个任务中实现84.4%的成功率,突破系统后端限制。
Chi Zhang, Zhao Yang, Jiaxuan Liu 等
提出Align Your Gaussians(AYG),利用动态3D高斯点云与变形场实现文本引导的4D动态场景合成,达到了SOTA性能。
Huan Ling, Seung Wook Kim, Antonio Torralba 等
Emu2,37亿参数的多模态生成模型,显著提升零样本和少样本的多模态理解能力。
Quan Sun, Yufeng Cui, Xiaosong Zhang 等
pixelSplat是一种基于3D高斯原语的端到端模型,从图像对中高效重建可编辑的3D辐射场,突破了局部最小值问题,性能优于现有方法。
David Charatan, Sizhe Li, Andrea Tagliasacchi 等
Pose2Gaze结合卷积神经网络和时空图卷积网络,利用全身姿势预测眼睛凝视,平均误差提升24%。
Zhiming Hu, Jiahui Xu, Syn Schmitt 等
DriveMLM通过对齐多模态大模型与行为决策状态,实现闭环自主驾驶,提升CARLA Town05 Long性能。
Erfei Cui, Wenhai Wang, Zhiqi Li 等
提出基于3D高斯点云的可动画人类头像生成方法,训练仅30分钟,实时渲染超50FPS。
Zhiyin Qian, Shaofei Wang, Marko Mihajlovic 等
Holodeck利用GPT-4和Objaverse实现文本引导的3D环境自动生成,提升场景多样性与交互性。
Yue Yang, Fan-Yun Sun, Luca Weihs 等