排序: 最新 热门 引用
cs.CV 2310.06773

Uni3D: Exploring Unified 3D Representation at Scale

Uni3D利用端到端预训练的2D ViT模型,规模达10亿参数,实现3D点云与图像文本对齐,显著提升多任务性能。

Junsheng Zhou, Jinsheng Wang, Baorui Ma 等

2023-10-11 37
cs.CV 2310.01415

GPT-Driver: Learning to Drive with GPT

GPT-Driver利用GPT-3.5将运动规划转化为语言模型,实现在nuScenes数据集上优异表现,误差仅0.84米。

Jiageng Mao, Yuxi Qian, Junjie Ye 等

2023-10-03 467 引用 37
cs.CV 2309.17444

LLM-grounded Video Diffusion Models

LVD利用大语言模型生成动态场景布局,结合无训练指导的扩散模型实现高质量视频生成。

Long Lian, Baifeng Shi, Adam Yala 等

2023-09-30 33