排序: 最新 热门 引用
cs.CV 2412.20206

Toward Visual Grounding: A Survey

综述视觉定位,分析新概念如基础预训练、多模态LLM等,提供全面研究方向。

Linhui Xiao, Xiaoshan Yang, Xiangyuan Lan 等

2024-12-29 36
cs.CV 2412.17806

Reconstructing People, Places, and Cameras

HSfM结合深度学习与SfM,能同时重建多个人体、场景点云与相机参数,精度显著提升。

Lea Müller, Hongsuk Choi, Anthony Zhang 等

2024-12-24 30