排序: 最新 热门 引用
cs.CV 2406.09414

Depth Anything V2

Depth Anything V2通过合成图像、增强模型容量和大规模伪标签实现更精细鲁棒的单目深度估计。

Lihe Yang, Bingyi Kang, Zilong Huang 等

2024-06-14 36
cs.CV 2406.04264

MLVU: Benchmarking Multi-task Long Video Understanding

MLVU基准使用长视频(平均15分钟)评估多任务长视频理解,涵盖9类任务,测试23个MLLM模型,揭示性能提升空间。

Junjie Zhou, Yan Shu, Bo Zhao 等

2024-06-07 262 引用 35