ImageNet3D: Towards General-Purpose Object-Level 3D Understanding
提出ImageNet3D数据集,结合200类物体的2D边界框、3D姿态与位置标注,推动通用对象级3D理解研究。
Wufei Ma, Guanning Zeng, Guofeng Zhang 等
提出ImageNet3D数据集,结合200类物体的2D边界框、3D姿态与位置标注,推动通用对象级3D理解研究。
Wufei Ma, Guanning Zeng, Guofeng Zhang 等
HOT3D数据集提供3D手和物体跟踪的多视角图像和注释,助力研究。
Prithviraj Banerjee, Sindi Shkodrani, Pierre Moulon 等
通过分析60,000个微调扩散模型的权重空间,提出weights2weights子空间,实现模型采样、编辑与反演。
Amil Dravid, Yossi Gandelsman, Kuan-Chieh Wang 等
Depth Anything V2通过合成图像、增强模型容量和大规模伪标签实现更精细鲁棒的单目深度估计。
Lihe Yang, Bingyi Kang, Zilong Huang 等
引入视觉草图板,结合多模态模型的线条、框等绘图工具,显著提升数学和视觉推理性能。
Yushi Hu, Weijia Shi, Xingyu Fu 等
Yo’LLaVA通过引入个性化潜在令牌,实现少样本学习,显著提升个性化视觉与语言理解能力。
Thao Nguyen, Haotian Liu, Yuheng Li 等
OmniTokenizer为图像视频联合编码器,采用空间-时间解耦架构,达成图像视频重建SOTA性能。
Junke Wang, Yi Jiang, Zehuan Yuan 等
提出LVNet框架,结合层级关键帧选择器(HKS)实现长视频问答,处理仅需12帧达最高准确率。
Jongwoo Park, Kanchana Ranasinghe, Kumara Kahatapitiya 等
提出自适应槽注意力(AdaSlot),动态调整对象槽数,提升对象发现性能。
Ke Fan, Zechen Bai, Tianjun Xiao 等
提出EgoExo-Fitness数据集,结合第一人称和第三人称视角,支持全身动作理解与解释。
Yuan-Ming Li, Wei-Jin Huang, An-Lan Wang 等
Real2Code通过图像分割和LLM代码生成,能重建含多达10个关节的复杂关节物体。
Zhao Mandi, Yijia Weng, Dominik Bauer 等
GUIOdyssey数据集和OdysseyAgent模型提升跨应用导航性能。
Quanfeng Lu, Wenqi Shao, Zitao Liu 等
Flash-VStream实现实时长视频流理解,显著降低推理延迟和VRAM消耗。
Haoji Zhang, Yiqin Wang, Yansong Tang 等
LVBench基于长视频理解,评估模型长时记忆与推理能力,数据涵盖六类核心任务。
Weihan Wang, Zehai He, Wenyi Hong 等
Hydra-MDP通过多目标蒸馏结合人类与规则教师,实现端到端多模态路径规划,获Navsim第一。
Zhenxin Li, Kailin Li, Shihao Wang 等
LlamaGen采用纯粹自回归架构,基于图像编码器和Transformer模型,在ImageNet上实现2.18的FID,超越扩散模型。
Peize Sun, Yi Jiang, Shoufa Chen 等
FPN-IAIA-BL模型提高乳腺肿块边缘分类准确性,AUROC达0.88。
Julia Yang, Alina Jade Barnett, Jon Donnelly 等
提出基于扩散模型的地球观测数据增强方法,通过四阶段流程显著提升语义多样性和模型性能。
Tiago Sousa, Benoît Ries, Nicolas Guelfi
提出ShareGPT4Video,通过差异化视频字幕策略实现高质量视频理解与生成,涵盖4万条GPT-4V标注字幕。
Lin Chen, Xilin Wei, Jinsong Li 等
MLVU基准使用长视频(平均15分钟)评估多任务长视频理解,涵盖9类任务,测试23个MLLM模型,揭示性能提升空间。
Junjie Zhou, Yan Shu, Bo Zhao 等