MVFlow: Deep Optical Flow Estimation of Compressed Videos with Motion Vector Prior
提出MVFlow,利用压缩视频中的运动向量作为先验,显著提升光流估计速度与精度。
Shili Zhou, Xuhao Jiang, Weimin Tan 等
提出MVFlow,利用压缩视频中的运动向量作为先验,显著提升光流估计速度与精度。
Shili Zhou, Xuhao Jiang, Weimin Tan 等
OpenFlamingo是一个开源框架,用于训练3B到9B参数的自回归视觉语言模型,性能达到Flamingo的80-89%。
Anas Awadalla, Irena Gao, Josh Gardner 等
LISA结合大语言模型实现推理分割,突破传统依赖明确指令的限制。
Xin Lai, Zhuotao Tian, Yukang Chen 等
提出ADTrans框架,通过语义原型学习解决PSG中的偏差问题,显著提升性能。
Li Li, Wei Ji, Yiming Wu 等
PointOdyssey利用真实运动捕捉数据构建长视频点追踪大规模合成数据集,提升长时细粒度追踪性能。
Yang Zheng, Adam W. Harley, Bokui Shen 等
提出CLIP-KD,通过特征对齐和对比学习提升小模型性能,最大化教师与学生特征相似性。
Chuanguang Yang, Zhulin An, Libo Huang 等
利用OpenPose和CNN检测考试中学生交换物品的Suspicious行为,关键指标包括手臂角度和持续时间。
Reuben Moyo, Stanley Ndebvu, Michael Zimba 等
提出DNA-Rendering,包含1500+人类样本和6700万帧,提升人类渲染多样性与精度。
Wei Cheng, Ruixiang Chen, Wanqi Yin 等
InternVid利用大规模视频文本数据和多尺度生成策略,训练出ViCLIP模型,实现零-shot动作识别和多模态理解。
Yi Wang, Yinan He, Yizhuo Li 等
利用检索增强的视频生成方法,生成连贯的故事视频。
Yingqing He, Menghan Xia, Haoxin Chen 等
NaViT通过序列打包处理任意分辨率图像,提升训练效率和性能。
Mostafa Dehghani, Basil Mustafa, Josip Djolonga 等
提出MMBench,基于CircularEval的多模态模型评估基准,涵盖3000+题,支持中英双语。
Yuan Liu, Haodong Duan, Yuanhan Zhang 等
提出基于可微渲染的3D原语分解方法,利用纹理超二次曲面实现场景解析。
Tom Monnier, Jake Austin, Angjoo Kanazawa 等
提出Objaverse-XL,包含超1000万3D模型,显著提升3D视觉任务性能。
Matt Deitke, Ruoshi Liu, Matthew Wallingford 等
AnimateDiff利用迁移学习和MotionLoRA,无需模型微调,实现个性化文本到动画生成,提升动画质量和多样性。
Yuwei Guo, Ceyuan Yang, Anyi Rao 等
SVIT提出了一个包含420万高质量视觉指令数据集的方法,显著超越当前多模态大模型性能。
Bo Zhao, Boya Wu, Muyang He 等
提出层次神经编码模型,利用三层代码树实现高效可控CAD生成,提升模型复杂度与交互能力。
Xiang Xu, Pradeep Kumar Jayaraman, Joseph G. Lambourne 等
提出Michelangelo框架,通过Shape-Image-Text对齐的潜在空间实现基于图像或文本的3D形状生成,显著提升质量与多样性。
Zibo Zhao, Wen Liu, Xin Chen 等
提出多领域评估基准MESS,利用CLIP等模型实现零样本语义分割,涵盖22个数据集。
Benedikt Blumenstiel, Johannes Jakubik, Hilde Kühne 等
Shikra模型实现多模态大模型的指称对话能力,提升定位任务表现。
Keqin Chen, Zhao Zhang, Weili Zeng 等