MobileVLM V2: Faster and Stronger Baseline for Vision Language Model
MobileVLM V2采用创新架构和高质量数据,参数规模1.7B,性能优于同类3B模型。
Xiangxiang Chu, Limeng Qiao, Xinyu Zhang 等
MobileVLM V2采用创新架构和高质量数据,参数规模1.7B,性能优于同类3B模型。
Xiangxiang Chu, Limeng Qiao, Xinyu Zhang 等
引入Direct-a-Video,实现多对象和相机运动的解耦控制,无需额外优化。
Shiyuan Yang, Liang Hou, Haibin Huang 等
提出DeCoF模型,通过帧一致性检测AI生成视频,适应不同模型,检测率显著提升。
Long Ma, Zhiyuan Yan, Qinglang Guo 等
提出UniTouch模型,通过对齐预训练图像嵌入,实现多模态触觉表示的零样本任务应用。
Fengyu Yang, Chao Feng, Ziyang Chen 等
PLoRA仅适配图像令牌;基于InternLM2-7B,提升自由式图文创作与理解。
Xiaoyi Dong, Pan Zhang, Yuhang Zang 等
Motion-I2V利用扩散模型和显式运动建模,实现高一致性和可控的图像转视频,支持稀疏轨迹和区域控制。
Xiaoyu Shi, Zhaoyang Huang, Fu-Yun Wang 等
研究表明,Soft MoE在固定计算预算下优于稀疏MoE。
Tianlin Liu, Mathieu Blondel, Carlos Riquelme 等
Grounded SAM结合Grounding DINO实现开放式目标检测与分割,达成48.7平均AP。
Tianhe Ren, Shilong Liu, Ailing Zeng 等
提出了能量概念瓶颈模型,提升预测准确率和概念解释能力。
Xinyue Xu, Yi Qin, Lu Mi 等
LAA-Net:基于局部伪影注意机制的深度伪造检测模型,显著提升AUC达99.96%。
Dat Nguyen, Nesryne Mejri, Inder Pal Singh 等
提出HAZARD基准,结合LLMs评估动态环境中的 embodied 决策能力,火灾、洪水、风暴场景,最高值77.8%。
Qinhong Zhou, Sunli Chen, Yisong Wang 等
SpatialVLM通过大规模互联网数据训练,显著提升VLM的3D空间推理能力,达成距离估算准确率99%。
Boyuan Chen, Zhuo Xu, Sean Kirmani 等
提出缺失模态令牌(MMT),在Ego4D等数据集上减少性能损失至10%。
Merey Ramazanova, Alejandro Pardo, Humam Alwassel 等
Vlogger结合大模型与扩散模型,实现长视频vlog自动生成,达5分钟,保持脚本与演员一致。
Shaobin Zhuang, Kunchang Li, Xinyuan Chen 等
POP-3D提出基于图像的开集词汇3D占据预测模型,利用自监督学习实现无需手工标注的多模态训练。
Antonin Vobecky, Oriane Siméoni, David Hurych 等
SceneVerse通过大规模3D场景-语言数据集和GPS预训练框架,实现3D场景理解的突破。
Baoxiong Jia, Yixin Chen, Huangyue Yu 等
本研究提出通过微调空间模块,利用低质量视频和高质量图片,训练高质量视频扩散模型。
Haoxin Chen, Yong Zhang, Xiaodong Cun 等
提出多轨时间线控制方法,结合预训练扩散模型实现多动作细粒度生成。
Mathis Petrovich, Or Litany, Umar Iqbal 等
TACO构建大规模双手工具-动作-物体交互数据集,支持泛化任务评估。
Yun Liu, Haolin Yang, Xu Si 等
本研究揭示多模态大模型在视觉理解中的系统性短板,提出结合自监督特征的混合方法以提升视觉定位。
Shengbang Tong, Zhuang Liu, Yuexiang Zhai 等