Fast Vision Mamba: Pooling Spatial Dimensions for Accelerated Processing
FastVim以交替空间平均池化将SSM并行步数减半,2048²图像推理提速72.5%。
Saarthak Kapse, Robin Betz, Srinivasan Sivanandan
FastVim以交替空间平均池化将SSM并行步数减半,2048²图像推理提速72.5%。
Saarthak Kapse, Robin Betz, Srinivasan Sivanandan
提出EgoMe数据集,结合多模态信息,促进机器人模仿学习,涵盖7902对视频,含眼动和IMU数据。
Heqian Qiu, Zhaofeng Shi, Lanxiao Wang 等
OmniPhysGS利用可学习的构成高斯模型实现多材料3D动力学生成,提升物理真实性。
Yuchen Lin, Chenguo Lin, Jianjin Xu 等
本研究提出基于人类偏好的视频生成强化学习方法,利用VideoReward模型实现流式模型的对齐,显著提升视频质量。
Jie Liu, Gongye Liu, Jiajun Liang 等
提出VideoLLaMA3,基于视觉中心训练范式,结合多阶段优化,显著提升图像与视频理解性能。
Boqiang Zhang, Kehan Li, Zesen Cheng 等
使用DiverseAR数据集,GPT等VLM在AR场景识别中TPR达93%。
Lin Duan, Yanming Xiu, Maria Gorlatova
InternLM-XComposer2.5-Reward通过多模态奖励模型提升LVLMs的生成质量,达成70%准确率。
Yuhang Zang, Xiaoyi Dong, Pan Zhang 等
VipDiff利用光流和无训练扩散模型实现视频修复,显著提升时空一致性。
Chaohao Xie, Kai Han, Kwan-Yee K. Wong
基于扩散变换器的Hunyuan3D 2.0系统,结合ShapeVAE与Paint模型,实现高分辨率纹理3D资产生成。
Zibo Zhao, Zeqiang Lai, Qingxiang Lin 等
提出One-D-Piece,支持1-256变长图像标记,结合Tail Token Drop实现高效质量可控压缩,超越JPEG/WebP。
Keita Miwa, Kento Sasaki, Hidehisa Arai 等
WMamba结合小波分析与动态轮廓卷积,提升面部伪造检测性能,达SOTA水平。
Siran Peng, Tianshuo Zhang, Li Gao 等
VRS-HQ利用多模态大模型的层级令牌实现视频推理分割,提升J&F得分超越VISA。
Sitong Gong, Yunzhi Zhuge, Lu Zhang 等
利用 conformal prediction 提供深度学习模型在精准除草中的90%以上置信保证。
Paul Melki, Lionel Bombrun, Boubacar Diallo 等
VideoRAG结合LVLM实现视频内容动态检索与多模态生成,显著优于基线。
Soyeong Jeong, Kangsan Kim, Jinheon Baek 等
OVO-Bench评估视频LLM的时间感知能力,揭示其与人类理解的差距。
Yifei Li, Junbo Niu, Ziyang Miao 等
提出基于Token级别洗牌与混合的无偏深度伪造检测方法,显著提升跨数据集泛化能力。
Xinghe Fu, Zhiyuan Yan, Taiping Yao 等
Sa2VA结合SAM-2与MLLM,实现图像视频的密集、多模态基础理解。
Haobo Yuan, Xiangtai Li, Tao Zhang 等
STAR方法通过文本到视频模型提升视频超分辨率,改善时空一致性。
Rui Xie, Yinhong Liu, Penghao Zhou 等
提出SceneVTG++,结合TLCG和CLTD实现多语言场景文本生成,达成高真实性和可控性。
Jiawei Liu, Yuanzhi Zhu, Feiyu Gao 等
AVTrustBench评估音视频LLM的可靠性,CAVPref提升30.19%。
Sanjoy Chowdhury, Sayan Nag, Subhrajyoti Dasgupta 等