Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
Video-RAG结合外部视觉对齐文本,无需训练,提升长视频理解,平均性能提升2.8%。
Yongdong Luo, Xiawu Zheng, Guilin Li 等
Video-RAG结合外部视觉对齐文本,无需训练,提升长视频理解,平均性能提升2.8%。
Yongdong Luo, Xiawu Zheng, Guilin Li 等
EgoVid-5M以500万片段和EgoDreamer实现文本—运动联合的第一人称视频生成。
Xiaofeng Wang, Kang Zhao, Feng Liu 等
GaussianAnything利用点云结构潜在空间实现多模态3D生成,支持交互编辑。
Yushi Lan, Shangchen Zhou, Zhaoyang Lyu 等
提出Image2Text2Image框架,利用扩散模型无需参考标注评估图像描述质量。
Jia-Hong Huang, Hongyi Zhu, Yixian Shen 等
采用多模态自监督学习提升心血管疾病预测,模型在有限标注数据下实现7.6%性能提升。
Francesco Girlanda, Olga Demler, Bjoern Menze 等
提出SG-I2V,无需微调即可通过预训练扩散模型实现目标轨迹控制。
Koichi Namekata, Sherwin Bahmani, Ziyi Wu 等
提出可变长度图像标记器,通过递归分配实现图像压缩,范围32-256个标记。
Shivam Duggal, Phillip Isola, Antonio Torralba 等
提出EVSNet,通过运动提取与融合实现低光环境下视频语义分割,参数效率提升11倍。
Zhen Yao, Mooi Choo Chuah
NoPoSplat模型从稀疏无姿态图像中实时重建3D高斯场景,超越需姿态方法。
Botao Ye, Sifei Liu, Haofei Xu 等
IC-LoRA以20–100组样本和LoRA激活DiT的上下文生成能力,实现高保真多图生成。
Lianghua Huang, Wei Wang, Zhi-Fan Wu 等
提出多模态检测(MM-Det)利用LMM生成多模态伪造表示,有效识别扩散模型生成视频。
Xiufeng Song, Xiao Guo, Jiache Zhang 等
Senna结合LVLM与端到端模型,提升自主驾驶规划准确率27.12%,碰撞率降低33.33%。
Bo Jiang, Shaoyu Chen, Bencheng Liao 等
DynaMath通过动态生成问题评估视觉语言模型的数学推理能力,发现其在问题变体上的表现不稳定。
Chengke Zou, Xingang Guo, Rui Yang 等
LARP采用全局查询的自回归视频编码,提升生成质量,FVD达57。
Hanyu Wang, Saksham Suri, Yixuan Ren 等
ProtoViT结合视觉Transformer实现可解释图像分类,性能优于现有原型模型。
Chiyu Ma, Jon Donnelly, Wenjun Liu 等
MoGe模型实现单目图像3D几何估计,采用仿射不变点云预测,训练引入全局与局部超监督。
Ruicheng Wang, Sicheng Xu, Cassie Dai 等
AVHBench为音视频大模型设计的跨模态幻觉评估基准,揭示模型在关系理解上的不足。
Kim Sung-Bin, Oh Hyun-Bin, JungMok Lee 等
提出TranSPORTmer,一体化变换器模型,能实现多运动体轨迹预测、插补、推断与状态分类,显著优于SOTA方法。
Guillem Capellera, Luis Ferraz, Antonio Rubio 等
LongVU采用时空自适应压缩,利用DINOv2和跨模态查询,有效处理长视频,提升理解性能。
Xiaoqian Shen, Yunyang Xiong, Changsheng Zhao 等
PyramidDrop通过逐层削减视觉冗余,提升LVLM训练和推理效率,达成40%训练时间和55%推理FLOPs加速。
Long Xing, Qidong Huang, Xiaoyi Dong 等