Muskie: Multi-view Masked Image Modeling for 3D Vision Pre-training
Muskie以多视角掩码重建学习几何一致性,在NAVI上将3D轨迹误差降至2.38厘米。
Wenyu Li, Sidun Liu, Peng Qiao 等
Muskie以多视角掩码重建学习几何一致性,在NAVI上将3D轨迹误差降至2.38厘米。
Wenyu Li, Sidun Liu, Peng Qiao 等
基于Deming循环的多智能体系统SciEducator实现科学视频理解与教育,显著优于现有模型。
Zhiyu Xu, Weilong Yan, Yufei Shi 等
SketchVerify通过草图验证提高物理感知视频生成的运动规划质量。
Yidong Huang, Zun Wang, Han Lin 等
提出TwiG框架,实现视觉生成中文本推理的实时交错,显著提升语义丰富度。
Ziyu Guo, Renrui Zhang, Hongyu Li 等
提出VLA-Fool,结合文本、视觉和跨模态攻击,揭示VLA模型在多模态扰动下的脆弱性。
Yuping Yan, Yuhan Xie, Yixin Zhang 等
VisPlay通过自演化强化学习框架提升视觉语言模型的推理能力,使用未标注图像数据实现性能提升。
Yicheng He, Chengsong Huang, Zongxia Li 等
提出ARC-Chapter模型,基于百万级长视频章节,利用多模态层级标注实现长视频结构化,性能提升显著。
Junfu Pu, Teng Wang, Yixiao Ge 等
PhysX-Anything基于单幅图像,采用VLM和新型3D表示,生成具物理属性的高质量模拟资产。
Ziang Cao, Fangzhou Hong, Zhaoxi Chen 等
提出SpatialSky-Bench评估VLM在无人机空间推理中的性能,Sky-VLM在13项任务中达SOTA。
Lingfeng Zhang, Yuchen Zhang, Hongsheng Li 等
GeoX-Bench评估大规模多模模型在跨视角地理定位和姿态估计中的性能,显示模型在定位上表现优异,但姿态估计仍具挑战。
Yushuo Zheng, Jiangyong Ying, Huiyu Duan 等
提出DGS-Net,通过梯度空间分解和蒸馏引导,提升CLIP微调在AI生成图像检测中的性能,平均提升6.6%。
Jiazhen Yan, Ziqiang Li, Fan Wang 等
Uni-Inter通过统一交互体积(UIV)实现多种交互场景下的人体运动合成。
Sheng Liu, Yuanzhi Liang, Jiepeng Wang 等
提出基于傅里叶级数的篡改合成框架FSTS,有效模拟真实场景中的隐性篡改参数,提升文本图像篡改定位模型的泛化能力。
Zeqin Yu, Haotao Xie, Jian Zhang 等
ReaSon利用因果信息瓶颈优化关键帧选择,显著提升视频理解性能。
Yuan Zhou, Litao Hua, Shilong Jin 等
GCAgent通过结构化记忆模型提升长视频理解,达23.5%准确率提升。
Jeong Hun Yeo, Sangyun Chung, Sungjune Park 等
MonkeyOCR v1.5通过视觉一致性强化学习和两阶段管道实现复杂文档解析,OmniDocBench性能提升2.34%。
Jiarui Zhang, Yuliang Liu, Zijun Wu 等
AHA!利用3D高斯喷射实现多场景中的人类动画,提升了几何一致性和自由视角渲染。
Aymen Mir, Jian Wang, Riza Alp Guler 等
本研究提出基于结构化长描述的文本到图像模型FIBO,采用DimFusion机制显著提升控制性与表达力。
Eyal Gutflaish, Eliran Kachlon, Hezi Zisman 等
DeepEyesV2通过两阶段训练和工具调用实现多模态自主推理,显著提升复杂任务表现。
Jack Hong, Chenxiao Zhao, ChengLin Zhu 等
提出“用视频思考”范式,利用Sora-2模型实现多模态推理,涵盖Vision和Text任务,准确率达92%(MATH)和69.2%(MMMU)。
Jingqi Tong, Yurong Mou, Hangcheng Li 等