MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?
采用多模态数学问题数据集MATHVERSE,结合文本内容削减与视觉推理评估,揭示MLLM在理解数学图像中的不足。
Renrui Zhang, Dongzhi Jiang, Yichi Zhang 等
采用多模态数学问题数据集MATHVERSE,结合文本内容削减与视觉推理评估,揭示MLLM在理解数学图像中的不足。
Renrui Zhang, Dongzhi Jiang, Yichi Zhang 等
提出无监督跨视角地理定位框架,利用投影和重排序实现40%以上的伪标签正确率。
Guopeng Li, Ming Qian, Gui-Song Xia
mPLUG-DocOwl 1.5通过统一结构学习提升文档理解性能,在10项基准测试中提升SOTA超过10分。
Anwen Hu, Haiyang Xu, Jiabo Ye 等
SpatialPIN通过多模型提示与交互,提升VLM的3D空间推理能力,适用于空间VQA与机器人任务。
Chenyang Ma, Kai Lu, Ta-Ying Cheng 等
提出VideoAgent,结合结构化记忆与多模态基础模型,提升长视频理解性能,平均在NExT-QA提升6.6%。
Yue Fan, Xiaojian Ma, Rujie Wu 等
RebQ框架在缺失模态学习中提升平均精度从20.00到50.92,减少遗忘从75.95到8.56。
Shu Zhao, Xiaohan Zou, Tan Yu 等
DiffUIR采用选择性钟形映射策略,结合强条件引导和共享分布,显著提升多任务图像恢复性能,参数仅0.89M。
Dian Zheng, Xiao-Ming Wu, Shuzhou Yang 等
VideoAgent利用大语言模型作为代理,通过多轮信息检索实现长视频理解,零样本准确率达54.1%。
Xiaohan Wang, Yuhui Zhang, Orr Zohar 等
提出MM1,结合多模态预训练策略,利用图像编码器、视觉语言连接器和多样数据,达成SOTA性能。
Brandon McKinzie, Zhe Gan, Jean-Philippe Fauconnier 等
OpenGraph利用层级图结构结合视觉-语言模型实现大规模户外环境的开域3D语义理解。
Yinan Deng, Jiahui Wang, Jingyu Zhao 等
提出TRUMANS数据集与基于扩散的自回归模型,实现任意长度人-场景交互运动生成。
Nan Jiang, Zhiyuan Zhang, Hongjie Li 等
提出TaskCLIP,结合大规模视觉-语言模型实现任务导向的目标检测,提升准确率3.5%,仅用一块RTX4090。
Hanning Chen, Wenjun Huang, Yang Ni 等
DriveDreamer-2用LLM+Unified Multi-View Model生成定制驾驶视频,FID 11.2、FVD 55.7。
Guosheng Zhao, Xiaofeng Wang, Zheng Zhu 等
提出FastV,通过学习自适应注意力和剪枝视觉Token,显著降低LVLM推理成本(如LLaVA-1.5-13B FLOPs降低45%),性能几乎不变。
Liang Chen, Haozhe Zhao, Tianyu Liu 等
VidProM收集了1.67百万个真实用户文本视频提示,结合4个先进扩散模型生成6.69百万视频,推动文本到视频研究。
Wenhao Wang, Yi Yang
ELLA通过TSC模块将LLM与扩散模型结合,实现语义对齐提升。
Xiwei Hu, Rui Wang, Yixiao Fang 等
提出CAT模型,通过引入线索聚合器和AI辅助偏好优化,显著提升动态音视频场景中的问答性能。
Qilang Ye, Zitong Yu, Rui Shao 等
TextMonkey: 无OCR大模型,提升文档理解,OCRBench得分561。
Yuliang Liu, Biao Yang, Qiang Liu 等
本文综述了可控生成的文本到图像扩散模型,分析了DDPMs的控制机制。
Pu Cao, Feng Zhou, Qing Song 等
SceneCraft利用LLM将文本转为Blender脚本,支持多达百个3D资产的场景生成。
Ziniu Hu, Ahmet Iscen, Aashi Jain 等