TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
TextMonkey: 无OCR大模型,提升文档理解,OCRBench得分561。
Yuliang Liu, Biao Yang, Qiang Liu 等
TextMonkey: 无OCR大模型,提升文档理解,OCRBench得分561。
Yuliang Liu, Biao Yang, Qiang Liu 等
本文综述了可控生成的文本到图像扩散模型,分析了DDPMs的控制机制。
Pu Cao, Feng Zhou, Qing Song 等
SceneCraft利用LLM将文本转为Blender脚本,支持多达百个3D资产的场景生成。
Ziniu Hu, Ahmet Iscen, Aashi Jain 等
提出Selective Recurrent Unit(SRU)结合频率信息选择,显著提升立体匹配精度,KITTI等榜单排名第一。
Xianqi Wang, Gangwei Xu, Hao Jia 等
提出TempCompass基准,涵盖五大时间维度,评估8个SOTA视频大语言模型,发现其时间感知能力显著不足。
Yuanxin Liu, Shicheng Li, Yi Liu 等
RAG结合检索增强生成,提升AIGC的准确性与鲁棒性。
Penghao Zhao, Hailin Zhang, Qinhan Yu 等
提出基于Diffusion潜在对齐器的多模态视觉-音频生成框架,显著提升联合生成性能。
Yazhou Xing, Yingqing He, Zeyue Tian 等
Sora采用扩散变换器,结合空间-时间潜在片段,实现高质量长视频生成。
Yixin Liu, Kai Zhang, Yuan Li 等
NaVid是一种基于视频的视觉-语言导航模型,利用单目RGB摄像头实现无需地图或深度信息的自主导航,达到了最先进的性能。
Jiazhao Zhang, Kunyu Wang, Rongtao Xu 等
提出PGI与GELAN,改善信息流与参数利用,提升YOLOv9性能。
Chien-Yao Wang, I-Hau Yeh, Hong-Yuan Mark Liao
VADv2提出基于概率规划的端到端自主驾驶模型,利用大规模示范数据实现高性能控制。
Bo Jiang, Shaoyu Chen, Hao Gao 等
提出ChartX评估集和ChartVLM模型,提升图表推理能力,达成与GPT-4V相当的性能。
Renqiu Xia, Bo Zhang, Hancheng Ye 等
提出Any-Shift Prompting,通过层次贝叶斯模型在23个数据集上显著提升跨分布泛化能力。
Zehao Xiao, Jiayi Shen, Mohammad Mahdi Derakhshani 等
GALA3D利用LLMs生成布局,通过布局引导的高质量3D高斯点云实现复杂场景重建。
Xiaoyu Zhou, Xingjian Ran, Yajiao Xiong 等
SPHINX-X通过模型参数和数据规模扩展,提升多模态大模型性能,涵盖多领域任务。
Dongyang Liu, Renrui Zhang, Longtian Qiu 等
提出UAV-Rain1k数据集,结合Blender模拟雨滴,评估多种图像去雨算法,揭示现有方法局限。
Wenhui Chang, Hongming Chen, Xin He 等
引入时间变化蓝噪声,利用相关性提升扩散模型生成质量,超越纯高斯噪声。
Xingchang Huang, Corentin Salaün, Cristina Vasconcelos 等
提出InstructScene,结合语义图先验与布局解码器,实现指令控制的3D室内场景合成,显著优于SOTA。
Chenguo Lin, Yadong Mu
ConsistI2V通过扩散模型提升图像到视频生成的一致性,实验显示显著改善。
Weiming Ren, Huan Yang, Ge Zhang 等
CogCoM通过链式操作推理实现视觉语言模型的精确推理,参数量17B,9个基准测试中表现优异。
Ji Qi, Ming Ding, Weihan Wang 等