LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models
LLaMA-VID提出双Token策略,有效支持长视频理解,提升性能。
Yanwei Li, Chengyao Wang, Jiaya Jia
LLaMA-VID提出双Token策略,有效支持长视频理解,提升性能。
Yanwei Li, Chengyao Wang, Jiaya Jia
提出MVBench基准,系统性评估多模态视频理解中的时间感知能力,基于静态任务转化与自动标注实现,VideoChat2模型性能提升超15%。
Kunchang Li, Yali Wang, Yinan He 等
提出跨视角知识迁移的密集视频字幕模型,利用Web教程视频实现egocentric视频理解。
Takehiko Ohkawa, Takuma Yagi, Taichi Nishimura 等
提出MCF模型,基于扩散生成直接预测分子构象的3D原子位置,突破传统结构假设。
Yuyang Wang, Ahmed A. Elhag, Navdeep Jaitly 等
提出CCoT,通过场景图零样本增强大多模态模型的组合推理,显著提升多个基准性能。
Chancharik Mitra, Brandon Huang, Trevor Darrell 等
MagicAnimate基于扩散模型实现长时序人像动画,提升了38%的视频保真度。
Zhongcong Xu, Jianfeng Zhang, Jun Hao Liew 等
SeeSR利用语义提示增强Diffusion模型,实现更真实的图像超分,提升语义保持。
Rongyuan Wu, Tao Yang, Lingchen Sun 等
提出MMMU基准,涵盖6大学科、30子领域,包含11.5K多模态题,挑战专家级认知与推理。
Xiang Yue, Yuansheng Ni, Kai Zhang 等
提出Mip-Splatting,通过3D平滑滤波和Mip滤波解决3D高斯点云的频率限制与混叠问题。
Zehao Yu, Anpei Chen, Binbin Huang 等
MeshGPT采用解码器式Transformer,基于量化几何词汇生成紧凑、锐利的三角网格,提升形状覆盖率9%。
Yawar Siddiqui, Antonio Alliegro, Alexey Artemov 等
首个法律LLM综述:梳理Transformer/ChatGPT在司法中的机遇与风险
Jinqi Lai, Wensheng Gan, Jiayang Wu 等
提出稳定视频扩散模型,结合三阶段训练策略,利用大规模高质量数据显著提升生成效果。
Andreas Blattmann, Tim Dockhorn, Sumith Kulal 等
通过博弈论和分支模型预测控制实现自动换道,验证了其在密集交通中的有效性。
Luyao Zhang, Shaohang Han, Sergio Grammatico
AutoEval-Video是一个评估大型视觉语言模型的视频问答基准,GPT-4V表现最佳但仍低于人类72.8%的准确率。
Xiuyuan Chen, Yuan Lin, Yuchen Zhang 等
本研究评估了多模态大模型GPT-4V在地理和地理空间任务中的能力,基于自制小规模基准测试,发现其在细节识别和复杂推理方面表现优异。
Jonathan Roberts, Timo Lüddecke, Rehan Sheikh 等
提出NIR作为神经形态中间表示,支持7个模拟器和4个平台,提升跨平台互操作性。
Jens E. Pedersen, Steven Abreu, Matthias Jobst 等
ZeroPS利用2D预训练模型SAM和GLIP实现零样本3D零件分割,无需微调,基于多视角关系。
Yuheng Xue, Nenglun Chen, Jun Liu 等
提出基于Leverage Scores采样的RKHS数值积分方法,显著降低计算成本。
Antoine Chatalic, Nicolas Schreuder, Ernesto De Vito 等
提出D3PO,无需奖励模型,基于人类偏好直接微调扩散模型,效果媲美传统方法。
Kai Yang, Jian Tao, Jiafei Lyu 等
引入ShareGPT4V数据集,通过高质量图文描述显著提升多模态大模型性能,达成多项SOTA指标。
Lin Chen, Jinsong Li, Xiaoyi Dong 等