From Slow Bidirectional to Fast Autoregressive Video Diffusion Models
本研究将慢速双向视频扩散模型转化为快速自回归模型,显著提升生成速度和交互性。
Tianwei Yin, Qiang Zhang, Richard Zhang 等
本研究将慢速双向视频扩散模型转化为快速自回归模型,显著提升生成速度和交互性。
Tianwei Yin, Qiang Zhang, Richard Zhang 等
提出3DSRBench基准,评估LMM在复杂3D空间推理中的表现,涵盖2772个标注问答,揭示模型在高度、方向、位置等方面的局限。
Wufei Ma, Haoyu Chen, Guofeng Zhang 等
MV-DUSt3R+在2秒内从稀疏视图重建场景,显著提升速度和精度。
Zhenggang Tang, Yuchen Fan, Dilin Wang 等
SAME模型实现多任务通用视觉导航,超越单任务模型,利用状态自适应专家混合机制。
Gengze Zhou, Yicong Hong, Zun Wang 等
UniScene以占据为枢纽,统一生成视频/激光雷达/占据。
Bohan Li, Jiazhe Guo, Hongsi Liu 等
InternVL 2.5通过模型、数据和测试时扩展,实现对开源多模态模型性能的显著提升,突破70% MMMU指标。
Zhe Chen, Weiyun Wang, Yue Cao 等
NVILA通过“先放大再压缩”策略,提升高分辨率图像和长视频处理效率,训练成本降低1.9-5.1倍。
Zhijian Liu, Ligeng Zhu, Baifeng Shi 等
VisionZip通过选择高信息量视觉Token,减少冗余,提升效率,性能提升至少5%。
Senqiao Yang, Yukang Chen, Zhuotao Tian 等
提出NoiseRefine,通过噪声映射实现无指导高质量图像生成,训练仅用5万文本-图像对。
Donghoon Ahn, Jiwon Kang, Sanghyun Lee 等
MIDI将预训练的单图3D模型扩展为多实例扩散模型,实现多物体空间关系的高效生成。
Zehuan Huang, Yuan-Chen Guo, Xingqiao An 等
PaliGemma 2结合SigLIP-So400m编码器和Gemma 2模型,训练多尺寸多任务,显著提升多模态迁移性能。
Andreas Steiner, André Susano Pinto, Michael Tschannen 等
提出BTimer,一种基于弹壳时间的动态场景单目视频实时重建模型,实现150ms内高质量场景重建。
Hanxue Liang, Jiawei Ren, Ashkan Mirzaei 等
HunyuanVideo为开源大规模视频生成模型,参数超13亿,性能媲美行业顶尖闭源模型。
Weijie Kong, Qi Tian, Zijian Zhang 等
SceneFactor利用因式分解的潜在扩散模型实现可控大规模3D场景生成与编辑。
Alexey Bokhovkin, Quan Meng, Shubham Tulsiani 等
LamRA利用大规模多模态模型实现多任务检索与重排序,显著提升零样本性能。
Yikun Liu, Pingan Chen, Jiayin Cai 等
提出结构化潜在(SLAT)表示的3D生成方法,结合稀疏网格与多视角特征,实现多格式输出,训练参数达20亿。
Jianfeng Xiang, Zelong Lv, Sicheng Xu 等
DynSUP方法通过两个无姿态图像对实现动态高斯喷溅,显著提升动态场景合成效果。
Weihang Li, Weirong Chen, Shenhan Qian 等
提出Video-3D LLM,通过引入3D位置编码实现视频到3D场景理解,提升多个基准任务性能。
Duo Zheng, Shijia Huang, Liwei Wang
提出AMO采样器,通过overshooting增强文本渲染,提升准确率达35.9%。
Xixi Hu, Keyang Xu, Bo Liu 等
提出轨迹注意力机制,通过像素轨迹实现视频细粒度运动控制,显著提升长程一致性。
Zeqi Xiao, Wenqi Ouyang, Yifan Zhou 等