Geometry-Aware Dataset Condensation for Diffusion Model Training
提出一种几何感知的数据集凝聚方法,提升扩散模型训练的保真度和分布覆盖。
Xiao Cui, Yulei Qin, Mo Zhu 等
提出一种几何感知的数据集凝聚方法,提升扩散模型训练的保真度和分布覆盖。
Xiao Cui, Yulei Qin, Mo Zhu 等
并行Jacobi解码实现快速自回归图像生成,提升4.8至6.4倍速度。
Boya Liao, Ying Li, Siyong Jian 等
WorldBench通过构建多领域视觉概念分类,评估MLLMs在多样视觉输入下的推理能力,模型最高准确率仅64%。
Yida Yin, Harish Krishnakumar, Chung Peng Lee 等
BloomBench以布卢姆分类法评测VLM,含7747条英阿样本,质量率98.45%。
Mohammad Mahdi Abootorabi, Omid Ghahroodi, Anas Madkoor 等
ZipSplat通过解耦高斯分布与像素网格,使用场景令牌实现高质量低成本的3D重建,减少6倍高斯数。
Alexander Veicht, Sunghwan Hong, Dániel Baráth 等
提出M³Eval,基于认知心理学设计的视频多模态记忆评估框架,涵盖四个关键维度。
Jie Huang, Ruixun Liu, Sirui Sun 等
本研究通过实证分析数据规模、模型复杂度与输入模态对视觉泛化的影响,发现数据规模提升显著,模型复杂度变化不稳定,色彩信息缺失影响较大。
Yidi Zhouluo
UniCanvas利用扩散模型在单一像素画布上实现文本与图像的联合生成,显著提升多模态多步推理能力。
Zeyuan Yang, Hao-Wei Chen, Xueyang Yu 等
VidMsg基准测试评估短视频中的隐含信息理解,使用VidVec-Msg方法提升检索性能。
Issar Tzachor, Michael Green, Rami Ben-Ari
EvoMemNav构建自我演化的细粒度记忆图,提升零样本 embodied navigation性能。
Zuhao Ge, Xiaosong Jia, Chao Wu 等
提出Steady-Forcing框架,结合V-Sink与EMA-Sink,改善长时长自然视频生成中的背景稳定性与流动性。
Matiur Rahman Minar, Seunghun Oh, GangHyeon Jeong 等
MemoGen通过经验记忆提升图像生成,超越Nano Banana Pro和GPT-Image-1。
Wenshuo Chen, Kuimou Yu, Bowen Tian 等
提出Any2Poster方法,支持跨模态多源内容生成海报,平均准确率达87.25%。
Amogh Vinaykumar, Aiden Li, Suozhi Huang 等
提出SEIG框架,利用预训练视觉-语言模型(VLM)实现单图反向图形,逐步细化几何、材质、布局和光照,生成可编辑的Blender程序。
Guangzhao He, Rundong Luo, Wei-Chiu Ma 等
AdaCodec采用预测性视觉编码,仅在预测成本高时使用完整视觉标记,显著提升长视频理解效率,平均节省84.7%的视觉Token。
Haowen Hou, Zhen Huang, Zheming Liang 等
本文提出VLM作为视频推理的教师,通过测试时在线优化,提升模型性能16.7分,超越传统方案。
Junhao Cheng, Liang Hou, Tianxiong Zhong 等
Li等提出DivIn,通过Langevin动力学优化初始化噪声,有效提升生成多样性,超越传统方法。
Xiang Li, Dianbo Liu, Kenji Kawaguchi
提出MSLoc模型,结合边界敏感提议和多模态推理,检测长视频中操控片段。
Yue Feng, Jingjing Li, Qijia Lu 等
WebSpline利用结构引导样条模型,实现单目视频中高效、结构一致的动态3D高斯重建。
Jongmin Park, Jeonghwan Yun, Minh-Quan Viet Bui 等
MOSS-Video-Preview通过交叉注意力实现实时视频理解,提升5倍速度。
Pengyu Wang, Chenkun Tan, Shaojun Zhou 等