PAVAS: Physics-Aware Video-to-Audio Synthesis
PAVAS通过物理驱动音频适配器实现物理感知的视频到音频合成,显著提高物理一致性。
Oh Hyun-Bin, Yuhta Takida, Toshimitsu Uesaka 等
PAVAS通过物理驱动音频适配器实现物理感知的视频到音频合成,显著提高物理一致性。
Oh Hyun-Bin, Yuhta Takida, Toshimitsu Uesaka 等
OneStory以自适应记忆生成多镜头视频,T2MSV一致性达0.5813。
Zhaochong An, Menglin Jia, Haonan Qiu 等
提出NPC方法,通过负提示优化文本-图像对齐,在GenEval++上表现提升54%。
Sangha Park, Eunji Kim, Yeongtak Oh 等
SJD++通过多token预测和高置信度重用,实现AR文本到图像生成的2-3倍加速。
Yao Teng, Zhihuan Jiang, Han Shi 等
RefBench-PRO通过Ref-R1提升多模态大模型在指代表达理解中的定位精度。
Tianyi Gao, Hao Li, Han Fang 等
CARD方法通过噪声白化和扩散模型更新,解决了相关高斯噪声问题,在CIN-D数据集上表现优异。
Niki Nezakati, Arnab Ghosh, Amit Roy-Chowdhury 等
DraCo结合低分辨率草图预览与文本推理,提升稀有属性生成,实验中在GenEval+8%、Imagine-Bench+0.91等指标显著优于传统方法。
Dongzhi Jiang, Renrui Zhang, Haodong Li 等
BulletTime框架通过4D位置编码和自适应归一化实现时间与摄像机姿态的解耦控制,提升视频生成的空间和时间操控能力。
Yiming Wang, Qihang Zhang, Shengqu Cai 等
SFD让语义先于纹理异步去噪,在ImageNet 256²达FID 1.04并显著加速收敛。
Yueming Pan, Ruoyu Feng, Qi Dai 等
LineAR通过压缩KV缓存,实现高效自回归图像生成,ImageNet FID从2.77降至2.68。
Ziran Qin, Youru Lv, Mingbao Lin 等
COOPER模型结合深度与分割,提升空间推理性能6.91%,实现内在感知与推理能力。
Zefeng Zhang, Xiangzhao Hao, Hengzhu Tang 等
提出KiMoI模型,通过操控面部运动基实现深度伪造视频的运动不一致检测,提升泛化能力。
Alejandro Cobo, Roberto Valle, José Miguel Buenaposada 等
PosterCopilot通过三阶段训练实现布局推理与可控编辑,提升专业平面设计的几何准确性和美学。
Jiazhe Wei, Ken Li, Tianyu Lao 等
RELIC结合长时记忆与实时流,利用压缩历史潜在表示实现高效交互视频世界建模。
Yicong Hong, Yiqun Mei, Chongjian Ge 等
提出高效测试时尺度调整方法,结合文本嵌入扰动提升生成多样性与质量。
Hang Xu, Linjiang Huang, Feng Zhao
LAMP利用大型语言模型生成可控视频,显著提升运动控制和用户意图对齐。
Muhammed Burak Kizil, Enes Sanli, Niloy J. Mitra 等
OneThinker模型融合图像与视频理解,涵盖10大任务,训练数据600k,显著提升多模态推理能力。
Kaituo Feng, Manyuan Zhang, Hongyu Li 等
PPTArena基准评估PowerPoint编辑,结合PPTPilot结构化代理实现超越VLM的编辑性能。
Michael Ofengenden, Yunze Man, Ziqi Pang 等
提出MindGPT-4ov,通过多阶段后训练提升多模态大模型性能,创新数据生成与微调策略。
Wei Chen, Chaoqun Du, Feng Gu 等
ReVSeg利用强化学习优化显式推理链,实现视频目标分割的可解释性和SOTA性能。
Yifan Li, Yingda Yin, Lingting Zhu 等