MotionCtrl: A Unified and Flexible Motion Controller for Video Generation
提出MotionCtrl,能独立控制视频中的相机与物体运动,采用多模块架构。
Zhouxia Wang, Ziyang Yuan, Xintao Wang 等
提出MotionCtrl,能独立控制视频中的相机与物体运动,采用多模块架构。
Zhouxia Wang, Ziyang Yuan, Xintao Wang 等
提出低成本高效的RMIA会员推断攻击,利用细粒度似然比检验实现优越性能。
Sajjad Zarifzadeh, Philippe Liu, Reza Shokri
提出结合LID检测和ML模型增强深度学习入侵检测系统的鲁棒性。
Xinwei Yuan, Shu Han, Wei Huang 等
VPD通过蒸馏程序推理能力提升视觉语言模型性能,超越现有模型。
Yushi Hu, Otilia Stretcu, Chun-Ta Lu 等
本论文提出通过层级幅值保持和后处理EMA优化,显著提升扩散模型训练稳定性和生成质量,FID从2.41降至1.81。
Tero Karras, Miika Aittala, Jaakko Lehtinen 等
本研究质疑“只靠自我状态”即可实现开环端到端自主驾驶,发现数据偏差和指标不足导致偏向依赖ego状态。
Zhiqi Li, Zhiding Yu, Shiyi Lan 等
TimeChat是一种时间敏感的多模态大语言模型,提升了长视频理解的精度,尤其在YouCook2上CIDEr提高了2.8。
Shuhuai Ren, Linli Yao, Shicheng Li 等
提出SCLIP,通过引入相关自注意力机制,提升零样本语义分割性能,从14.1%到38.2%的平均mIoU。
Feng Wang, Jieru Mei, Alan Yuille
提出RaIR作为内在奖励信号,显著提升机器人装配任务的零样本性能。
Cansu Sancaktar, Justus Piater, Georg Martius
VideoBooth以粗到细视觉嵌入生成定制视频,DINO达65.0979。
Yuming Jiang, Tianxing Wu, Shuai Yang 等
Mamba采用选择性状态空间模型,实现线性时间序列建模,推理速度比Transformer快5倍。
Albert Gu, Tri Dao
DeepCache通过缓存邻近去噪阶段特征,实现无训练加速,提升Stable Diffusion 2.0 2.3倍。
Xinyin Ma, Gongfan Fang, Xinchao Wang
DREAM通过引入扩散校正与估计自适应,提升扩散模型在超分任务中的训练效率和样本质量。
Jinxin Zhou, Tianyu Ding, Tianyi Chen 等
GraphDreamer利用场景图生成可解耦的3D场景,超越传统全景模型。
Gege Gao, Weiyang Liu, Anpei Chen 等
提出PI-ViT,通过引入2D/3D骨架信息增强视频变换器,提升日常活动识别性能。
Dominick Reilly, Srijan Das
ChatPose利用多模态大模型结合SMPL参数,实现3D人体姿态理解与生成。
Yao Feng, Jing Lin, Sai Kumar Dwivedi 等
提出分布匹配蒸馏(DMD)将扩散模型一键生成,FID达2.62,速度提升百倍。
Tianwei Yin, Michaël Gharbi, Richard Zhang 等
X-InstructBLIP框架将多模态对齐到LLMs,实现跨模态推理,显著提升性能。
Artemis Panagopoulou, Le Xue, Ning Yu 等
CritiqueLLM通过Eval-Instruct方法,利用伪参考数据训练,显著提升大模型评价的细粒度和信息丰富度,在点评和对比任务中优于多基线。
Pei Ke, Bosi Wen, Zhuoer Feng 等
DiffCAD利用扩散模型实现RGB图像中CAD模型的弱监督检索与对齐,突破了昂贵标注的限制。
Daoyi Gao, Dávid Rozenberszki, Stefan Leutenegger 等