Trajectory Attention for Fine-grained Video Motion Control
提出轨迹注意力机制,通过像素轨迹实现视频细粒度运动控制,显著提升长程一致性。
Zeqi Xiao, Wenqi Ouyang, Yifan Zhou 等
提出轨迹注意力机制,通过像素轨迹实现视频细粒度运动控制,显著提升长程一致性。
Zeqi Xiao, Wenqi Ouyang, Yifan Zhou 等
提出FonTS,利用两阶段DiT管线实现字级字体与风格控制,提升文本渲染的细粒度和一致性。
Wenda Shi, Yiren Song, Dengming Zhang 等
AC3D通过频率分析与模型调优,实现视频中3D相机控制的高精度与高质量。
Sherwin Bahmani, Ivan Skorokhodov, Guocheng Qian 等
提出VDMini,通过剪枝和一致性损失加速视频扩散模型,提升2.5倍速度。
Yiming Wu, Zhenghao Chen, Huan Wang 等
ChatRex通过解耦感知设计提高多模态大模型的感知能力,在COCO数据集上召回率达72.8%。
Qing Jiang, Gen Luo, Yuqin Yang 等
Type-R通过后处理自动修正文本生成中的拼写错误,显著提升文字渲染准确率。
Wataru Shimoda, Naoto Inoue, Daichi Haraguchi 等
提出CHOICE基准,系统评估大视觉-语言模型在遥感中的感知与推理能力,涵盖23个任务。
Xiao An, Jiaxing Sun, Zihan Gui 等
本研究深入分析VLM中的注意力机制,揭示模型如何利用查询Token存储全局信息。
Omri Kaduri, Shai Bagon, Tali Dekel
提出ConsisID,无需微调,通过频域控制实现人脸身份一致的文本到视频生成。
Shenghai Yuan, Jinfa Huang, Xianyi He 等
PreF3R是一种无需姿态估计的实时3D高斯点云重建与新视角合成方法,达20FPS。
Zequn Chen, Jiezhi Yang, Heng Yang
本文提出视频扩散Transformer的精准缩放定律,结合最优超参数预测模型性能,显著提升训练效率,减少40.1%的推理成本。
Yuanyang Yin, Yaqi Zhao, Mingwu Zheng 等
提出EPS:基于DCT特征的高效视频超分Patch采样,显著降低训练成本。
Yiying Wei, Hadi Amirpour, Jong Hwan Ko 等
Zoom Eye通过树搜索算法提升多模态LLM的视觉推理能力,InternVL2.5-8B在HR-Bench上提升15.71%。
Haozhan Shen, Kangjia Zhao, Tiancheng Zhao 等
提出正交子空间分解方法,通过SVD冻结主成分提升AIGI检测的泛化能力,显著优于现有方法。
Zhiyuan Yan, Jiangming Wang, Peng Jin 等
利用k-SAE解析扩散模型中的单一语义特征,揭示不同层次的视觉信息表达。
Dahye Kim, Xavier Thomas, Deepti Ghadiyaram
提出截断扩散策略,结合多模锚点,显著提升自主驾驶的多样性与效率。
Bencheng Liao, Shaoyu Chen, Haoran Yin 等
OminiControl通过重用DiT的VAE编码器和Transformer块,仅增加0.1%参数,实现对多任务的通用控制,超越专用方法。
Zhenxiong Tan, Songhua Liu, Xingyi Yang 等
Stable Flow用vital layers+注意力注入实现训练免费稳定编辑
Omri Avrahami, Or Patashnik, Ohad Fried 等
DINO-X模型在开放世界物体检测中表现最佳,COCO上达56.0 AP。
Tianhe Ren, Yihao Chen, Qing Jiang 等
提出极端稀疏训练方法EAST,结合动态ReLU、权重共享和循环稀疏,实现99.99%稀疏下的性能突破。
Andy Li, Aiden Durrant, Milan Markovic 等