SGMD: Score Gradient Matching Distillation for Few-Step Video Diffusion Distillation
提出SGMD,通过梯度匹配优化伪评分,显著提升4步视频蒸馏速度和运动动态。
Zhuguanyu Wu, Ruihao Gong, Yang Yong 等
提出SGMD,通过梯度匹配优化伪评分,显著提升4步视频蒸馏速度和运动动态。
Zhuguanyu Wu, Ruihao Gong, Yang Yong 等
EarlyTom在视觉编码内实现早期令牌压缩,显著降低TTFT至2.65倍,保持精度。
Hesong Wang, Xin Jin, Lu Lu 等
通过几何引导的特征建模,GODeform框架在单目3D形状恢复中实现了显著的形变学习性能提升。
Yiyao Ma, Kai Chen, Zhongxiang Zhou 等
本文重新审视FID指标,发现其受参考数据几何结构影响显著,强调结合几何特征进行评估。
Yunghee Lee, Byeonghyun Pak
引入扩散测地矩(DGM),在FAUST-Reg和TOSCA数据集上表现优异。
Zhicheng Du, Changyue Liu, Wenji Xi 等
提出NEO-ov,一种端到端无外部编码器的原生一体化视觉-语言模型,支持单图、多图和视频理解,显著提升细粒度感知与空间推理能力。
Haiwen Diao, Jiahao Wang, Penghao Wu 等
提出VisualMem,结合结构化视觉记忆模块,有效增强个性化AI的长期视觉记忆能力,显著优于现有方法。
Viet Nguyen, Thao Nguyen, Vishal M. Patel 等
DeGO框架通过解耦刚性和非刚性运动,实现13.5%的人体实例提升。
Yang Gao, Wuyang Li, Po-Chien Luan 等
StayFair方法在不同指导尺度下保持扩散模型的群体公平性,提升公平性8.6%。
Myeongsoo Kim, Eunji Kim, Minwoo Chae 等
ROVER通过对象中心的视觉证据路由提高多图像推理准确性。
Guannan Lv, Ren Nie, Hongjian Dou 等
提出AndroidDaily基准和GRADE评估框架,有效验证闭源移动应用中的GUI代理能力。
Yifan Sui, Xin Huang, Hongbing Li 等
STROP通过学习可变长度视觉程序,提高场景结构表示的准确性。
Piotr Wyrwiński, Kacper Dobek, Krzysztof Krawiec
LocateAnything基于并行框解码,训练138M样本,显著提升定位速度与精度
Shihao Wang, Shilong Liu, Yuanguo Kuang 等
基于DINO表征的条件扩散模型实现高质量且可控图像生成,LSUN和CelebA数据集验证。
Nithesh Chandher Karthikeyan, Jonas Unger, Gabriel Eilertsen
HydraPrompt通过动态调整类别中心,结合样本自适应提示和对比学习,实现对合成图像的高效检测。
Senyuan Shi, Hao Tan, Zichang Tan 等
MIND模型通过显式建模数据流形几何,在ImageNet上实现了2.06的FID。
Duoduo Xue, Zhiyu Zhu, Junhui Hou
VEOcc通过体素中心框架实现在线语义占用预测,在Occ-ScanNet上表现优异。
Ruoyu Wang, Yong Liu, Sheng Tao 等
MineC2FNet利用注意蒸馏提升多光谱影像中矿区足迹分割,显著改善精细分割精度。
Alif Tri Handoyo, Vincent C. S. Lee, Rizka Widyarini Purwanto 等
提出递归块对角耦合(RBDC)方法,通过训练窄模型递归构建宽模型,节省30% FLOPs,性能持平或更优。
Maxim Henry, Adrien Deliège, Sébastien Piérard 等
CoMoGen利用MaskAdapter和LoRA实现单掩码序列的可控视频生成,提升运动逼真度。
Adil Meric, Lin Geng Foo, Mert Kiray 等