Frequency Dynamic Convolution for Dense Image Prediction
提出频率动态卷积(FDConv),在保持参数预算不变的基础上实现频率多样性,提升图像预测性能。
Linwei Chen, Lin Gu, Liang Li 等
提出频率动态卷积(FDConv),在保持参数预算不变的基础上实现频率多样性,提升图像预测性能。
Linwei Chen, Lin Gu, Liang Li 等
PhysTwin结合弹簧-质量模型与生成形状,利用稀疏视频实现高保真动态变形物重建。
Hanxiao Jiang, Hao-Yu Hsu, Kaifeng Zhang 等
提出了一种量化评估方法,测量3D高斯点云场景中移除物体后的语义残留,验证了隐私保护场景的有效性。
Simona Kocour, Assia Benbihi, Aikaterini Adam 等
PrediCIR利用世界模型预测缺失目标内容,提升零样本图像检索性能,提升幅度达4.45%。
Yuanmin Tang, Jing Yu, Keke Gai 等
VLU-Net通过视觉语言模型实现多退化图像的统一恢复,在SOTS去雾数据集上提升3.74 dB。
Haijin Zeng, Xiangming Wang, Yongyong Chen 等
提出DCEdit,通过双层控制和精准语义定位实现高精度图像编辑,显著优于现有方法。
Yihan Hu, Jianing Peng, Yiheng Lin 等
MagicMotion通过密稠到稀疏轨迹引导,实现高质量、多目标、多格式的可控视频生成,构建了MagicData与MagicBench,显著优于SOTA。
Quanhao Li, Zhen Xing, Rui Wang 等
提出基于3D高斯点云的3D人-物交互重建方法,构建了包含133类物体和120类交互的开放词汇野外数据集Open3DHOI。
Boran Wen, Dingbang Huang, Zichen Zhang 等
MotionStreamer结合连续潜在空间与自回归扩散模型,实现在线流式人类动作生成。
Lixing Xiao, Shunlin Lu, Huaijin Pi 等
EfficientLLaVA采用结构风险最小化实现大视觉-语言模型自动剪枝,使用64样本达83.05%准确率,提升1.8倍速度。
Yinan Liang, Ziwei Wang, Xiuwei Xu 等
提出TRACE方法,通过语义感知变换检测目标检测模型中的后门样本,提升30% AUROC。
Hangtao Zhang, Yichen Wang, Shihui Yan 等
提出基于知识引导的深度伪造检测框架,显著提升泛化能力,关键指标AUC达99.53%。
Peipeng Yu, Jianwei Fei, Hui Gao 等
DualToken通过分离高低层视觉词汇,实现视觉理解与生成的统一,提升ImageNet零样本准确率至82.0%。
Wei Song, Yuran Wang, Zijia Song 等
提出Concat-ID,利用VAE和3D自注意力实现多场景身份保持视频生成。
Yong Zhong, Zhuoyi Yang, Jiayan Teng 等
提出多输出符合预测(M-R2CCP、M-R2C2R)实现2D/3D解剖标志点的可靠不确定性量化。
Jef Jonkers, Frank Coopman, Luc Duchateau 等
FlexVLN以LLM规划器和指令跟随器协同,实现跨REVERIE、SOON、CVDN-target的零微调泛化。
Siqi Zhang, Yanyuan Qiao, Qunbo Wang 等
提出CAVE模型,结合3D神经对象体积实现鲁棒性与可解释性,提升OOD数据表现。
Nhi Pham, Artur Jesslen, Bernt Schiele 等
提出一种名为On-the-Fly GS的渐进框架,实现近实时3DGS优化,每张图像优化仅需数秒。
Yiwei Xu, Yifei Yu, Wentian Gan 等
Reflect-DiT通过推理反思机制在推理时间提升文本到图像生成性能,基于参数1.6B模型实现+0.19分提升。
Shufan Li, Konstantinos Kallidromitis, Akash Gokul 等
基于SceneScript的多任务模型实现3D场景布局的全局预测与局部修正,显著提升局部修正性能。
Christopher Xie, Armen Avetisyan, Henry Howard-Jenkins 等