ManiDext: Hand-Object Manipulation Synthesis via Continuous Correspondence Embeddings and Residual-Guided Diffusion
提出ManiDext,基于连续对应嵌入和残差引导扩散模型,实现手-物体动态操控合成。
Jiajun Zhang, Yuxiang Zhang, Liang An 等
提出ManiDext,基于连续对应嵌入和残差引导扩散模型,实现手-物体动态操控合成。
Jiajun Zhang, Yuxiang Zhang, Liang An 等
本研究验证稀疏神经网络在硬样本学习中可达或超越密集模型,尤其在有限数据和高难度样本下。
Qiao Xiao, Boqian Wu, Lu Yin 等
提出VLTP,通过视觉-语言引导的Token剪枝技术,提升ViT在任务导向分割中的效率,减少约25%的计算成本。
Hanning Chen, Yang Ni, Wenjun Huang 等
本文综述了深度多模态学习中处理缺失模态的方法,提升模型鲁棒性。
Renjie Wu, Hu Wang, Hsiang-Ting Chen 等
EndoOmni利用自我学习和鲁棒损失实现零样本跨数据集内窥镜深度估计,提升33%的绝对相对误差。
Qingyao Tian, Zhen Chen, Huai Liao 等
本研究提出GenCAD,结合Transformer、对比学习和扩散模型,将图像转化为可编辑的CAD指令序列,显著优于现有方法。
Md Ferdous Alam, Faez Ahmed
POINTS通过低困惑度数据筛选和模型权重融合提升视觉语言模型性能,达到SOTA水平。
Yuan Liu, Zhongyin Zhao, Ziyuan Zhuang 等
VILA-U采用单一自回归框架,融合视频、图像、语言理解与生成,性能接近最先进模型。
Yecheng Wu, Zhuoyang Zhang, Junyu Chen 等
提出MSQA数据集,结合3D场景图和多模态输入,提升场景理解能力。
Xiongkun Linghu, Jiangyong Huang, Xuesong Niu 等
ViewCrafter结合点云与视频扩散模型,实现单/稀疏图像高保真新视角合成。
Wangbo Yu, Jinbo Xing, Li Yuan 等
DC²框架提升MLLM对4K&8K图像的感知能力,准确率提高6%。
Wenbin Wang, Liang Ding, Minyan Zeng 等
Show-o是一款融合自回归与离散扩散的单一Transformer模型,能同时实现多模态理解与生成,参数规模约1.3B,性能优越。
Jinheng Xie, Weijia Mao, Zechen Bai 等
提出GRAB基准,涵盖五类任务和23个图属性,评估20个LMM模型,最高得分21%。
Jonathan Roberts, Kai Han, Samuel Albanie
TrackGo利用自由掩码和箭头实现高精度、低成本的可控视频生成,采用TrackAdapter增强时序自注意力。
Haitao Zhou, Chuang Wang, Rui Nie 等
使用DDC损失训练无Alpha标签的抠图模型,在AM-2K和P3M-10K数据集上表现优异。
Wenze Liu, Zixuan Ye, Hao Lu 等
提出EEPPR,用相关性在3D空间估算事件相机中周期性现象频率,误差0.1%。
Jakub Kolář, Radim Špetlík, Jiří Matas
DC3DO结合LION和扩散模型,实现3D形状的零样本分类,提升12.5%。
Nursena Koprucu, Meher Shashwat Nigam, Shicheng Xu 等
Lumina-mGPT是一种基于解码器的多模态自回归模型,通过多模态生成预训练实现高效、灵活的高分辨率照片级图像生成,具备多任务能力。
Dongyang Liu, Shitian Zhao, Le Zhuo 等
提出基于质量、多样性和重要性的数据评估与选择方法,优化指令微调效果。
Yulei Qin, Yuncheng Yang, Pengcheng Guo 等
MiniCPM-V通过架构优化实现端侧部署,性能优于GPT-4V,支持30+语言。
Yuan Yao, Tianyu Yu, Ao Zhang 等