OneRestore: A Universal Restoration Framework for Composite Degradation
OneRestore框架通过交叉注意力机制实现复杂图像退化的恢复,提升了PSNR和SSIM。
Yu Guo, Yuan Gao, Yuxu Lu 等
OneRestore框架通过交叉注意力机制实现复杂图像退化的恢复,提升了PSNR和SSIM。
Yu Guo, Yuan Gao, Yuxu Lu 等
提出基于内容感知的数据过拟合方法(Dy-DCA),实现单模型高效视频超分,提升PSNR和实时性能。
Gen Li, Zhihao Shu, Jie Ji 等
GlyphDraw2结合扩散模型与大语言模型,实现复杂海报自动生成,支持中英文文本与字体控制。
Jian Ma, Yonglin Deng, Chen Chen 等
提出MMLongBench-Doc,基于135份长篇PDF文档的多模态长文本理解基准,评估14个LVLM模型,最佳F1仅42.7%。
Yubo Ma, Yuhang Zang, Liangyu Chen 等
FoleyCrafter利用预训练文本到音频模型,通过语义适配器和时间控制器实现高质量、同步的视频配音。
Yiming Zhang, Yicheng Gu, Yanhong Zeng 等
CORE4D是基于混合捕获与合成的4D人-物-人交互数据集,支持协作物体重排,含1K真实与10K合成序列。
Yun Liu, Chengwen Zhang, Ruofan Xing 等
提出动态高斯弹球(Gaussian Marbles)方法,用于单目视频中的新视角合成,结合三项核心改进实现高质量重建。
Colton Stearns, Adam Harley, Mikaela Uy 等
StableNormal通过降低扩散推理方差,实现高质量、稳定且锐利的法线估计,无需集成,适应复杂场景。
Chongjie Ye, Lingteng Qiu, Xiaodong Gu 等
提出Cambrian-1,基于视觉的多模态大模型,利用20余个视觉编码器,创新空间视觉聚合器(SVA),实现优异性能。
Shengbang Tong, Ellis Brown, Penghao Wu 等
VGA通过图像中心微调减少幻觉,提升GUI理解,使用63.8k数据集和FAC方法。
Ziyang Meng, Yu Dai, Zezheng Gong 等
HiFiAlbedo模型通过纹理量化从单张图像中估计高保真面部反照率。
Zimin Ran, Xingyu Ren, Xiang An 等
提出多维剪枝框架,联合通道、层和块剪枝,达成高比例裁剪下的延迟与准确率平衡。
Xinglong Sun, Barath Lakshmanan, Maying Shen 等
提出无需向量量化的自回归图像生成,通过扩散模型建模每个Token的概率,显著提升生成质量。
Tianhong Li, Yonglong Tian, He Li 等
提出GeoGPT4V,通过GPT-4V生成对齐的几何问题和图像,显著提升模型几何理解能力。
Shihao Cai, Keqin Bao, Hangyu Guo 等
提出CoMM数据集,通过多角度筛选提升图文内容连贯性与一致性,显著增强多模态模型的理解与生成能力。
Wei Chen, Lin Li, Yongqi Yang 等
L4GM是一种基于4D高斯表示的快速单视角视频动画重建模型,能在一秒内实现高质量动画生成。
Jiawei Ren, Kevin Xie, Ashkan Mirzaei 等
Glyph-ByT5-v2通过扩展多语种数据集和引入偏好学习,实现10种语言的高精度视觉文本渲染与美学优化。
Zeyu Liu, Weicong Liang, Yiming Zhao 等
提出Med-HallMark基准和MediHall Score,结合多任务和层级分类,提升医疗视觉语言模型的虚假信息检测能力。
Jiawei Chen, Dingkang Yang, Tong Wu 等
CarLLaVA采用LLaVA视觉编码器和LLaMA架构,纯摄像头输入实现闭环自主驾驶,性能领先。
Katrin Renz, Long Chen, Ana-Maria Marcu 等
提出D-NPC,通过动态神经点云实现单目视频中的非刚性场景新视角合成。
Moritz Kappel, Florian Hahlbohm, Timon Scholz 等