Coarse Correspondences Boost Spatial-Temporal Reasoning in Multimodal Language Model
引入粗糙对应增强多模态语言模型的空间-时间推理,无需架构修改或微调,提升性能达20%以上。
Benlin Liu, Yuhao Dong, Yiqin Wang 等
引入粗糙对应增强多模态语言模型的空间-时间推理,无需架构修改或微调,提升性能达20%以上。
Benlin Liu, Yuhao Dong, Yiqin Wang 等
SAM 2结合流式记忆实现图像与视频的高效提示式分割,性能提升显著。
Nikhila Ravi, Valentin Gabeur, Yuan-Ting Hu 等
提出MotionFix数据集和TMED模型,实现基于文本的3D人类运动编辑,利用条件扩散模型提升编辑精度。
Nikos Athanasiou, Alpár Cseke, Markos Diomataris 等
RFNet+RFFT提升广告图可用率,构建RF1M超百万标注数据
Zhenbang Du, Wei Feng, Haohan Wang 等
C3T方法在无监督模态适应中提升至少8%的准确率。
Abhi Kamboj, Anh Duy Nguyen, Minh N. Do
提出噪声选择与优化算法,基于逆向稳定性显著提升扩散模型生成质量。
Zipeng Qi, Lichen Bai, Haoyi Xiong 等
VD3D提出基于Plücker坐标的时空摄像机嵌入,控制大规模视频变换器实现3D摄像机运动。
Sherwin Bahmani, Ivan Skorokhodov, Aliaksandr Siarohin 等
提出VISA模型实现基于大语言模型的复杂视频目标推理与分割,显著优于现有方法。
Cilin Yan, Haochen Wang, Shilin Yan 等
FANet利用AFE模块结合SCM和FRM,提升复杂场景下语义分割性能,达成最新效果。
Muhammad Ali, Mamoona Javaid, Mubashir Noman 等
LightenDiffusion结合Retinex理论与扩散模型,实现无监督低光图像增强,性能超越现有方法。
Hai Jiang, Ao Luo, Xiaohong Liu 等
PaliGemma结合SigLIP-So400m和Gemma-2B,参数3B,展现广泛迁移能力。
Lucas Beyer, Andreas Steiner, André Susano Pinto 等
基于多模态大模型和世界模型,系统分析 embodied AI 的感知、交互与迁移能力。
Yang Liu, Weixing Chen, Yongjie Bai 等
提出EVI-MAE方法,结合视频和IMU数据,提升动作识别准确率达92.78%。
Mingfang Zhang, Yifei Huang, Ruicong Liu 等
Tailor3D利用双面图像快速实现个性化3D资产编辑,融合LoRA三平面Transformer,提升一致性与效率。
Zhangyang Qi, Yunhan Yang, Mengchen Zhang 等
提出TSGi模型,结合场景图与多模态信息实现交通事故分类,提升近5个百分点。
Aaron Lohner, Francesco Compagno, Jonathan Francis 等
GenArtist利用多模态大语言模型作为智能代理,实现图像生成与编辑的统一系统,超越DALL-E 3等模型。
Zhenyu Wang, Aoxue Li, Zhenguo Li 等
提出测试时对比概念方法,提升开放域语义分割的准确性。
Monika Wysoczańska, Antonin Vobecky, Amaia Cardiel 等
OneRestore框架通过交叉注意力机制实现复杂图像退化的恢复,提升了PSNR和SSIM。
Yu Guo, Yuan Gao, Yuxu Lu 等
提出基于内容感知的数据过拟合方法(Dy-DCA),实现单模型高效视频超分,提升PSNR和实时性能。
Gen Li, Zhihao Shu, Jie Ji 等
GlyphDraw2结合扩散模型与大语言模型,实现复杂海报自动生成,支持中英文文本与字体控制。
Jian Ma, Yonglin Deng, Chen Chen 等