MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning
MedVLM-R1通过强化学习实现医学视觉语言模型的显式推理,提升准确率至78.22%。
Jiazhen Pan, Che Liu, Junde Wu 等
MedVLM-R1通过强化学习实现医学视觉语言模型的显式推理,提升准确率至78.22%。
Jiazhen Pan, Che Liu, Junde Wu 等
提出ViDoRAG框架,结合GMM多模态检索与多代理推理,提升视觉文档检索生成性能超10%。
Qiuchen Wang, Ruixue Ding, Zehui Chen 等
该综述以高维时空分布序列采样统一分析一致性,比较VAE、AR、扩散与Flow模型及评测体系。
Zhiyu Yin, Kehai Chen, Xuefeng Bai 等
PosterSum采用分段层次方法,提升科学海报摘要准确率,ROUGE-L提升3.14%。
Rohit Saxena, Pasquale Minervini, Frank Keller
VideoGrain通过调制时空注意力机制,实现多粒度视频编辑中的细粒度控制。
Xiangpeng Yang, Linchao Zhu, Hehe Fan 等
ReAuSE通过内置自回归搜索引擎实现知识增强VQA,提升性能达9.6%。
Xinwei Long, Zhiyuan Ma, Ermo Hua 等
CCGS方法通过点图关联和分片平面约束,实现一致且紧凑的3D高斯分割场,在ScanNet和Replica数据集上表现优异。
Wenhao Hu, Wenhao Chai, Shengyu Hao 等
提出一种基于SNN的多模态人类动作识别框架,显著提高能效和准确率。
Naichuan Zheng, Hailun Xia, Zeyu Liang 等
提出YOLOv12,结合注意力机制与高效架构,实现40.6% mAP,速度1.64ms,优于YOLOv10/11。
Yunjie Tian, Qixiang Ye, David Doermann
提出UTR框架,解决视频MLLM的时间黑客问题,提高视频理解能力。
En Yu, Kangheng Lin, Liang Zhao 等
提出Conv-LiGRU模型,减少测试时过度计算,提升CIFAR10-C准确率。
Hieu Tran Bao, Nguyen Cong Dat, Nguyen Duc Anh 等
NPSim通过单目逆向渲染和光线追踪实现昼夜图像转换,提升夜间语义分割性能。
Shutong Zhang
VidCRAFT3通过建模几何、运动和光照的交互,实现图像到视频的精确控制。
Sixiao Zheng, Zimian Peng, Yanpeng Zhou 等
提出MMGDreamer,结合混合模态图实现几何可控的3D室内场景生成,显著提升控制精度。
Zhifei Yang, Keyang Lu, Chao Zhang 等
Long-VITA是一款支持1百万Token长序列的多模态模型,结合视觉、视频与文本理解,达成短序列高精度。
Yunhang Shen, Chaoyou Fu, Shaoqi Dong 等
Goku采用修正流变换Transformer,实现图像视频联合生成,性能领先。
Shoufa Chen, Chongjian Ge, Yuqi Zhang 等
提出滑动块注意力(STA),在视频生成中实现2.8-17倍加速,保持质量。
Peiyuan Zhang, Yongqi Chen, Runlong Su 等
Mosaic3D提出了一种新型数据生成管道和模型,生成5.6M高质量3D掩码-文本对,提升了开放词汇3D分割性能。
Junha Lee, Chunghyun Park, Jaesung Choe 等
MotionLab提出基于运动-条件-运动范式的统一人类运动生成与编辑框架,利用rectified flows实现多任务学习。
Ziyan Guo, Zeyu Hu, De Wen Soh 等
BVINet通过零标注实现盲视频修复,显著提升修复效果。
Zhiliang Wu, Kerui Chen, Kun Li 等