MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning
MedVLM-R1通过强化学习实现医学视觉语言模型的显式推理,提升准确率至78.22%。
Jiazhen Pan, Che Liu, Junde Wu 等
MedVLM-R1通过强化学习实现医学视觉语言模型的显式推理,提升准确率至78.22%。
Jiazhen Pan, Che Liu, Junde Wu 等
Bi'an框架结合双语基准和轻量级模型,有效检测RAG中的幻觉内容。
Zhouyu Jiang, Mengshu Sun, Zhiqiang Zhang 等
CLADA框架通过认知负荷感知的动态激活提高LLM效率,速度提升20%,准确率下降不到2%。
Yiheng Yang, Yujie Wang, Chi Ma 等
OneRec采用端到端生成模型,结合会话偏好对齐,显著提升推荐效果。
Jiaxin Deng, Shiyao Wang, Kuo Cai 等
基于Gemini多智能体架构的Co-Scientist系统,通过自我演化提升假设质量,验证于药物重定位和新靶点发现。
Juraj Gottweis, Wei-Hung Weng, Alexander Daryin 等
ConsJudge方法提高了RAG模型评估的一致性,提升了LLM的判断准确性。
Shuliang Liu, Xinze Li, Zhenghao Liu 等
提出自信度(Self-Certainty)指标,利用LLM输出概率分布实现无外部奖励模型的高效Best-of-N选择。
Zhewei Kang, Xuandong Zhao, Dawn Song
本文提出嵌套核积分估计器,减少样本需求,提高收敛速度。
Zonghao Chen, Masha Naslidnyk, François-Xavier Briol
本文系统分析了利用大语言模型(LLMs)进行布局丰富文档信息提取的设计空间,提出LayIE-LLM测试套件,优化配置提升性能达37.5 F1点。
Gaye Colakoglu, Gürkan Solmaz, Jonathan Fürst
提出SpargeAttn,训练无关的通用稀疏注意力机制,显著加速多模态模型推理。
Jintao Zhang, Chendong Xiang, Haofeng Huang 等
提出GazeBot,利用凝视信息和运动瓶颈实现机器人技能的高再利用性。
Ryo Takizawa, Izumi Karino, Koki Nakagawa 等
提出ViDoRAG框架,结合GMM多模态检索与多代理推理,提升视觉文档检索生成性能超10%。
Qiuchen Wang, Ruixue Ding, Zehui Chen 等
该综述以高维时空分布序列采样统一分析一致性,比较VAE、AR、扩散与Flow模型及评测体系。
Zhiyu Yin, Kehai Chen, Xuefeng Bai 等
提出多模态大模型(MLLMs)在时间序列异常检测中的零样本能力,构建VisualTimeAnomaly基准,发现其在粗粒度异常检测中优于传统方法。
Xiongxiao Xu, Haoran Wang, Yueqing Liang 等
提出梯度引导的拒绝方向识别,发现多维概念锥,强调表示独立性。
Tom Wollschläger, Jannes Elstner, Simon Geisler 等
PosterSum采用分段层次方法,提升科学海报摘要准确率,ROUGE-L提升3.14%。
Rohit Saxena, Pasquale Minervini, Frank Keller
VideoGrain通过调制时空注意力机制,实现多粒度视频编辑中的细粒度控制。
Xiangpeng Yang, Linchao Zhu, Hehe Fan 等
AutoLogi通过程序验证和可控难度生成逻辑谜题,评估大模型推理能力,性能从35%到73%。
Qin Zhu, Fei Huang, Runyu Peng 等
ONPO以乐观镜像下降实现一般偏好对齐,理论间隙降至O(1/T),AlpacaEval最高48.6。
Yuheng Zhang, Dian Yu, Tao Ge 等
CODESYNC通过实时更新Python库API,提升大语言模型的代码同步能力。
Chenlong Wang, Zhaoyang Chu, Zhengxiang Cheng 等