dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
提出dVLA,基于扩散模型的多模态链式推理,达成96.4%成功率。
Junjie Wen, Minjie Zhu, Jiaming Liu 等
提出dVLA,基于扩散模型的多模态链式推理,达成96.4%成功率。
Junjie Wen, Minjie Zhu, Jiaming Liu 等
引入QFrBLiMP,基于人类标注的魁北克法语最小对比语法测试集,评估大模型的语法理解能力。
David Beauchemin, Pier-Luc Veilleux, Johanna-Pascale Roy 等
提出一种混合奖励归一化方法PPR,在多个基准上取得最先进性能。
Peiran Xu, Zhuohao Li, Xiaoying Xing 等
Forensic-Chat框架通过先感知后推理的方法提升假图检测的泛化性和可解释性。
Kaiqing Lin, Zhiyuan Yan, Ruoxin Chen 等
该研究提出“从感知到认知”框架,分析MLLMs在视觉语言交互中的瓶颈,提供解决方案。
Chenyue Zhou, Mingxuan Wang, Yanbiao Ma 等
提出SARM:基于视频的阶段感知奖励建模,提升长时序机器人操控性能,成功应用T恤折叠任务,成功率达83%。
Qianzhong Chen, Justin Yu, Mac Schwager 等
YOLO26通过移除DFL、端到端无NMS推理、引入ProgLoss、STAL和MuSGD,实现实时边缘检测,提升速度与精度。
Ranjan Sapkota, Rahul Harsha Cheppally, Ajay Sharda 等
Cogito, ergo ludo(CEL)通过推理和规划学习游戏,成功掌握多种网格世界任务。
Sai Wang, Yu Wu, Zhongwen Xu
提出GCM模型,利用多模型历史预测提升校准性和泛化能力,超越自我预测。
Hanqi Xiao, Vaidehi Patil, Hyunji Lee 等
提出ROVER算法,通过评估固定随机策略的Q值实现LLM推理,性能优于复杂方法。
Haoran He, Yuxiao Ye, Qingpeng Cai 等
提出一种光谱-格拉斯曼Wasserstein度量,显著提升动态系统的算子表示比较效率。
Thibaut Germain, Rémi Flamary, Vladimir R. Kostic 等
提出DelRec,通过微分插值训练递归突触延迟,提升SNN时序处理能力。
Alexandre Queant, Ulysse Rançon, Benoit R Cottereau 等
T-POP算法通过在线偏好反馈实现实时个性化,显著提升LLM性能。
Zikun Qu, Min Zhang, Mingze Kong 等
InfLLM-V2提出密稀切换注意力机制,优化长短序列处理效率,性能接近98%以上。
Weilin Zhao, Zihan Zhou, Zhou Su 等
SPLICE基准测试揭示VLM在视觉推理上与人类表现差距显著。
Mohamad Ballout, Okajevo Wilfred, Seyedalireza Yaghoubi 等
提出NeMo任务评估视频长时理解,结合自动化数据生成,构建NeMoBench基准。
Zi-Yuan Hu, Shuo Liang, Duo Zheng 等
Samiksha方法通过社区反馈在印度医疗领域评估LLM,提升多语言模型表现。
Hamna Hamna, Gayatri Bhat, Sourabrata Mukherjee 等
提出Latent Visual Reasoning(LVR),在视觉嵌入空间实现端到端推理,显著提升视觉问答性能。
Bangzheng Li, Ximeng Sun, Jiang Liu 等
提出Grounding IDs,通过外部线索改善多模态绑定,提升视觉-语言模型性能。
Hosein Hasani, Amirmohammad Izadi, Fatemeh Askari 等
引入EvolveCast框架评估大模型在新信息下的预测更新能力,发现模型普遍保守且不够合理。
Zhangdie Yuan, Zifeng Ding, Andreas Vlachos