Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
提出MMRB2基准,评估多模态奖励模型在文本-图像、编辑、推理任务中的表现,最高API模型Gemini 3 Pro达80%。
Yushi Hu, Reyhane Askari-Hemmat, Melissa Hall 等
提出MMRB2基准,评估多模态奖励模型在文本-图像、编辑、推理任务中的表现,最高API模型Gemini 3 Pro达80%。
Yushi Hu, Reyhane Askari-Hemmat, Melissa Hall 等
Kling-Omni为多模态视频生成框架,融合多模态输入实现高保真内容,支持编辑与推理。
Kling Team, Jialu Chen, Yuanzheng Ci 等
VLA模型整合视觉、语言和动作,提升自动驾驶的可解释性和通用性。
Tianshuai Hu, Xiaolu Liu, Song Wang 等
证明条件充分统计后,e变量期望效用提升,类比Rao-Blackwell定理。
Dante de Roos, Ben Chugg, Peter Grünwald 等
提出TODSynth框架结合MM-DiT和CRFM,有效提升遥感语义分割合成数据质量。
Yunkai Yang, Yudong Zhang, Kunquan Zhang 等
本研究提出JustRL,采用单阶段固定超参数训练1.5B模型,性能超越复杂方法,训练稳定且耗费更少计算资源。
Bingxiang He, Zekai Qu, Zeyuan Liu 等
分析PPO-Clip的非渐近全局收敛性,基于f-散度正则化,导出线性收敛率。
Yin Liu, Qiming Dai, Junyu Zhang 等
N3D-VLM通过原生3D感知与空间推理,显著提升3D目标定位与理解能力。
Yuxin Wang, Lei Ke, Boqiang Zhang 等
本综述系统梳理了时空知识图模型,分析其起源、建模维度及应用挑战。
Philipp Plamper, Hanna Köpcke, Anika Groß
提出基于Practical Inquiry Model的科学通用智能定义,设计SGI-Bench评估模型在深度研究、创新、实验等方面的表现。
Wanghan Xu, Yuhao Zhou, Yifan Zhou 等
本研究评估6个SpeechLLMs在16个基准上的性能,发现大多能匹配或超越传统级联架构,强调LLM整合的重要性。
Sara Papi, Javier Garcia Gilabert, Zachary Hopton 等
OS-Oracle框架通过310k样本数据集实现跨平台GUI批评模型的最先进性能。
Zhenyu Wu, Jingjing Xie, Zehao Li 等
BayesSum算法通过高斯过程在离散空间中高效估计期望值,实验显示样本需求减少50%以上。
Sophia Seulkee Kang, François-Xavier Briol, Toni Karvonen 等
提出VoP方法,利用Web规模知识提升MLLM在城市导航中的表现,成功率显著提高。
Dwip Dalal, Utkarsh Mishra, Narendra Ahuja 等
提出mimic-video,结合预训练视频模型与逆动力学解码器,实现机器人控制的样本效率提升10倍,收敛速度加快2倍。
Jonas Pai, Liam Achenbach, Victoriano Montesinos 等
提出“Off-The-Grid”架构,通过子像素级检测优化3D高斯原语布局,显著提升场景重建质量与效率。
Arthur Moreau, Richard Shaw, Michal Nazarczuk 等
SoliReward通过单项二元注释和层次渐进查询注意机制,提升视频生成奖励模型的鲁棒性。
Jiesong Lian, Ruizhe Zhong, Zixiang Zhou 等
研究发现语义等价代码转换可降低LLM的成员推断成功率,RenameVariable规则使成功率降低10.19%。
Hua Yang, Alejandro Velasco, Thanh Le-Cong 等
EVICPRESS通过联合KV缓存压缩与逐出策略,优化LLM推理中的延迟与质量。
Shaoting Feng, Yuhan Liu, Hanchen Li 等
提出基于On-policy专家校正的多轮语言模型训练方法,有效缓解协变量偏移,提升软件工程任务表现。
Niklas Lauffer, Xiang Deng, Srivatsa Kundurthy 等