MathCoder-VL: Bridging Vision and Code for Enhanced Multimodal Mathematical Reasoning
MathCoder-VL以代码对齐视觉与数学,在MathVista几何子集达73.6%。
Ke Wang, Junting Pan, Linda Wei 等
MathCoder-VL以代码对齐视觉与数学,在MathVista几何子集达73.6%。
Ke Wang, Junting Pan, Linda Wei 等
MIRAGE基准测试评估模型在计数、关系和计数与关系任务上的空间感知能力。
Chonghan Liu, Haoran Wang, Felix Henry 等
L2T框架通过信息论强化学习优化LLM的推理效率和效果,减少不必要的token使用。
Jingyao Wang, Wenwen Qiang, Zeen Song 等
提出结合几何归纳偏差的安全层ATACOM,确保机器人基础模型的安全性。
Maximilian Tölle, Theo Gruner, Daniel Palenicek 等
提出ADS安全达标的评估标准,结合多层次风险分析与验证方法,确保无不合理风险。
Francesca Favaro, Scott Schnelle, Laura Fraade-Blanar 等
提出EnerVerse-AC,基于多级动作条件的机器人视觉环境生成模型,提升仿真与评估效率。
Yuxin Jiang, Shengcong Chen, Siyuan Huang 等
MetaSPO通过元学习优化系统提示,在14个数据集上提升性能。
Yumin Choi, Jinheon Baek, Sung Ju Hwang
Qwen3结合思考与非思考模式,参数规模达235B,提升多语言、多任务性能。
An Yang, Anfeng Li, Baosong Yang 等
提出InForage,基于信息觅食理论的强化学习框架,优化动态检索与推理,提升复杂任务表现。
Hongjin Qian, Zheng Liu
提出CodePDE框架,利用大语言模型生成偏微分方程求解器,结合推理、调试、优化和扩展策略,达成优异性能。
Shanda Li, Tanya Marwah, Junhong Shen 等
TRAIL框架通过148条人类标注的追踪数据评估多代理系统,最佳模型仅得11%。
Darshan Deshpande, Varun Gangal, Hersh Mehta 等
利用傅里叶神经算子和核算子学习心脏激活和复极化时间,提升计算效率。
Edoardo Centofanti, Giovanni Ziarelli, Nicola Parolini 等
ResULIC结合语义残差编码与压缩感知扩散模型,实现极低比特率图像压缩,LPIPS和FID节省超66%。
Anle Ke, Xu Zhang, Tong Chen 等
本文系统综述了大规模语言模型(如GPT-4、LLaMA)在计算机辅助设计(CAD)中的应用,涵盖方法、数据、实验和未来方向。
Licheng Zhang, Bach Le, Naveed Akhtar 等
本文提出DanceGRPO,基于稳定的Group Relative Policy Optimization(GRPO)框架,有效提升视觉生成模型在多任务、多场景下的强化学习性能,实验中最高提升达181%。
Zeyue Xue, Jie Wu, Yu Gao 等
Step1X-3D通过混合VAE-DiT和扩散模型生成高质量可控的3D资产,数据集达200万。
Weiyu Li, Xuanyang Zhang, Zheng Sun 等
本研究评估大规模语言模型在化学推理中的能力,利用ChemIQ基准测试模型结构理解与推理,最高准确率达57%。
Nicholas T. Runcie, Charlotte M. Deane, Fergus Imrie
本研究提出ChemRAG-Bench和ChemRAG-Toolkit,利用多源知识提升化学任务中的检索增强生成性能,平均提升17.4%。
Xianrui Zhong, Bowen Jin, Siru Ouyang 等
MiMo-7B通过三阶段数据混合和多Token预测提升推理能力,预训练25万亿Token,后训练130K验证问题,显著优于更大模型。
LLM-Core Xiaomi, :, Bingquan Xia 等
DARLR通过动态奖励优化推荐系统,实验显示在KuaiRand上提升16%。
Yi Zhang, Ruihong Qiu, Xuwei Xu 等