Schoenfeld's Anatomy of Mathematical Reasoning by Language Models
ThinkARM框架揭示语言模型的推理动态,显著提高数学问题解决准确率。
Ming Li, Chenrui Fan, Yize Cheng 等
ThinkARM框架揭示语言模型的推理动态,显著提高数学问题解决准确率。
Ming Li, Chenrui Fan, Yize Cheng 等
提出OpenBench基准,利用多传感器数据评估MLLMs的空间推理能力,发现其在开放环境中表现不足。
Mingrui Wu, Zhaozhi Wang, Fangjinhua Wang 等
VA-π通过变分策略对像素生成模型进行后训练优化,显著提升FID至7.65,改善图像质量。
Xinyao Liao, Qiyuan He, Kai Xu 等
提出基于最优耦合观测器的AV运动控制框架,有效抵抗有限传感器攻击,保障乘员安全与舒适。
Farzam Tajdari, Georgios Papaioannou, Riender Happee
StoryMem通过Memory-to-Video机制,将预训练单镜头扩散模型转化为多镜头长视频讲故事工具,显著提升跨镜头一致性。
Kaiwen Zhang, Liming Jiang, Angtian Wang 等
本文综述扩散模型在基于模拟的推断中的应用,涵盖训练、推断和评估设计,强调指导、得分组合、流匹配等关键技术。
Jonas Arruda, Niels Bracher, Ullrich Köthe 等
提出高斯熵最优运输的谱缩减方法,通过特征谱收缩实现高效多尺度分析。
Ho Yun
EchoTrail-GUI通过批评引导的自我探索为GUI代理构建可操作的记忆,显著提高任务成功率。
Runze Li, Yuwen Zhai, Bo Xu 等
Signal-SGN++通过拓扑增强的时间-频率脉冲图网络实现骨架动作识别,能耗显著降低。
Naichuan Zheng, Xiahai Lun, Weiyi Li 等
提出GenSDR,利用生成模型实现非线性充分维度约简,具备全信息恢复能力。
Shuntuo Xu, Zhou Yu, Jian Huang
探讨NLP中概念化和操作化的教学与批判,强调跨学科阅读和讨论。
Vagrant Gautam
SWE-EVO基准测试结合多文件长远软件演化任务,模型仅达25%,揭示现有AI编码代理的巨大差距。
Tue Le, Minh V. T. Thai, Dung Nguyen Manh 等
RadarGen利用扩散模型,从多视角摄像头生成逼真的汽车雷达点云,结合BEV表示与预训练模型引导。
Tomer Borreda, Fangqiang Ding, Sanja Fidler 等
YOTO框架通过可微分子集选择和多任务学习,在单细胞转录组数据中实现高效基因子集选择与预测。
Daphné Chopard, Jorge da Silva Gonçalves, Irene Cannistraci 等
Seed-Prover 1.5以Agentic RL和测试时扩展,在PutnamBench达88%。
Jiangjie Chen, Wenxiang Chen, Jiacheng Du 等
Mitty基于扩散变换器实现端到端人类示范视频到机器人执行视频的生成。
Yiren Song, Cheng Liu, Weijia Mao 等
提出基于扩散映射的核岭回归(DM-KRR)实现复杂动力系统长时预测,显著优于现有方法。
Jiwoo Song, Daning Huang, John Harlim
提出DTDR,基于动态依赖关系的轻量检索提升函数调用成功率23%-104%。
Bhrij Patel, Davide Belli, Amir Jalalirad 等
提出LongShOTBench,结合长视频多模态推理,采用基于评分的诊断机制,评估105模型,最高达66.64%。
Mohammed Irfan Kurpath, Jaseel Muhammad Kaithakkodan, Jinxing Zhou 等
提出后验行为克隆(PostBC)提升RL微调效率,确保行为覆盖。
Andrew Wagenmaker, Perry Dong, Raymond Tsao 等