EvoHarnessBench: Can Your Agents Keep Pace with an Evolving Harness?
EVOHARNESSBENCH评估代理在不断发展的工具、技能、代理环境中表现,揭示性能下降与适应性不足。
Zixuan Ke, Vaidehi Patil, Haizhou Shi 等
EVOHARNESSBENCH评估代理在不断发展的工具、技能、代理环境中表现,揭示性能下降与适应性不足。
Zixuan Ke, Vaidehi Patil, Haizhou Shi 等
UniCon采用以上下文单元为核心的统一建模架构,显著提升CTR预测性能。
Jiajun Cui, Zhengqi Xu, Fan Zhang 等
提出R2S-Eval,通过真实到模拟校准结合视觉-语言模型偏好评估,实现机器人行为的稳定评价。
Yidi Wang, Feixiang Ruan, Ruoqu Chen 等
RoboTok利用3D手轨迹学习互联网视频检索,提升机器人操控示范匹配。
Howard Qian, Yiting Chen, Yunfei Xie 等
OQRC以有限占用建模量化风险,有限样本下显著收紧风险界,MS COCO风险差距降低78.64%。
Zihao Shi, Huajun Xi, Bingyi Jing 等
SolarWM利用多源数据引擎和原生适配框架,训练长时序视频世界模型,支持实时交互。
Junchao Huang, Guian Fang, Shengju Qian 等
引入预测状态匹配训练目标,提升Web代理的判别能力和任务成功率。
Kelvin Li, Dhruv Pendharkar, Anish Pahilajani 等
提出Graph Machine(GM),维护O(n)状态,通过稀疏动态路由提升预训练效率,替代75%Transformer层。
Lintai Hou
GRADSOLVE是基于JAX的GPU高效反向微分工具,针对ODE集成实现快速精确梯度。
Alessio Spurio Mancini
提出教师门控的在策略蒸馏(TGOPD),在提示级别验证教师可靠性,提升性能并显著提高GPU利用率。
Zhiwei Zhang, Zechen Sun, Fei Zhao 等
提出RIG-BENCH,系统评估视觉推理生成能力,涵盖四大任务域,揭示模型推理与生成的差距。
Yutong Liu, Nan Huang, Xu Cao 等
提出TRACE架构,实现自主机器人决策的可追溯性,达98.6%的证据追溯率。
Cagri Temel
通过构建合成与真实数据,验证用户反馈对LLMs提升效果显著,揭示评估偏差。
Shachar Don-Yehiya, Leshem Choshen, Omri Abend
采用大规模问题策划、合成推理、SFT和RL,训练出超越人类的编程AI模型,IOI 2026获奖。
Aleksander Ficek, Sean Narenthiran, Mehrzad Samadi 等
提出UE5M3 FP4块尺度方案,结合周期性张量缩放,优化语言模型预训练,模型达190B参数,训练损失优于NVFP4。
Robert Hu, Carlo Luschi, Paul Balanca
提出AICOME框架,通过 respondent-level AI测量恢复个体与群体效应,验证CFPS数据。
Wenxin Jiang, Xuyang Wang, Yuxiao Wu
提出基于验证证书的frb100-40最优性证明,验证最大独立集为100,耗时显著降低。
Onur Uğurlu
基于de Finetti定理,评估语言模型概率预测的内在不一致性,利用线性规划计算最大Dutch-book利润。
Isaiah Andrews, Suproteem Sarkar
SafeEvolve通过轨迹经验实现外部护具与策略的协同演化,显著提升安全性。
Qinghua Mao, Wanying Qu, Dadi Guo 等
提出基于测量的子网络选择方法,通过结构压缩和检索引导微调,实现工厂边缘设备高效部署,模型大小与性能解耦。
Vasileios Rizeakos, Georgios Paisios, Alexandros Machairas 等