Training Communication-Efficient Mixture-of-Experts Language Models with Layer Re-Configuration
采用层重构的通信高效专家混合模型,31.5B参数下GPU小时减少33.3%。
Simeng Sun, Roger Waleffe
采用层重构的通信高效专家混合模型,31.5B参数下GPU小时减少33.3%。
Simeng Sun, Roger Waleffe
SpikeOPD通过自生成前缀稳定蒸馏自回归尖峰语言模型,提升准确率2.9个点。
Enqiao Lu, Xingrui Yu, Yiwei Fu 等
提出CorporateBench,基于时间演化知识库的企业级多任务问答基准,涵盖超23万文档。
Sil Hamilton, Albert Yu Sun, Oscar J. Romero 等
WM-R1通过世界模型替代真实环境,显著提升GUI代理的推理能力。
Yu Han, Tianwen Qian
Addressing critical global challenges, from food security and disaster risk to disease outbreaks and socio-economic vulnerability, demands high-fidelity geospatial modeling. However, building predicti
Evelyn Ma, Rama Kumar Pasumarthi, Kishwar Shafin 等
SwarmWorld利用无角色、多智能体自组织,构建持久技术生态,超越孤立搜索。
Subhadeep Pal, Fiona Y. Wang, Markus J. Buehler
提出多目标强化学习的MO-IKE,提升LLM知识编辑的可靠性(92%)和保持率(63.4%),同时兼顾广泛性和特异性。
Xuzhong Wang, Maiqi Jiang, Tejal Nair 等
SPO++通过标准化终点优势和事件时间记忆,提升异步强化学习效率,超越SPO。
Kai Ruan, Jinghao Lin, Qianshan Wei 等
提出FedV-KGQA,支持多跳推理的垂直分割知识图问答框架,保持近似集中性能。
Md Saikat Islam Khan Bappy, Oshani Seneviratne
提出CES-PK框架,通过轻量符号约束提升LLM在不完整知识图中的答案验证效果。
Emanuel Kitzelmann
引入FrontierChallenge,评估跨域科学工作流的完整性,最佳模型完成率仅20.6%。
Liangcai Su, Zhaopeng Feng, Zhuo Chen 等
StarHarness通过分层搜索在企业环境中演化固定模型权重的任务调度框架,提升性能20-35个百分点。
Esakkivel Esakkiraja, Denis Akhiyarov, Vikas Yadav 等
CAFE框架通过共同进化反馈提升搜索代理性能,在七个基准上表现优异。
Boyang Liu, Senjie Jin, Peixin Wang 等
MHA-CSP利用马氏距离实现复杂状态传播,参数仅119K。
Xiaohe Li
VideoHarness-RSI通过递归优化构建长视频上下文,提升冻结视觉语言模型的理解能力。
Guoyang Xu, Hao Chen
ReWorld通过分离控制与记忆训练,采用混合注意力窗口和边缘缓存,实现长时记忆与实时控制的平衡。
Zhifei Chen, Luozhou Wang, Guibao Shen 等
Prime Agent通过递归语言模型和持续性工具整合,实现长时程自主评估,提升ARC-AGI-3得分至95.5%。
Seth Karten, Alex L. Zhang, Kevin Thomas 等
采用贝叶斯潜能模型分析AI帮助对逻辑推理技能的影响,发现自主思考促进技能提升。
Shang Wu, Catarina G Belem, Shuyuan Fu 等
提出安全方向惩罚(SDP)缓解推理引起的模型偏差,基于表示空间分析,显著提升Qwen2.5-3B和7B模型安全性。
Yipeng Zhao, Qishun Yang, Shenzhe Zhu 等
通过能力评估,分析生成式世界模型向真实模拟器的差距,重点在物理规律和状态反馈。
Tong Wang, Huan Deng, Mucheng Yang 等