Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts
提出无损负载均衡策略,避免辅助损失引入干扰梯度,有效改善专家负载平衡。
Lean Wang, Huazuo Gao, Chenggang Zhao 等
提出无损负载均衡策略,避免辅助损失引入干扰梯度,有效改善专家负载平衡。
Lean Wang, Huazuo Gao, Chenggang Zhao 等
CoT-SelfEvolve用StackOverflow+自纠循环提升DS-1000代码生成
Thai Tang Quoc, Duc Ha Minh, Tho Quan Thanh 等
提出Grand canonical扩散模型,采用连续体体素表示,成功生成晶体相和晶界结构。
Bo Lei, Enze Chen, Hyuna Kwon 等
DC²框架提升MLLM对4K&8K图像的感知能力,准确率提高6%。
Wenbin Wang, Liang Ding, Minyan Zeng 等
分类四种概念模型:抽象主义、相似性、功能和不变性,揭示其数学结构。
Jun Otsuka
通过知识蒸馏将Transformer转为线性RNN(Mamba),提升推理效率,性能媲美原模型。
Junxiong Wang, Daniele Paliotta, Avner May 等
符号工作记忆增强语言模型处理复杂规则应用,显著提升多步骤推理准确性。
Siyuan Wang, Zhongyu Wei, Yejin Choi 等
提出鲁棒优化方法构建随机过程置信带,显著减少样本需求。
Timothy Chan, Jangwon Park, Vahid Sarhangian
Show-o是一款融合自回归与离散扩散的单一Transformer模型,能同时实现多模态理解与生成,参数规模约1.3B,性能优越。
Jinheng Xie, Weijia Mao, Zechen Bai 等
RTF框架结合ReAct策略与工具检索,提升人类级预测准确率,超越部分人类表现。
Elvis Hsieh, Preston Fu, Jonathan Chen
提出GRAB基准,涵盖五类任务和23个图属性,评估20个LMM模型,最高得分21%。
Jonathan Roberts, Kai Han, Samuel Albanie
提出“Sinkhorn桥”估计Schrödinger桥,无需反复模拟扩散或训练神经网络。
Aram-Alexandre Pooladian, Jonathan Niles-Weed
LARR结合域知识预训练与对比学习,提升实时场景语义理解与CTR预测。
Zhizhong Wan, Bin Yin, Junjie Xie 等
TrackGo利用自由掩码和箭头实现高精度、低成本的可控视频生成,采用TrackAdapter增强时序自注意力。
Haitao Zhou, Chuang Wang, Rui Nie 等
基于量子支持向量机和变分量子电路的异常检测算法,提升了处理速度和准确性。
Sebastiano Corli, Lorenzo Moro, Daniele Dragoni 等
使用DDC损失训练无Alpha标签的抠图模型,在AM-2K和P3M-10K数据集上表现优异。
Wenze Liu, Zixuan Ye, Hao Lu 等
提出Goldfish系列单语模型,针对350种低资源语言,参数为125M,显著优于多语模型在困惑度和语法任务中的表现。
Tyler A. Chang, Catherine Arnett, Zhuowen Tu 等
提出了两种基于GPU的布尔矩阵逻辑编程算法,在大规模推理任务中实现1-4个数量级的加速。
Lun Ai
提出MOHAWK方法,将预训练Transformer模型蒸馏为低复杂度的SSM模型,显著提升性能。
Aviv Bick, Kevin Y. Li, Eric P. Xing 等
本研究提出基于物理感知的无数据动作屏蔽深度强化学习,用于拼装序列规划,成功构建250+乐高结构。
Ruixuan Liu, Alan Chen, Weiye Zhao 等