UniMoMo: Expert Merging-Based MoE Acceleration for Large Recommendation Models
UniMoMo通过专家合并实现推荐模型MoE的后训练压缩,提升速度与效率。
Lei Xin, Bin Gu, Peize Li 等
UniMoMo通过专家合并实现推荐模型MoE的后训练压缩,提升速度与效率。
Lei Xin, Bin Gu, Peize Li 等
FailForge通过诊断失败实例,诱导可迁移的程序技能,提升代码代理的验证成功率6.6点。
Dongyi Lv, Fushun E, Aichen Cai 等
提出IoA-Suite检测隐藏分歧,模型F1仅达49.5%,私有上下文是瓶颈。
Kaiming Liu, Fuwen Luo, Ziyue Wang 等
提出统一的自蒸馏框架USD,通过双变量调节令 supervision 与学生学习能力匹配,显著提升推理性能。
Yongkang Yang, Zhezheng Hao, Hong Zhang 等
提出SkillCDG,通过两层图模型提升长SKILL合规检测,F1提升12.8%,节省64.3%令牌。
Shuaitao Zhao, Feng Ni, Lichao Ma 等
提出基于代表性、选择和推理的归因框架,实证分析多页视觉丰富文档理解中的失败机制。
Lewei Xu, Yihao Ding, Zihan Xu 等
视觉语言模型通过将时间序列编码为2D图像,减少了输入token数量,提升了精度并降低了能耗。
Bhavika Jalli, Nikhil Korati Prasanna, Jayanta Choudhury
提出CoBa,基于计算平衡的测试时推理调度策略,减少49.1%的参数加权令牌,达85.13%宏观准确率。
Yan Zhou, Yue Ouyang, Kaiyang Zheng 等
FinRank通过手工标注硬负样本,提升金融文件问答的证据识别能力,基准涵盖1185条问答记录。
Sasan Mansouri, Daniel Saad, Mark Wahrenburg 等
WNM-3D以3D场景令牌增强闭环VLN,但论文节选未披露GN-Bench具体分数。
Yuehao Huang, Yunzi Wu, Xiaotao Zhang 等
提出MemWM,通过世界记忆库提升文本世界模型的状态保真度,SSF提升达206.3%。
Yujun Wang, Tao Zhang, Jinhe Bi 等
SkillEval通过线性方向投影评估技能文档的四个可解释维度,关联下游任务表现。
Jiahui Han, Qinuo Li, Ziheng Peng 等
提出SYF,基于LLM的交互推荐系统,实现多模态实时内容调控。
Ziyun Xu, Bosen Ding, Yue Zhang 等
本文分析静态与演变数据中解释方法的评估挑战,提出基于偏差检测和概念漂移的改进策略。
Jerzy Stefanowski
引入HarnessOpt-Bench基准,评估5个前沿大型语言模型在昂贵且随机的全流程 harness 优化中的表现,揭示模型差异和潜在提升空间。
Varun Ursekar, Apaar Shanker, Yash Maurya 等
CAV与TopK SAE审计显示:概念可恢复性不等于对评分的实际影响。
Arya Labroo, Mengjie Qian, Kate Knill
提出AgentOPSD,基于递归贝叶斯信念更新的长时序智能体信用分配方法,显著优于基线。
Zi-Han Wang, Zhengxi Lu, Zhiyuan Yao 等
SkillTV-Bench评估长轨迹任务中的判决准确性,提升14.8个百分点。
Zhi Han, Chenxi Zeng, Liuhaichen Yang 等
SCP-NL2TL用语义核验与保序风险控制,在α=0.10下选择性拒绝不可靠逻辑公式。
Yixuan Wang, Licheng Luo, Yu Fu 等
本文引入IRT模型对192个大模型在8个安全基准上的表现进行分析,发现三大潜在能力,显著降低评估成本并支持模型审计。
Joshua Fonseca Rivera, Neil Shah, David Demitri Africa 等