UniMoMo: Expert Merging-Based MoE Acceleration for Large Recommendation Models
UniMoMo通过专家合并实现推荐模型MoE的后训练压缩,提升速度与效率。
核心发现
方法论
UniMoMo将训练好的稀疏专家模型转化为目标专家预算的标准MoE,采用基于功能相似性的无标签校准集评估专家响应,结合图粗化算法进行专家合并。通过专家响应的KL散度构建专家相似图,利用受保护机制避免高流量专家被频繁合并,最终融合专家参数并进行少量监督微调。该流程无需在线压缩模块,直接在离线阶段完成,确保模型在不同部署预算下保持较高的性能。
关键结果
- 在Amazon Beauty、KuaiRec和TenRec数据集上,4专家模型经过UniMoMo压缩后,NDCG@10的平均相对性能达到99.92%至102.30%,速度提升1.28×至1.63×。两专家模型在极端压缩点下,性能仍达98.36%至104.24%,速度提升达2.21×。这些结果验证了模型完整的转换与适配流程在多场景、多深度模型中的有效性。
- 通过专家响应的功能相似性评估和受保护机制,有效避免了性能下降,同时实现了专家数量的显著减少,满足不同部署预算的需求。实验还显示,采用该方法的模型在保持高准确率的同时,显著降低了推理延迟和计算成本。
- 在不同MoE层数和专家预算下,UniMoMo均表现出优异的性能-效率折衷能力,验证了其在实际推荐系统中的应用潜力。
研究意义
该研究突破了稀疏MoE模型在部署中的瓶颈,提出一种无需在线模块的离线专家合并方案,有效缩减模型规模,提升推理速度,满足工业场景对高效推荐的需求。它解决了训练后模型大小与性能之间的矛盾,为大规模推荐系统的模型压缩和快速部署提供了新思路,推动了推荐模型的实用化和普及。
技术贡献
UniMoMo创新性地将专家合并问题转化为基于功能相似性和流量保护的图粗化问题,提出专家响应的无标签校准评估机制,结合受保护策略实现高流量专家的稳定性。该方法无需引入额外在线压缩模块,只依赖离线校准数据,简化了模型部署流程。通过参数重构和少量微调,确保模型在不同预算下的性能一致性,显著优于传统参数剪枝和参数平均等压缩技术。
新颖性
UniMoMo首次提出基于专家响应功能相似性和流量保护的专家合并策略,结合图粗化算法实现稀疏专家模型的离线压缩,解决了专家合并中行为一致性和流量保护的难题。与现有专家融合方法不同,它不依赖参数距离或输出相似性,而是从模型行为出发,兼顾性能和流量分布,具有较强的实用性和鲁棒性。
局限性
- 该方法依赖于校准集的代表性,若校准数据不足或偏差较大,可能影响合并效果和模型性能。
- 在极端压缩情况下,模型仍可能出现性能下降,特别是在高复杂度任务或极端流量分布变化时。
- 专家响应的评估和合并过程具有一定的计算成本,尤其在大规模模型中,可能影响整体效率。
未来方向
未来可探索多层次、多尺度的专家合并策略,结合动态流量调度和自适应保护机制,进一步提升模型压缩的灵活性和鲁棒性。同时,结合在线微调和自监督学习,增强模型在实际部署中的适应能力。
AI 总览摘要
在工业推荐系统中,模型容量与部署成本之间存在明显矛盾。稀疏专家(MoE)模型通过条件计算提升了推荐能力,但其存储和路由仍依赖完整专家库,限制了实际应用的灵活性。本文提出的UniMoMo框架,创新性地将专家合并问题转化为基于功能相似性和流量保护的图粗化问题,实现了训练后模型的离线压缩。该方法利用无标签校准集评估专家响应,通过专家响应的KL散度构建专家相似图,结合受保护机制避免高流量专家被频繁合并,最终融合专家参数,获得符合目标专家预算的标准MoE模型。实验在Amazon Beauty、KuaiRec和TenRec数据集上验证了该方案的有效性,压缩后模型在保持几乎不变的推荐性能(NDCG@10性能比99.92%至102.30%)的同时,达到了1.28×至1.63×的推理速度提升。极端压缩点(两个专家)仍保持良好性能(98.36%至104.24%)并实现2.21×的加速。这一工作不仅解决了稀疏模型在部署中的规模瓶颈,也为大规模推荐系统的高效压缩提供了新思路。未来,结合动态流量调度和自适应保护机制,有望进一步优化模型的鲁棒性和适应性,推动推荐模型的普及与应用。
深度分析
研究背景
近年来,推荐系统模型不断演进,从因子分解、神经匹配到交叉网络、注意力机制和序列编码器,极大提升了推荐性能。伴随模型规模的扩大,稀疏专家(MoE)架构成为提升模型容量的关键技术,广泛应用于多任务、多行为场景中。现有研究主要关注模型训练和架构设计,如何在训练后高效压缩模型以满足实际部署需求仍是难点。传统的剪枝、量化技术在固定参数空间内优化,但难以应对专家响应行为的复杂性。专家合并技术如MergeMoE、HC-SMoE等,试图在保持性能的同时减少专家数,但多依赖参数距离或输出相似性,未充分考虑专家行为的动态特性。本文提出的UniMoMo,结合专家响应的功能相似性和流量保护,提供一种全新的离线压缩方案,填补了模型部署中的空白。
核心问题
稀疏MoE模型在训练完成后,如何在保证推荐性能的前提下,将专家数量缩减到有限预算内,是实际部署中的核心难题。现有方法多依赖参数距离或输出相似性,忽视了专家在推荐状态下的行为一致性和流量分布。若未合理合并,可能导致模型性能下降、推理效率降低,甚至出现流量不均衡的问题。如何在不引入在线模块的情况下,利用离线校准数据实现专家合并,成为亟待解决的关键技术难题。
核心创新
UniMoMo的核心创新在于:1)提出基于专家响应的功能相似性评估机制,避免参数距离带来的误导;2)引入专家流量保护机制,防止高流量专家被频繁合并,确保模型稳定性;3)采用图粗化算法,将专家合并问题转化为专家相似图的簇划分,结合专家响应的KL散度作为边权,优化合并策略;4)融合专家参数时,利用响应的线性校正确保非线性专家的输出一致性。整个流程无需在线压缩模块,依赖离线校准数据,简化部署,提升效率。
方法详解
- �� 利用训练好的稀疏MoE模型和无标签校准集,评估每个专家在共享状态下的响应,计算响应的均值和方差,构建专家响应的高维高斯模型。
- �� 计算专家间的KL散度,构建专家相似图,边权反映专家行为的相似程度。
- �� 采用贪心图粗化算法,逐步合并相似度最高且未被保护的专家对,形成目标专家数的簇。
- �� 在合并过程中,考虑专家的路由流量,保护高流量专家,避免其被频繁合并。
- �� 利用簇内专家响应的加权平均参数,结合响应的线性校正,融合专家参数,确保输出一致性。
- �� 最后,重建压缩后模型的路由和专家,进行少量微调以恢复性能。
实验设计
在Amazon Beauty、KuaiRec和TenRec数据集上,分别测试2、4、6层MoE模型。对比原始模型与UniMoMo压缩模型的性能变化(NDCG@10、速度提升),评估不同专家预算的效果。采用多组实验验证不同层数和专家数的鲁棒性,进行参数敏感性分析和消融研究,确保方法的普适性和稳定性。
结果分析
压缩后模型在所有数据集和层数上,性能几乎保持不变(相对性能99.92%至102.30%),速度提升1.28×至1.63×。在极端压缩(两个专家)下,性能仍达98.36%至104.24%,速度提升最高达2.21×。专家响应的功能相似性评估和流量保护机制,有效避免性能下降,验证了方法的有效性和鲁棒性。
应用场景
该方法适用于工业推荐系统中的模型压缩与部署,尤其在需要快速响应和低延迟场景中。通过离线压缩,模型可以在不同硬件平台和预算下灵活部署,降低存储和计算成本,提升用户体验。未来,可结合动态流量调度,进一步优化模型的适应性和鲁棒性。
局限与展望
依赖校准数据的代表性,若数据偏差大,可能影响合并效果。极端压缩可能导致性能下降,尤其在复杂任务或变化的流量分布中。合并过程计算成本较高,需优化算法以适应大规模模型。未来需探索动态保护机制和自适应微调策略。
通俗解读 非专业人士也能看懂
想象你经营一家工厂,里面有很多不同的工人(专家),每个工人擅长不同的任务。平时工厂运转正常,但如果需要节省成本,你可能会考虑把一些工人合并,让他们共同完成任务。可是,不能随便合并,否则可能会影响工厂的效率。UniMoMo就像一个聪明的管理者,它会根据工人的工作表现(专家响应)和工厂的订单(推荐状态)来决定哪些工人可以合并,哪些不能。它会先评估每个工人在不同任务中的表现,然后用一种特殊的算法,把表现相似、工作量不高的工人合成一组。这样,工厂就能用更少的人手,依然保持高效率。整个过程不用在工厂里增加新设备,只是在后台做一些调整,最后让工厂继续正常运转,节省成本又不影响质量。
简单解释 像给14岁少年讲一样
想象你在学校里有很多不同的老师(专家),每个老师都擅长不同的科目。有时候,老师们会教很多学生(模型的推荐任务),但如果学校想节省开支,就需要让一些老师合并,减少老师的数量。可是,不能随便合并,否则学生会觉得老师变得不专业或者不懂他们的需求。UniMoMo就像一个聪明的校长,它会观察每个老师的教学风格和学生的反馈(专家响应),判断哪些老师的教学内容很像,可以合成一组。它还会考虑哪些老师每天都很忙(高流量专家),避免把他们合并掉。这样,学校可以用更少的老师,依然让学生学得很好。整个过程不用在课堂上增加新老师,只是在后台调整老师的组合,最后让学校正常运作,既省钱又保证教学质量。
术语表
稀疏专家模型 (Sparse MoE)
一种模型架构,通过只激活部分专家实现高效推理,减少计算资源。技术上采用路由机制选择专家。
本文中用于提升推荐模型容量和效率的基础架构。
专家合并 (Expert Merging)
将多个专家的参数和行为融合成一个专家,以减小模型规模。技术上包括参数融合和行为匹配。
本文核心技术,用于模型压缩。
图粗化 (Graph Coarsening)
通过合并相似节点形成较大簇的算法,用于简化图结构。应用于专家合并中评估专家相似性。
UniMoMo中的关键算法步骤。
响应相似性 (Response Similarity)
衡量两个专家在相同输入下输出行为的相似程度,采用KL散度等指标。
评估专家行为一致性的重要依据。
受保护机制 (Protection Mechanism)
在合并过程中,避免高流量专家被频繁融合,确保模型稳定性。
UniMoMo中的关键策略。
开放问题 这项研究留下的未解疑问
- 1 如何在更复杂的动态流量环境中保持专家合并的鲁棒性仍需研究。当前方法主要依赖静态校准集,未来需探索在线自适应机制。
- 2 专家响应的评估指标是否能更好反映实际推荐性能,仍有优化空间。
原文摘要
Sparse mixture-of-experts (MoE) layers expand recommendation capacity through conditional computation, yet a trained checkpoint still stores and routes over its full expert bank. We study a deployment problem: convert that checkpoint to a smaller standard MoE under an explicit expert budget, without adding a compression-specific online module. To address this, we introduce UniMoMo, a post-training compression framework formulated as a constrained graph coarsening problem. Rather than relying on parameter distance, UniMoMo groups experts based on their functional similarity, using an unlabeled calibration set to measure how similarly experts respond to shared recommendation states. To prevent performance degradation, we introduce a layer-adaptive protection mechanism that restricts the merging of high-traffic experts based on their routing exposure. Across Amazon Beauty, KuaiRec, and TenRec with 2, 4, and 6 MoE blocks, the final four-expert checkpoints obtain source-relative five-run mean NDCG@10 ratios of 99.92%--102.30% and measured A100 speedups of 1.28$\times$--1.63$\times$. An aggressive two-expert, top-1 operating point obtains ratios of 98.36%--104.24% and speedups of 1.47$\times$--2.21$\times$. These endpoint results evaluate the complete conversion-and-adaptation workflow and show that a trained recommendation MoE can be exported at multiple serving budgets.