Beyond Routing Weights: Faithful Response-Level Interpretation of Mixture-of-Experts Reward Models via Contribution Contrast

TL;DR

提出CoCo方法,通过贡献对比解释专家模型,提升解释性和准确性。

cs.AI 🔴 高级 2026-08-01 3 次浏览
Yifan Wang Jinyi Mu Mayank Jobanputra Yu Wang Soyoung Oh Isabel Valera Vera Demberg
混合专家 奖励模型 解释性 贡献对比 机器学习

核心发现

方法论

该研究提出了一种新的解释方法,称为贡献对比(CoCo),用于混合专家(MoE)奖励模型。CoCo通过选择具有最大贡献对比的响应对来解释专家的角色,结合路由和偏好行为。该方法通过自动和人工评估,证明比基于路由、得分和稀疏自编码器的替代方法更具连贯性、忠实性和专业性,同时保持竞争性的奖励建模准确性。

关键结果

  • 在700K数据集上,CoCo方法实现了83.56%的奖励模型准确性,显著高于其他方法。
  • 在Reddit数据集上,CoCo的解释质量和专家专业化指标均优于基线方法。
  • CoCo在专家移除翻转率和专家准确性方面表现出色,证明其选择的示例集能够反映模型决策。

研究意义

该研究为混合专家奖励模型的解释性提供了新的视角,解决了现有方法仅能部分解释专家行为的问题。通过引入贡献对比,研究不仅提高了模型的可解释性,还为学术界和工业界提供了更可靠的模型分析工具,特别是在需要理解复杂决策过程的领域。

技术贡献

技术贡献包括引入贡献对比作为解释信号,提供了比路由权重和专家得分差异更具信息量的专家行为解释。通过对现有解释性正则化器的适应,CoCo方法在不改变MoE架构的情况下,增强了解释性约束与对比贡献信号的对齐。

新颖性

CoCo方法首次系统性地研究了MoE奖励模型的解释方法,通过贡献对比捕捉路由和专家偏好行为的交互,提供了更忠实的响应级别偏好维度解释。

局限性

  • CoCo解释的质量依赖于MoE奖励模型学习到的结构,可能无法保证专家对应于语义上有意义的偏好维度。
  • 由于是数据驱动的方法,可能无法恢复在训练数据中缺失或不明显的模式。

未来方向

未来工作可以探索如何在不同数据集和模型设计下提高CoCo方法的有效性,并研究如何将其应用于更广泛的机器学习模型解释任务中。

AI 总览摘要

奖励模型在从人类偏好中学习中扮演着重要角色,但识别其预测背后的驱动因素仍然具有挑战性。现有的稀疏混合专家(MoE)奖励模型通过将提示路由到专门的专家来改善可解释性,但路由权重仅揭示了专家接收哪些提示,而非如何判断响应。

为解决这一问题,研究提出了贡献对比(CoCo)响应级别解释方法,通过选择具有最大贡献对比的响应对来忠实地表征专家的角色,结合路由和偏好行为。通过自动和人工评估,CoCo方法在连贯性、忠实性和专业性方面优于基于路由、得分和稀疏自编码器的替代方法,同时保持竞争性的奖励建模准确性。

该研究为混合专家奖励模型的解释性提供了新的视角,解决了现有方法仅能部分解释专家行为的问题。通过引入贡献对比,研究不仅提高了模型的可解释性,还为学术界和工业界提供了更可靠的模型分析工具,特别是在需要理解复杂决策过程的领域。未来工作可以探索如何在不同数据集和模型设计下提高CoCo方法的有效性,并研究如何将其应用于更广泛的机器学习模型解释任务中。

深度分析

研究背景

奖励模型在强化学习和大语言模型的对齐中起着关键作用。然而,理解哪些属性驱动其偏好预测仍然具有挑战性。现有研究试图从标准偏好数据中发现可解释的偏好模式,而无需依赖昂贵的细粒度注释。稀疏混合专家(MoE)奖励模型通过使用提示条件路由器将输入分配给专门的响应评分专家,提供了一种有前途的方法。

核心问题

现有的MoE奖励模型主要通过路由权重解释专家,但这仅揭示了专家接收哪些提示,而非如何判断响应,提供的专家行为解释不完整。尤其是在需要理解复杂决策过程的领域,这种局限性显得尤为突出。

核心创新

研究提出了贡献对比(CoCo)方法,通过选择具有最大贡献对比的响应对来忠实地表征专家的角色。此方法结合路由和偏好行为,提供了比路由权重和专家得分差异更具信息量的专家行为解释。

方法详解

  • �� CoCo方法通过选择具有最大贡献对比的响应对来解释专家的角色。
  • �� 贡献对比定义为路由权重与绝对专家得分差异的乘积。
  • �� 适应现有解释性正则化器以鼓励稀疏和多样的贡献对比模式。

实验设计

研究在700K和Reddit两个数据集上进行实验,评估CoCo方法的解释性和奖励建模准确性。实验设计包括自动和人工评估,比较CoCo方法与基于路由、得分和稀疏自编码器的替代方法。

结果分析

在700K数据集上,CoCo方法实现了83.56%的奖励模型准确性,显著高于其他方法。在Reddit数据集上,CoCo的解释质量和专家专业化指标均优于基线方法。

应用场景

CoCo方法可用于需要理解复杂决策过程的领域,如自动驾驶、医疗诊断和金融分析。其解释性增强了模型的透明度和可靠性。

局限与展望

CoCo解释的质量依赖于MoE奖励模型学习到的结构,可能无法保证专家对应于语义上有意义的偏好维度。由于是数据驱动的方法,可能无法恢复在训练数据中缺失或不明显的模式。

通俗解读 非专业人士也能看懂

想象一个工厂,工厂里有不同的专家,每个专家负责不同的任务。现有的方法只能告诉我们哪个专家负责哪个任务,但不能告诉我们他们是如何完成任务的。CoCo方法就像是在专家之间建立了一种沟通机制,让我们不仅知道哪个专家负责哪个任务,还知道他们是如何做出决策的。这就像是给每个专家配备了一个透明的工作日志,记录他们的每一步操作。

简单解释 像给14岁少年讲一样

想象你在玩一个多人游戏,每个玩家都有不同的技能。现有的方法只能告诉你哪个玩家负责哪个任务,但不能告诉你他们是如何完成任务的。CoCo方法就像是一个超级观察者,可以看到每个玩家的操作细节,让你知道他们是如何做出决策的。这就像是给每个玩家配备了一个透明的工作日志,记录他们的每一步操作。是不是很酷?

术语表

混合专家 (Mixture-of-Experts)

一种机器学习模型结构,使用多个专家模型来处理不同的输入。

在本文中用于奖励模型的解释。

奖励模型 (Reward Model)

用于从人类偏好中学习的模型,通常用于强化学习。

在本文中用于评估CoCo方法的有效性。

贡献对比 (Contribution Contrast)

用于解释专家角色的信号,结合路由权重和专家得分差异。

本文提出的新方法。

路由权重 (Routing Weights)

用于决定哪个专家处理哪个输入的权重。

在现有方法中用于解释专家。

稀疏自编码器 (Sparse Autoencoder)

一种用于特征学习的神经网络结构,强调学习稀疏表示。

在本文中作为基线方法之一。

开放问题 这项研究留下的未解疑问

  • 1 如何在不同数据集和模型设计下提高CoCo方法的有效性?
  • 2 如何将CoCo方法应用于更广泛的机器学习模型解释任务中?

应用场景

近期应用

自动驾驶

通过提高模型的可解释性,增强自动驾驶系统的安全性和可靠性。

远期愿景

医疗诊断

在医疗领域应用CoCo方法,提高诊断模型的透明度和信任度。

原文摘要

Reward models are central to learning from human preferences, yet identifying what drives their predictions remains challenging. Recent sparse Mixture-of-Experts (MoE) reward models seek to improve interpretability by routing prompts to specialized experts and characterizing experts through examples with high routing weights. However, routing weights only reveal which prompts an expert $\textit{receives}$, not how it $\textit{judges}$ responses, providing only a partial account of expert behavior. We therefore propose $\textbf{Co}$ntribution-$\textbf{Co}$ntrast ($\textbf{CoCo}$) response-level interpretation, which faithfully characterizes experts' roles using chosen-rejected response pairs with the largest contribution contrasts, jointly capturing routing and preference behavior. Across automatic and human evaluations, CoCo yields more coherent, faithful, and specialized interpretations than router-based, score-based, and sparse autoencoder-based alternatives while maintaining competitive reward modeling accuracy. To the best of our knowledge, this is the first systematic study of interpretation methods for MoE reward models.

cs.AI