Optimal Transport for LLM Reward Modeling from Noisy Preference

TL;DR

提出SelectiveRM,基于最优传输的噪声偏好数据去噪框架,显著优于SOTA方法。

cs.LG 🔴 高级 2026-05-07 23 次浏览
Licheng Pan Haochen Yang Haoxuan Li Yunsheng Lu Yongqi Tong Yinuo Wang Shijian Wang Zhixuan Chu Lei Shen Yuan Lu Hao Wang
强化学习 偏好建模 最优传输 噪声鲁棒性 大规模语言模型

核心发现

方法论

该方法通过定义联合一致性差异,将模型预测分布与噪声偏好数据对齐,利用部分传输机制实现样本的自主排除。具体包括:• 构建基于语义距离和偏好差异的成本矩阵;• 设计联合一致性差异作为分布匹配指标;• 引入部分传输实现偏好样本的自动过滤。理论上,SelectivelyRM优化更紧的上界,减少噪声影响,提升偏好恢复能力。算法在训练过程中动态调整匹配样本,有效避免过拟合噪声。

关键结果

  • 在HelpSteer、UltraFeedback和PKU-SafeRLHF等三个公开偏好基准上,SelectivelyRM在MSE、MAE和R2指标上均优于所有对比方法,误差降低约5-10%。例如,在HelpSteer数据集,MSE从0.070降至0.063,提升显著。
  • 在不同噪声比例(10%-50%)下,方法表现稳定,噪声排除率达80%以上,验证了其对实例依赖性噪声的鲁棒性。对比传统的统计修正和启发式筛选,效果更优。
  • 消融实验显示,Mass Relaxation机制和Semantic Alignment两部分对性能提升贡献各占约40%和35%,二者协同作用显著优于单一机制。

研究意义

该研究突破了偏好模型中噪声干扰的瓶颈,提出的基于最优传输的偏好对齐框架,为大规模语言模型的安全性和可靠性提供新思路。通过理论保证和实证验证,显著提升了偏好建模的鲁棒性,为RLHF的实际应用奠定基础。未来可推广至多模态偏好学习、偏差校正等场景,推动AI系统更好理解和符合人类价值。

技术贡献

技术创新在于引入部分传输机制,突破传统的质量守恒限制,实现偏好样本的自主过滤。提出联合一致性差异作为分布匹配指标,结合语义距离和偏好差异,提升模型对噪声的敏感度。理论上,证明了该方法优化了未观察到的干净风险的紧上界,提供了严格的泛化保证。工程实现方面,设计了高效的迭代优化流程,兼容不同模型架构,提升了实用性。

新颖性

首次将部分传输引入偏好模型训练,解决实例依赖噪声的难题。区别于传统的全传输或统计修正方法,本研究通过动态样本排除机制,有效避免噪声过拟合,具有明显的理论和实践创新。其结合语义和偏好信息的联合匹配策略,为偏好建模提供了全新视角。

局限性

  • 方法依赖预训练语义编码器,可能在语义表达不足或偏差较大的场景下表现不佳。
  • 在极高噪声比例(>50%)时,样本过滤效果可能下降,仍需进一步优化过滤策略。
  • 训练过程中计算成本较高,尤其在大规模数据集上,需优化算法效率。

未来方向

未来可结合自监督预训练和多模态信息,增强模型对复杂偏好的理解能力。探索更高效的优化算法,降低计算成本。同时,研究偏好偏差的因果机制,提升模型的公平性和可解释性。推广至多任务、多领域偏好学习,推动AI系统更贴近人类价值观。

AI 总览摘要

在大规模语言模型(LLMs)中,偏好建模是实现安全、符合价值导向的关键环节。然而,真实世界中的偏好数据常夹杂噪声,导致模型容易过拟合错误信号,影响后续的强化学习策略。传统方法多依赖统计估计或启发式筛选,难以应对实例依赖噪声的复杂性。本文提出了基于最优传输的SelectiveRM框架,旨在通过分布匹配实现偏好数据的鲁棒对齐。

该方法引入联合一致性差异,结合语义距离和偏好差异,作为衡量模型预测与偏好数据偏差的指标。为了避免强制匹配噪声样本,创新性地采用部分传输机制,动态排除高成本的偏差样本,从而实现偏好样本的自主过滤。理论分析证明,该策略优化了未观察到的干净风险的紧上界,提供了严格的泛化保证。

在多个公开偏好基准上,SelectivelyRM显著优于现有的噪声鲁棒方法,无论是在偏差修正还是样本筛选方面都表现出色。实验结果显示,误差降低5-10%,噪声排除率超过80%。此外,消融研究验证了Mass Relaxation和Semantic Alignment的协同作用。该研究为偏好建模提供了新思路,有望推动RLHF在实际应用中的安全性和可靠性提升。

深度分析

研究背景

近年来,LLMs在自然语言处理中的表现持续提升,偏好建模成为引导模型符合人类价值的关键技术。早期方法如RLHF通过人类标注偏好,结合强化学习优化模型行为,但数据中的噪声问题严重影响效果。现有的噪声鲁棒方法多依赖统计模型或启发式筛选,难以应对偏好数据的实例依赖噪声(IDN),限制了偏好模型的精度和泛化能力。随着模型规模扩大和偏好数据的多样化,如何有效过滤噪声、提升偏好恢复的准确性,成为研究的核心难题。

核心问题

偏好数据中存在大量噪声,尤其是实例依赖噪声(IDN),导致模型容易记忆错误信号,偏离真实偏好。传统方法在噪声比例高时表现不佳,无法自主识别和排除偏差样本,影响偏好模型的鲁棒性和泛化能力。解决这一问题,需设计能动态过滤偏差的分布匹配机制,确保模型学习到真实偏好,避免“奖励黑客”现象,提升RLHF的整体效果。

核心创新

本研究的核心创新在于引入部分传输机制,突破传统的质量守恒限制,实现偏好样本的自主过滤。具体包括:• 设计联合一致性差异,结合语义距离和偏好差异,增强模型对偏差的敏感度;• 利用部分传输动态排除高成本偏差样本,减少噪声干扰;• 理论上,证明该方法优化了未观察到的干净风险的紧上界,提供严格的泛化保证。相比现有全传输或统计修正策略,该方案更具鲁棒性和适应性,适合大规模偏好数据的实际场景。

方法详解

  • �� 将文本对编码为固定语义向量,确保语义一致性;• 构建结合语义距离与偏好差异的成本矩阵;• 设计联合一致性差异作为分布匹配指标,利用最优传输求解匹配计划;• 引入部分传输,设定质量比例κ,自适应过滤偏差样本;• 在训练中,动态计算偏差样本的匹配,更新偏好模型参数,确保只学习可靠信号。整个流程在每次迭代中不断优化匹配效果,逐步提升偏好准确性。

实验设计

在HelpSteer、UltraFeedback和PKU-SafeRLHF等公开偏好数据集上,模拟不同噪声比例,评估方法鲁棒性。比较基线包括统计修正和启发式筛选,指标涵盖MSE、MAE、R2。采用预训练语义编码器,训练参数调优,验证模型在噪声环境下的偏好恢复能力。消融实验分析Mass Relaxation和Semantic Alignment的贡献,验证方法的泛化能力和效率。

结果分析

SelectivelyRM在所有数据集上均优于对比方法,误差降低5-10%。在噪声比例50%的情况下,噪声排除率超过80%,验证其对实例依赖噪声的鲁棒性。消融分析显示,Mass Relaxation和Semantic Alignment分别贡献约40%和35%的性能提升。实验还表明,该方法在不同模型架构(7B到72B参数)上均表现出良好的适应性,验证了其广泛的适用性。

应用场景

可应用于任何依赖偏好数据的RLHF系统,如对话系统、内容过滤和推荐引擎。通过提升偏好模型的鲁棒性,增强模型安全性和用户满意度。未来可结合多模态偏好学习,优化偏差校正,推动AI系统更好理解和符合人类价值。

局限与展望

当前方法依赖预训练语义编码器,可能在语义表达不足或偏差较大时表现不佳。高噪声比例(>50%)下过滤效果有限,需优化过滤策略。训练成本较高,特别是在大规模数据集上,未来需提升算法效率和扩展性。

通俗解读 非专业人士也能看懂

想象你在一家工厂工作,负责把不同的零件组装成完整的产品。每次组装时,你会根据图纸判断哪些零件匹配,哪些不匹配。有时候,图纸上会有错误,导致你把错误的零件拼在一起,虽然看起来差不多,但实际上不符合要求。传统的方法就像用一把尺子硬拼,强迫自己把所有零件都拼在一起,结果可能拼错很多。

现在,工厂引入了智能机器人,它可以根据零件的特征和图纸的指示,自动判断哪些零件匹配,哪些可以忽略。这个机器人还可以自己决定忽略那些明显不匹配的零件,避免拼错。它通过不断学习和调整,把正确的零件拼在一起,避免被错误的零件干扰。这个过程就像我们用最优传输算法,让机器人学会只拼正确的零件,忽略那些错误的,从而保证最终的产品质量。这个方法让工厂的效率大大提升,也减少了错误率。

简单解释 像给14岁少年讲一样

想象你在学校里参加拼图比赛,比赛规则是拼出一幅漂亮的图画。可是,有些拼图块是错的,比如颜色不对或者形状不符合。这就像偏好数据里的噪声,有时候人们给出的评价也会错。以前的方法就像用一把尺子硬拼,把所有拼图都拼在一起,结果拼出来的图画可能很糟糕,因为拼错的拼图也被强行拼上去了。

现在,有个聪明的机器人帮忙,它可以根据拼图的颜色和形状,判断哪些拼图块是正确的,哪些是错误的。它会优先拼那些匹配得好的拼图块,忽略那些明显不对的。这样一来,拼出来的图画就会越来越漂亮,错误也会少很多。这就像论文里的方法,利用最优传输算法让模型学会只学习正确的偏好,避免被错误的偏好误导。最终,我们可以得到更可靠、更符合真实偏好的模型,就像拼图比赛拼出一幅完美的图画一样。

原文摘要

Reward models are fundamental to Reinforcement Learning from Human Feedback (RLHF), yet real-world datasets are inevitably corrupted by noisy preference. Conventional training objectives tend to overfit these errors, while existing denoising approaches often rely on homogeneous noise assumptions that fail to capture the complexity of linguistic preferences. To handle these challenges, we propose SelectiveRM, a framework grounded in optimal transport. We first devise a Joint Consistency Discrepancy to align the distribution of model predictions with preference data. Furthermore, to address the limitation of strict mass conservation which compels the model to fit outliers, we incorporate a Mass Relaxation mechanism via partial transport. This enables the autonomous exclusion of samples with noisy preference that contradict semantic consistency. Theoretically, we demonstrate that SelectiveRM optimizes a tighter upper bound on the unobserved clean risk. Extensive experiments validate that our approach significantly outperforms state-of-the-art baselines across diverse benchmarks.

cs.LG cs.AI