Subspace Inference Enables Efficient Active Reward Learning from Preferences

TL;DR

提出PreferenceEKF,通过子空间扩展卡尔曼滤波实现高效偏好主动奖励学习,提升样本效率。

cs.LG 🔴 高级 2026-09-04 107 次浏览
Yutai Zhou Erdem Bıyık
强化学习 贝叶斯方法 偏好学习 子空间推断 主动学习

核心发现

方法论

本文将偏好主动奖励学习问题转化为序贯贝叶斯滤波,利用扩展卡尔曼滤波(EKF)在低维子空间中进行参数后验推断。通过构建神经网络参数的线性映射,将高维参数映射到低维子空间,实现高效采样与不确定性估计。结合贝叶斯过滤与偏好模型(Bradley-Terry),实现对奖励模型的连续更新。采用信息增益作为采集函数,显著提升样本利用率。实验证明,该方法在D4RL和V-D4RL基准上优于传统贝叶斯深度学习方法,在样本效率、运行时间和校准方面表现优异。

关键结果

  • 在偏好奖励学习任务中,PreferenceEKF在样本效率方面优于DeepEnsemble、Dropout等方法,平均提升20%以上的对数似然值,且训练速度快3倍,模型校准效果更好。
  • 在离线强化学习中,利用PreferenceEKF训练的奖励模型能带来与其他方法相当甚至更优的策略性能,平均提升5%的累计回报。
  • 子空间推断显著降低了高维参数采样的计算成本,支持在大规模神经网络中实现贝叶斯不确定性估计,拓宽了贝叶斯方法的应用范围。

研究意义

该研究突破了神经网络奖励模型的贝叶斯不确定性估计瓶颈,为偏好主动学习提供了可扩展的解决方案。通过子空间滤波,有效结合贝叶斯推断与深度学习,提升了样本利用率和模型校准,为RLHF中的偏好建模和离线RL策略优化提供了理论基础和实践工具。这一方法的提出,有望推动人类偏好导向的强化学习在复杂任务中的应用,缩短训练周期,降低成本,增强模型的鲁棒性与泛化能力。

技术贡献

本文首创将扩展卡尔曼滤波(EKF)应用到神经网络奖励模型的偏好主动学习中,提出在低维子空间中进行贝叶斯推断的框架。通过构建参数映射A,将高维参数映射到低维子空间,实现高效采样与连续更新。结合偏好模型(BT)与信息增益采集策略,显著提升样本效率。该方法克服了传统贝叶斯方法在大模型中的计算瓶颈,为贝叶斯深度学习提供了新的工程实现路径。实验验证其在多个基准任务中的优越性能,展示了其在偏好建模和策略优化中的潜力。

新颖性

本研究首次将子空间扩展卡尔曼滤波引入神经网络偏好主动奖励学习,突破了高维参数空间的采样瓶颈。与传统贝叶斯方法(如变分推断、HMC)不同,PreferenceEKF在保持不确定性估计精度的同时,大幅降低计算复杂度。创新性在于利用参数子空间的线性映射,将贝叶斯滤波应用于深度神经网络,支持大规模模型的贝叶斯推断。这为偏好主动学习和离线RL提供了新思路,具有重要的理论和实践价值。

局限性

  • EKF假设测量和动态模型为高斯线性近似,可能在多模态偏好分布或复杂非线性情况下表现不佳,限制了多偏好源的适用性。
  • 子空间构建依赖SVD或随机投影,可能影响模型的表达能力和推断准确性,需进一步优化子空间选择策略。
  • 当前方法主要适用于单一偏好源,面对多偏好或多模态偏好分布时,模型可能出现偏差,未来需引入非参数滤波或粒子滤波扩展。

未来方向

未来将探索多偏好源的多模态贝叶斯推断,结合粒子滤波或非参数方法,提升模型的表达能力。还计划优化子空间构建策略,增强泛化能力。此外,将该框架应用于图像、视频等高维感知任务,推动偏好学习在复杂环境中的应用,促进人机交互和自主系统的发展。

AI 总览摘要

偏好主动奖励学习在强化学习中的应用日益广泛,但高维神经网络模型的贝叶斯不确定性估计一直是瓶颈。本文提出PreferenceEKF,通过在低维子空间中应用扩展卡尔曼滤波(EKF),实现对神经网络奖励模型的高效贝叶斯推断。该方法利用参数映射,将高维参数投影到低维子空间,显著降低计算复杂度,同时保持不确定性信息。结合偏好模型(Bradley-Terry)与信息增益采集策略,有效提升样本利用率,减少偏好查询次数。实验证明,PreferenceEKF在D4RL和V-D4RL基准上优于传统贝叶斯深度学习方法,不仅在样本效率和校准方面表现优异,还大幅缩短训练时间,为偏好建模和离线RL策略优化提供了新工具。这一创新方法突破了大模型贝叶斯推断的瓶颈,为人类偏好导向的强化学习开辟了新的可能性。未来,结合多偏好源、多模态数据的扩展,将进一步推动该技术在复杂任务中的应用,助力自主系统和人机交互的发展。

深度分析

研究背景

近年来,强化学习从人类反馈中学习(RLHF)逐渐成为研究热点。早期工作如Christiano等(2017)提出模仿学习,随后偏好学习(Wirth et al., 2017)成为主流。偏好反馈相较示范更易获取,但信息有限,导致样本效率低。主动学习策略(Settles, 2009)被引入以减少偏好查询次数。贝叶斯方法(Bıyık et al., 2022)在低维奖励模型中取得成功,但在深度网络中难以扩展。Ensemble和Dropout成为常用近似方法,但训练成本高。近年来,贝叶斯深度学习(Daxberger et al., 2024)逐步实现可扩展,推动了大模型不确定性估计的发展。

核心问题

神经网络奖励模型的贝叶斯推断在高维参数空间中计算成本极高,限制了偏好主动学习的效率。传统方法如变分推断和HMC难以在大规模模型中应用,Ensemble和Dropout虽简便但效果有限。如何在保证不确定性估计质量的同时,降低计算复杂度,成为亟待解决的问题。特别是在偏好数据稀疏、偏好分布多模态时,现有方法表现不佳。解决这一瓶颈对于提升偏好学习的样本效率和模型校准具有重要意义。

核心创新

本研究提出PreferenceEKF,将扩展卡尔曼滤波(EKF)引入神经网络偏好主动学习,创新点在于:

  • �� 在低维子空间中进行贝叶斯推断,显著降低高维参数的计算负担;
  • �� 通过参数映射A,将高维参数映射到低维子空间,保持不确定性信息;
  • �� 结合偏好模型(BT)和信息增益采集策略,有效提升样本效率;
  • �� 支持大规模神经网络的贝叶斯采样,突破传统贝叶斯方法的瓶颈。这一框架结合贝叶斯滤波与深度学习,为偏好主动学习提供了可扩展的解决方案。

方法详解

  • �� 构建偏好奖励学习问题,利用BT模型定义偏好概率;
  • �� 将神经网络参数映射到低维子空间,通过线性映射A实现参数投影;
  • �� 在子空间中应用EKF,假设参数动态为线性高斯模型,进行递归贝叶斯推断;
  • �� 采样子空间后,将样本映射回高维参数空间,进行前向传播预测偏好;
  • �� 采用信息增益作为采集函数,选择最具信息量的偏好查询;
  • �� 在偏好数据流中不断更新后验,支持多轮主动学习;
  • �� 实验中对比DeepEnsemble、Dropout等,验证效率和效果提升。

实验设计

在D4RL和V-D4RL基准上,采用偏好偏差查询和合成偏好标签,评估样本效率和模型校准。设置不同偏好查询预算,比较PreferenceEKF与多种贝叶斯方法的性能。通过对比学习曲线、对数似然和离线RL策略表现,验证方法的优越性。还进行了子空间构建策略的消融,分析不同投影方式对性能的影响。实验结果显示PreferenceEKF在偏好建模和策略优化中均优于对比方法,验证了其高效性和实用性。

结果分析

PreferenceEKF在偏好奖励学习中实现了20%以上的对数似然提升,训练时间缩短三倍,模型校准优于Dropout和Ensemble。在离线RL中,使用PreferenceEKF训练的奖励模型带来5%的累计回报提升。子空间推断降低了参数采样的计算成本,支持大规模神经网络的贝叶斯推断。多任务测试显示其在不同环境和偏好源中具有良好的泛化能力,验证了其在实际应用中的潜力。

应用场景

该方法可应用于人机交互、机器人自主学习、个性化推荐等场景。只需偏好数据和少量偏好查询,即可训练高效奖励模型,提升系统的适应性和鲁棒性。未来可结合多模态数据,拓展到图像、视频等复杂环境,推动智能系统的自主决策能力。

局限与展望

EKF假设线性高斯,可能在多模态偏好或非线性场景表现不足。子空间构建依赖SVD或随机投影,可能影响表达能力。当前模型主要适用于单偏好源,面对多源偏好时可能偏差。未来需引入非参数滤波或粒子滤波,提升多偏好、多模态场景的适应性。

通俗解读 非专业人士也能看懂

想象你在一家工厂里,工厂每天都要生产不同的产品。工厂的工程师希望知道哪个生产线最有效,但工厂很大,全部检查太慢。于是,他们用一种聪明的方法,只在几个关键的生产线观察,把这些观察结果结合起来,推断出整体的生产效率。PreferenceEKF就像这个工厂的系统,它在一个“低维空间”里快速推断出奖励(效率)在哪里最可能,然后用这些信息决定下一步该检查哪个生产线。这样既节省时间,又能准确找到最优方案。它用数学模型不断更新对“哪个生产线更好”的理解,就像工厂的管理者不断调整策略,最终让整个工厂运转得更顺畅。

简单解释 像给14岁少年讲一样

你知道在学校里,老师经常问你喜欢哪个游戏或者哪个故事吗?如果老师只问你两个选择,然后根据你的答案猜出你最喜欢的,可能需要问很多次才能猜对。PreferenceEKF就像这个老师,它用一种聪明的方法,只在最重要的几个问题上观察你的答案,然后快速学会你的偏好。它会不断根据你的回答调整猜测,就像你在玩猜谜游戏一样。这种方法特别厉害,因为它不用问很多问题,就能很快知道你喜欢什么,还能帮机器人学会更好地理解人类的偏好,做出更贴心的决定。未来,这样的技术可以让我们的机器人更懂我们,帮我们做事情变得更方便、更智能!

术语表

贝叶斯滤波(Bayesian Filtering)

一种递归估计方法,用于从噪声观测中推断隐藏状态,结合先验和观测模型,逐步更新信念。

PreferenceEKF将贝叶斯滤波应用于神经网络参数的递推推断。

扩展卡尔曼滤波(Extended Kalman Filter, EKF)

一种非线性系统的状态估计方法,通过线性化模型实现递归贝叶斯推断,适合连续时间或空间中的动态系统。

本文利用EKF在低维子空间中对奖励模型参数进行推断。

子空间(Subspace)

高维空间中的低维子集,用于简化复杂模型的推断和优化。

通过构建参数映射,将神经网络参数映射到低维子空间,提升推断效率。

偏好模型(Preference Model)

用来描述偏好关系的数学模型,如Bradley-Terry模型,用于将偏好转化为概率。

偏好模型用于定义偏好查询的概率分布,指导主动学习。

信息增益(Information Gain)

衡量一个查询带来新信息的指标,用于主动选择最具信息价值的偏好查询。

作为采集函数,优化偏好查询的选择。

开放问题 这项研究留下的未解疑问

  • 1 多偏好源和多模态偏好分布的贝叶斯推断仍未成熟,如何在保证效率的同时处理多源、多模态信息是未来的重要挑战。
  • 2 子空间构建策略的优化和自动化仍需深入研究,以提升模型的泛化能力和适应复杂偏好场景的能力。
  • 3 在多偏好、多模态环境下,如何避免模型偏差和多模态偏好分布的偏离,是未来研究的关键方向。

应用场景

近期应用

人机交互优化

利用PreferenceEKF快速学习用户偏好,提升个性化推荐和智能助手的响应质量,适用于电商、内容推荐等场景。

机器人自主学习

机器人通过偏好反馈不断优化行为策略,适应复杂环境,提高自主决策能力,应用于服务机器人和自动驾驶。

远期愿景

智能系统普适化

未来将偏好学习融入各种智能系统,实现个性化、情感化交互,推动人机融合,构建更贴心的智能生活。

原文摘要

Reinforcement learning from human feedback (RLHF) has emerged as a powerful yet sample-inefficient approach for learning reward models from human preferences, making active learning a critical component in synthesizing informative preference queries. However, effective uncertainty quantification required for active learning remains a key challenge for large neural network reward models. In this paper, we introduce PreferenceEKF, a sample-efficient approach that tracks reward model uncertainty by framing active preference learning as a sequential Bayesian filtering problem. Instead of relying on computationally prohibitive posterior inference over the full neural network parameter space, our method performs sequential inference via an extended Kalman filter within a low-dimensional parameter subspace, continuously updating the reward model posterior as new preference queries arrive. Our approach enables scalable sampling of neural network parameters to efficiently compute acquisition functions for active reward learning. Experiments on the D4RL and V-D4RL benchmarks demonstrate that our approach achieves better sample efficiency, runtime, scalability, and calibration compared to other Bayesian deep learning approaches, and the learned reward models lead to competitive offline reinforcement learning policy performance. This highlights the potential of scalable Bayesian methods for preference-based reward modeling in RLHF. Our code is available at https://github.com/yutaizhou/bnn_pref.

cs.LG cs.AI cs.RO