Boosting Robustness in Preference-Based Reinforcement Learning with Dynamic Sparsity

TL;DR

R2N用动态稀疏训练在5个高噪DMControl任务上显著提升PbRL鲁棒性。

cs.LG 🔴 高级 2024-06-11 36 次浏览
Calarina Muslimani Bram Grooten Deepak Ranganatha Sastry Mamillapalli Mykola Pechenizkiy Decebal Constantin Mocanu Matthew E. Taylor
偏好强化学习 动态稀疏训练 噪声鲁棒性 Simulated teacher DMControl

核心发现

方法论

本文提出R2N(Robust-to-Noise),将动态稀疏训练引入PbRL。它先把奖励模型输入层随机稀疏化到s_R=80%,再每ΔT_R=100步按权重幅值剪枝、按RigL用梯度幅值增长连接;同样策略也用于SAC策略的actor/critic输入层。奖励学习采用Bradley-Terry偏好模型与二元交叉熵损失L_CE,完全从偏好段对(σ0,σ1,y)学习,不依赖真值奖励。

关键结果

  • 在Cartpole-swingup、Walker-walk、Quadruped-walk、Cheetah-run、Humanoid-stand五个DMControl ENE任务上,R2N-PEBBLE是唯一在所有环境中都稳定保持最优或近最优的稀疏基线。与L1 Regularization和DropConnect相比,R2N在4/5环境的学习效率显著更好(p≤0.034),说明其不仅能压噪,还能更快学到有效策略。
  • 在15组“PbRL算法×环境”组合上,把R2N加到PEBBLE、SURF、RUNE后,学习效率显著提升(p≤0.021),最终回报也显著提升(p≤0.006)。作者还指出,在Humanoid-stand中,R2N对Static-PEBBLE和SET-PEBBLE的AUC与最终回报都显著更优(p≤0.024);在Cheetah-run中,对Static-PEBBLE的AUC也显著更好(p≤0.018)。
  • 消融结果表明,R2N若只对奖励模块或只对RL模块做DST,性能都会明显低于同时作用于两者的完整版本。作者进一步发现,RigL比SET更适合偏好学习场景,这与奖励模型本质上是监督学习问题一致。

研究意义

这项工作把“噪声特征过滤”从普通RL推进到PbRL,回应了真实人机环境中大量无关信息干扰学习的问题。其意义在于:当机器人、交互代理或家庭助手只能通过偏好而非真值奖励学习时,系统不应把所有传感输入都当成有用信号,而应自动把连接集中到真正与任务相关的特征上。R2N证明了动态稀疏性不仅能减参,更能作为一种鲁棒归纳偏置,提高偏好学习在极噪环境中的样本效率与最终性能。

技术贡献

技术上,R2N首次把动态稀疏训练用于PbRL的奖励学习模块,这是与既有噪声RL工作的关键分界。此前DST主要用于RL策略网络,如SET、RigL、Sokar等;而R2N把RigL引入奖励模型,并同时稀疏化actor/critic输入层,形成“双通道过滤”。其核心贡献还包括:在ENE设置下系统评估PbRL;证明奖励模块与RL模块都需要稀疏化;以及在PEBBLE、SURF、RUNE三种PbRL框架上验证方法可迁移性。

新颖性

本文的首要新意是:将Extremely Noisy Environment(ENE)明确引入PbRL,并提出首个面向偏好学习的动态稀疏方法R2N。与只做静态剪枝、L1正则或DropConnect不同,R2N在训练中持续“剪掉无用连线、长出更有用连线”,且这一过程直接作用于偏好奖励模型。相比相关RL稀疏方法,它把“学奖励”和“学策略”同时纳入稀疏化设计。

局限性

  • 实验使用的是simulated teacher,偏好来自真值奖励而非真实人类;因此尚不能直接说明在人类标注噪声、偏好不一致或疲劳情况下的效果。作者也明确将人类教师作为未来工作。
  • 评测主要集中在DMControl的5个任务和ENE噪声设定,任务类型仍偏连续控制;对于离散决策、长时序规划或多模态感知,R2N是否同样稳健还未知。
  • R2N需要调节稀疏度、更新周期和drop fraction等超参数,且动态稀疏更新会增加实现复杂度;在更大模型或更高频在线交互中,其计算代价仍需进一步量化。

未来方向

未来可直接推进到真实人类偏好反馈、含不一致标注的场景,以及更复杂的噪声类型,如相关噪声或会伪装成任务特征的干扰。另一个方向是把R2N扩展到离线PbRL、多模态感知和大模型对齐设置,并研究更自适应的稀疏调度策略,以减少超参数敏感性。

AI 总览摘要

在真实世界里,机器人面对的从来不是“干净”的输入:它可能同时看到与任务无关的颜色、声音、温度乃至大量随机扰动。本文正是针对这一现实难题,提出了R2N(Robust-to-Noise),把动态稀疏训练引入偏好强化学习(PbRL)。作者研究的是Extremely Noisy Environment(ENE):在原始状态后拼接大量服从N(0,1)的无关特征,使状态维度膨胀到原来的数倍甚至十倍。问题的关键不只是“能不能学”,而是“能不能从偏好中学会忽略噪声,只抓住真正相关的输入”。

R2N的核心思想很直接:让网络自己不断“断开无用连接、长出更有用的连接”。在奖励模型中,R2N先将输入层随机稀疏化到80%,随后每100次更新按权重幅值剪掉最弱的20%活跃连接,再用RigL按梯度幅值在新位置补回同样数量的连接;actor和critic也采用同样的动态稀疏策略。奖励学习遵循Bradley-Terry偏好模型,并用二元交叉熵L_CE训练,整个过程只依赖偏好段对(σ0,σ1,y),不需要真值奖励。

实验覆盖五个DMControl任务:Cartpole-swingup、Walker-walk、Quadruped-walk、Cheetah-run和Humanoid-stand;噪声比例分别为90%或70%,并相应将状态空间扩展到51、171、241、260和224维。结果显示,R2N-PEBBLE在所有环境中都保持竞争性甚至更优表现;与L1 Regularization和DropConnect相比,R2N在4/5环境的学习效率显著更好(p≤0.034)。更重要的是,当R2N接入PEBBLE、SURF和RUNE三种PbRL算法后,在15组“算法×环境”组合上,学习效率与最终回报均显著提升(分别p≤0.021和p≤0.006)。在Humanoid-stand和Cheetah-run上,R2N还在AUC或最终回报上取得了显著优势。

这项工作的意义不仅在于“更高分数”,而在于把PbRL从理想化的干净环境推进到更接近真实的人机交互场景。作者证明,动态稀疏性不只是模型压缩工具,也可以成为抵抗无关特征的学习机制。尤其值得注意的是,R2N把DST同时用于奖励学习和RL模块;消融实验表明,任一部分缺失都会明显掉性能。对未来的家庭机器人、交互代理和人类偏好对齐系统来说,这提供了一条清晰路线:先学会过滤噪声,再谈高效对齐。

深度分析

研究背景

偏好强化学习(PbRL)让智能体通过比较两段行为轨迹来学习奖励函数,适合人类不愿或无法给出精确数值奖励的场景。已有方法如PEBBLE、SURF、RUNE分别从无监督探索、半监督学习、数据增强和不确定性探索等角度提升样本效率。但这些方法大多默认环境信息相对干净,或者只在任务相关状态上评估。另一方面,动态稀疏训练(DST)在监督学习与RL中已显示出过滤无关特征的潜力,例如SET、RigL、L1正则和DropConnect。本文将这两条线索合并:把“偏好学习”放进“高噪环境”中,检验DST能否成为PbRL的鲁棒归纳偏置。

核心问题

核心问题是:在状态中混入大量随机噪声特征后,PbRL如何从偏好数据中识别真正重要的输入,并在不依赖真值奖励的前提下学到稳健策略?ENE设置把原始状态扩展为高维向量,其中噪声特征来自N(0,1),且与任务完全无关。这会同时伤害奖励模型拟合和策略优化,因为错误的特征连接会被偏好监督“放大”。难点在于,PbRL本身已经比标准RL更稀疏、反馈更少,再叠加高维噪声后,模型极易学到伪相关模式。

核心创新

R2N的创新可以概括为三点。第一,它首次把DST引入PbRL的奖励学习模块,证明奖励模型也可以通过动态稀疏连接实现特征选择,而不只是在策略网络中压噪。第二,它区分了奖励学习与RL控制两条路径:奖励模型用RigL,因为其本质是监督学习;actor/critic也做输入层稀疏化,以同步过滤噪声。第三,它在ENE下系统验证PbRL,并将R2N嵌入PEBBLE、SURF、RUNE等算法,证明该思想具有框架无关的可迁移性,而不是单一技巧。

原文摘要

To integrate into human-centered environments, autonomous agents must learn from and adapt to humans in their native settings. Preference-based reinforcement learning (PbRL) can enable this by learning reward functions from human preferences. However, humans live in a world full of diverse information, most of which is irrelevant to completing any particular task. It then becomes essential that agents learn to focus on the subset of task-relevant state features. To that end, this work proposes R2N (Robust-to-Noise), the first PbRL algorithm that leverages principles of dynamic sparse training to learn robust reward models that can focus on task-relevant features. In experiments with a simulated teacher, we demonstrate that R2N can adapt the sparse connectivity of its neural networks to focus on task-relevant features, enabling R2N to significantly outperform several sparse training and PbRL algorithms across simulated robotic environments.

cs.LG