Improving LLM General Preference Alignment via Optimistic Online Mirror Descent

TL;DR

ONPO以乐观镜像下降实现一般偏好对齐,理论间隙降至O(1/T),AlpacaEval最高48.6。

cs.LG 🔴 高级 2025-02-24 23 次浏览
Yuheng Zhang Dian Yu Tao Ge Linfeng Song Zhichen Zeng Haitao Mi Nan Jiang Dong Yu
RLHF 一般偏好 ONPO 在线学习 镜像下降

核心发现

方法论

论文放弃Bradley–Terry奖励模型,将偏好建模为二人零和博弈,目标是寻找不会输给任意策略的Nash策略。ONPO采用Optimistic Online Mirror Descent:用上一轮胜率向量m_t=r_{t-1}预测当前奖励r_t,并执行预测更新与真实反馈校正两步KL镜像下降。实现上直接在在线二元偏好数据上最小化平方损失,无需训练奖励模型或使用高方差PPO。

关键结果

  • 理论上,ONPO对均匀策略平均值的duality gap满足4√D/T,即O(T^-1),优于普通OMD及INPO的O(T^-1/2)。在AlpacaEval 2.0上,Mistral-Instruct和Llama-3-SFT分别取得42.8和48.6,相对最强基线提升21.2%和9.9%。
  • 在Arena-Hard上,ONPO分别达到29.7和36.4;在MT-Bench上分别达到7.68和8.40。相较INPO,Mistral配置三项指标均提升,Llama配置的AlpacaEval与MT-Bench提升,但Arena-Hard为36.4,略低于INPO的37.0。
  • ONPO仅需每轮从当前策略采样,并通过偏好模型选出胜者与败者;论文使用K=8候选响应和pair-preference-model-LLaMA3-8B,避免SPPO估计单响应对整策略胜率所需的大量查询。

研究意义

该工作将LLM偏好对齐从“每个回答存在标量真实奖励”推进到更贴近现实的比较式偏好。它允许循环偏好、群体偏好和不可完全排序的判断进入统一框架,缓解BT奖励模型失配问题。对学术界而言,论文连接了在线学习、博弈论与直接偏好优化;对工业界而言,ONPO提供了无需独立奖励模型、比PPO更轻量稳定的在线训练路径,有望降低标注、显存和调参成本。

技术贡献

核心技术贡献有三点:第一,将一般偏好定义为期望胜率J(π1,π2)的零和博弈,并以duality gap衡量近似Nash质量;第二,把乐观OMD的预测—校正机制嵌入self-play,令m_t=r_{t-1},利用奖励变化与策略变化的抵消获得O(1/T)收敛;第三,通过偏好分布λ_p和log概率比平方损失,把理论更新转化为可直接训练的监督式目标,避免显式计算P(y≻π_t)。

新颖性

相较IPO只学习固定比较策略的最佳响应、Nash-MD依赖KL正则博弈及混合策略采样、INPO采用普通OMD,ONPO首次在该LLM一般偏好self-play框架中系统引入optimistic OMD,并给出O(T^-1) duality-gap保证。其新颖性不仅在算法更新,也在于将理论上的策略期望奖励改写成二元偏好数据损失。

局限性

  • 实验主要是单轮响应生成,并以pair-preference-model作为偏好oracle;模型偏差、提示分布外样本和真实人类偏好噪声可能改变结论。
  • 多轮扩展需要估计终局偏好诱导的Q值,论文尚未实现;若采用actor-critic或PPO估计,仍会面临高方差、计算昂贵和训练敏感性。

未来方向

后续应实现多轮CMDP版本,研究低方差Q值估计、真实人类反馈和更大模型规模;还可分析last-iterate收敛、非对称偏好、动态或多群体oracle,以及采样预算、偏好模型误差与安全指标之间的关系。

AI 总览摘要

RLHF通常先训练BT奖励模型,再用PPO优化策略。但BT假设每个提示—回答都有稳定标量奖励,并要求偏好近似传递;真实用户判断可能循环、矛盾且依赖比较对象。论文因此把对齐问题改写为二人零和博弈:策略的目标不是追逐绝对分数,而是在对抗任意策略时保持至少50%的胜率。

作者提出Optimistic Nash Policy Optimization(ONPO)。它在self-play中使用Optimistic Online Mirror Descent,以上一轮胜率预测当前反馈,再用真实反馈校正,并通过KL项限制策略剧烈漂移。更重要的是,作者推导出只依赖成对偏好标签的平方损失,因此可以像直接偏好训练一样优化,不必显式训练奖励模型,也不需估计一个回答对整套策略的胜率。

理论上,ONPO的duality gap为O(T^-1),优于普通OMD/INPO的O(T^-1/2)。实验中,使用Mistral-Instruct时,AlpacaEval 2.0、Arena-Hard、MT-Bench分别为42.8、29.7、7.68;使用Llama-3-SFT时分别为48.6、36.4、8.40。尤其AlpacaEval相对最强基线提升21.2%和9.9%。不过,结果依赖偏好模型,且多轮实现仍属未来工作。整体而言,ONPO展示了博弈论驱动的一般偏好对齐路线。

深度分析

研究背景

RLHF从InstructGPT、Claude等系统中的奖励模型加PPO流程发展到DPO、Iterative DPO等直接偏好方法。后者降低了训练成本,却大多仍依赖Bradley–Terry模型。论文指出,BT要求P(y1≻y2|x)=σ(R*(x,y1)-R*(x,y2)),难以表达群体偏好和非传递判断,因此需要直接处理比较式反馈。

核心问题

给定提示分布d和偏好oracle P,定义J(π1,π2)=E[P(y1≻y2|x)]。最大玩家提升胜率,最小玩家压低胜率;目标是找到对称Nash策略π*,满足其对任意策略的胜率不低于0.5。论文以DualGap=maxπ1J(π1,π)-minπ2J(π,π2)衡量误差。

核心创新

ONPO把乐观在线学习引入LLM一般偏好self-play。普通OMD只根据当前胜率更新,理论上平均策略间隙为O(T^-1/2);ONPO使用上一轮r_{t-1}作预测器,先更新π_t,再用r_t更新辅助策略π'_{t+1}。self-play带来的稳定性抵消奖励变化项,使界限达到O(T^-1)。同时,算法能转换为偏好数据上的直接损失。

方法详解

  • �� 初始化π'_1=π_1=π_SFT。
  • �� 第t轮从π_t采样响应对;论文每个提示生成K=8个回答,并用偏好oracle进行竞赛。
  • �� 得到胜者y_w和败者y_l,形成D_t。
  • �� 计算r_t(y)=E_{y'~π_t}P(y≻y'),但训练时不显式估计它。
  • �� 使用m_t=r_{t-1}进行乐观更新,使用r_t进行校正更新。
  • �� 通过g_t(π,y,y')=log[π(y)/π(y')]-log[π'_t(y)/π'_t(y')]构造平方损失,分别优化π'_{t+1}与π_{t+1}。
  • �� 输出最后一轮π_T;KL正则保持相邻策略稳定。

实验设计

基座模型为Mistral-7B-Instruct-v0.3和Llama-3-8B的Llama-3-SFT。偏好oracle是pair-preference-model-LLaMA3-8B。基线包括Iterative DPO、SPPO和INPO。评测使用AlpacaEval 2.0(805条指令,报告LC win rate)、Arena-Hard(500条查询,报告胜率)和MT-Bench(80个多轮问题,GPT-4评分)。

结果分析

ONPO+Mistral在三项任务上为42.8、29.7、7.68,明显超过INPO的35.3、25.3、7.46。ONPO+Llama为48.6、36.4、8.40,AlpacaEval和MT-Bench超过INPO的44.2和8.28,但Arena-Hard略低于37.0。与SPPO和Iterative DPO相比,ONPO总体更强,显示理论改进具有实践价值。

应用场景

ONPO适合在线客服、写作助手、代码解释和安全问答等场景:系统可让当前模型生成多个候选,再由人工或偏好模型选择优胜者。其前提是存在可靠的成对比较oracle、足够的在线提示和可承受的采样成本;不需要单独奖励模型,适合资源受限的迭代对齐流程。

局限与展望

论文尚未在多轮CMDP中实现ONPO;终局反馈需要Q值传播,工程难度高。实验使用自动偏好模型和固定基准,不能完全代表真实用户或跨分布安全性。理论界限针对平均策略duality gap,普通游戏目标不保证最后一轮策略收敛;此外,K=8采样和多轮偏好查询仍可能带来显著推理与标注成本。

通俗解读 非专业人士也能看懂

把模型想成一所餐厅,厨师每轮做出几道菜,顾客只需要在两道菜之间选更好的一道,而不必给每道菜打绝对分数。传统方法会试图训练一个“总分评委”,再让厨师追逐分数;但如果不同顾客喜欢不同味道,甚至出现“甲胜乙、乙胜丙、丙又胜甲”,总分就会误导。

ONPO让厨师和自己的上一版菜单比赛。它先猜顾客这轮会喜欢什么,再根据真实选择修正菜单,同时规定每次改动不能太剧烈。上一轮的经验通常能帮助预测下一轮,所以比完全重新猜测更快、更稳。

关键是,系统只需保存“这两道菜中哪道赢了”的记录,不必问同一道菜对所有菜的总胜率。反复比赛后,菜单会变成一种稳健方案:面对任何其他菜单,都不会明显落败。论文中,这种方法在多个模型和测试集上优于几种竞争方案。

简单解释 像给14岁少年讲一样

想象你在玩一个聊天机器人比赛。每一轮,机器人写出8个答案,裁判两两比较,选出赢家和输家。普通训练像是每次只看今天的比赛;ONPO则会记住上一轮的表现,先猜“这次什么答案可能更受欢迎”,再拿新裁判结果纠正猜测。

它还有一个“别一下子改太多”的规则。就像游戏角色升级,不能一秒钟把所有技能点重置,否则可能变强也可能崩掉。小步调整让训练更稳定。它不需要给每个答案打一个永久分数,只需要知道两答案谁更好,这很适合人类评价。

为什么叫乐观?不是盲目自信,而是合理利用最近的趋势。如果上一轮某类回答变好了,下一轮可能还会有帮助。理论上,ONPO找到稳定策略的速度比普通方法更快:误差从大约1/√T改进到1/T。

实验也很亮眼:Mistral版本在AlpacaEval 2.0得分42.8,Llama版本48.6;MT-Bench分别为7.68和8.40。不过它还主要测试单轮回答,而且裁判是模型,不是真人,所以未来还要在多轮对话和真实用户反馈中验证。

术语表

General Preference Oracle(一般偏好预言机)

只比较两个回答并返回二元偏好信号的评价机制,不要求绝对奖励。它可以表达非传递或情境化偏好。

ONPO通过该oracle构造在线偏好数据。

Bradley–Terry Model(BT模型)

假设每个回答存在标量奖励,并用奖励差的sigmoid表示胜率。论文放弃这一假设。

用于解释传统RLHF的限制。

Nash Policy(纳什策略)

在对称零和博弈中,对任意对手策略都不落败的稳定策略。其理想胜率为0.5。

ONPO的优化目标。

Duality Gap(对偶间隙)

最佳响应可获得的收益与当前策略可被对手压低的收益之差。间隙为零表示达到Nash平衡。

论文的理论性能指标。

Optimistic OMD(乐观在线镜像下降)

先用预测奖励更新,再用真实奖励校正的在线学习方法。KL散度提供稳定的近端约束。

ONPO的核心更新机制。

Self-play(自博弈)

让策略与自身或自身历史版本对抗,从竞争反馈中持续改进。

ONPO生成在线训练数据的框架。

开放问题 这项研究留下的未解疑问

  • 1 真实人类偏好常具有群体差异和噪声;论文主要依赖自动偏好模型,因此尚不清楚理论优势在真人标注、偏好漂移和安全冲突下是否保持。
  • 2 多轮任务的终局偏好如何低方差地转化为中间动作学习信号,仍需高效Q值估计与大规模实验验证。

应用场景

近期应用

在线客服回答优化

客服系统可让当前模型生成多个候选,由人工或偏好模型选择优胜答案,再用ONPO迭代更新。它无需单独训练BT奖励模型,适合已有SFT模型、持续收集比较反馈的团队。

写作与代码助手对齐

用户可在两份摘要、解释或代码方案中选择更有用者。系统将胜负样本直接用于ONPO训练,逐步贴合产品用户群体,而不是依赖固定的绝对评分标准。

远期愿景

多轮个性化智能体

若解决终局偏好到Q值的信用分配问题,ONPO可用于长对话和工具调用智能体,使策略在复杂交互中学习稳健的整体偏好。主要障碍是反馈稀疏、采样成本和偏好安全约束。

原文摘要

Reinforcement learning from human feedback (RLHF) has demonstrated remarkable effectiveness in aligning large language models (LLMs) with human preferences. Many existing alignment approaches rely on the Bradley-Terry (BT) model assumption, which assumes the existence of a ground-truth reward for each prompt-response pair. However, this assumption can be overly restrictive when modeling complex human preferences. In this paper, we drop the BT model assumption and study LLM alignment under general preferences, formulated as a two-player game. Drawing on theoretical insights from learning in games, we integrate optimistic online mirror descent into our alignment framework to approximate the Nash policy. Theoretically, we demonstrate that our approach achieves an $O(T^{-1})$ bound on the duality gap, improving upon the previous $O(T^{-1/2})$ result. More importantly, we implement our method and show through experiments that it outperforms state-of-the-art RLHF algorithms across multiple representative benchmarks.

cs.LG cs.AI cs.CL