SocialRL: Refining LLMs' Social Intelligence through Multi-turn Reinforcement Learning and Reward Design

TL;DR

SocialRL用多轮PPO与动态过程奖励提升社会对话目标达成率,平均提高9.2个百分点。

cs.CL 🔴 高级 2026-09-09 42 次浏览
Jianing Wang Xintao Wang Aili Chen Jie Shi Hongcheng Guo Jun Gao Wenxuan Zhao Chengkun Lang Yuanli Guo Yanghua Xiao
社会智能 多轮强化学习 PPO 过程奖励 大语言模型

核心发现

方法论

SocialRL将社会对话建模为有限时域MDP,以完整多轮轨迹而非单句作为优化单位。它使用PPO、价值网络和GAE传播延迟回报,并以六维动态过程奖励评估目标推进、策略定位、关系适配、人格一致、语境连贯和轮次质量。奖励模型每轮生成2—4条二值标准,阶段权重随对话早期、中期、后期变化。

关键结果

  • 在SOTOPIA-π上,Qwen2.5-7B的Goal Achievement由Base的42.3%升至SocialRL的52.3%,提高10.0个百分点;Relationship Change由0.311升至0.358。LLaMA3.1-8B达到59.6%目标达成率。
  • 在AgentSense上,Qwen3-8B由Base的73.3%提升至80.5%,关系变化由0.392升至0.444;Gemma-3-4B由46.3%升至68.1%,显示方法对较小模型尤其有效。
  • 四个基座模型在四项基准上的平均Goal Achievement提升为9.2个百分点;论文还报告SOTOPIA-π平均增益10.725个百分点、AgentSense平均增益9.625个百分点。

研究意义

该研究把社会智能从“单轮说得像人”推进到“跨轮次完成目标并维护关系”。它回应了对话代理长期缺乏规划、只优化局部流畅度以及最终奖励过于稀疏的问题。对学术界而言,SocialRL提供了可解释的过程监督和阶段化目标;对产业而言,它有助于构建更可靠的协作助手、谈判代理与情感支持系统,降低因过度施压或过早放弃造成的交互失败。

技术贡献

核心技术贡献是将完整轨迹PPO与密集、多维、阶段感知奖励统一起来。每轮复合奖励为˜R_t=αR_process,t,末轮再加βR_outcome,其中α=0.3、β=1;GAE使用λ=0.95,PPO裁剪系数ϵ=0.2。与Sotopia-RL采用的单轮GRPO不同,SocialRL通过状态价值函数估计未来回报,减少不同对话状态共享同一轮次基线所产生的方差和偏差。

新颖性

论文的独特之处不是单独提出PPO或LLM评分器,而是首次在该社会对话设定中联合优化完整多轮轨迹、六维过程奖励和阶段权重。相比ArCHer的宏观回报、Sotopia-RL的单轮GRPO以及BC/SDPO的静态监督,SocialRL显式编码了“先建立关系、再推进目标、最后平衡收束”的策略结构。

局限性

  • 奖励模型仍由LLM生成标准并进行二值判定,可能继承模型偏见;不同文化、权力关系或隐含礼貌规范下,评分稳定性和跨域有效性未充分验证。
  • 实验主要依赖SOTOPIA-π、SOTOPIA-All、SOTOPIA-Hard和AgentSense的模拟或脚本场景,真实用户长期互动、在线安全风险和训练计算成本仍缺少系统评估。
  • gpt-4o仍在若干设置中领先,说明SocialRL尚未消除模型规模、先验能力和社会推理深度带来的差距。

未来方向

后续可研究跨文化、长期关系和真实用户环境中的在线评估,加入不确定性校准、人工反馈和安全约束;还可探索自适应阶段识别、因果信用分配、多智能体协商及更高效的过程奖励模型,从而降低每轮生成评分标准的推理成本。

AI 总览摘要

社会智能并不是每一轮都说得礼貌,而是在持续对话中同时理解语境、推断意图、推进目标并维护关系。现有单轮强化学习,如Sotopia-RL,容易优化局部流畅度;仅使用最终结果的ArCHer则反馈稀疏,难以告诉模型哪一步造成了成功或关系破裂。

SocialRL把完整多轮对话作为强化学习轨迹,使用PPO、价值网络和GAE将延迟结果回传到每个轮次。同时,奖励模型为每轮生成具体二值标准,从目标推进、策略定位、关系适配、人格一致、语境连贯和轮次质量六个维度评分。权重还会随阶段变化:早期优先建立信任,中期推进目标,后期兼顾达成与体面收束。

结果显示,SOTOPIA-π上Qwen2.5-7B的目标达成率由42.3%升至52.3%,关系变化由0.311升至0.358;AgentSense上Qwen3-8B由73.3%升至80.5%。四个基座模型跨四项基准平均提高9.2个百分点。研究表明,社会对话代理需要的不只是更好的句子生成,而是面向长期互动的信用分配、过程监督和阶段性策略。

深度分析

研究背景

随着LLM从问答工具转向自主协作者,社会智能成为可信交互的基础。SOTOPIA、SOTOPIA-π和AgentSense覆盖谈判、同理心、信息验证及隐含信息推断。既有BC能模仿表达风格,Sotopia-RL用GRPO优化单轮,ArCHer建模宏观回报,但多轮社会行为中的目标—关系权衡仍缺乏细粒度学习信号。

核心问题

社会对话是部分可观测、状态依赖且具有延迟结果的序列决策问题。早期坚持可能帮助最终目标,却损害关系;过早让步则关系良好但目标失败。单轮奖励无法表示前后轮次的因果作用,最终奖励又稀疏、高方差,因此模型容易短视,难以学习何时建立关系、何时施压以及如何结束。

核心创新

  • ��完整轨迹优化:以整段对话作为PPO单位,价值网络估计每个状态的未来回报。
  • ��六维过程奖励:将目标推进与策略定位置于目标侧,将关系适配与人格一致置于关系侧,并以语境连贯和轮次质量提供通用约束。
  • ��动态评分标准:奖励模型每轮生成2—4条可检查的二值rubric。
  • ��阶段权重:早期重视亲和与连贯,中期重视目标和策略,后期平衡闭合与关系。

方法详解

  • ��任务输入:场景S、私人目标G、双方人格C及历史H_t;动作是完整话语而非单个token。
  • ��过程评分:六维分数为通过标准的比例,r_t,i=(1/M_i)Σ_j pass_i,j。
  • ��奖励合成:R_process,t=Σ_i w_t,i r_t,i,权重非负且和为1;末轮加入结果奖励,α=0.3、β=1。
  • ��轨迹训练:用δ_t=˜R_t+γV(s_{t+1})−V(s_t)计算TD误差,用GAE λ=0.95求优势,再以ϵ=0.2的PPO裁剪目标更新策略。
  • ��阶段推断:奖励模型依据场景、目标和历史识别Early/Mid/Late,并经过白名单、裁剪、上限和归一化处理权重。

实验设计

实验使用SOTOPIA-π(1,773个场景、259个测试场景)、SOTOPIA-All(90个场景)、SOTOPIA-Hard(14个高冲突场景)和AgentSense(1,225个场景、245个模板)。训练Qwen2.5-7B、Qwen3-8B、LLaMA3.1-8B和Gemma-3-4B,对手包括Qwen2.5-7B、Qwen3-8B、Qwen3.5-35B和gpt-4o。指标为Goal Achievement与Relationship Change,每种策略—对手组合重复5次。

结果分析

SOTOPIA-π中,SocialRL-Qwen2.5-7B平均达到52.3%/0.358,而Base为42.3%/0.311;LLaMA3.1-8B达到59.6%/0.341。AgentSense中Qwen3-8B为80.5%/0.444,高于Base的73.3%/0.392;Gemma-3-4B从46.3%/0.065升至68.1%/0.234。gpt-4o仍达到69.0%和91.7%的相应平均目标分数,表明仍有差距。

应用场景

可用于谈判助手、客户服务、团队协作、教育辅导和情感支持。部署前应明确私人目标与安全边界,验证奖励模型的文化适配性,并采用人工抽检或在线监控。其价值在于让代理知道何时倾听、何时推进、何时妥协,而不是只生成表面礼貌的回复。

局限与展望

方法依赖LLM奖励模型生成rubric,评分偏差、奖励黑客和阶段误判仍可能导致策略失真。模拟场景与脚本数据不能完全代表真实长期关系;多轮rollout、价值网络和每轮评分也增加训练成本。未来应引入真人反馈、跨文化数据、长期纵向评估、风险敏感奖励及更高效的批量评分机制。

通俗解读 非专业人士也能看懂

把社会对话想成两个人一起完成一项困难任务。一个只会单轮训练的助手,就像只看眼前一步的队友:对方刚拒绝,它要么立刻放弃,要么继续逼迫,却不知道这会影响后面的合作。SocialRL则像一位会看全局的队长。

它先记录整场合作,而不是只评价某一句话。每一步都检查六件事:事情有没有推进,策略是否合适,是否照顾对方感受,前后人设是否一致,是否接得上上下文,以及这句话本身是否合格。早期先建立信任,中间再推进任务,最后既完成事情又让双方体面结束。

训练时,系统不仅看最后有没有成功,也把最终结果的影响传回前面的每一步。这样,助手能学会“先理解,再建议,再请求”的节奏。实验中,SOTOPIA-π的目标达成率从42.3%升至52.3%,说明更好的社会表现来自整场合作策略,而不只是更漂亮的句子。

简单解释 像给14岁少年讲一样

想象你和同学组队打游戏,还要请他帮你完成作业。如果你一上来就命令他,他可能直接不想理你;如果你马上说“算了”,关系没问题,但任务也没完成。真正厉害的队友会先问对方是不是很忙,再提出交换办法,最后一起确认计划。

SocialRL就是训练AI成为这种队友。它不只看AI某一句话好不好,而是看完整聊天过程:有没有让事情向前走,有没有理解对方,有没有前后表现一致,有没有说清楚,以及最后关系有没有变差。

它还会根据聊天阶段换策略。开头像交朋友,中间像一起解决问题,结尾像打完比赛后友好握手。系统用PPO学习整段对话,并让一个评分模型逐轮指出哪些地方做得好或不好。

结果很有意思:在SOTOPIA-π中,Qwen2.5-7B的目标成功率从42.3%提高到52.3%;在AgentSense中,Qwen3-8B从73.3%提高到80.5%。所以,社交能力不只是会说话,更是知道什么时候说什么、为什么说,以及这句话会怎样影响下一步!

术语表

Multi-turn PPO(多轮近端策略优化)

PPO是一种限制策略更新幅度的强化学习算法。SocialRL把完整对话轨迹作为优化对象,让早期话语受后续结果影响。

用于跨轮次更新策略并传播延迟结果奖励。

GAE(广义优势估计)

GAE结合多步TD误差估计某个动作比基准策略好多少,在偏差与方差之间折中。

论文设λ=0.95,在轮次级奖励上计算优势。

Process Reward(过程奖励)

过程奖励评价完成任务前的中间行为,而非只看最终结果。它提供更密集、可解释的学习信号。

由六个社会维度加权组成。

Stage-aware Weight(阶段感知权重)

不同对话阶段使用不同评价重点。早期偏关系,中期偏目标,后期强调平衡收束。

奖励模型根据上下文推断Early、Mid或Late。

Goal Achievement(目标达成)

衡量代理是否完成场景中的私人社会目标。不同数据集使用百分比或0—10分数。

论文的主要效果指标。

Relationship Change(关系变化)

衡量对话后双方关系质量相对变化的指标,数值越高通常表示关系维护越好。

与Goal Achievement共同评估目标—关系权衡。

开放问题 这项研究留下的未解疑问

  • 1 奖励模型生成的二值标准是否能跨文化、跨年龄和跨权力关系稳定工作?目前数据主要来自模拟或脚本场景,尚不足以回答真实社会规范差异问题。
  • 2 多轮PPO带来的收益有多少来自轨迹优化、过程奖励或阶段权重?论文展示了整体比较,但更系统的组件级消融和成本分析仍值得开展。
  • 3 模型能否在数周或数月的真实关系中保持一致、诚实且安全的策略?短基准无法充分测试长期信任、记忆和错误修复。

应用场景

近期应用

协作与客户服务代理

企业可在明确任务目标、隐私边界和人工升级规则后,将SocialRL用于多轮客户咨询、排期协商和团队任务分配。系统可减少过度施压与过早放弃,并通过Relationship Change监测交互质量。

教育与谈判辅导

教育平台可用它模拟老师、同学或谈判对手,训练学生先建立共识、再提出请求、最后确认方案。部署时应保留人工审核,避免奖励模型把特定文化中的礼貌误判为有效沟通。

远期愿景

长期人机协作伙伴

未来代理可在跨项目、跨场景关系中持续调整目标与信任策略,成为研究、管理和生活中的协作伙伴。实现这一愿景需要长期记忆、跨文化评价、可验证安全约束和真人在线反馈。

原文摘要

Social intelligence enables agents to read social context, infer intent, and adapt over sustained dialogue. As language models become autonomous collaborators, it is central to building effective and trustworthy human-AI interaction. Existing reinforcement learning methods optimize single-turn utterances and sparse outcome rewards, producing short-sighted policies that struggle to manage goal-relationship tensions across multi-turn interactions. We propose SocialRL, a multi-turn reinforcement learning framework addressing both challenges. First, we apply multi-turn reinforcement learning using PPO that propagates delayed outcome rewards back to each turn, enabling long-horizon planning. Second, we design six process reward dimensions capturing the goal-relationship trade-off, including goal advancement, relational attunement, contextual coherence, etc. A reward model dynamically generates fine-grained scoring criteria for each dimension, while a stage-aware weight schedule prioritizes relationship-building in early turns, goal advancement mid-way, and balanced closure late. Across multiple social-dialogue benchmarks, SocialRL improves Goal Achievement by an average of 9.2 percentage points over the corresponding Base models. These results demonstrate the effectiveness of SocialRL across synthetic and real social scenes, as well as standard and challenging social scenarios.

cs.CL