Coachable agents for interactive gameplay
Style-conditioned UVFA结合Cat-RAC,让智能体可实时切换风格;HFW评估覆盖57,000场战斗。
核心发现
方法论
论文将任务奖励与风格奖励分离:r(s,a;θ)=r_task(s,a)+r_style(s,a,θ),用多维风格向量θ控制奖励权重、阈值与目标值。核心模型是style-conditioned UVFA,并结合scenario training、数据增强、专用replay buffer及面向HFW开发的Categorical Regularized Actor-Critic(Cat-RAC)。
关键结果
- HFW中,5个随机种子训练至450万梯度步,在19种敌人、3个地点和20种风格上评估;每种机器—风格—地点—种子组合采样10次,共57,000场战斗。风格伤害矩阵呈明显对角线,说明请求风格与实际攻击类型高度一致。
- GT Sophy在Gran Turismo 7的Lago Maggiore赛道使用Red Bull X2019 Competition赛车;燃油或轮胎惩罚最多可使进站间隔延长约60%,代价是每圈慢约2–3秒,形成可由用户运行时调节的速度—资源Pareto权衡。
- HFW总体胜率多数超过0.90,默认风格胜率为0.998;但面对Thunderjaw和Slaughterspine时,近战、Sunscourge或IceStorm风格胜率低于一半。部件拆除风格约拆下其他风格两倍部件,却可能因奖励过高追逐目标而超时。
研究意义
传统强化学习通常只收敛到一种近最优行为,难以响应“安静一点”“更保守”或“少用某武器”等实时偏好。本研究把“完成什么”与“怎样完成”统一到一个可条件化策略中,并在AAA游戏、赛车和动态人形环境中验证。其意义不仅是增强NPC和游戏辅助,也为机器人在人类偏好、环境约束和任务目标之间进行即时折中提供了可行框架。
技术贡献
技术上,论文把UVFA从目标条件控制扩展到固定任务、多行为风格的高维控制。风格向量可表达线性奖励、门控阈值和setpoint;训练侧通过场景设计、风格采样、数据增强和分风格回放缓解稀疏数据与不稳定问题。Cat-RAC进一步为HFW复杂离散动作提供SAC家族中的新实现。运行时只需改变θ或风格权重,无需重新训练策略。
新颖性
新颖性不在于单独提出奖励塑形或UVFA,而在于将style-conditioned UVFA、场景课程、采样与高维算法工程化组合,并推进到Horizon Forbidden West这类AAA开放世界。相较把每种风格视为独立任务的方法,本框架保留共享任务能力,也支持连续强度、组合风格和执行中切换。
局限性
- 风格奖励与任务奖励的尺度敏感;部件拆除奖励过高会使智能体沉迷瞄准部件,导致弱敌人战斗超时或胜率下降。
- 部分风格在强敌上明显损害任务完成率;近战、Sunscourge和IceStorm面对Thunderjaw或Slaughterspine时胜率低于50%,显示风格可行性受环境与装备限制。
未来方向
后续应研究自动发现风格奖励、在线安全调节和更精细的多目标标定;还需扩大真实机器人验证,评估长期交互、用户反馈、风格可解释性与计算成本,并探索从自然语言偏好映射到θ的接口。
AI 总览摘要
强化学习已能让智能体驾驶、战斗或行走,却常常只学会一种“标准答案”。现实用户关心的不只是是否成功,还关心过程:机器人能否安静清扫,赛车能否省油,游戏角色能否坚持近战。把这些偏好拆成多个任务会丢失共同核心,也难以表达风格强弱。
论文提出style-conditioned UVFA:固定任务奖励负责“赢得战斗、完成比赛或向前行走”,风格奖励则由向量θ调节,例如燃油、轮胎、武器、元素状态或步幅。作者还结合scenario training、数据增强、专用回放池,并为Horizon Forbidden West设计Cat-RAC。用户在执行时改变θ或风格权重,即可改变行为而无需重新训练。
结果跨越三类环境。HFW用5个种子、450万梯度步、19种敌人、3个地点和20种风格生成57,000场战斗,伤害矩阵显示请求风格与实际伤害高度对应,默认胜率达0.998。GT7中资源惩罚使进站间隔最多延长60%,但每圈代价约2–3秒;DMC Humanoid则组合三种手臂姿势与0.3–0.65米步幅。局限是风格奖励可能压过主任务,说明可控性必须与安全、胜率和奖励校准共同设计。
深度分析
研究背景
深度强化学习已在游戏与机器人中取得突破,如SAC、GT Sophy及DMC基准。但标准策略通常追求单一回报最大化,因而缺乏运行时偏好控制。多任务、多目标和goal-conditioned learning能改变任务或目标,却不自然表达同一任务的不同做法。本文将“风格”定义为任务不变而行为特征可变的条件。
核心问题
目标是在不牺牲核心任务的前提下,让智能体实时执行连续、可组合的行为偏好。难点包括高维动作、风格奖励稀疏、不同场景分布、任务与风格奖励冲突,以及训练数据无法覆盖所有风格组合。AAA游戏还包含复杂NPC、武器、元素状态和长时序决策。
核心创新
第一,提出style-conditioned UVFA,用θ而非独立策略表示行为族。第二,将奖励写成任务项与风格项之和,支持权重、阈值、门控和目标值。第三,系统结合scenario training、data augmentation、专用replay buffer。第四,针对HFW提出Cat-RAC。第五,验证风格组合、OOD敌人和运行时切换,展示策略并非简单模仿单一动作。
方法详解
- �� 输入:环境观测s与风格向量θ;输出:游戏手柄或机器人动作a。
- �� 奖励:r=r_task+r_style(s,a,θ),调节风格项尺度以形成任务—风格折中。
- �� 训练:构造不同敌人、地点和风格请求的场景,采集轨迹并按风格存入回放池。
- �� 学习:采用UVFA条件价值估计;HFW使用Cat-RAC,属于SAC扩展。
- �� 增强:通过数据增强与针对性采样提升稀有风格和组合风格覆盖。
- �� 执行:固定策略后改变θ或权重,实现实时风格切换与Pareto调节。
实验设计
实验覆盖Gran Turismo 7、Horizon Forbidden West和DeepMind Control Suite Humanoid。GT7测试Lago Maggiore—Full赛道上的Red Bull X2019 Competition,并独立控制燃油消耗和轮胎磨损。HFW使用700 HP、满技能树、六件满级武器,5个种子训练450万梯度步,评估20种风格、19种敌人和3个地点,共57,000场战斗;指标包括胜率、伤害类型和风格得分。
结果分析
HFW伤害矩阵的对角线显著,说明近战、陷阱、六种武器和七种元素请求均能改变行为;元素风格还会依据状态切换武器,体现情境化决策。OOD敌人上仍保持良好表现。部件拆除约为其他风格两倍,但高奖励造成超时。GT7资源惩罚最多延长进站间隔60%,代价2–3秒/圈;人形可组合手臂姿势与0.3–0.65米步幅。
应用场景
游戏中可用于可控NPC、QA测试、难度辅助、无障碍玩法和设计师行为调节。赛车游戏可按比赛策略实时平衡速度、燃油与轮胎。机器人可根据婴儿睡眠、拥挤环境或用户偏好切换安静、快速或保守模式。部署前提是可测量的任务奖励、可实施的风格奖励及安全动作约束。
局限与展望
论文主要展示三个环境,尚未证明方法在真实机器人、长期开放任务或自然语言偏好上的普适性。风格奖励需要人工设计且尺度敏感;某些风格本身与胜利冲突。训练AAA游戏成本高,完整消融和用户研究有限。未来需自动奖励设计、约束优化、风险敏感学习、语言到θ的映射及更系统的泛化评估。
通俗解读 非专业人士也能看懂
把智能体想成一名万能厨师。顾客永远点同一道主菜,这就是“任务”:必须把菜做好;但顾客可能要求少油、快上桌、少放辣椒,或摆盘更精致,这些就是“风格”。传统厨师只会做一种标准版本,论文的方法则让厨师先学会做主菜,再学会根据一张可调菜单改变做法。
这张菜单就是θ。厨房里同时记录“菜是否成功”和“是否符合要求”:如果是赛车,就分别记录有没有赢、用了多少油和轮胎;如果是战斗,就记录敌人是否被击败,以及伤害来自哪种武器。训练时,厨师会在不同顾客、地点和订单下反复练习,并把少见订单的经验特别保存。
真正方便之处在于,顾客不必重新培训厨师。比赛中把省油旋钮调高,车会慢一点但更晚进站;战斗中切换到冰冻或近战,角色会改变攻击方式。代价也很现实:如果某项要求太重要,厨师可能为了摆盘忘记尽快上菜。
简单解释 像给14岁少年讲一样
想象你在玩一个超复杂的游戏。任务是打倒机器人,但你可以要求角色“只用近战”“多用陷阱”“制造冰冻状态”,甚至中途改口。普通AI像只会一种打法的高手:它可能很强,却不会听你临时安排。
这篇论文训练的是“可教练AI”。AI同时看游戏画面和你的风格指令,再决定下一步按哪个按钮。它不只是背动作,而是学会目标之间的关系:先用冰弹让敌人变脆,再换更强武器快速输出。就像篮球教练说“稳一点”时,球员不会停止得分,而是用更安全的方式进攻。
研究者在《Horizon Forbidden West》《Gran Turismo 7》和会走路的虚拟人形机器人上测试。HFW用了57,000场战斗;赛车最多能让进站间隔延长60%,但每圈慢约2–3秒;人形机器人能把三种手臂姿势和0.3到0.65米步幅自由组合。
不过,AI有时太认真执行风格。例如“拆部件”奖励过高时,它可能一直瞄准零件,忘记赶快打赢敌人。所以未来要让玩家更容易调节“听指令”和“完成任务”之间的平衡。
术语表
Universal Value Function Approximator(通用价值函数近似器)
把价值函数扩展为同时依赖状态和条件变量的模型。它能用一个网络表示多个目标或行为偏好。
本文将条件变量改为风格向量θ,形成style-conditioned UVFA。
Style-conditioned UVFA(风格条件UVFA)
在固定任务不变时,根据风格请求改变策略输出。它表达的是“如何完成”,而非“完成什么”。
用于GT7资源管理、HFW战斗风格和人形步态。
Cat-RAC(分类正则化演员—评论家)
SAC家族算法,结合分类化与正则化机制处理复杂控制。演员产生动作,评论家评估长期回报。
专为HFW高维、复杂离散动作空间开发。
Scenario training(场景训练)
预先设计多样状态、对手和任务情境,使训练覆盖真实使用条件。它比单一随机采样更有针对性。
HFW按19种敌人和3个地点构造训练场景。
Pareto curve(帕累托曲线)
展示两个目标之间的最佳折中边界。改善一个目标通常会牺牲另一个目标。
论文用它展示风格得分与HFW胜率的权衡。
OOD(分布外)
测试样本来自训练中未见过的分布。OOD性能衡量泛化能力。
HFW用未见敌人及不同攻击行为检验泛化。
开放问题 这项研究留下的未解疑问
- 1 如何自动从自然语言或用户示范生成可靠的r_style与θ,仍未解决;当前方案依赖专家手工设计奖励。
- 2 风格组合数量会快速增长。论文展示了少量组合,但尚不清楚更大组合空间中的泛化、冲突检测与安全保证。
- 3 真实机器人需要处理传感器噪声、碰撞风险和长期磨损;DMC Humanoid的成功尚不能替代现实验证。
应用场景
近期应用
可控游戏NPC与无障碍辅助
游戏开发者可用风格请求控制NPC的武器、攻击节奏和风险偏好;玩家也可在困难战斗中让代理接管。前提是游戏提供可计算奖励和安全动作接口,预期结果是更丰富的玩法与更强的可访问性。
赛车策略调节
GT7类系统可在比赛中实时选择省油、护胎或冲刺风格。工程师只需调节风格权重,不必为每种策略重新训练模型,从而支持进站规划、赛事平衡和自动化测试。
远期愿景
可协作家庭机器人
未来机器人可把清洁、搬运等核心任务与安静、快速、谨慎等偏好分离,并根据家庭成员和环境实时切换。主要障碍是语言理解、风险约束、真实世界泛化及责任可追溯性。
原文摘要
Reinforcement learning has proven to be a valuable tool in the creation of advanced AI and robotic systems, contributing to everything from game playing to robotics to foundation models. Through trial-and-error, these AI systems typically learn one, near-optimal behavior to solve their tasks. However, there are many use cases in which one would like to assert some level of control, preferably in real time, over how the task is solved. We refer to these modifications of a core task as styles. We combine universal value function approximators (UVFAs) with carefully selected training scenarios, learning algorithms, and data augmentation to create a framework for coaching agents that exhibit styles in complex domains. We demonstrate the framework's application in the AAA video games Horizon Forbidden West and Gran Turismo, and in an open-source humanoid test domain. Despite the different nature of the domains -- car racing, stylized game combat, and humanoid walking -- each agent shows strong coherence to the style requests while still satisfying the main task in its domain. Importantly, the techniques outlined in this paper allow an end user to choose the final behavior at run time, giving them flexible control over the final executed performance.