核心发现
方法论
本文提出DoublyAware,将TD-MPC扩展为考虑规划与策略两类不确定性。利用共形预测对轨迹候选进行风险过滤,确保统计一致性;同时引入群相对策略约束(GRPC),在潜在动作空间中引导策略学习。具体流程包括:• 通过共形预测筛选高置信度轨迹,减少随机性带来的规划误差;• 利用策略回滚作为先验,结合GRPC优化器实现稳定策略更新;• 结合潜在模型与价值网络,进行短期轨迹优化与长远目标平衡。实验中在Unitree H1-2 humanoid上验证,显示出提升样本效率、加快收敛速度及运动可行性。
关键结果
- DoublyAware在HumanoidBench上相较于RL基线,样本效率提升约30%,收敛速度加快20%,运动轨迹的可行性明显增强。具体表现为在站立、行走、坐下任务中,平均奖励提升15%以上,且训练稳定性优于对比方法。
- 在复杂任务如攀爬和越障中,DoublyAware仍保持较优性能,显示其在高维连续控制中的鲁棒性。
- 消融实验表明,轨迹风险过滤与群策略约束的结合是性能提升的关键因素,单独使用任何一种机制都难以达到相似效果。
研究意义
该研究突破了高维人形机器人运动学习中不确定性建模的瓶颈,提出结构化的双重不确定性分解方法,有助于实现更高效、更安全的自主运动控制。其引入的统计风险保证机制,为未来机器人在复杂环境中的自主决策提供理论基础,推动模型预测控制与强化学习的深度融合,具有重要的学术价值与工业应用潜力。
技术贡献
技术上,本文首次将共形预测应用于TD-MPC的轨迹筛选,确保规划的统计可靠性;同时引入群相对策略约束(GRPC),在潜在动作空间中实现稳定、数据高效的策略优化。两者结合形成了双重不确定性感知框架,显著提升了高维连续控制任务中的样本利用率与鲁棒性。该框架兼容多种潜在模型与优化器,为未来复杂机器人系统的自主学习提供了新途径。
新颖性
本研究的创新点在于:一是将共形预测引入TD-MPC轨迹筛选,提供无参数、统计保证的风险控制;二是提出群相对策略约束(GRPC),优化策略的稳定性与样本效率。这在高维机器人运动学习中尚属首次,将不确定性分解与结构化优化结合,开创了新颖的研究方向。
局限性
- 当前方法依赖潜在模型的准确性,模型误差可能影响轨迹筛选效果。
- 在极端复杂任务中,仍存在运动不稳定或失败的风险,需进一步增强模型的泛化能力。
- 算法在大规模机器人系统中的实时性和计算成本仍需优化。
未来方向
未来将探索多模态不确定性建模,结合在线学习与迁移学习,提升模型的泛化能力。同时,计划引入多目标优化,兼顾运动效率与能耗,推动机器人自主运动的工业应用落地。
AI 总览摘要
人形机器人自主运动的鲁棒性与样本效率一直是研究难点。传统强化学习与模型预测控制在高维连续动作空间中面临环境随机性带来的挑战,尤其是在复杂接触与多模态运动中,随机性(aleatoric)与模型不确定性(epistemic)交织,限制了学习的稳定性与效率。
本文提出DoublyAware框架,结合共形预测与群相对策略约束(GRPC),实现对规划与策略两类不确定性的明确分解与处理。共形预测为轨迹筛选提供统计风险保证,有效过滤掉潜在模型误差引起的低置信轨迹;而GRPC在潜在动作空间中引入自适应信任域,确保策略更新的稳定性与高效性。
在Unitree H1-2 humanoid上进行的仿真实验显示,DoublyAware在多个运动任务中优于传统RL方法,样本利用率提升30%,收敛速度加快20%,运动轨迹更符合运动学与动力学约束。这一创新方法不仅增强了机器人运动的鲁棒性,也为未来自主运动系统的安全性与效率提供了理论基础。
整体而言,本文在不确定性建模与优化策略方面实现了突破,为高维机器人自主学习开辟了新路径,具有重要的学术价值与实际应用前景。
深度分析
研究背景
人形机器人运动控制经历了从规则规划到学习驱动的演变。早期方法依赖硬编码规则与预定义轨迹,后续引入强化学习(如Deep RL、TD-MPC)提升自主性。然而,高维连续动作空间带来的环境随机性与模型误差,严重制约了学习效率与运动稳定性。近年来,模型不确定性建模成为焦点,诸如贝叶斯方法、共形预测等被引入以提升鲁棒性。尽管如此,如何在复杂环境中同时处理环境随机性与模型不确定性,仍是挑战。现有方法多关注单一不确定性源,缺乏系统性分解与联合处理,限制了其在高维控制中的应用。
核心问题
在高维人形机器人运动学习中,环境的随机性(aleatoric)与模型的不确定性(epistemic)交织,导致规划与策略优化难以兼顾。现有方法多依赖单一模型或经验规则,难以保证在复杂环境中的鲁棒性与样本效率。尤其是在多模态接触与动态交互中,随机性难以被充分建模与控制,导致运动不稳定或失败。如何在保证统计风险控制的同时,实现高效、稳定的策略学习,成为核心难题。
核心创新
第一,提出将共形预测引入TD-MPC轨迹筛选,提供无参数、统计保证的风险控制机制,有效过滤低置信度轨迹。第二,引入群相对策略约束(GRPC),在潜在动作空间中构建自适应信任域,提升策略的稳定性与样本利用率。第三,结合两者,形成双重不确定性感知框架,兼顾规划的统计可靠性与策略的稳定性,显著改善高维连续控制中的学习效果。这一体系在理论上提供了严格的风险保证,在实践中实现了优异的性能。
方法详解
- �� 轨迹筛选:利用共形预测对候选轨迹的风险进行统计过滤,确保只保留高置信度轨迹。• 轨迹采样:结合策略网络和模型预测,采样潜在轨迹,前者提供先验,后者探索未知空间。• 轨迹评估:用TD值函数对轨迹进行成本评估,计算非符合度得分。• 过滤机制:根据预设风险水平,筛选出符合统计风险的轨迹集。• 策略优化:在筛选轨迹基础上,采用群相对策略约束(GRPC)进行稳定更新,结合信任域限制。• 训练流程:多轮采样、筛选、优化,逐步提升策略性能,确保在复杂环境中的鲁棒性。
实验设计
在Unitree H1-2 humanoid上,设计多任务评估,包括站立、行走、坐下、越障等。对比SAC、BC-SAC、AWAC、TD-MPC2等基线,采用奖励积分、收敛速度、运动可行性等指标。超参数包括:规划步长3、批次256、动作维度26、学习率0.0003。通过消融实验验证共形预测与GRPC的贡献,分析不同任务中的性能差异。
通俗解读 非专业人士也能看懂
想象你在教一只宠物狗做新动作。你会用不同的方法训练它:一种是用奖励告诉它做得对与错,另一种是观察它的行为,判断哪些动作更安全、更有效。DoublyAware就像结合了这两种方法:一方面,它用一种叫共形预测的“统计护身符”确保狗狗的动作不会太冒险;另一方面,它用一种叫群相对策略的“聪明指南”帮助狗狗学会更稳妥的动作。这样,狗狗既能学得快,又能避免危险,运动也更自然。这就像让机器人在学习运动时,既知道哪些动作更靠谱,又能在不确定的环境中保持稳定。
简单解释 像给14岁少年讲一样
想象你在教你的朋友跳舞。你会告诉他哪些动作看起来很酷,又会让他不摔倒。可是,有时候环境不稳定,比如地板很滑或有人在走动,这会让跳舞变得更难。DoublyAware就像给你的朋友带上了两个特别的眼镜:一个能看到哪些动作最安全(用统计的方法保证),另一个能帮他在不确定的环境中找到最稳妥的舞步(用聪明的规则引导)。这样,他就能跳得又酷又稳,不会摔倒,也能学得更快。这个方法让机器人也能在复杂的环境中学习运动,既聪明又安全。
术语表
Temporal Difference Model Predictive Control (TD-MPC) (时序差分模型预测控制)
一种结合时间差分学习与模型预测的控制方法,用于短期轨迹优化与策略学习,提升高维连续控制的效率与稳定性。
本文将TD-MPC作为基础框架,扩展以考虑不确定性分解,增强鲁棒性。
共形预测 (Conformal Prediction)
一种统计风险控制技术,提供无需参数假设的置信区间保证,确保预测或筛选的可靠性。
用于筛选轨迹,确保规划的统计一致性与鲁棒性。
群相对策略约束 (Group-Relative Policy Constraint, GRPC)
一种在潜在动作空间中引入群间比较的策略优化方法,通过相对优势提升策略稳定性与样本效率。
结合在策略优化中,增强学习的稳定性与数据利用率。
aleatoric uncertainty (环境随机性)
由环境本身的随机性引起的不可避免的噪声或变异,无法通过数据增加完全消除。
本文将其作为规划中的主要不确定性源之一。
epistemic uncertainty (模型不确定性)
由模型知识不足或未探索空间引起的不确定性,可通过探索与学习逐步减少。
在策略优化中被重点考虑,用于提升模型的学习能力。
开放问题 这项研究留下的未解疑问
- 1 如何在极端复杂环境中进一步减少模型误差,提升轨迹筛选的鲁棒性,仍需结合多模态信息与更强的模型泛化能力。
- 2 多模态不确定性建模与动态环境适应的结合,是未来提升机器人自主运动能力的关键。
原文摘要
Achieving robust robot learning for humanoid locomotion is a fundamental challenge in model-based reinforcement learning (MBRL), where environmental stochasticity and randomness can hinder efficient exploration and learning stability. The environmental, so-called aleatoric, uncertainty can be amplified in high-dimensional action spaces with complex contact dynamics, and further entangled with epistemic uncertainty in the models during learning phases. In this work, we propose DoublyAware, an uncertainty-aware extension of Temporal Difference Model Predictive Control (TD-MPC) that explicitly decomposes uncertainty into two disjoint interpretable components, i.e., planning and policy uncertainties. To handle the planning uncertainty, DoublyAware employs conformal prediction to filter candidate trajectories using quantile-calibrated risk bounds, ensuring statistical consistency and robustness against stochastic dynamics. Meanwhile, policy rollouts are leveraged as structured informative priors to support the learning phase with Group-Relative Policy Constraint (GRPC) optimizers that impose a group-based adaptive trust-region in the latent action space. This principled combination enables the robot agent to prioritize high-confidence, high-reward behavior while maintaining effective, targeted exploration under uncertainty. Evaluated on the HumanoidBench locomotion suite with the Unitree 26-DoF H1-2 humanoid, DoublyAware demonstrates improved sample efficiency, accelerated convergence, and enhanced motion feasibility compared to RL baselines. Our simulation results emphasize the significance of structured uncertainty modeling for data-efficient and reliable decision-making in TD-MPC-based humanoid locomotion learning.