Safe Probabilistic Planning for Human-Robot Interaction using Conformal Risk Control

TL;DR

CRC-CBF以风险自适应安全裕度保障人机导航,但全文未报告具体数值结果。

cs.RO 🔴 高级 2026-03-11 24 次浏览
Jake Gonzales Kazuki Mizuta Karen Leung Lillian J. Ratliff
人机交互 控制屏障函数 保形风险控制 概率安全 机器人导航

核心发现

方法论

论文提出CRC-CBF框架,将控制屏障函数(CBF)与非交换保形风险控制(CRC)结合。机器人先用随机人类策略预测动作,再计算预测屏障值,并通过加权校准学习安全裕度λ。在线阶段,LSTM根据交互上下文输出λ,CRC安全滤波器通过二次规划最小化与名义控制的偏差,同时满足概率安全约束。

关键结果

  • 在人机导航仿真中,作者报告CRC安全滤波器相较标准CBF等基线显著减少碰撞与安全违规,并保持较高目标到达率和控制效率;但所提供正文未给出碰撞率、成功率或运行时间的具体数值。
  • 理论上,若非交换CRC满足E[L(λ)]≤α+β,取ε=(α+β)/γ,并施加预测屏障值约束,则定理1保证Pr(h(xk+1)≥0)≥1−γ;β表示时间序列非交换性造成的总变差误差。
  • 方法使用几何权重wi=ρ^(nk+1−i)处理历史依赖;较高交互不确定性会增大λ、收紧控制集合,低风险情境则降低λ,从而改善安全性与保守性之间的平衡。

研究意义

研究针对人类行为多模态、历史依赖且难以精确建模这一长期难题,避免预设高斯分布或已知有界扰动。它把统计风险控制直接嵌入CBF安全约束,使机器人能够用有限数据获得单时间步概率安全保证。对学术界而言,该工作连接了统计验证、学习型人类预测与控制不变性;对工业界而言,它提供了可接入现有CBF-QP和实时控制器的风险调节机制。

技术贡献

核心贡献包括:定义真实屏障证书B与预测证书B̂之间的误差损失L(λ)=max{0,|B−B̂|−λ};使用带几何衰减权重的非交换CRC估计最小安全裕度;通过Lemma 3将期望损失界转化为屏障误差的高概率界;再由Theorem 1推出Pr(h(xk+1)≥0)≥1−γ。Algorithm 1完成离线校准,Algorithm 2用LSTM在线预测λ。

新颖性

作者称这是首次将CRC用于联合人机系统的控制论安全约束。与仅保证轨迹预测覆盖率的保形预测不同,CRC直接控制屏障预测误差;与只保证长期平均违规率的保形决策方法不同,本文目标是每个离散时间步的概率安全保证,并显式处理时间依赖。

局限性

  • 理论依赖屏障预测误差存在有限上界ξ,且保证质量受非交换误差β影响;实际部署中β难以计算,快速分布漂移可能削弱覆盖保证。
  • 实验主要是仿真人机导航,行为模型由真实行人数据训练但当前数据不含机器人动作;因此尚未充分验证真实机器人、传感噪声和人类策略反应下的性能。

未来方向

后续应评估真实机器人与真实行人交互,学习包含机器人动作反馈的robot-aware人类模型,并报告碰撞率、成功率、计算延迟和校准曲线。还可研究自适应ρ、在线更新β、多机器人扩展,以及面对剧烈分布漂移时的鲁棒CRC与安全恢复策略。

AI 总览摘要

机器人进入商场、医院和道路后,必须在不可预测的人群中行动。人的行为可能向左或向右绕行,也会受此前互动影响。传统概率规划常假设高斯噪声;采样方法虽能表达复杂分布,却缺乏严格保证并可能难以实时运行。本文把这一问题转化为:机器人能否在不准确知道人类下一步动作时,仍以用户指定的概率保持安全?

作者提出CRC-CBF框架。CBF把安全区域写成h(x)≥0,并用二次规划筛选名义控制;CRC则从历史真实屏障值B与预测值B̂的误差中学习安全裕度λ。非交换CRC使用几何衰减权重处理时间依赖,LSTM再根据当前交互上下文在线输出λ。理论上,若风险界满足E[L(λ)]≤α+β,取ε=(α+β)/γ后,约束B̂−(λ+ε)≥0即可推出下一时刻Pr(h(xk+1)≥0)≥1−γ。

在人机导航仿真中,论文报告该方法相比标准CBF等基线显著减少碰撞和安全违规,同时维持较高到达成功率及高效控制;但所给全文没有列出具体百分比、数据集名称或运行时间,因此不能补充未报告的数字。其价值在于把“预测不确定性”变成可校准的控制缓冲区:高风险时更保守,低风险时减少不必要绕行。真正落地仍需真实机器人实验、公开数值指标和对分布漂移的系统评估。

深度分析

研究背景

CBF通过控制不变性保障安全,经典形式将安全集写为S={x:h(x)≥0},并求解CBF-QP。鲁棒CBF可处理已知有界扰动,但人的行为通常多模态、历史依赖且难以给出可靠上界。保形预测提供分布无关覆盖,Adaptive Conformal Prediction可应对漂移;然而固定覆盖率不等于直接控制安全约束风险。

核心问题

离散采样和零阶保持会产生连续时间安全缺口,未知人类控制uH又使机器人无法直接求解含真实动作的RCBF-QP。目标是在状态历史x0:k条件下,使机器人控制满足Pr(uR∈Ĉ)≥1−γ,并保持目标到达、控制效率与不过度保守之间的平衡。

核心创新

  • ��首次将非交换CRC用于人机联合系统的CBF安全值。
  • ��以L(λ)=max{0,|B−B̂|−λ}直接度量屏障预测误差,而非仅校准轨迹覆盖。
  • ��用几何权重ρ^(nk+1−i)适应时间依赖。
  • ��用LSTM把场景特征映射为动态λ,使高风险互动收紧控制、低风险互动放宽控制。

方法详解

  • ��系统建模:离散动力学为xk+1=fd(xk)+BR,duR,k+BH,duH,k。
  • ��鲁棒化:用η=ΔT·Lx(LhLgRu+LhLf+LK∘h)补偿采样误差。
  • ��预测:从随机人类策略P(uH|x0:k)采样动作,得到B̂;真实证书B用于离线校准。
  • ��CRC:求最小λ,使(1/(nw+1))(ΣwiLi(λ)+B)≤α。
  • ��安全滤波:最小化||uR−unom||²,并约束B̂−(λ+ε)≥0。
  • ��在线控制:Algorithm 2由LSTM Φ(ϕk)更新λ并逐步执行。

实验设计

实验采用人机导航与多人群仿真。人类行为模型根据真实行人数据训练,输入多智能体位置、速度和交互历史,输出人类控制序列;名义机器人策略用于离线生成轨迹。Algorithm 1收集M条、每批K条、时域N的轨迹,并按ρ校准λ;Algorithm 2在线使用LSTM。正文提到标准CBF等基线及碰撞率、安全违规、目标成功率和控制效率,但未提供数据集名称、超参数完整表或数值结果。

结果分析

定理结果是单步概率安全:满足CRC风险条件并使用ε=(α+β)/γ时,Pr(h(xk+1)≥0)≥1−γ。图示显示高不确定性交互中λ增大、控制空间收缩,低风险时λ减小。实验定性结论为碰撞和安全违规下降,同时成功率与控制效率保持较高水平;由于原文摘录没有具体数字,无法严谨比较提升幅度。

应用场景

适用于服务机器人、仓储移动机器人、医院配送和拥挤公共空间导航。部署前需要人类行为预测器、可微或可计算的CBF、名义控制器、历史校准数据及实时QP求解器。系统尤其适合无法可靠指定高斯分布或最坏情况扰动界的场景。

局限与展望

保证依赖有限屏障误差、局部Lipschitz动力学、可行控制集和缓慢分布变化。非交换误差β通常难以计算,极端突发行为可能令历史校准失效。当前模型由行人数据训练且未显式包含机器人动作,可能低估相互反应。论文还缺少公开的数值实验表、真实硬件验证和计算成本分析;后续应补充这些评估。

通俗解读 非专业人士也能看懂

把机器人想成商场里推着餐车的员工,把人群想成随时改变路线的顾客。普通做法像只看顾客上一秒站在哪里,然后规定餐车离人至少一米;但顾客可能突然转身,所以这个规则有时不够安全。

本文给餐车装了一个“会复盘的安全助手”。助手比较过去预测的顾客路线和实际路线,看看自己通常会错多少,并把这个误差变成额外缓冲距离。若周围人很多、路线混乱,助手就要求餐车离人更远;若通道空旷、预测稳定,就允许餐车更直接地前进。

关键是它不是简单地说“永远留很大距离”,而是根据历史表现和当前场景调整谨慎程度。每一步,系统都会在“尽快到目的地”和“不要撞人”之间选择最接近原计划、但仍足够安全的动作。论文还给出数学保证:在设定的可信程度下,下一步仍处于安全区域的概率至少达到指定水平。不过,论文提供的实验摘要没有列出具体百分比,因此只能确认方向性优势,不能声称精确提升多少。

简单解释 像给14岁少年讲一样

想象你在一款游戏里操控机器人穿过人群。问题是,NPC不一定按固定路线走:他可能向左躲,也可能向右躲,还会根据你刚才怎么移动来改变下一步。若机器人只猜一个路线,猜错时就可能撞上。

这篇论文设计了一个“安全护盾”。它先画出一条不能越过的危险线,再让机器人尽量按照原计划走;如果原计划太危险,护盾就把它挡下来。更聪明的是,护盾会记录过去的预测错得有多厉害。周围情况越混乱,它就留出越大的缓冲区;情况简单时,缓冲区会变小,机器人不会傻乎乎地绕远路。

这个系统叫CRC-CBF。CRC像一个会检查预测准确率的裁判,CBF像游戏里的防撞墙。论文还证明,只要校准风险达到设定标准,机器人下一步留在安全区域的概率就至少是1−γ。比如γ越小,要求就越严格。

实验是人机导航仿真。作者说它比普通CBF更少碰撞和违规,同时仍能完成目标。不过,给出的正文没有具体百分比,也没有真实机器人测试。所以它像一套很有希望的游戏防撞系统,但还需要在真实商场、医院或街道里继续考试!

术语表

Control Barrier Function (控制屏障函数)

用函数h(x)≥0描述安全区域,并通过限制控制动作保持该区域不被越过。它把安全要求转化为可求解的控制约束。

论文用CBF构造安全证书B,并嵌入二次规划安全滤波器。

Conformal Risk Control (保形风险控制)

一种以有限样本、较少分布假设控制预测损失期望的方法。它不只追求覆盖率,还能针对用户定义的风险函数调节阈值。

论文用CRC学习屏障预测误差对应的安全裕度λ。

Nonexchangeable CRC (非交换CRC)

针对时间序列依赖数据的CRC变体,通过重新加权历史样本处理当前数据与过去数据分布不同的问题。

论文使用几何权重wi=ρ^(nk+1−i)校准动态人机互动风险。

Safety margin λ (安全裕度)

从预测安全值中扣除的缓冲量,用于覆盖预测误差。λ越大,允许的控制动作集合越小。

Algorithm 2通过LSTM根据交互上下文在线更新λ。

Barrier certificate (屏障证书)

由CBF导数、系统动力学和离散化补偿项组成的安全数值。证书非负表示控制动作满足相应安全条件。

论文区分真实B(xk,uk)和可计算的预测B̂。

Chance constraint (机会约束)

要求约束满足事件以至少某个概率发生,而不是要求所有可能情况都满足。它能表达风险与性能的折中。

SRCBF-QP要求Pr(uR∈Ĉ)≥1−γ。

开放问题 这项研究留下的未解疑问

  • 1 论文没有报告碰撞率、成功率和延迟的具体数值,因而无法判断相对基线的实际提升幅度。
  • 2 β代表非交换性误差但通常难以计算;在快速分布漂移、突发行为和机器人主动影响人类时,理论保证如何校准仍未解决。
  • 3 真实机器人与真实行人实验、传感噪声、模型失配和大规模多人场景下的实时性仍需验证。

应用场景

近期应用

医院与仓储配送

移动机器人可用现有名义导航器生成目标控制,再由CRC-CBF过滤靠近行人时的危险动作。部署需要行人预测模型、CBF几何模型、历史校准数据和实时QP求解器,预期减少碰撞而不过度牺牲通行效率。

公共空间服务机器人

在机场、商场或校园中,系统可根据人群密度和交互历史动态扩大或缩小安全缓冲区。适合难以准确假设行人噪声分布的场景,但必须监控分布漂移和预测器失效。

远期愿景

可验证的社会化自主机器人

未来可将robot-aware人类模型、在线CRC和多机器人CBF结合,使机器人在长期互动中持续校准风险。若能建立真实世界评测标准,它可能成为面向公共环境部署的安全控制层。

原文摘要

In this paper, we present a novel probabilistic safe control framework for human-robot interaction that combines control barrier functions (CBFs) with conformal risk control to provide formal safety guarantees while considering complex human behavior. The approach uses conformal risk control to quantify and control the prediction errors in CBF safety values and establishes formal guarantees on the probability of constraint satisfaction during interaction. We introduce an algorithm that dynamically adjusts the safety margins produced by conformal risk control based on the current interaction context. Through experiments on human-robot navigation scenarios, we demonstrate that our approach significantly reduces collision rates and safety violations as compared to baseline methods while maintaining high success rates in goal-reaching tasks and efficient control. The code, simulations, and other supplementary material can be found on the project website: https://jakeagonzales.github.io/crc-cbf-website/.

cs.RO cs.AI