SCP-NL2TL: Selective Conformal Prediction with Semantic Verification for Natural Language to Temporal Logic Specifications

TL;DR

SCP-NL2TL用语义核验与保序风险控制,在α=0.10下选择性拒绝不可靠逻辑公式。

cs.AI 🔴 高级 2026-08-06 20 次浏览
Yixuan Wang Licheng Luo Yu Fu Kaidi Xu Yue Dong Mingyu Cai
自然语言到逻辑 保序风险控制 选择性预测 时序逻辑 安全人工智能

核心发现

方法论

框架将任意NL2TL翻译器视为黑盒,先用基于指令嵌入的k近邻保序异常检测器筛除分布外输入,再生成公式。翻译结果由回译保真度Sbt与5次采样语义一致性Ssc组成融合分数Sfu=(Sbt+Ssc)/2,最后使用Conformal Risk Control按联合风险预算α校准接受阈值。

关键结果

  • 在STL上,Sfu总体AUROC为0.706,高于Ssc的0.655和Sbt的0.634;在SpaTiaL上达到0.920,高于0.867和0.871,说明两种信号能识别不同错误。
  • 合并三层级、600个校准样本并设α=0.10时,STL融合分数接受率为0.347,SpaTiaL为0.889;可行风险下限分别为0.0483和0.0083。
  • 实验使用NL2TL的STL、无区间LTL及NL2SpaTiaL的D2–D4层级;GPT-5.2误差约48%,微调LLaMA-3-8B约15%,框架在评估移位下保持更好的风险合规性。

研究意义

论文把“模型必须总给答案”转变为“模型知道何时不应执行”。这对机器人、自动驾驶和工业控制尤其重要,因为语法正确但语义错误的公式可能直接诱导危险行为。与平均准确率不同,联合风险Rjoint=P(接受且错误)直接对应错误规格进入规划器的概率,并通过保序校准给出有限样本、分布无关的期望约束。

技术贡献

核心技术贡献包括:以黑盒可访问的最终指令—公式对替代token概率;以LLM回译和逻辑等价聚类构建语义分数;将CRC损失定义为1[S≤τ]z,从而控制接受错误率;用嵌入k近邻距离D(x)和保序p值在翻译前执行异常筛查。定理1保证交换性下Rjoint≤α,定理2限制正常输入被筛除的概率。

新颖性

作者据称首次为NL2TL加入可校准的accept-or-abstain层,并直接约束单个可执行公式的联合错误风险,而非构造预测集合。其关键新意不是改造翻译器,而是组合回译语义、重复采样稳定性和输入级异常检测,形成可迁移到STL、LTL、SpaTiaL的模型无关安全门。

局限性

  • 定理1依赖校准与测试样本交换性;异常过滤只能发现显著分布外输入,无法保证检测所有移位,残余风险仍需实验评估。
  • 回译和LLM裁判可能出现提示敏感、评价偏差与额外推理成本;小校准集、分数并列或过低α还会导致阈值为负无穷并全面拒答。

未来方向

未来可研究非交换分布下的条件风险保证、更加可靠的形式语义验证器、低成本回译与并行采样,以及按任务风险动态分配α。还应扩大真实机器人轨迹和更复杂逻辑语言实验,并分析异常检测漏报、组间校准及人机升级机制。

AI 总览摘要

机器人能否准确理解“避开障碍后到达目标”?自然语言到时序逻辑翻译器会把指令转换成可规划、可验证的公式,但现有系统几乎总会输出一个答案。问题在于,公式即使语法正确,也可能误解谓词、时间区间、逻辑范围或空间关系;在安全关键系统中,这种“自信地答错”比明确拒答更危险。

SCP-NL2TL为翻译器增加了一道选择性安全门。它先以指令嵌入和k近邻距离运行Conformal异常检测,判断输入是否偏离校准分布;对通过者,系统用回译公式的自然语言保真度Sbt,以及5次随机翻译在精确语义等价下的最大一致簇得到Ssc,并融合为Sfu=(Sbt+Ssc)/2。随后,Conformal Risk Control依据校准集选择最大阈值,使联合风险Rjoint=P(接受且错误)不超过预算α,而不是盲目追求覆盖率。

实验覆盖NL2TL的STL、无区间LTL和NL2SpaTiaL的SpaTiaL,均含D2–D4难度层级。STL与SpaTiaL的融合AUROC分别为0.706和0.920;在α=0.10、600个合并校准样本下,接受率分别为0.347和0.889。结果表明,系统能够在保留较多正确翻译的同时拒绝高风险答案,并在评估的跨层级移位下比覆盖率校准基线更符合风险目标。其意义在于让自然语言接口具备“不会就停”的能力,但保证仍依赖交换性,且LLM核验带来成本与偏差。

深度分析

研究背景

LTL以F、G、U描述离散时序要求,STL处理连续信号及有界时间区间,SpaTiaL进一步表达几何和空间关系。NL2TL研究已使用语义解析、序列模型、预训练模型、结构化中间表示和语法约束解码提升生成质量,但主流评估仍集中于exact match或平均错误率,不能判断某个具体公式是否值得执行。

核心问题

设指令为x、生成公式为φ̂、参考公式为φ⋆,错误z=1[φ̂≢φ⋆]。系统需最大化覆盖C=P(g=1),同时约束Rjoint=E[gz]≤α。输出空间近乎无限,预测集合不适合规划器;黑盒翻译器也没有可靠token likelihood,因此必须从最终输入和公式推断语义可靠性。

核心创新

第一,提出面向单公式执行的选择性NL2TL,而非预测集合。第二,以回译一致性检测语义偏差,以重复采样等价簇检测不稳定性,二者互补。第三,用CRC选择最大可行阈值,并以+1/(n+1)修正有限样本风险。第四,将嵌入异常检测前置,在翻译前拒绝分布外指令。

方法详解

  • �� 输入筛查:归一化嵌入e(x)与训练参考集Xref计算平均k近邻距离D(x),再由式(14)得到保序p值;p(x)<δ时拒绝,实验δ=0.05。
  • �� 公式生成:黑盒翻译器输出φ̂;不可解析公式的Sbt设为1。
  • �� 语义评分:GPT-5.2回译φ̂,gpt-4o按逻辑结构、时间算子、时间约束、整体意义四维评分,Sbt=1−A。
  • �� 稳定性评分:k=5、温度1.0采样,按逻辑特定规范化聚类,Ssc=1−最大等价簇/k。
  • �� 校准决策:在Dcal上计算错误z与经验联合风险,按式(10)取最大τ̂;S≤τ̂则接受,否则拒答。定理1在交换性下保证期望Rjoint≤α。

实验设计

数据来自NL2TL的STL、interval-free LTL及NL2SpaTiaL的SpaTiaL。每层200例校准、150例测试,语义等价由基准规范化检查器判断;100次随机重划分报告均值和标准误。比较GPT-5.2 few-shot、微调LLaMA-3-8B及少量T5结果,指标包括AUROC、联合风险、接受率和超预算重划分次数。

结果分析

融合分数在STL达到AUROC 0.706,在SpaTiaL达到0.920,分别比最佳单信号提高约0.051和0.049。α=0.10时,STL融合接受率0.347,SpaTiaL为0.889;对应可行下限αℓ为0.0483和0.0083。STL的Ssc单独接受率为0,显示单一稳定性信号可能过于保守;融合显著恢复覆盖。

应用场景

可部署于自然语言机器人任务规划、自动驾驶规则输入、工业控制约束生成和人机协作系统。执行前先筛查输入,再核验公式;若拒答,可请求用户澄清、调用更强模型或转人工。实际部署需固定提示词、保存校准集,并按逻辑语言和风险等级分组校准。

局限与展望

理论保证是期望意义且要求交换性,不等同于每次运行都不出错。k近邻过滤无法发现所有隐蔽移位;分数并列会降低可调节性,校准样本不足时αℓ较高甚至全面拒答。回译、LLM裁判和多次采样带来延迟、费用及潜在偏差,且论文主要在基准数据和评估层级移位上验证,真实系统闭环安全性仍待证明。

通俗解读 非专业人士也能看懂

把系统想成机场安检。旅客先出示行程单,工作人员判断它是否像平时见过的行程;太奇怪的行程先暂停检查。通过后,机器把行程翻译成机场真正执行的路线,再请另一位工作人员把路线翻回普通语言,看是否仍然表达原意。同时让机器重复规划五次,观察这些路线是否基本相同。两项检查合在一起,像给路线打“可信分”。

系统不会凭感觉决定放行,而是先用一批已经知道对错的历史行程校准门槛,并规定最多允许多少错误路线进入机场。分数足够好才放行,否则就说“我不确定”。这样做的好处不是让机器永远正确,而是让它在危险时停下来。研究中,STL的综合识别能力为0.706,SpaTiaL为0.920;在10%的风险预算下,分别放行34.7%和88.9%的结果。

简单解释 像给14岁少年讲一样

想象你在给机器人写游戏任务:“先拿钥匙,再避开怪物,最后在十秒内到门口。”机器人不能只看懂大概意思,它要把任务写成一套非常精确的规则。要是把“十秒”看成“十分钟”,游戏里的机器人就会做错事,而且规则表面上还可能完全合法。

SCP-NL2TL像一个会踩刹车的翻译助手。它先问:“这句话是不是我见过的类型?”太陌生就暂不处理。接着把机器写出的规则翻译回人话,看是不是还像你的原话;还让机器人重复翻译五次,看答案是不是总在同一个方向。两种检查都像给答案做不同科目的考试。

最后,助手用一批已经知道答案的练习题决定分数线。如果答案不够可靠,它不会硬猜,而是说:“请你再说明一下!”论文测试了STL、LTL和SpaTiaL。SpaTiaL综合分数的辨错能力达到0.920,说明这种刹车机制确实能帮忙发现危险答案。

当然,它不是魔法。它仍可能遇到从没见过的新句子,也要花额外时间调用几个语言模型。可是在自动驾驶或机器人面前,少做一个危险动作,通常比多给一个看似聪明的答案更重要!

术语表

Selective Conformal Prediction(选择性保序预测)

一种允许模型回答或拒答的可靠性框架。它用校准数据控制接受结果的风险。

SCP-NL2TL以此决定公式是否交给规划器执行。

Conformal Risk Control(保序风险控制,CRC)

将保序校准扩展到有界单调损失,而不只保证预测集合覆盖。

论文用损失1[S≤τ]z校准联合错误风险。

Back-translation(回译)

把形式公式重新翻译成自然语言,再与原指令比较。

生成Sbt,主要检测语义不匹配。

Self-consistency(自一致性)

重复生成多个答案,并观察它们是否具有相同含义。

Ssc按五次翻译的最大语义等价簇计算。

Joint risk(联合风险)

被接受且错误的概率,即Rjoint=E[gz]。它关注错误答案是否真的进入执行环节。

系统直接以α预算约束该指标。

STL/LTL/SpaTiaL

分别表示信号时序逻辑、线性时序逻辑和几何时空逻辑。

三者用于验证框架的跨形式语言通用性。

开放问题 这项研究留下的未解疑问

  • 1 如何在明显非交换、持续漂移的真实环境中提供条件风险保证,而不是仅依赖异常检测筛除少数离群输入?
  • 2 LLM回译与裁判的偏差如何由形式语义、模型检查器或人类反馈可靠校正?
  • 3 在机器人闭环执行中,拒答率、延迟和安全收益之间应如何动态优化?

应用场景

近期应用

机器人任务规划门控

机器人系统可在执行自然语言任务前运行指令异常筛查和公式语义核验。低分公式自动交给规划器,高分风险结果要求用户澄清或人工确认,从而减少错误约束导致的动作。

工业与自动驾驶规则输入

工程师可将操作规程转换为STL或LTL,并以CRC风险预算控制哪些规则进入验证器。部署前需准备同分布校准集、固定提示词,并为不同风险等级分别设定阈值。

远期愿景

可信自然语言控制接口

长期可形成跨逻辑、跨机器人平台的安全语言接口:系统不仅生成规则,还能说明不确定性、请求澄清并留下可审计证据。主要障碍是分布漂移、实时成本和真实世界验证。

原文摘要

Translating natural language instructions into machine-interpretable formal specifications enables robots and autonomous systems to plan, reason, and formally verify their behavior. However, existing translation models typically generate a specification for every input, even when the result is unreliable or fails to capture the user's intent, creating risks in safety-critical applications. Inspired by selective conformal prediction, we propose a selective translation framework that not only generates formal specifications but also determines when they can be trusted. Reliability is scored by two complementary black-box signals, the fidelity of the specification back-translated into natural language and the dispersion of repeated translations under exact semantic equivalence, which fail on different errors and jointly separate incorrect translations more sharply than either alone. Conformal risk control calibrates this score into a decision that accepts a specification or abstains, with a distribution-free bound on the rate at which incorrect specifications are accepted for execution, and a conformal anomaly detector on instruction embeddings screens out-of-distribution inputs before any translation is attempted. The proposed framework is general across formal specification languages, with experiments on Signal Temporal Logic (STL), Linear Temporal Logic (LTL), and geometric Spatio-Temporal Logic (SpaTiaL) demonstrating improved translation reliability, robustness under the evaluated cross-tier shifts, and effective uncertainty-aware abstention. This work establishes a foundation for trustworthy natural language interfaces by enabling AI systems to recognize when generated specifications may not be reliable.

cs.AI cs.LG