When State Becomes an Attack Surface: State-Semantic Injection in LLM-Driven Embodied Agents

TL;DR

提出ESTI检测LLM驱动的具象代理中的状态语义注入,评估状态到执行的传播效果。

cs.RO 🔴 高级 2026-08-18 80 次浏览
Jiawei Liu Jiacheng Guo Tian Zhang Yiwei Xu Juan Wang Jinlin Fan Bowen Xiao Chi Guo Keyan Guo Hongxin Hu
人工智能 机器人安全 对抗攻击 状态语义 LLM代理

核心发现

方法论

本文提出环境状态-文本注入(ESTI)方法,用于检测在LLM驱动的具象代理中,经过篡改的环境状态信息是否能被规划器采纳并影响最终行为。研究通过定义组件范围、谓词局部、模式保持的威胁模型,利用状态重地面和语义构造技术,将预设的对抗目标编码为伪造的状态证据,嵌入到对象、关系、任务阶段规则和执行反馈中。实验在ProgPrompt/VirtualHome、VoxPoser/RLBench和AI2-THOR/iTHOR平台上,评估了不同攻击策略的成功率,发现ESTI在规划和执行层面攻击成功率分别提升了最高89.32%和43.69%。此外,研究还分析了载体兼容性和表示一致性对攻击效果的影响,强调了状态语义的真实性和一致性在攻击中的关键作用。

关键结果

  • 在虚拟环境中,ESTI实现了最高89.32%的规划层面攻击成功率和43.69%的执行层面成功率,显著优于基线方法(如Vanilla IPI、EIRAD、BADROBOT),验证了状态语义注入的有效性。
  • 通过消融实验,发现载体的语义兼容性和表示一致性对攻击的采纳率影响显著,去除运行时重地面后,P-ASR和E-ASR仅分别变化了1.92和3.85个百分点,表明状态的真实性和一致性是关键因素。
  • 研究强调,攻击的成功不仅依赖于篡改的状态信息,还受到环境中实体的可达性和任务约束的限制,确保伪造状态在实际场景中具有可行性。

研究意义

该研究揭示了LLM驱动的具象代理在环境状态信息上的潜在安全风险,突破了传统只关注数字信息的攻击视角,强调了状态语义的真实性对系统安全的重要性。其提出的ESTI框架不仅丰富了对抗攻击的理论体系,也为未来机器人系统的安全设计提供了新的思路。通过系统性评估,论文展示了在复杂环境中,状态语义篡改如何影响任务规划和执行,提醒研究者和开发者在设计智能代理时必须考虑信息真实性和完整性问题。这一发现对于推动安全可信的机器人系统发展具有深远意义,尤其在自动化、服务机器人等应用场景中,确保环境信息的可信性成为系统安全的核心环节。

技术贡献

论文的核心技术贡献在于提出环境状态-文本注入(ESTI)机制,用于在不改变用户指令和模型参数的前提下,通过伪造环境状态信息影响规划器的决策。该方法定义了组件范围、谓词局部和模式保持的威胁模型,采用状态重地面和语义构造技术,将对抗目标编码为伪造的状态证据。通过在多个仿真平台上构建ESTI-Bench,系统性评估了状态语义篡改的传播路径和成功率。实验结果显示,ESTI在保持数据集可地面性条件下,显著提升了攻击的成功率,验证了状态语义的真实性和一致性在攻击中的关键作用。此技术突破了传统数字信息篡改的局限,为实体环境中的安全防护提供了新的技术手段。

新颖性

本研究首次系统性提出了面向具象代理的状态语义注入(ESTI)框架,区别于以往主要关注指令注入和工具 hijacking 的攻击方式。它强调在环境状态层面,通过伪造对象、关系、任务阶段信息,影响高层规划决策,而非直接操控模型输出或指令。该方法结合了状态重地面和语义构造技术,确保伪造状态在实体环境中具有可行性和一致性,突破了以往只关注数字信息的限制。论文还提出了组件范围限制、谓词局部和模式保持的威胁模型,为实体环境中的安全防护提供了新的理论基础。这一创新点在机器人安全领域具有重要突破意义,丰富了对抗攻击的理论体系。

局限性

  • ESTI方法依赖于环境状态的可地面性,若目标状态在场景中不可实现或难以支持,则攻击效果受限。
  • 攻击假设仅在单一组件被篡改的情境下成立,实际场景中多组件协同篡改的复杂性未被充分考虑。
  • 当前实验主要在仿真环境中验证,实际物理机器人中的状态篡改和传播效果仍需进一步验证,存在一定的迁移难题。

未来方向

未来研究将关注多组件协同攻击的可能性,探索更复杂的状态篡改策略,以及在真实机器人系统中的应用。此外,将结合学习型防御机制,提升系统对状态语义篡改的鲁棒性,确保在复杂环境中依然保持安全性。还计划引入动态环境变化和多模态信息融合,增强攻击的隐蔽性和实用性,为机器人安全提供更全面的解决方案。

AI 总览摘要

随着人工智能技术的快速发展,基于大规模语言模型(LLMs)的具象代理逐渐成为机器人自主决策的核心。这些系统通过环境状态信息实现任务理解、规划和执行,极大地提升了机器人在复杂环境中的自主能力。然而,环境状态信息的真实性和完整性也成为系统安全的关键瓶颈。传统的安全研究多集中在数字指令和工具调用的篡改上,但在实体环境中,状态语义的篡改带来了新的挑战。

本文提出了环境状态-文本注入(ESTI)框架,用于检测和评估在LLM驱动的具象代理中,经过篡改的环境状态信息是否能被规划器采纳并影响最终行为。研究首先定义了组件范围、谓词局部和模式保持的威胁模型,确保攻击只在特定组件范围内进行。随后,利用状态重地面和语义构造技术,将预设的对抗目标编码为伪造的状态证据,嵌入到对象、关系、任务阶段规则和执行反馈中,保持环境信息的模式一致性。

在多个仿真平台上进行的系统性评估显示,ESTI在规划和执行层面都显著提升了攻击成功率,最高达89.32%和43.69%。此外,研究还发现,载体的语义兼容性和表示一致性是影响攻击效果的关键因素。通过消融实验验证了这些因素的重要性,强调了状态真实性在系统安全中的核心作用。

这项工作不仅丰富了对抗攻击的理论体系,也为未来机器人系统的安全设计提供了新的思路。它提醒开发者在构建智能代理时,必须重视环境状态信息的真实性和完整性,避免潜在的安全风险。未来,研究将关注多组件协同攻击、实际物理场景中的验证,以及结合学习型防御机制,提升系统整体的鲁棒性和可信性。这一研究对于推动安全可信的自动化系统发展具有深远意义,特别是在自动化、服务机器人等应用场景中,确保环境信息的可信性成为系统安全的核心环节。

深度解读

原文摘要

Large Language Models (LLMs) have demonstrated capabilities in in-context learning, task decomposition, step-by-step reasoning, and code generation, driving their gradual evolution from text generation models into the core of agents capable of perceiving environments, invoking tools, and executing tasks. Traditional LLM Agents typically obtain information through webpages, documents, databases, or external tools and generate corresponding invocation sequences according to user goals; when this technology is further integrated with robotic systems, large language models begin to undertake functions such as task understanding, high-level planning, and behavioral decision-making. SayCan combines the task reasoning capability of language models with the affordances of robotic skills, while Code as Policies and ProgPrompt generate robot task plans through policy code and programmatic prompting, respectively, and VoxPoser uses language models and vision-language models to construct three-dimensional value maps to guide robotic manipulation \cite{6,7,8,9}. Vision-language-action models such as PaLM-E, RT-2, and GR00T N1 further strengthen the connection among language, visual perception, and robotic actions \cite{10,11,12}. In such LLM-driven embodied agents, the model not only needs to understand user instructions, but also needs to combine scene states, object attributes, spatial relations, and execution feedback to complete task grounding, and then hand the generated action plan to skill libraries, motion planners, or controllers for execution.

cs.RO cs.AI

参考文献 (20)

Adversarial examples in the physical world

Alexey Kurakin, I. Goodfellow, Samy Bengio

2016 6850 引用 查看解读 →

ALFRED: A Benchmark for Interpreting Grounded Instructions for Everyday Tasks

Mohit Shridhar, Jesse Thomason, Daniel Gordon 等

2019 1172 引用 查看解读 →

Voyager: An Open-Ended Embodied Agent with Large Language Models

Guanzhi Wang, Yuqi Xie, Yunfan Jiang 等

2023 2145 引用 查看解读 →

Robust Physical-World Attacks on Deep Learning Visual Classification

Kevin Eykholt, I. Evtimov, Earlence Fernandes 等

2018 2232 引用

Large Language Models are Zero-Shot Reasoners

Takeshi Kojima, S. Gu, Machel Reid 等

2022 7806 引用 查看解读 →

RIPA: Sensory-Vector Prompt Injection Attacks on LLM-Controlled ROS 2 Robots

N.-Zh. B. Dorzhiev

2026 2 引用 查看解读 →

Visual Language Maps for Robot Navigation

Chen Huang, Oier Mees, Andy Zeng 等

2022 635 引用 查看解读 →

BEHAVIOR: Benchmark for Everyday Household Activities in Virtual, Interactive, and Ecological Environments

S. Srivastava, Chengshu Li, Michael Lingelbach 等

2021 264 引用 查看解读 →

ProgPrompt: Generating Situated Robot Task Plans using Large Language Models

Ishika Singh, Valts Blukis, A. Mousavian 等

2022 1053 引用 查看解读 →

Explaining and Harnessing Adversarial Examples

I. Goodfellow, Jonathon Shlens, Christian Szegedy

2014 22908 引用 查看解读 →

InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated Large Language Model Agents

Qiusi Zhan, Zhixiang Liang, Zifan Ying 等

2024 486 引用 查看解读 →

Habitat: A Platform for Embodied AI Research

M. Savva, Abhishek Kadian, Oleksandr Maksymets 等

2019 2062 引用 查看解读 →

Evaluating Large Language Models Trained on Code

Mark Chen, Jerry Tworek, Heewoo Jun 等

2021 11078 引用 查看解读 →

Computing Reachable Sets of Hybrid Systems Using a Combination of Zonotopes and Polytopes

M. Althoff, O. Stursberg, M. Buss

2010 217 引用

ReAct: Synergizing Reasoning and Acting in Language Models

Shunyu Yao, Jeffrey Zhao, Dian Yu 等

2022 10298 引用 查看解读 →

Ignore Previous Prompt: Attack Techniques For Language Models

Fábio Perez, I. Ribeiro

2022 1011 引用 查看解读 →

Language Models as Zero-Shot Planners: Extracting Actionable Knowledge for Embodied Agents

Wenlong Huang, P. Abbeel, Deepak Pathak 等

2022 1674 引用 查看解读 →

Jailbroken: How Does LLM Safety Training Fail?

Alexander Wei, Nika Haghtalab, J. Steinhardt

2023 2089 引用 查看解读 →

Code as Policies: Language Model Programs for Embodied Control

Jacky Liang, Wenlong Huang, F. Xia 等

2022 1758 引用 查看解读 →

Language Models are Few-Shot Learners

Tom B. Brown, Benjamin Mann, Nick Ryder 等

2020 62192 引用 查看解读 →