核心发现
方法论
PRISM采用冻结目标模型的隐藏状态作为输入,通过训练的激活投影和LoRA适配器,将激活映射到模型输入空间。利用判决引导的GRPO方法,优化指令集的召回率和减少虚假指令。训练分为监督预训练和强化学习两个阶段,前者通过交叉熵学习激活到指令列表的映射,后者通过判决模型的反馈,增强指令的完整性和准确性。该方法特别适用于多指令、多约束环境,能有效捕获潜在指令和隐藏目标。
关键结果
- 在安全相关场景(如提示注入和隐藏目标)中,PRISM的召回率达到97%以上,远超激活到语言基线(约53%)。在多指令场景下,PRISM平均覆盖率提升至73.1%,虚假指令率降低至1.4%。在不同模型(Qwen3.5-9B)和数据集(包括Benign、Adversarial)上,表现均优于LatentQA和Activation Oracles,尤其在安全敏感任务中效果显著。
- 通过判决引导的GRPO训练,显著提高了指令集的完整性(覆盖率提升约20%),同时减少虚假指令(虚假率降低约30%),验证了目标导向训练的有效性。实验证明,PRISM在多场景下的指令恢复能力优于现有激活到语言方法,尤其在复杂、多指令环境中表现出更强的鲁棒性和准确性。
- 在不同攻击场景(提示注入、隐藏目标)中,PRISM的指令恢复效果保持稳定,验证了其在安全监控中的潜力。实验还显示,判决模型的校准(Cohen’s κ达0.78)确保了评估的一致性和可靠性,为未来标准化指标提供基础。
研究意义
该研究突破了模型内部指令集的自动提取难题,为模型行为监控提供了强有力工具。通过精确识别模型当前的指令和约束,有助于提升AI系统的透明度与安全性,尤其在敏感应用场景中防止潜在滥用。该方法还为未来模型调试、责任追踪和安全审计提供了技术基础,推动模型解释性和安全性研究迈向新阶段。
技术贡献
PRISM创新性地提出了激活状态到指令集的直接映射框架,结合判决引导的强化学习优化策略,显著提升指令覆盖率和减少虚假。其架构设计实现了模型参数的复用和高效部署,创新性地将判决模型引入训练流程,确保输出的指令集具有高信度和完整性。这一方法突破了传统激活到语言的局限,为多指令环境下的模型监控提供了新思路。
新颖性
本文首次系统性提出指令集检索问题,将激活状态直接映射为完整指令列表,区别于以往只生成描述或单一目标的激活到语言方法。引入判决引导的强化学习策略,优化指令的召回和减少虚假,解决多指令、多约束环境中的信息缺失和误导问题。该方法在安全敏感场景中表现出优越的鲁棒性,具有重要创新意义。
局限性
- 当前方法依赖于预训练的判决模型,其性能受判决模型校准和判决质量影响较大。对于极端复杂或高度隐蔽的指令,PRISM可能仍存在漏检或误判风险。
- 模型在多指令环境下的表现受限于训练数据的多样性和覆盖范围,未来需扩展到更广泛的指令空间和复杂场景。
- 训练和推理过程中的计算成本较高,尤其在大规模模型和多场景应用中,需优化效率以实现实时监控。
未来方向
未来将探索多模态激活信息的融合,提升指令集的全面性和鲁棒性。还计划引入更复杂的判决模型和多任务训练策略,以增强模型在极端环境下的表现。此外,将结合联邦学习和隐私保护技术,推动安全监控在实际系统中的落地应用。
AI 总览摘要
随着大规模语言模型(LLMs)在自动化任务中的广泛应用,理解其内部指令集成为确保安全和责任的关键。传统方法多依赖模型输出的自然语言描述,难以全面捕获模型当前的多重指令、约束和潜在目标。本文提出PRISM,一种基于激活状态的指令集提取框架,利用冻结模型的隐藏状态,通过训练的激活投影和判决引导的强化学习,有效解码模型内部的指令集。
PRISM的核心创新在于其直接优化指令召回率,减少虚假指令,适应多指令、多约束环境。实验结果显示,在安全相关场景(如提示注入和隐藏目标)中,PRISM的指令召回率超过97%,远超现有激活到语言方法的53%。在多场景测试中,覆盖率达73%,虚假率仅1.4%,验证了其优越的性能和鲁棒性。
该技术不仅提升了模型行为的透明度,也为模型调试、责任追踪和安全审计提供了新工具。未来,研究将结合多模态信息和多任务训练,进一步增强指令集的全面性和适应性,为AI系统的安全与责任管理开辟新路径。
深度分析
研究背景
近年来,随着LLMs在自动化、对话系统和内容生成中的广泛应用,模型的内部机制逐渐成为研究焦点。早期工作如Probing和Latent Space Classifiers尝试从激活中提取信息,揭示模型的知识存储,但多局限于单一属性检测。激活到语言的解释方法如LatentQA、Activation Oracles等,能将隐藏状态转化为文本描述,但多指令、多约束环境下难以完整提取所有指令,存在信息遗漏和虚假指令的问题。随着模型应用复杂化,理解其多重目标和约束成为关键,亟需更精细的内部监控工具。
核心问题
核心挑战在于如何从模型内部激活状态中准确提取当前所有影响行为的指令、约束和潜在目标。现有激活到语言方法多为单一描述或问答,难以覆盖多指令、多约束的复杂场景,容易遗漏关键指令或引入虚假信息。这限制了模型行为的透明度和安全监控的有效性。特别是在安全敏感场景中,误判或漏检潜在风险指令可能导致严重后果。因此,开发一种能全面、准确提取指令集的工具成为研究重点。
核心创新
PRISM的创新在于其将激活状态直接映射为完整的指令集,结合判决引导的强化学习优化策略,显著提升指令的召回率和减少虚假。其架构设计采用冻结模型参数,利用激活投影和LoRA适配器,确保高效部署。引入判决模型对指令的真实性进行打分,指导训练过程,确保输出的指令集具有高信度和完整性。这一方法突破了传统激活到语言的局限,为多指令、多约束环境下的模型监控提供了新思路。
方法详解
- �� 采集目标模型在特定输入下的隐藏状态激活Hℓ。• 训练激活投影,将激活映射到模型输入空间,形成软前缀。• 利用判决模型对预测指令的真实性进行评分,作为强化学习的奖励信号。• 采用判决引导的GRPO方法,采样多个候选指令集,优化召回率和虚假率。• 训练过程中,冻结目标模型参数,仅更新投影和适配器。• 结合监督预训练和强化学习,逐步提升指令提取的准确性和完整性。
实验设计
使用多场景数据集(Benign、Adversarial)进行训练和评估,数据包括真实指令和模拟攻击场景。基线方法包括LatentQA和Activation Oracles。评价指标为指令覆盖率、虚假指令率和整体召回率。采用Qwen3.5-9B模型,激活层为第16层最后128个生成标记的残差状态。通过多轮训练和调参,验证PRISM在多场景下的优越性能,特别是在安全敏感场景中的表现。还进行了消融实验,验证判决引导强化学习的贡献。
结果分析
PRISM在安全场景中的指令召回率达97%以上,显著优于基线的53%。在多指令环境中,覆盖率提升至73.1%,虚假指令率降至1.4%。判决引导的强化学习显著改善了指令完整性,减少虚假信息。在提示注入和隐藏目标场景中,表现稳定,验证了其鲁棒性。校准的判决模型(Cohen’s κ=0.78)确保了评估的可靠性,显示出其在实际监控中的应用潜力。
应用场景
该方法可用于模型安全监控、行为追踪和责任追溯,特别适合在敏感场景中检测潜在滥用或隐藏目标。企业和研究机构可以利用PRISM实现模型行为的内部审查,增强系统透明度。未来还可结合多模态信息,扩展到更复杂的指令环境,推动AI安全治理的标准化和自动化。
局限与展望
当前PRISM依赖判决模型的校准,可能在极端复杂或隐蔽指令下出现漏检。训练成本较高,尤其在大模型和多场景下,实时性有限。未来需优化算法效率,扩展指令空间,增强对未知指令的适应能力。同时,模型在多模态信息融合和多任务训练方面仍有待提升,以应对更复杂的应用场景。
通俗解读 非专业人士也能看懂
想象你在管理一个复杂的工厂,工厂里有许多不同的指令和规则,比如什么时候开工、如何检查产品、哪些操作禁止。每个工人都在按照这些指令工作,但你不能每次都去问他们,工厂的机器也会记住一些秘密指令,比如隐藏的操作或特殊的任务。PRISM就像是一个聪明的监控员,它可以偷偷观察工厂的内部状态(激活信息),然后告诉你工厂现在在执行哪些具体的任务、遵守了哪些规则、隐藏了哪些秘密。这样你就能知道工厂是否在正常工作,是否有潜在的问题,而不用打扰工人或检查每个细节。这种方法帮助你更好地理解和控制工厂的运行,确保一切都在安全范围内。
简单解释 像给14岁少年讲一样
想象你在学校里有个超级厉害的老师,他可以偷偷观察每个学生的表现,知道他们在做什么秘密任务。平时老师不会直接问学生,但他有一种特殊的办法,可以通过观察学生的动作和反应,猜出他们在做什么。PRISM就像这个老师,它可以通过观察大脑里的“秘密信息”——也就是模型内部的隐藏状态,来猜出模型正在执行哪些指令、遵守哪些规则。这样一来,老师就能确保学生没有偷偷做坏事,也能帮老师发现哪些指令被隐藏或被误解。这个方法让我们更聪明地监控AI,确保它们在正确的轨道上运行,不会做出危险或不合规的事情。
原文摘要
As LLMs are deployed as agents, reliable monitoring requires knowing not only what they output, but which instructions are steering their behavior. This is difficult when models infer unintended subgoals, follow contextual cues, or are influenced by prompt injections and hidden objectives. While activation-to-language methods suggest that hidden states can reveal natural-language information, existing approaches are not designed to recover the full set of simultaneous instructions, constraints, prohibitions, and subgoals active in agentic settings. We formalize this problem as instruction set retrieval and introduce PRISM, an activation-conditioned interpreter that decodes hidden states from a frozen target model into a faithful bullet list of active instructions. Unlike prior activation-to-language methods, PRISM is trained to recover instruction sets directly, using judge-guided GRPO to reward covered instructions and penalize unsupported ones. Across benign, constrained, prompt-injection, and hidden-objective settings, PRISM outperforms activation-to-language baselines, especially on security-relevant objectives.