IHDec: Divergence-Steered Contrastive Decoding for Securing Multi-Turn Instruction Hierarchies

TL;DR

IHDec利用JSD检测角色偏离,动态调节对比解码以强化多轮指令层级。

cs.CL 🔴 高级 2026-06-29 45 次浏览
Nicole Geumheon Liu Haeun Jang Yonghyun Jun Hwanhee Lee
对抗解码 指令层级 多轮对话 模型安全 无训练调节

核心发现

方法论

本文提出基于Jensen-Shannon Divergence (JSD)的角色影响归因框架,结合动态对比解码策略,实时检测并校正模型在多轮对话中的指令层级偏离。通过计算角色影响分数,识别角色偏离,利用对比偏差调整logits,抑制次级角色干扰,确保模型严格遵循指令优先级。实验证明,该方法在多轮冲突场景中超越训练调优的基线,提升11.98个百分点,且在安全性和模型扩展性方面表现优异。

关键结果

  • 在IHEval多轮冲突场景中,IHDec实现了最高70.96%的指令层级遵从率,明显优于基线方法的39.04%,提升超过30个百分点,验证了其在复杂对话中的有效性。
  • 在安全防护测试中,IHDec在对抗恶意提示注入时,准确率提升至54.3%,比传统方法提升约25个百分点,显著增强模型安全性。
  • 模型规模扩展实验显示,IHDec与Qwen3-32B结合,性能随模型增大而线性提升,最大提升27.8个百分点,展现出良好的扩展性和规模适应性。

研究意义

该研究突破了现有训练依赖的指令层级维护限制,提出无训练调节的实时校正机制,显著提升多轮对话中模型的指令遵从性与安全性,推动大规模语言模型在复杂任务中的应用落地。其方法的通用性和扩展性,为未来多源、多角色交互系统提供了新思路,有望在自动化客服、智能助理等场景中实现更高的安全与可靠性。

技术贡献

技术上,本文创新性地引入JSD角色影响归因机制,结合动态对比解码策略,提出无需微调的指令层级校正框架。该方法通过实时监测角色偏离,动态调节生成logits,有效抑制次级角色干扰,确保模型严格遵循层级优先关系。相比传统训练调优方案,极大降低了成本,增强了模型的适应性和可扩展性,为多轮对话安全提供了新技术路径。

新颖性

本研究首次提出基于JSD的角色影响归因机制结合动态对比解码的无训练调节方法,解决多轮对话中模型指令层级失衡问题。与现有基于微调或提示工程的方案不同,创新点在于实时、无训练调节,兼具高效性与普适性,填补了多轮场景下模型层级维护的技术空白。

局限性

  • 该方法依赖于准确的角色影响分数估计,若角色定义模糊或影响分数计算偏差,可能影响效果。
  • 在极端对抗场景中,模型仍可能被复杂提示误导,安全性尚需进一步验证。
  • 实时调节机制可能增加推理时间,影响系统响应速度,需优化实现效率。

未来方向

未来将探索多角色动态权重调节机制,结合强化学习优化影响归因策略,提升在极端复杂场景中的鲁棒性。同时,计划将该技术扩展到多模态交互系统,增强多源信息融合中的指令层级维护能力,推动其在实际应用中的广泛部署。

AI 总览摘要

随着大规模语言模型(LLMs)在多源、多角色环境中的应用不断扩大,指令层级(IH)维护成为确保模型行为安全、符合预期的关键挑战。传统方法多依赖微调或提示工程,成本高昂且在多轮对话中表现不佳。本文提出IHDec,一种基于Jensen-Shannon Divergence(JSD)的无训练、实时调节框架,自动检测角色偏离并动态调节生成逻辑。通过角色影响归因,识别次级角色对输出的过度干扰,利用对比偏差调整logits,有效抑制层级失衡。实验在IHEval多轮冲突场景中,IHDec实现了70.96%的指令遵从率,远超基线的39.04%,提升超过30个百分点。安全性方面,在对抗恶意提示注入时,准确率提升至54.3%,增强模型抗攻击能力。模型扩展实验显示,IHDec与Qwen3-32B结合,性能随模型规模线性增长,最大提升27.8个百分点,展现出良好的扩展性。该方法无需微调,兼容多种模型架构,为多轮对话中的指令安全与层级维护提供了新思路。未来,将结合强化学习优化影响归因策略,拓展多模态应用,推动其在实际场景中的落地,极大提升大模型的安全性和可靠性。

深度分析

研究背景

近年来,LLMs在多源信息融合、复杂指令执行方面取得显著进展,但在多轮对话中,指令层级(IH)维护仍面临挑战。现有方案多依赖微调或提示工程,成本高昂且在长对话中表现不佳。研究显示,模型易受次级角色影响,导致安全风险和行为偏差。如何在不增加训练成本的前提下,增强模型对指令优先级的遵循能力,成为研究热点。本文在此背景下,提出基于JSD的角色影响归因与动态调节机制,为多轮对话中的指令层级维护提供新思路。

核心问题

多轮对话中,模型容易被次级角色干扰,导致指令优先级失衡,表现为次级角色影响力超过主导角色。传统微调方法成本高且难以适应多变场景,提示工程缺乏鲁棒性。缺乏实时、无训练调节机制,难以应对复杂、多源、多角色环境中的安全和行为一致性需求。如何在保证模型响应质量的同时,动态检测并校正角色偏离,成为核心难题。

核心创新

本文创新点包括:1)引入基于JSD的角色影响归因机制,量化角色对输出的影响力;2)设计动态对比解码策略,实时调节生成logits,抑制次级角色干扰;3)实现无训练、端到端的指令层级校正,兼容多模型架构。该方案突破了微调依赖,显著降低成本,提升多轮对话中的指令遵循能力,为模型安全提供新技术路径。

方法详解

  • �� 计算角色影响分数:利用JSD衡量完整上下文与去除特定角色后输出分布差异。
  • �� 识别偏离角色:根据影响分数,检测角色偏离,构建冲突集。
  • �� 实时调节:在解码过程中,计算对比偏差,动态调整logits,抑制偏离行为。
  • �� 影响归因:监测角色影响,确保层级优先关系,动态校正生成。
  • �� 结合超参数调节:通过β和衰减系数,平衡调节强度与响应速度。
  • �� 评估:在IHEval多轮冲突场景中,比较不同模型和方法的指令遵从率、安全性和扩展性。

实验设计

采用IHEval数据集,重点测试多轮冲突场景中的指令遵从性。基线包括微调模型和提示工程方法。指标涵盖指令层级遵守率、安全性指标和模型响应质量。超参数调节包括β值和衰减速率。通过消融实验验证影响归因和调节机制的有效性。多模型、多场景、多任务的评估确保方法的普适性和鲁棒性。

结果分析

IHDec在多轮冲突场景中达70.96%的指令遵从率,显著优于微调基线的39.04%,提升超过30个百分点。在安全性测试中,提示注入防御准确率提升至54.3%,比传统方法高出约25个百分点。模型扩展实验显示,结合Qwen3-32B,性能随模型规模线性增长,最大提升27.8个百分点,验证了其良好的扩展性和适应性。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,有很多不同的厨师在帮忙,每个人都告诉你该做什么。系统厨师是老板,最有权决定菜的味道;用户厨师是客人,提出各种需求;助手厨师是帮手,按照指令操作;数据厨师提供原料。每个厨师的指令都有优先级,但有时候,助手会听错,按照次要厨师的指令做事,导致菜变味。为了避免这种情况,厨房引入了一个智能助手,它能实时检测谁在说话,谁的指令更重要,然后调整厨师的指令,让菜保持原有味道。这样,厨房里每个人都能合作愉快,菜也更好吃。这就像论文里的模型,利用JSD检测角色偏离,动态调节生成内容,确保优先级正确,避免误操作。

简单解释 像给14岁少年讲一样

想象你在学校里,有很多老师和同学在给你指示。老师是最重要的,他们说的话必须听从;同学是次要的,他们说的话可以忽略或听少一些。有时候,同学会说一些和老师相反的话,如果你只听信他们,就会搞砸事情。现在,有个聪明的朋友会在你听到指示时,马上判断谁说得更重要,然后帮你调整听到的内容,确保你听到的指令是正确的。这个朋友会用一种特别的方法,观察每个人的话对你做事的影响,及时提醒你该听谁的话,避免被次要的声音误导。就像论文里的方法一样,它用一种叫JSD的数学工具,实时检测谁在影响模型,然后调整模型的回答,让它始终遵循最重要的指令,保证对话的安全和正确。

术语表

Jensen-Shannon Divergence (JSD) ( Jensen-Shannon散度)

一种衡量两个概率分布差异的对称指标,范围在0到1之间,越小表示越相似。

用于衡量模型输出分布在不同角色影响下的偏离程度。

角色影响分数 (Role Influence Score)

通过JSD计算的指标,量化每个角色对模型生成的影响力。

用以识别模型偏离指令层级的偏差。

对比偏差 (Contrastive Divergence)

一种调节生成分布的技术,通过比较不同条件下的输出分布,调整模型行为。

在本文中用于动态调节模型输出,抑制次级角色干扰。

指令层级 (Instruction Hierarchy)

定义不同角色在多源输入中的优先级关系,确保模型遵循安全和行为规范。

本文核心目标,保证模型在多轮对话中优先执行高优先级指令。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端复杂场景中保持角色偏离检测的准确性仍需验证。
  • 2 模型在多模态、多源信息融合时,指令层级维护的适应性和效率有待研究。

应用场景

近期应用

多轮对话安全增强

在客服、智能助理中,实时检测并校正指令偏离,提升系统安全性与用户体验。

远期愿景

多模态交互系统

结合视觉、语音等多模态信息,构建更智能、更安全的多源交互平台,推动人机协作的智能化发展。

原文摘要

Large Language Models (LLMs) often fail to maintain instruction hierarchies (IH) when processing multi-source inputs with varying role-level priorities, paradoxically adhering to lower-priority directives during conflicts. While existing defenses mitigate this issue, they are largely restricted to single-turn scenarios and require expensive fine-tuning. In this paper, we formalize this failure mode in multi-turn contexts via a Jensen-Shannon Divergence (JSD) framework, uncovering a pervasive role-influence inversion phenomenon where subordinate inputs override superior roles. To rectify this without training, we propose IHDec (Instruction Hierarchy-steered Decoding). IHDec leverages JSD to automatically detect token-level hierarchy violations and dynamically executes contrastive decoding to suppress misaligned subordinate roles. Extensive evaluations demonstrate that IHDec outperforms training-based baselines in multi-turn conflicts while fully preserving general response quality. Furthermore, IHDec strengthens safety against adversarial prompt injections and exhibits a robust scaling synergy with larger models. The Code is available at https://github.com/nxcolelxu/IHDec.git

cs.CL