Transfer Safety Awareness for Cross-Modal Safety Drift in Multimodal Large Language Models

TL;DR

提出SRT方法,通过转移安全意识提高跨模态安全性,实验显示在多种基准上安全性提高。

cs.MM 🔴 高级 2026-09-02 10 次浏览
Tianqi Xiao Shiyao Cui Minghao Zhang Junxiao Yang Renmiao Chen
跨模态 安全性 大语言模型 视觉模态 安全漂移

核心发现

方法论

研究提出了一种轻量级的方向精炼方法,称为安全意识表示转移(SRT),通过冻结的MLLM主干来缓解跨模态安全漂移。该方法通过分析模型激活和注意力,识别出视觉风险线索受到的有限关注,并提出将不安全文本处理中的安全信号转移到跨模态情境中。

关键结果

  • 实验显示,SRT在多种跨模态设置中有效提高了安全性,Qwen3-VL-8B模型在StUi设置中的不安全生成率从43.10%降至23.10%。
  • 在Gemma-3-12B-IT模型中,SRT将StSi设置的不安全率从68.86%降低到23.35%。
  • 在LLaVA-OneVision-7B模型中,SRT在FigStep基准上的不安全率从77.86%降至34.64%。

研究意义

该研究系统性地研究了跨模态安全漂移问题,提出的SRT方法不仅提高了模型的安全性,还保持了其效用。这为多模态大语言模型在安全性和效用之间的平衡提供了新的思路,具有重要的学术和工业影响。

技术贡献

SRT方法通过转移不安全文本诱导的安全意识来提高跨模态安全性,与现有方法相比,它在保持模型效用的同时显著提高了安全性。此外,该方法不需要修改模型主干,提供了一种轻量级的解决方案。

新颖性

该研究首次提出了跨模态安全漂移的概念,并开发了SRT方法来解决这一问题。与现有的安全校准方法不同,SRT通过转移不安全文本诱导的安全信号来提高安全性。

局限性

  • SRT在处理复杂的视觉风险线索时可能表现不佳,因为这些线索可能在视觉模态中被弱化。
  • 该方法依赖于不安全文本的存在来激活安全信号,可能在纯视觉输入时效果有限。

未来方向

未来研究可以探索如何在没有不安全文本的情况下激活安全信号,以及如何进一步提高视觉模态中的风险识别能力。

AI 总览摘要

跨模态大语言模型在理解和推理文本-图像输入方面表现出色,但也引入了新的安全风险。现有方法在处理跨模态安全漂移问题时表现不佳,尤其是在文本和图像组合可能隐含有害意图的情况下。

研究提出了一种名为安全意识表示转移(SRT)的方法,通过转移不安全文本诱导的安全信号来提高跨模态安全性。实验表明,SRT在多种基准上显著提高了安全性,同时保持了模型的效用。

该方法不仅在学术界具有重要意义,还为工业界提供了一种新的解决方案,帮助多模态大语言模型在安全性和效用之间取得平衡。未来研究可以进一步探索如何在没有不安全文本的情况下激活安全信号。

深度分析

研究背景

多模态大语言模型能够处理文本和图像输入,显著提高了模型的理解和推理能力。然而,这种能力的增强也带来了新的安全风险,尤其是在文本和图像组合可能隐含有害意图的情况下。现有的安全校准方法在处理这种跨模态安全漂移问题时表现不佳。

核心问题

跨模态安全漂移是指安全文本在与不安全图像结合时可能传达有害意图。现有方法在处理这种问题时表现不佳,尤其是在文本和图像组合可能隐含有害意图的情况下。

核心创新

研究提出了一种名为安全意识表示转移(SRT)的方法,通过转移不安全文本诱导的安全信号来提高跨模态安全性。该方法不需要修改模型主干,提供了一种轻量级的解决方案。

方法详解

  • �� 分析模型激活和注意力,识别视觉风险线索受到的有限关注。
  • �� 提出安全意识表示转移(SRT),通过冻结的MLLM主干来缓解跨模态安全漂移。
  • �� 实验验证SRT在多种跨模态设置中的有效性。

实验设计

实验使用了多个基准,包括VLSBench、MM-SafetyBench、FigStep等。通过比较不安全生成率,验证了SRT在多种跨模态设置中的有效性。

结果分析

实验结果显示,SRT在多种跨模态设置中有效提高了安全性,同时保持了模型的效用。具体来说,Qwen3-VL-8B模型在StUi设置中的不安全生成率从43.10%降至23.10%。

应用场景

SRT方法可以应用于多模态大语言模型的安全校准,尤其是在处理文本和图像组合可能隐含有害意图的情况下。

局限与展望

SRT在处理复杂的视觉风险线索时可能表现不佳,因为这些线索可能在视觉模态中被弱化。此外,该方法依赖于不安全文本的存在来激活安全信号,可能在纯视觉输入时效果有限。

通俗解读 非专业人士也能看懂

想象一个厨房,厨师需要根据食材和配方来做菜。多模态大语言模型就像这个厨师,文本和图像是食材和配方。安全漂移问题就像厨师在做菜时忽略了某些食材的过敏性。SRT方法就像一个提醒厨师注意过敏食材的助手,确保菜品安全。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,角色需要根据提示来完成任务。多模态大语言模型就像这个角色,文本和图像是提示。安全漂移问题就像角色在任务中忽略了某些危险提示。SRT方法就像一个提醒角色注意危险提示的助手,确保任务安全完成。

术语表

跨模态安全漂移

指安全文本在与不安全图像结合时可能传达有害意图的问题。

在研究中用于描述视觉模态引入的安全风险。

安全意识表示转移(SRT)

一种通过转移不安全文本诱导的安全信号来提高跨模态安全性的方法。

用于缓解跨模态安全漂移问题。

视觉模态

指模型处理图像输入的能力。

在研究中用于描述多模态大语言模型的能力。

不安全生成率

指模型在处理输入时生成不安全输出的比例。

用于评估模型的安全性。

多模态大语言模型(MLLM)

能够处理文本和图像输入的大型语言模型。

在研究中用于描述模型的能力。

开放问题 这项研究留下的未解疑问

  • 1 如何在没有不安全文本的情况下激活安全信号仍是一个开放问题。
  • 2 复杂视觉风险线索的识别能力需要进一步提高。

应用场景

近期应用

多模态安全校准

SRT方法可以应用于多模态大语言模型的安全校准,确保模型在处理文本和图像组合时的安全性。

远期愿景

视觉风险识别

未来研究可以探索提高视觉模态中的风险识别能力,进一步提高模型的安全性。

原文摘要

Visual modality enhances the capabilities of multimodal large language models (MLLMs) but also introduces a safety concern: a benign textual query may convey harmful intent when grounded in a visual image. We term this cross-modal safety drift and our pilot studies show that the safety response rate for such requests is substantially lower than that for requests containing explicitly unsafe text. This paper aims to systematically study this issue. First, we conduct an empirical analysis to identify representative unsafe response patterns. Building on these, we interpret model representations and attentions, revealing that visually risky cues receive limited attention and weakly trigger refusal. Motivated by the observation that safety signals from unsafe text processing can be transferred, we propose safety-awareness representation transfer (SRT), a lightweight direction-refinement method that mitigates cross-modal safety drift with a frozen MLLM backbone. Experiments across multiple benchmarks and models show that SRT effectively improves safety in diverse cross-modal settings while preserving utility. Code is available at https://github.com/cucu220123/safety-awareness.

cs.MM cs.AI cs.CL cs.CR