核心发现
方法论
NeST采用激活探测识别安全相关神经元,利用簇聚算法(如k-means)对相似激活模式的神经元进行分组,训练簇级共享更新参数,冻结其他参数。该方法仅在恶意提示上训练,避免使用特定攻击数据,能泛化应对多样化越狱攻击。训练完成后,将更新折叠入原始模型,无推理开销。实验证明在14个开源模型中,NeST将越狱成功率从44.5%降至1.1%,参数仅为0.4M,优于LoRA等轻量化方案。
关键结果
- 在文本模型上,NeST将平均越狱成功率由44.5%降至1.1%,训练参数仅占模型的0.4M,显著提升安全性。多模态模型中,ASR从55.3%降至1.1%,在下游微调模型中,安全成功率从53.8%降至0.8%。这些结果显示NeST在保持模型能力的同时,有效抑制危险输出,且参数效率极高。
- NeST通过激活探测和簇级训练,避免了全模型微调的高成本,且无需推理时开销,具有良好的迁移性和可维护性。其结构感知特性使得安全更新更具针对性和稳定性,适应模型频繁演化的实际需求。
- 对比传统RLHF和LoRA,NeST在安全性能和参数效率方面均优越,验证了将安全行为关联到局部神经元簇的有效性,为未来安全对齐提供新思路。
研究意义
本研究突破了模型安全微调的瓶颈,将安全行为与内部神经元结构关联,实现高效、可维护的安全对齐。该方法不仅降低了成本,还增强了模型对多样化越狱攻击的鲁棒性,推动了AI安全技术的实用化。通过局部结构优化,NeST提供了一种可扩展的安全策略,适应模型快速迭代和多任务场景,具有重要的理论和应用价值。
技术贡献
NeST提出基于激活探测的神经元筛选、簇级聚合和参数共享机制,创新性地将安全行为局部化,避免全模型微调的复杂性。其簇级训练策略实现了安全机制的结构感知,折叠更新后无推理开销,兼具效率与效果。该框架支持迁移和后处理,极大提升了安全微调的实用性和可维护性,为模型安全提供了新技术路径。
新颖性
首次将神经元激活探测与簇级训练结合,用于后置安全微调,突破了传统参数全局更新的限制。不同于LoRA等参数效率方法,NeST专注于安全相关的内部结构,提供结构感知的安全机制,显著提升鲁棒性和迁移性。这一创新实现了安全行为的局部化和高效维护,开辟了模型安全微调的新方向。
局限性
- NeST依赖于激活探测的准确性,若安全神经元识别不充分,可能影响效果。对于极端复杂或新颖的越狱策略,簇级训练可能不足以应对全部攻击类型。
- 簇数选择和阈值设定仍需调优,可能影响泛化能力。模型规模较大时,簇级训练仍存在一定计算成本,未来需优化算法效率。
- 当前方法主要在静态模型上验证,动态环境或持续学习场景中的适应性仍需探索。
未来方向
未来将结合动态激活分析,提升神经元筛选的自动化和鲁棒性,探索多模态安全机制的联合优化。还计划引入更复杂的簇结构和自适应簇数策略,以增强对新型越狱攻击的适应能力。此外,结合联邦学习等技术,实现分布式安全微调,也是潜在的研究方向。
AI 总览摘要
在大规模语言模型(LLMs)广泛应用的背景下,模型安全性成为关键挑战。现有的安全对齐方法,如强化学习和参数微调,虽能一定程度减少有害输出,但成本高昂且难以维护,特别是在模型频繁更新的场景中。NeST提出了一种创新的神经元选择性微调框架,通过激活探测识别安全相关神经元,利用簇级聚合训练实现结构化的安全机制调整。该方法避免了全模型微调的高成本,折叠更新后无推理开销,且具备良好的迁移性。实验证明,NeST在14个开源模型中将越狱成功率从44.5%降至1.1%,参数仅为0.4M,优于LoRA等参数效率方案。其核心在于将安全行为局部化到特定神经元簇,提升了安全鲁棒性和可维护性。这一技术突破为模型安全提供了新路径,使得在保证模型能力的同时,有效应对多样化攻击成为可能。未来,NeST有望结合动态激活分析和多模态优化,推动安全微调的持续发展。整体而言,NeST代表了模型安全领域的一次重要创新,兼具理论深度和实际应用潜力。
深度解读
原文摘要
Safety alignment is essential for the responsible deployment of Large Language Models (LLMs). Yet, existing approaches often rely on heavyweight fine-tuning that is costly to update, audit, and maintain across model families. Full fine-tuning incurs substantial computational and storage overhead, while parameter-efficient methods, e.g., Low-Rank Adaptation (LoRA), trade efficiency for inconsistent safety gains and sensitivity to design choices. Safety intervention mechanisms reduce unsafe outputs without modifying model weights, but do not directly shape or preserve the internal representations that govern safety behavior. We present NeST, a Neuron-Selective Tuning framework for efficient post-hoc safety alignment. NeST identifies safety-relevant feed-forward neurons via activation probing on vanilla harmful and benign prompts, clusters neurons with similar activation profiles, and trains shared cluster-level updates while freezing the rest of the model. Importantly, NeST is trained only on vanilla malicious prompts, without using jailbreak-specific attack data, yet generalizes robustly to diverse jailbreaks. The learned updates are then folded into the original weights, incurring no inference-time overhead. Evaluated on 14 open-weight language and multimodal models, NeST outperforms lightweight baselines and approaches full fine-tuning robustness with significantly fewer trainable parameters. On text-only models, NeST reduces average jailbreak attack success rate from 44.5% to 1.1% while training only 0.4M parameters on average. Across multimodal settings, it reduces ASR from 55.3% to 1.1%, and for downstream fine-tuned variants, it restores safety by reducing ASR from 53.8% to 0.8%. These results show that robust, maintainable safety alignment can be achieved by concentrating adaptation on localized, functionally coherent safety structures.