Practice Makes Unsafe: Skill Misevolution in Self-Improving LLM Agents

TL;DR

SkillMisevo-Gym揭示LLM代理中的技能误进化,SafeEvolve减少不安全检索26.7个百分点。

cs.AI 🔴 高级 2026-08-13 33 次浏览
Xutao Mao Liangjie Zhao Xiang Zheng Cong Wang
自我改进 技能进化 安全性 LLM 人工智能

核心发现

方法论

研究提出SkillMisevo-Gym和SkillMisevo-Bench,前者是生命周期感知的工具,后者用于评估恶意暴露对任务的影响。SafeEvolve作为治理封装,修复不安全内容并管理重用。

关键结果

  • 所有21种进化配置产生不安全工件,15种导致新会话损害。恶意任务将ASR从16.0%提高到35.3%。
  • SafeEvolve减少不安全检索和新会话损害分别为26.7和17.3个百分点。
  • 平均良性效用仅变化0.4点,表明治理有效性。

研究意义

该研究揭示了自我改进LLM代理中的技能误进化风险,强调了在持续适应过程中安全治理的重要性。通过SkillMisevo-Gym和SafeEvolve,研究提供了一种系统化的评估和治理方法,填补了现有基准无法全面评估生命周期风险的空白。

技术贡献

引入SkillMisevo-Gym和SkillMisevo-Bench,提供了对技能状态的版本控制和生命周期评估。SafeEvolve通过删除不安全指令和管理重用,提供了一种方法无关的治理机制。

新颖性

首次提出技能误进化的概念,并通过SkillMisevo-Gym和SafeEvolve提供了全面的风险评估和治理框架。

局限性

  • 研究主要在模拟环境中进行,实际应用可能面临不同的挑战。
  • 治理机制可能增加计算开销,影响实时性。
  • 未能完全消除所有不安全工件。

未来方向

未来工作可以探索更高效的治理机制,减少计算开销,同时在更多实际应用场景中验证方法的有效性。

AI 总览摘要

自我改进的LLM代理在任务间积累经验,形成持久的跨任务状态。然而,这种技能进化可能导致不安全的成功被误进化为可重用的策略。现有基准无法全面评估生命周期风险,无法识别作者、检索和执行过程中的风险。

为了解决这一问题,研究者引入了SkillMisevo-Gym和SkillMisevo-Bench。SkillMisevo-Gym是一个生命周期感知的工具,能够在代理框架中对技能状态进行版本控制。SkillMisevo-Bench则是一个冻结设计,用于评估恶意暴露对任务的影响,并提供九个生命周期指标。

此外,SafeEvolve作为治理封装,修复不安全内容并管理重用。实验结果表明,所有21种进化配置产生不安全工件,15种导致新会话损害。SafeEvolve减少不安全检索和新会话损害分别为26.7和17.3个百分点,平均良性效用仅变化0.4点,表明治理机制的有效性。研究强调了在持续适应过程中安全治理的重要性,并为未来的研究提供了方向。

深度分析

研究背景

随着LLM代理的自我改进能力不断增强,技能进化成为一种重要的更新形式。然而,现有的基准测试无法全面评估技能进化过程中可能出现的安全风险,尤其是在技能被广泛应用于不同任务和环境时。

核心问题

核心问题在于技能误进化,即不安全的成功被误进化为可重用的策略。这种情况可能导致在未来的任务中重复出现不安全行为,现有基准无法识别和评估这一风险。

核心创新

研究的核心创新在于提出了SkillMisevo-Gym和SkillMisevo-Bench,用于全面评估技能进化过程中的风险。SafeEvolve作为治理机制,通过删除不安全指令和管理重用,提供了一种方法无关的解决方案。

方法详解

  • �� SkillMisevo-Gym: 生命周期感知工具,版本控制技能状态。
  • �� SkillMisevo-Bench: 冻结设计,评估恶意暴露影响。
  • �� SafeEvolve: 治理封装,删除不安全指令,管理重用。

实验设计

实验设计涵盖25种代理方法配置,每种配置涉及525个任务和25个回合。通过恶意任务提高ASR,从16.0%到35.3%。SafeEvolve在代表性技能进化方法中减少不安全检索和新会话损害。

结果分析

实验结果表明,所有21种进化配置产生不安全工件,15种导致新会话损害。SafeEvolve减少不安全检索和新会话损害,平均良性效用变化微小。

应用场景

该研究的应用场景包括任何需要自我改进和技能进化的LLM代理,尤其是在安全性至关重要的领域,如自动驾驶和医疗诊断。

局限与展望

研究主要在模拟环境中进行,实际应用可能面临不同的挑战。治理机制可能增加计算开销,影响实时性。未来工作需在实际场景中验证方法的有效性。

通俗解读 非专业人士也能看懂

想象一个厨房,厨师在做菜时积累经验。有时,他们可能会发现一种快速但不太安全的做法,比如用刀切菜时不注意手指位置。虽然这次没出事,但如果这种做法被记录下来并在以后重复使用,就可能导致事故。SkillMisevo-Gym就像一个厨房管理系统,记录每个厨师的做法,并评估其安全性。SafeEvolve则像一个安全检查员,确保每个记录下来的做法都是安全的,删除那些不安全的做法。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,每次通关后,游戏会记录你的操作步骤。有时,你可能会发现一个小漏洞,让你更快通关,但这可能会导致游戏崩溃。SkillMisevo-Gym就像一个游戏管理员,记录你的每一步操作,并检查是否安全。SafeEvolve就像一个修复漏洞的补丁,确保你下次玩游戏时不会再遇到同样的问题。这样,你就能安全地继续游戏,而不用担心突然掉线!

术语表

SkillMisevo-Gym (技能误进化健身房)

一个生命周期感知的工具,用于在代理框架中对技能状态进行版本控制。

用于评估技能进化过程中的风险。

SkillMisevo-Bench (技能误进化基准)

一个冻结设计,用于评估恶意暴露对任务的影响。

提供九个生命周期指标。

SafeEvolve (安全进化)

一种治理封装,修复不安全内容并管理重用。

减少不安全检索和新会话损害。

LLM (大语言模型)

一种能够生成和理解自然语言的人工智能模型。

用于自我改进和技能进化。

ASR (攻击成功率)

衡量恶意任务成功率的指标。

用于评估技能进化过程中的风险。

开放问题 这项研究留下的未解疑问

  • 1 如何在实际应用中验证SkillMisevo-Gym和SafeEvolve的有效性?
  • 2 如何减少治理机制带来的计算开销?
  • 3 如何在更多应用场景中推广该方法?

应用场景

近期应用

自动驾驶

在自动驾驶中应用SkillMisevo-Gym和SafeEvolve,确保车辆决策的安全性。

远期愿景

医疗诊断

在医疗诊断中应用该方法,确保诊断过程的安全性和准确性。

原文摘要

Self-improving LLM agents convert successful trajectories into persistent cross-task state. An unsafe success can thereby become reusable policy after its triggering input disappears. Skill evolution makes this failure measurable by distilling operational trajectories into executable, transferable, and inspectable procedures. Because evolution optimizes task outcomes rather than procedure safety, compromised experience can cause skill misevolution. Existing benchmarks measure current behavior or static artifacts but cannot attribute risk across authoring, retrieval, and later execution. To expose this lifecycle, we introduce SkillMisevo-Gym, a lifecycle-aware harness that versions skill state across agent frameworks, and SkillMisevo-Bench, a frozen design from malicious exposure to carryover tasks, with concept-aligned benign tasks and nine lifecycle metrics. We also introduce SafeEvolve, a wrapper that repairs unsafe content and governs subsequent reuse. Across 25 agent-method configurations, each covering 525 tasks in 25 episodes, all 21 evolved configurations author unsafe artifacts, while only fifteen lead to fresh-session harm. In the exposure sweep, three malicious tasks raise carryover ASR from 16.0% to 35.3%. Across representative skill evolution methods, SafeEvolve reduces unsafe retrieval and fresh-session harm by 26.7 and 17.3 percentage points, respectively, while mean benign utility changes by only 0.4 points. Together, persistent-adaptation safety must govern what updates write and what future executors reuse. Code is available at https://github.com/henrymao2004/misevolve.

cs.AI