BraveGuard: From Open-World Threats to Safer Computer-Use Agents

TL;DR

BraveGuard通过多轮开源威胁挖掘和轨迹监督,提升计算机代理安全检测,从38.79%到82.38%。

cs.CR 🔴 高级 2026-05-31 44 次浏览
Yunhao Feng Xiaohu Du Xinhao Deng Yifan Ding Ming Wen Yixu Wang Yuxiang Xie Baihui Zheng Yingshui Tan Yige Li Yutao Wu Kerui Cao Wenke Huang Yanming Guo Xingjun Ma Yu-Gang Jiang
AI安全 对抗攻击 轨迹监督 自适应防御 开源威胁挖掘

核心发现

方法论

BraveGuard采用开源研究资料挖掘技术,构建动态威胁分类体系,实例化为可执行任务,采集代理轨迹,并以轨迹级标签进行监督训练。其核心包括威胁知识抽取、任务合成、轨迹采集与标注、闭环自适应更新。利用多轮迭代不断扩展威胁库,训练多种守卫模型(如Qwen3-Guard、Llama-Guard),在AgentHazard等基准上显著提升检测准确率,从38.79%提升至82.38%。

关键结果

  • 在AgentHazard基准上,BraveGuard训练的守卫模型平均检测准确率达82.38%,比现成模型提升43.59%;召回率从20.17%跃升至90.94%,大幅降低漏检风险。
  • 在ATBench-500上,Qwen3-Guard-8B模型达86.4%准确率,95.2%召回率,F1达86.1%,显示跨格式迁移能力强。
  • 逐步消融实验表明,威胁知识挖掘、任务实例化和轨迹监督三大环节共同推动性能提升,缺一不可。

研究意义

该研究突破了传统静态、基于固定范畴的安全检测方法,提出动态自适应的威胁发现与轨迹监督体系,有效应对不断演变的开源攻击策略,为智能代理安全提供可扩展、持续的解决方案,推动AI安全从静态检测向动态适应转变。

技术贡献

提出基于开源威胁挖掘的动态威胁知识库,结合实例化任务与轨迹级监督的训练框架,实现模型的持续自我进化。引入多轮闭环机制,结合多模型融合提升检测鲁棒性,显著优于传统静态检测方法。实现跨格式迁移,增强模型泛化能力,为未来AI安全体系奠定基础。

新颖性

首次将开源研究资料作为威胁源,结合实例化任务和轨迹监督,构建动态自适应的安全检测体系。区别于以往静态数据和固定范畴的检测方法,强调持续学习与演化,解决新型攻击不断涌现的问题。

局限性

  • 当前模型对极端复杂、多步骤攻击链的检测仍有限,部分威胁未能完全覆盖。
  • 采集轨迹依赖模拟环境,真实部署中可能面临环境差异带来的性能下降。
  • 多轮迭代带来计算成本较高,实际应用需优化效率。

未来方向

未来将结合强化学习优化威胁实例生成,提升检测效率;探索多模态信息融合增强威胁识别能力;加强在真实环境中的部署适应性,推动安全体系的工业化应用。

AI 总览摘要

随着AI代理逐步从单一文本生成扩展到多工具、多步骤交互,安全风险也随之升级。传统检测多依赖静态范畴和有限数据,难以应对不断涌现的复杂威胁。BraveGuard提出一种自适应防御框架,通过挖掘开源研究资料,动态构建威胁知识库,将新威胁实例化为可执行任务,采集代理轨迹,并进行轨迹级监督训练。该方法实现了模型的持续自我演化,能够有效识别长链、多步骤的潜在危害。实验显示,基于BraveGuard训练的守卫模型在AgentHazard基准上的检测准确率从38.79%提升到82.38%,召回率从20.17%跃升至90.94%,显著优于传统静态模型。这一体系突破了以往依赖固定范畴和合成数据的限制,为未来AI代理安全提供了可扩展、持续的解决方案。其核心创新在于结合开源威胁挖掘、实例化任务和轨迹监督,构建动态演化的安全检测体系。未来,结合强化学习和多模态信息,将进一步提升模型的适应性和实用性,推动AI安全迈向新阶段。

深度分析

研究背景

AI代理从单纯的对话系统演变为具备多工具、多步骤操作能力的智能体,极大拓展了应用场景,但也带来了复杂的安全挑战。现有研究如OpenAI的安全检测框架和AgentHazard基准,主要关注静态范畴和短期响应,难以应对多轮交互中的潜在风险。近年来,研究者开始关注长链轨迹的安全检测,提出基于行为分析、异常检测等方法,但多依赖预定义规则和有限数据,难以应对不断变化的攻击策略。开源威胁信息、攻击手法不断演化,传统方法逐渐暴露出适应性不足的问题。如何构建一个持续学习、动态更新的安全体系,成为当前的研究热点。

核心问题

核心问题在于,现有安全检测模型多基于静态数据和固定范畴,难以应对新兴、多步骤、多工具的攻击链。代理的行为轨迹复杂,单一响应或静态范畴无法捕捉潜在风险。如何实现持续的威胁发现、实例化和轨迹监督,提升检测的适应性和鲁棒性,是亟待解决的难题。这不仅关系到模型的安全性,也影响到实际应用中的风险控制效果。

核心创新

本研究提出基于开源资料的动态威胁挖掘体系,结合实例化任务和轨迹级监督,构建持续演化的安全检测框架。创新点包括:1)利用开源研究资料自动构建威胁知识库,动态跟踪新兴攻击;2)将威胁实例化为可执行任务,采集真实轨迹;3)采用轨迹级标签进行模型训练,捕捉多步骤交互中的潜在风险;4)引入闭环机制,根据验证错误不断扩展威胁库和优化模型。该体系区别于传统静态检测,强调持续学习和适应性,显著提升检测效果。

方法详解

  • �� 威胁知识抽取:从arXiv、OpenReview等公开源自动挖掘新兴风险和攻击模式,构建结构化威胁分类体系。
  • �� 任务实例化:将威胁知识转化为具体可执行任务,模拟攻击场景,确保动作在单步中合理。
  • �� 轨迹采集:利用OpenClaw代理执行任务,采集完整操作轨迹,包括工具调用、文件修改、命令输出等。
  • �� 轨迹标注:由专家或自动机制对轨迹进行安全标签,标明风险类别和理由。
  • �� 模型训练:基于标注轨迹,训练多模型(如Qwen3-Guard、Llama-Guard),实现轨迹级安全检测。
  • �� 迭代优化:利用验证中的错误样本,扩展威胁库,合成新任务,持续更新训练数据,形成闭环。

实验设计

采用AgentHazard和ATBench-500两个基准,分别评估模型在长链轨迹中的检测能力。训练过程中,采集多轮模拟攻击轨迹,比较不同模型(如静态模型、AgentDoG、BraveGuard)在准确率、召回率和F1上的表现。通过逐步消融验证威胁挖掘、任务实例化和轨迹监督的贡献。多模型融合和跨格式迁移测试模型鲁棒性,确保在不同环境和数据格式下的适应能力。

结果分析

训练的BraveGuard模型在AgentHazard上检测准确率达82.38%,比传统模型提升43.59%;召回率从20.17%跃升至90.94%,极大减少漏检。跨格式测试显示,Qwen3-Guard-8B在ATBench-500上达86.4%准确率,95.2%召回,验证了模型的泛化能力。逐轮消融分析确认,威胁知识库、任务实例化和轨迹监督三环节共同驱动性能提升。

核心概念词典

轨迹监督

基于完整操作轨迹进行安全评估,区别于单次响应检测,强调多步骤行为的整体风险。

开源威胁挖掘

利用公开研究资料自动识别新兴攻击和风险,动态更新威胁知识库。

实例化任务

将抽象威胁知识转化为具体可执行的攻击场景,用于采集真实轨迹。

闭环自适应

通过验证错误不断扩展威胁库和优化模型,实现持续自我演化。

开放问题 这项研究留下的未解疑问

  • 1 如何在真实部署环境中高效采集和标注轨迹数据,减少人工成本。
  • 2 模型在极端复杂攻击链中的检测能力仍有限,需增强多步骤推理能力。

原文摘要

Computer-use agents extend language models from text generation to sustained interaction with files, terminals, browsers, and external tools. This shift creates safety risks that are difficult to detect from isolated prompts or final responses, because harm often emerges only through multi-step execution traces whose individual actions appear locally benign. We introduce BraveGuard, a self-evolving defense framework for training guard models from open-world threat signals and realistic agent trajectories. BraveGuard mines recent research sources to identify emerging risks and attack patterns, instantiates them as executable computer-use tasks, collects agent rollouts, and derives trajectory-level supervision for guard model training. As new threats and validation failures appear, the pipeline can be repeated, yielding an adaptive defense loop rather than a static, benchmark-driven training process. We instantiate BraveGuard by training multiple guard backbones, including Qwen3-Guard and Llama-Guard variants, and evaluate the resulting guards on trajectory-level agent-safety benchmarks. BraveGuard consistently improves safety detection across computer-use trajectories. On AgentHazard, it substantially improves detection accuracy over off-the-shelf guard models, with accuracy increasing from 38.79% to 82.38% under the averaged guard-model setting. These results show that guard supervision grounded in open-world threat discovery and realistic agent execution can improve safety monitoring beyond fixed taxonomies and synthetic prompt-level data. BraveGuard offers a scalable path toward adaptive defenses for computer-use agents facing evolving real-world risks.

cs.CR cs.CL