AIChilles: Automatically Uncovering Hidden Weaknesses in AI-Evolved Systems

TL;DR

AIChilles以差分搜索发现30个AI演化程序中的49项隐藏弱点。

cs.AI 🔴 高级 2026-06-14 24 次浏览
Yajie Zhou Ao Li Ashwin Silla Zaoxing Liu Vyas Sekar
AI系统演化 程序测试 差分测试 鲁棒性 系统安全

核心发现

方法论

AIChilles输入基线程序P与演化程序P′,先从评估器和工作负载生成器确定性提取参数,再由智能体推断取值范围及跨参数约束,形成有效工作负载语法。随后为正确性、时间、内存和最优性分别配置搜索子智能体,以P为差分预言机,并用P′执行轨迹的代码频率覆盖引导多样化搜索。

关键结果

  • 在Engram、AdaEvolve和OpenEvolve生成的30个程序设置、5类系统应用及GPT-5和Claude-Opus-4.6上,AIChilles发现49项不同隐藏弱点。时间回归涉及25个实例,内存回归11个,正确性7个,最优性6个。
  • 与随机模糊、变异模糊、基于属性测试及单一LLM智能体相比,在相同时间预算下,AIChilles持续发现更多且更具多样性的弱点。Prism案例显示,OpenEvolve将复杂度从O(MG)推至O(MG²),Engram的局部搜索还造成运行时间和质量回归。
  • 将AIChilles反馈纳入演化闭环并惩罚暴露弱点的候选程序,可消除若干回归;但鲁棒性增强伴随代价:原先12–60%的基准分提升缩小,部分最优鲁棒程序接近人工基线。

研究意义

论文揭示,AI生成系统算法的高基准分并不等于部署安全。它把过拟合、资源爆炸和崩溃重新定义为可自动搜寻的系统安全风险,为AI辅助编程建立了类似持续集成中的对抗性回归测试层。对学术界,研究提供跨应用比较框架;对工业界,它提醒开发者在在线调度、模型部署和资源控制器中同时评估质量、延迟、内存与失败行为。

技术贡献

核心贡献是把异构系统测试统一为P与P′之间的有效输入差分问题。确定性参数提取降低了提示式推断的不稳定性;约束推断恢复应用语义;四类专门智能体避免单一智能体只追逐崩溃;执行轨迹向量提供行为多样性信号;弱点去重和根因分析则把大量见证输入归并为独立故障。形式化条件包括P′崩溃而P成功、t′>Ft·t、m′>Fm·m及q′<q。

新颖性

相较传统模糊测试主要寻找崩溃、性能工具针对单一程序,AIChilles面向AI演化系统的“相对退化”进行搜索,并同时覆盖正确性、时间、内存和质量。其独特性不只是使用LLM,而是结合AST/确定性参数发现、语义约束、类型分治、差分预言机和轨迹覆盖。

局限性

  • 论文依赖P作为差分预言机;若人工基线本身错误、过慢或质量较低,比较可能遗漏共同错误或误判改进。
  • 工作负载约束仍需智能体推断,复杂环境、随机性和非确定执行可能产生无效样本、测量噪声或难以复现的回归。
  • 实验覆盖5类应用和30个设置,但未证明对所有系统领域及长期生产流量都同样有效。

未来方向

未来可结合多预言机、形式化约束、真实生产流量和统计重复实验,降低基线偏差与噪声;还可将轨迹覆盖扩展为数据流、资源状态和语义覆盖,并研究面向安全、成本和能源的回归指标。

AI 总览摘要

AI驱动的系统演化正在改变算法设计。AlphaEvolve、AdaEvolve、Engram和OpenEvolve让LLM反复改写程序,并在固定工作负载上筛选高分版本;AdaEvolve甚至报告相对人工方法12–60%的提升。然而,固定评估器也可能成为漏洞:程序学会迎合基准,却在未见输入上变慢、耗尽内存、崩溃或产生较差方案。

Zhou等人提出AIChilles,将人工程序P视为演化程序P′的差分预言机。系统从评估器中确定性提取工作负载参数,再由智能体恢复范围和交叉约束;随后四个专门搜索器分别寻找正确性、时间、内存和最优性回归。代码执行频率构成行为轨迹,帮助系统避开重复故障。形式上,它寻找有效w,使P′崩溃而P成功,或满足t′>Ft·t、m′>Fm·m、q′<q。

在Engram、AdaEvolve、OpenEvolve的30个程序设置中,覆盖交易调度、专家并行负载均衡、多云作业调度、LLM前缀缓存和模型部署五类应用,AIChilles发现49项弱点:时间25项、内存11项、正确性7项、最优性6项。Prism案例中,OpenEvolve把O(MG)变为O(MG²),Engram的复杂局部搜索也造成规模化风险。加入反馈能修复若干问题,但会牺牲部分基准收益。研究因此主张:AI演化系统必须同时优化分数与最坏情形鲁棒性。

深度分析

研究背景

AlphaEvolve推动了LLM驱动的算法演化;OpenEvolve采用固定突变与保留策略,AdaEvolve动态分配探索资源,Engram通过持久档案支持长周期演化。它们已用于调度、负载均衡、缓存和模型部署,并报告12–60%的分数提升。但固定基准可能鼓励奖励投机,隐藏复杂度与未见工作负载回归。

核心问题

给定人工程序P、演化程序P′和有效工作负载集合W,论文寻找P′相对P的显著退化。输出可写为P(w)→〈q,t,m〉或⊥,P′同理。难点在于输入格式异构、约束隐含、弱点类型多样,以及搜索需要区分“二者都难”与“P′特有的失败”。

核心创新

  • ��把检测目标定义为相对差分退化,而非孤立错误。
  • ��确定性参数提取结合智能体约束推断,形成工作负载语法。
  • ��正确性、时间、内存、最优性采用分类型智能体搜索。
  • ��以P′代码频率轨迹作为行为多样性信号,减少重复见证。
  • ��将发现结果去重并交给智能体分析根因,反馈至后续演化。

方法详解

  • ��输入:程序P、P′、评估器及示例工作负载。
  • ��提取:解析评估器和生成器,收集整数、序列、资源规模等参数。
  • ��推断:智能体补充范围与交叉约束,构造有效采样器。
  • ��搜索:四个子智能体分别优化崩溃、时间比、内存比或质量差异。
  • ��验证:在相同w上运行P和P′,检查⊥、t′>Ft·t、m′>Fm·m或q′<q。
  • ��多样化:记录P′逐行执行频率,按轨迹差异优先探索。
  • ��分析:合并相似输入,生成弱点类别与根因,并将历史工作负载用于warm start。

实验设计

实验覆盖Engram、AdaEvolve、OpenEvolve,使用GPT-5和Claude-Opus-4.6生成程序;应用包括交易调度、专家并行负载均衡、多云作业调度、LLM前缀缓存优化和Prism模型部署。比较对象包括随机模糊、变异模糊、属性测试和基线LLM智能体;指标是四类弱点数量、差异性及缓解效果。

结果分析

AIChilles共发现49项独立弱点,其中时间回归25个实例、内存11个、正确性7个、最优性6个。Engram总体暴露较少,但没有程序族在对抗性搜索下完全稳健。Prism中人工算法为O(MG),OpenEvolve为O(MG²);Engram虽提高基准分,却可能陷入局部最优。加入惩罚反馈能提升鲁棒性,但削弱原有分数优势。

应用场景

工具可嵌入AI代码生成的CI/CD,在调度器、GPU模型放置、缓存管理和云作业系统发布前生成对抗工作负载。部署前提是能运行P/P′、读取评估器并测量质量、时间和峰值内存。它尤其适合在线控制器,因为资源回归可能直接延迟重新配置或形成DoS风险。

局限与展望

方法依赖可执行基线和可观测评估器;P若不是可靠参考,差分结论会受限。智能体约束推断和执行测量仍有成本,随机程序、外部服务及真实生产状态会增加噪声。当前结果来自5类应用、30个设置,尚不足以给出普适覆盖保证。未来需多基线、形式化约束、真实流量和更丰富的安全及能源指标。

通俗解读 非专业人士也能看懂

把AI写程序想成一家工厂。原来的人工程序P像经验丰富的老工人,动作不花哨,但面对不同订单通常稳定。AI程序P′像新工人:工厂用几种固定订单考核它,它可能学会把这些订单做得特别漂亮,于是分数很高,却未必能处理真正混乱的订单。

AIChilles像一名专门的质检员。它先阅读工厂规则,弄清订单必须满足什么条件;然后故意改变订单规模、材料和组合,同时让老工人和新工人做同一份订单。如果新工人出错、耗时明显更久、占用更多仓库,或成品更差,就记录下来。

它还会记住新工人采用过哪些操作路线。如果一次检查只是重复同一种错误,系统会换一种订单,去寻找不同的隐藏问题。研究发现,30个AI改造程序中有49项弱点:最常见的是越做越慢,其次是占用更多内存。结论很简单:一次考试得高分,不代表能在所有真实订单中可靠工作。

简单解释 像给14岁少年讲一样

想象你在做一个游戏里的自动排队机器人。老师给它一组固定关卡,它不断修改代码,最后分数比原来的机器人高12%到60%。听起来超酷,对吧?但问题是,它可能只是背熟了这几关;换一张地图,它就卡住、变慢,甚至闪退。

AIChilles就是“专门找坑的玩家”。它拿原机器人P和新机器人P′,制造很多合法但刁钻的关卡,再让两者同时挑战。如果新机器人崩了、明显更慢、吃掉更多电脑内存,或者分数更低,就算找到一个弱点。它还会检查两台机器走过的代码路线,避免一直发现同一个坑。

研究者在30个AI改造程序里找到了49个隐藏弱点。25个和运行变慢有关,11个会用更多内存,7个会出错,6个在新情况中表现更差。比如Prism模型放置程序,原算法大约按O(MG)工作,但一个AI版本变成O(MG²),GPU越多就越拖沓。

所以,AI写出的程序不能只看排行榜分数。更像游戏装备:攻击力高不代表耐久好。把AIChilles放回改代码的循环里,可以修掉一些坑,但有时最高分会下降。这说明真正厉害的程序,要同时做到高分、稳定和省资源。

术语表

AI-driven system optimization (AI驱动系统优化)

让AI智能体反复修改系统算法,并用评估器筛选候选程序。它把算法设计转化为自动演化过程。

论文研究的应用范式,包括AdaEvolve、Engram和OpenEvolve。

Differential oracle (差分预言机)

通过比较两个程序在同一输入上的行为来判断退化。论文把人工基线P作为P′的参考。

用于检查正确性、时间、内存和质量差异。

Workload grammar (工作负载语法)

描述输入参数合法范围及其相互约束的规则集合。它帮助搜索器生成有效而非随机无效的工作负载。

由参数解析和智能体约束推断共同构建。

Code-frequency coverage (代码频率覆盖)

用各代码行被执行的频率表示一次运行的行为轨迹。轨迹差异越大,越可能代表不同故障路径。

用于引导多样化搜索和弱点去重。

Optimality regression (最优性回归)

演化程序在某个有效输入上的质量分数低于基线程序。它通常反映对固定基准分布的过拟合。

Prism中使用平衡分数比较模型放置质量。

开放问题 这项研究留下的未解疑问

  • 1 论文尚未给出跨所有系统领域的覆盖保证;复杂生产流量、随机执行和外部服务依赖是否能稳定生成可复现证据,仍需长期验证。
  • 2 P被视为可靠参考,但基线可能共享错误或效率不足。未来需要多基线、形式化规范和统计置信区间来区分真实回归与测量噪声。

应用场景

近期应用

AI代码发布门禁

系统团队可在每轮AI改写后运行P与P′的对抗性工作负载,检查崩溃、延迟、峰值内存和质量差异;将独立弱点作为CI失败条件,阻止风险版本进入生产。

在线调度器压力测试

云平台和GPU集群可用AIChilles生成不同规模的节点、模型和请求组合,提前识别O(MG²)等扩展性退化,避免负载变化时控制器响应过慢。

远期愿景

鲁棒性驱动的AI演化

未来的系统优化器可把质量、延迟、内存、安全和能源共同纳入适应度函数,形成“高分且可靠”的演化,而非只针对小型基准奖励投机行为。

原文摘要

The computer systems community has recently seen growing interest in AI-driven system evolution, where AI agents iteratively rewrite systems. Frameworks such as AdaEvolve and Engram report 12-60% score improvements over human-designed algorithms. While these results are promising, there are practical concerns if these AI-evolved programs can perform worse on unseen workloads and exhibit scalability regressions. Given the speed and scale of AI-generated code, we need automated mechanisms to uncover such identify hidden weaknesses in AI-evolved systems programs. To this end, we develop AIChilles that takes as input a baseline program $P$ and an AI-evolved program $P'$, AIChilles searches for valid workloads where $P'$ regresses relative to $P$ in correctness, runtime, memory usage, or output quality. To tackle the diversity in system applications, weakness types and potential bugs, AIChilles combines deterministic workload-parameter extraction, agent-based constraint inference, differential oracles, and code-frequency coverage to discover diverse failures. Across five system applications and 30 AI-evolved programs, AIChilles finds 49 distinct hidden weaknesses. We also show that explicitly including AIChilles in the AI-driven development lifecycle can mitigate several of these weaknesses.

cs.AI cs.CR eess.SY