Harness Engineering for LLM-Driven GPU Kernel Generation

TL;DR

提出基于Harness的LLM辅助GPU核生成系统,提升五类操作符平均速度1.62-29.68倍。

cs.LG 🔴 高级 2026-07-20 43 次浏览
Yue Shui Chenyu Ma Hangfei Xu Shengzhao Wen Yanpeng Wang
GPU核优化 大语言模型 系统工程 性能提升 算法设计

核心发现

方法论

该系统通过将评估工具与优化控制器分离,利用人类设计的技能捕获操作符约束,结合Codex与Claude Code生成候选核。控制器基于Profiler和工作负载证据,进行有界候选生成决策。系统支持多语言(CUDA、Triton、CuTe),采用二阶段搜索和Latency-first promotion策略,确保核的正确性与性能提升。通过Profile-backed状态管理和轨迹记忆,提升搜索的可追溯性与复现性。多轮迭代中,结合人工引导的plateau recovery,有效避免优化停滞。系统在五个操作符定义上实现了平均速度提升1.62到29.68倍,验证了人类专家指导与AI生成的协同效果。

关键结果

  • 在五个操作符定义中,Retained artifacts的平均速度提升分别为1.62x、18.05x、29.68x、1.12x和13.70x,显著优于基础的FlashInfer基线。Agent-Assisted核在所有定义中优于Full-Agent核,表明专家指导、优质参考和工作负载上下文仍是关键。
  • 系统在CUDA 13.2、PyTorch 2.12、Triton 3.6环境下实现,确保了核的正确性和性能。多轮优化中,结合Profiler信息和手动调节,有效规避了微观微调中的错误与瓶颈。
  • 通过对五个操作符的详细分析,验证了Shape-aware dispatch和Workload-grounded promotion的有效性,特别是在稀疏注意力和门控网络中表现出极大优势。

研究意义

该研究突破了GPU核自动生成的瓶颈,将LLM引入系统工程,结合人类专家经验与AI搜索,显著提升核性能,推动深度学习推理效率。其方法为未来自动化核优化提供了可复用的工程框架,有望在大模型部署、硬件加速等场景中广泛应用,解决传统方法中工程复杂、效果不稳定的问题。

技术贡献

提出基于Harness的系统架构,将评估与优化解耦,利用Profile-backed状态管理和轨迹记忆实现可追溯的搜索。引入多语言支持、二阶段搜索和Latency-first promotion策略,结合人类引导的plateau recovery,有效提升核的正确性与性能。系统在五个操作符定义上实现了显著性能提升,验证了人机协同的有效性,为GPU核自动化生成提供了工程范式。

新颖性

首次系统性引入Harness工程思想,将人类设计的技能与LLM生成结合,利用Profile-backed状态和轨迹记忆实现可控、可追溯的核搜索。不同于传统自动优化方法,该系统强调工程约束与验证,确保生成核的正确性与性能,具有较强的工程实用性和可复用性。

局限性

  • 系统依赖于人类设计的技能和参考,自动化程度有限,仍需专家参与。某些复杂操作符的优化效果受限于训练数据和Profile信息的准确性,可能在极端场景下失效。
  • 多轮优化过程耗时较长,特别是在高复杂度操作符中,实际部署时需权衡时间成本与性能收益。
  • 系统在不同硬件环境下的迁移性和适应性尚未充分验证,未来需增强泛化能力。

未来方向

未来将探索更强的自动化技能生成机制,结合强化学习优化搜索策略,提升系统自主性。同时,计划扩展多硬件平台支持,增强系统的适应性和迁移能力。此外,将引入更丰富的工作负载模型,提升核的泛化性能,推动自动化核生成在工业级深度学习推理中的应用。

AI 总览摘要

随着深度学习模型规模的不断扩大,GPU核的优化成为提升推理效率的关键环节。传统手工调优方法面临工程复杂、效率有限的挑战。本文提出了一套基于Harness工程思想的LLM辅助GPU核生成系统,旨在通过人机协同实现核的高效、可靠生成。系统将评估工具与优化控制器分离,利用Profile-backed状态管理和轨迹记忆,确保每次生成都在可控范围内进行。人类专家设计的技能定义了操作符约束、参考代码和推广规则,结合Codex和Claude Code生成候选核。优化流程采用多轮迭代,结合Profiler信息和手动引导,有效避免优化停滞,提升核性能。在五个操作符定义上,Retained artifacts的平均速度提升达1.62到29.68倍,显著优于基础基线。实验验证了该系统在CUDA、PyTorch和Triton环境中的有效性,展示了人机结合的强大潜力。该研究不仅推动GPU核自动生成的工程实践,也为未来深度学习硬件优化提供了可复用的系统架构。未来工作将聚焦于增强系统的自主性和迁移能力,推动深度学习推理的广泛应用。

深度分析

研究背景

近年来,深度学习模型不断扩大,GPU硬件成为推理的核心平台。传统核优化依赖手工调优,效率低且难以应对复杂操作符。早期工作如KernelBench、KernelEvolve通过生成-评估-选择循环探索优化空间,但缺乏系统工程支持。随着大语言模型(LLM)崛起,利用其生成能力辅助核设计成为新趋势。现有研究多集中于自动化搜索,但缺乏工程化的可控性和验证机制,导致生成核在实际应用中难以保证正确性和性能。本文在此背景下提出Harness工程思想,结合Profile-backed状态管理和人类专家的技能定义,构建了一个可控、可追溯的核生成系统,填补了自动化与工程实践的空白。

核心问题

GPU核优化面临多重挑战:一是核的正确性必须严格保证,否则会引发错误;二是性能提升需在多样化工作负载中实现,而非单一指标;三是工程实现复杂,容易出现基线漂移、验证不充分等问题。传统方法难以兼顾这些需求,导致优化效果不稳定。如何在保证正确性的同时,系统性地提升核性能,成为亟待解决的问题。特别是在多操作符、多硬件环境下,如何实现高效、可靠的自动化核生成,仍是研究难点。

核心创新

本研究的核心创新包括:1)引入Harness工程思想,将人类设计的技能封装为可复用的约束和操作规则,确保生成核符合工程要求;2)采用Profile-backed状态管理,将Profiler信息作为搜索的基础,提升搜索的可追溯性和稳定性;3)多语言支持(CUDA、Triton、CuTe),满足不同硬件和微调需求;4)结合多轮迭代和Latency-first promotion策略,有效平衡性能与正确性,避免优化停滞。这些创新使系统在保证核正确性的基础上,显著提升了性能,突破了传统自动优化的局限。

方法详解

  • �� 设计评估工具(Harness)与优化控制器(Controller),将工作负载、Profile信息、候选核封装为结构化上下文;
  • �� 利用人类专家定义的技能捕获操作符约束、参考代码、推广规则,确保核的工程可控性;
  • �� 采用Profile-backed状态管理,记录每轮候选核的性能、正确性和Profiler证据,作为下一轮搜索的基础;
  • �� 多语言支持:CUDA C++、Triton、CuTe,满足不同硬件需求;
  • �� 结合二阶段搜索策略:候选生成(模型/模型新)、验证(正确性、性能)、推广(Latency-first);
  • �� 设计多轮迭代流程:识别瓶颈、生成候选、编译验证、Profiler测量、轨迹存储、人工引导plateau recovery。
  • �� 通过多任务、多工作负载、多轮优化,确保核在不同场景下的性能提升与正确性。

实验设计

实验在NVIDIA Blackwell B200 GPU上进行,使用CUDA 13.2、PyTorch 2.12、Triton 3.6环境,评估五个操作符定义(MoE FP8、DSA top-k、DSA attention、GDN decode、GDN prefill),对比基础FlashInfer基线。每个定义采用不同工作负载(如19、128、23、54、100个),验证核的正确性和性能提升。多轮优化中,结合Profiler信息和人工引导,筛选出最优候选核。通过对比Agent-Assisted与Full-Agent方法,验证了系统的有效性。指标包括平均延迟、速度提升(最高达29.68倍)和正确性保证。还进行了微调和高试验轮次验证,确保核的稳健性。

结果分析

在五个操作符定义中,Retained artifacts的平均速度提升分别为1.62x、18.05x、29.68x、1.12x和13.70x,显著优于基础基线。Agent-Assisted核在所有定义中优于Full-Agent核,特别是在稀疏注意力和门控网络中表现出极大优势。多轮优化结合Profiler信息,有效避免了微调中的错误,验证了Shape-aware dispatch和Workload-grounded promotion的有效性。实验结果显示,结合人类专家引导的系统架构,核生成的性能提升具有高度稳定性和可控性,为GPU核自动化生成提供了新范式。

应用场景

该系统适用于深度学习模型部署中的GPU核优化,特别是在大规模模型推理、稀疏注意力、门控网络等场景。通过结合Profile信息和工程化技能,能显著缩短核开发周期,提升推理速度,降低能耗。未来可扩展到多硬件平台,支持自动化调优,推动深度学习硬件加速产业升级。

局限与展望

系统依赖人类专家设计的技能,自动化程度有限,难以完全自主。多轮优化耗时较长,实际部署需权衡时间成本。对极端或新颖操作符的适应性不足,未来需增强泛化能力和迁移性。

通俗解读 非专业人士也能看懂

想象你在一个工厂里,工人们要制造一批复杂的机器。每台机器都需要不同的零件和组装步骤,工人们需要确保每个步骤都正确无误,才能保证机器正常工作。传统上,工人们自己设计每个机器的制造流程,但这样既耗时又容易出错。现在,有了智能助手(就像大语言模型),它可以根据工人的指导,快速生成符合要求的制造流程。工人们提供一些基本规则和参考样例,助手根据这些信息,自动设计出多种方案。然后,工人们会检查这些方案,选择最优的那一个。这个过程不断循环,直到找到既快又正确的制造流程。这个系统就像一个智能工厂助手,结合人类经验和AI的计算能力,大大提高了生产效率,确保每台机器都能高质量地制造出来。

简单解释 像给14岁少年讲一样

想象你在学校的厨房里做饭。以前,你需要自己想办法,把所有材料和步骤都安排好,才能做出美味的菜肴。这很难,也容易出错。现在,有个聪明的机器人助手,它可以帮你设计菜谱。你告诉它你想做什么菜,它会根据你的要求,给出几种不同的做法。你可以试试这些方案,看看哪个最合你口味。你还可以告诉它你喜欢吃辣还是不辣,它会调整菜谱。你们一起反复试验,最后找到最棒的做法。这个机器人就像一个厨房助手,帮你节省时间,又保证菜做得好吃。这个系统用在GPU核优化上也是一样的:人类提供一些基本规则和参考,AI帮忙设计不同的核方案,然后人类挑选最好的,反复优化,最终让GPU跑得更快、更稳定。

术语表

Harness工程 (Harness Engineering)

一种系统设计思想,将工程约束和验证机制融入自动化流程,确保AI生成的核符合性能和正确性要求。

论文中用于确保GPU核生成的工程可控性与可追溯性。

Profile-backed状态 (Profile-backed State)

利用Profiler收集的性能和正确性信息,作为搜索和优化的基础状态。

用于多轮优化中记录核的性能指标。

Latency-first promotion (延迟优先推广)

一种优先提升核性能的策略,确保优化目标是降低平均延迟。

在多轮优化中用以筛选候选核。

Shape-aware dispatch (形状感知调度)

根据工作负载的形状特征,动态调整核调度策略。

优化稀疏注意力和门控网络中的调度路径。

Agent-Assisted (代理辅助)

结合人类专家和AI模型共同进行核设计的系统架构。

论文的核心方法之一。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步减少多轮优化所需时间,提升系统的自动化程度,成为未来研究的重要方向。当前系统仍依赖人类技能设计,自动化水平有限。

应用场景

近期应用

深度学习模型推理加速

利用该系统优化GPU核,提升大模型推理速度,降低能耗,适用于云端推理平台和边缘设备。

硬件加速器设计

为新一代GPU或专用加速器设计定制核,提升硬件性能和能效,推动AI硬件产业升级。

远期愿景

自动化深度学习硬件生态

实现从模型到硬件的全链路自动化优化,推动深度学习硬件的普及与定制化,缩短研发周期。

原文摘要

Large language models (LLMs) can assist GPU kernel generation, but their practical effectiveness depends on whether generated code can be reliably constrained, validated, profiled, and selected. This paper presents a harness-centered system for LLM-driven GPU kernel optimization in the MLSys 2026 FlashInfer AI Kernel Generation Contest on NVIDIA Blackwell B200 GPUs. The system separates an evaluation harness from a profile-backed optimization controller: the harness enforces compilation, correctness, official-aligned timing, and artifact archival, while the controller turns profiler and workload evidence into bounded candidate-generation decisions. Human-authored skills capture operator constraints, references, profiling procedures, and promotion rules, while Codex and Claude Code agents generate candidate kernels inside those constraints. Across five operator definitions, the retained official-aligned artifacts achieved mean-latency speedups over supplied FlashInfer baselines of 1.62x, 18.05x, 29.68x, 1.12x, and 13.70x. The Agent-Assisted kernels outperform the Full-Agent artifacts across the evaluated definitions, indicating that expert-provided optimization directions, high-quality references, and workload context remain critical for reliable AI-driven kernel optimization.

cs.LG cs.AI