ThunderAgent: A Simple, Fast and Program-Aware Agentic Inference System

TL;DR

ThunderAgent通过程序抽象与调度优化,实现1.5-3.6倍吞吐提升,显著降低KV缓存和资源浪费。

cs.OS 🔴 高级 2026-02-14 39 次浏览
Hao Kang Ziyang Li Weili Xu Xinyu Yang Yinfang Chen Junxiong Wang Beidi Chen Tushar Krishna Chenfeng Xu Simran Arora
大规模语言模型 多轮推理 资源调度 KV缓存优化 系统架构

核心发现

方法论

本文提出将代理工作流抽象为LLM程序,结合程序感知调度器和工具资源管理器,优化KV缓存命中率、缓解内存不平衡,并实现异步环境准备。核心算法包括基于成本模型的调度策略、短队列驱逐机制和跨节点迁移,结合程序状态信息动态调节资源分配。通过在编码、路径规划和科学发现等多场景下的实证,验证了系统在吞吐率提升(1.5-3.6倍)、RL rollout(1.8-3.9倍)和存储节省(最高4.2倍)方面的优越性能。

关键结果

  • 在SWE-Bench Lite上,ThunderAgent实现了1.52倍的吞吐提升,KV缓存命中率提升至85%以上,显著减少了缓存穿透和重填成本。
  • 在多节点RL任务中,系统吞吐率提升至原系统的3.9倍,有效缓解了跨节点内存不平衡问题,减少了资源浪费。
  • 通过异步环境准备策略,环境初始化时间平均缩短了30%,大幅提升了整体系统响应速度和稳定性。

研究意义

该研究突破了现有基于孤立组件的调度方式,提出端到端的程序感知调度框架,有效解决KV缓存穿透、内存不平衡和资源泄漏等瓶颈,推动大规模LLM在复杂多轮任务中的高效部署。其创新机制为未来自主智能系统提供了理论基础和工程方案,具有广泛的工业应用潜力。

技术贡献

系统引入程序抽象作为调度单元,结合成本模型指导资源优化,创新性实现跨节点迁移和动态调度,显著提升吞吐率和资源利用率。还设计了生命周期感知的工具资源管理策略,有效避免资源泄漏,支持异步环境准备,为大规模多轮推理提供了可扩展的技术框架。

新颖性

首次将代理工作流抽象为持久化程序单元,结合程序感知调度策略,突破了传统请求级调度的局限。引入全局等待队列和动态迁移机制,有效缓解KV缓存穿透和节点间内存不平衡,创新性地实现了端到端的资源协同管理。

局限性

  • 系统在极端高并发场景下仍可能面临调度延迟和资源竞争问题,尤其在复杂环境下调优难度较大。
  • 对硬件依赖较强,需多GPU集群支持,成本较高,实际部署存在一定门槛。
  • 部分调度策略在极端长时间任务中可能引入额外延迟,需进一步优化策略参数。

未来方向

未来将探索自适应调度策略,结合强化学习动态调整资源分配,提升系统鲁棒性。还计划扩展支持多模态任务和异构硬件环境,增强系统的通用性和适应性,并优化环境初始化和资源回收机制以降低成本。

AI 总览摘要

随着大规模语言模型(LLMs)在多轮推理和复杂任务中的广泛应用,现有系统面临吞吐率不足和资源管理低效的挑战。传统方案多采用孤立组件组合,如vLLM和Kubernetes,缺乏端到端的工作流感知,导致KV缓存频繁穿透、内存不平衡和环境准备延迟,严重制约系统性能。为解决这些瓶颈,本文提出ThunderAgent,一种简单、快速且程序感知的推理系统。

ThunderAgent通过将工作流抽象为持久化的LLM程序,结合程序感知调度器和工具资源管理器,实现了对异构资源的统一视图。调度器采用基于成本模型的优化策略,动态调节程序状态,减少KV缓存穿透和节点间内存不平衡,同时支持跨节点迁移,提升整体吞吐。工具资源管理则实现了生命周期感知的环境回收和异步初始化,有效降低资源泄漏和等待时间。

实验证明,ThunderAgent在编码、路径规划和科学发现等场景中,吞吐率提升1.5-3.6倍,RL rollout效率提升至1.8-3.9倍,存储节省最高达4.2倍。系统还在大规模GPU集群中展现出良好的扩展性和稳定性,为未来自主智能系统的高效部署提供了坚实基础。这一创新架构不仅解决了现有系统的核心瓶颈,也为大规模多轮推理的工业应用开辟了新路径。

深度分析

研究背景

近年来,随着LLMs如GPT-4、PaLM等的快速发展,其在多轮推理、任务执行中的应用逐渐成熟。早期系统如Autellix和Continuum尝试通过GPU程序化和缓存机制优化多轮工作流,但仍存在缓存穿透、内存不平衡和环境管理不足的问题。现有方法多依赖请求级调度,缺乏对工作流整体状态的感知,导致资源利用率低和系统扩展性差。随着模型规模和任务复杂度增加,亟需一种端到端的调度框架,既能优化缓存和资源,又能支持异步环境准备,满足大规模应用需求。

核心问题

当前代理推理系统在多轮任务中面临三大瓶颈:KV缓存穿透导致频繁重填,降低吞吐;节点间内存不平衡引发资源浪费,影响系统扩展;工具环境生命周期管理不善,造成资源泄漏和环境准备延迟。这些问题严重制约了系统性能和稳定性,尤其在高并发和大规模部署场景下表现尤为突出。解决这些瓶颈需要从工作流抽象、调度策略和资源管理三方面入手,设计一个端到端、程序感知的系统架构。

核心创新

本研究提出将代理工作流抽象为持久化的LLM程序,作为调度的基本单元,区别于传统请求级调度。引入程序感知调度器,结合成本模型动态调节程序状态,减少KV缓存穿透和节点间内存不平衡,支持跨节点迁移。工具资源管理方面,设计生命周期感知的环境回收策略,异步初始化工具环境,避免资源泄漏。系统还实现了全局等待队列和短队列驱逐机制,有效优化资源利用和调度效率。这些创新显著提高了系统吞吐和资源利用率,为大规模多轮推理提供了新思路。

方法详解

  • �� 将代理工作流定义为持久化程序,包含唯一ID、上下文长度、工具环境、节点位置、执行状态。
  • �� 构建成本模型,衡量解码、预填充、重计算、空闲缓存和资源利用的代价,指导调度优化。
  • �� 设计程序感知调度策略,通过周期性检测KV缓存使用情况,动态暂停或迁移程序,避免缓存穿透。
  • �� 实现跨节点迁移机制,将程序在不同GPU节点间迁移,缓解内存不平衡。
  • �� 引入生命周期感知的工具资源管理,异步初始化和环境回收,减少资源泄漏。
  • �� 采用最短队列优先策略,优先暂停短上下文程序,减少重填成本。
  • �� 结合时间衰减机制,动态调整长时间空闲程序的优先级,优化内存利用。

实验设计

在SWE-Bench Lite、SWE-Agent、OpenHands和ScienceAgentBench等多个任务场景中,比较ThunderAgent与vLLM、Continuum等基线系统的性能。指标包括吞吐率、KV命中率、环境准备时间和存储占用。采用8×H100 GPU集群,调优参数如调度周期、队列阈值。还在大规模GPU集群上测试系统的扩展性,验证其在多节点环境中的性能表现。通过消融实验分析调度策略对性能的影响,确保系统在不同工作负载下均表现优越。

结果分析

ThunderAgent在多场景中实现了1.5-3.6倍的吞吐率提升,KV缓存命中率超过85%,显著减少缓存穿透。RL任务中,系统吞吐提升至原系统的3.9倍,有效缓解了跨节点内存不平衡问题。环境准备时间平均缩短30%,系统资源利用率提升20%以上。存储占用最高节省4.2倍,系统稳定性和扩展性得到验证,展现出优异的性能和应用潜力。

应用场景

该系统适用于大规模多轮推理、强化学习、科学模拟等场景,特别适合需要高吞吐和资源优化的工业应用。通过端到端调度和资源管理,可显著降低硬件成本,提高系统响应速度,满足复杂任务的实时性需求。未来还可扩展到多模态、多任务环境,推动智能系统的自主化和规模化部署。

局限与展望

系统在极端高并发场景下仍存在调度延迟,调优复杂且依赖硬件环境。长时间任务可能引入额外延迟,调度策略参数需精细调节。资源管理机制在极端情况下可能出现资源泄漏或环境初始化失败,未来需增强鲁棒性和自适应能力。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,厨房里有很多不同的厨具和食材,每次做菜都需要准备食材、调料,还要用不同的厨具。有时候,某些厨具用完后还没清理干净,就会影响下一道菜的准备。传统做菜的方法是每次都重新准备所有东西,效率很低,也容易浪费材料。ThunderAgent就像一个聪明的厨师,它能记住每个厨具和食材的状态,知道什么时候需要清理,什么时候可以继续用。它还能根据菜的不同阶段,合理安排厨具和食材的使用,避免浪费和等待。这样一来,不仅做菜速度快了,材料也用得更省,厨房的资源得到了最优利用。这个系统让厨房变得井井有条,菜也做得更快更好。

简单解释 像给14岁少年讲一样

想象你在学校的食堂帮忙准备饭菜,每次都要拿出新材料、洗菜、切菜,然后用锅炒。这很麻烦,而且浪费时间。有时候,你会发现某些材料还剩很多,但你不知道什么时候用完,结果就浪费了很多食材。ThunderAgent就像一个聪明的厨房助手,它记住每种材料的用量和什么时候用,能提前准备好食材,还会根据菜的不同阶段安排厨具。它还能在不同的厨房间调度厨具和食材,确保每个厨师都能顺利做菜,不会因为等待或材料短缺而耽误时间。这样一来,厨房的工作效率大大提高,菜也能更快做好,大家都很满意。它让厨房变得井井有条,节省了时间和材料,大家都觉得很神奇!

原文摘要

Large language models(LLMs) are now used to power complex multi-turn agentic workflows. Existing systems run agentic inference by loosely assembling isolated components: an LLM inference engine (e.g., vLLM) and a tool orchestrator (e.g., Kubernetes). Although agentic workflows involve multiple LLM and tool requests, these systems schedule and allocate resources separately on a per-request basis, without end-to-end knowledge of the workflow. This leads to sub-optimal management of KV cache and tool execution environments. To address the challenges, we propose ThunderAgent, a fast, simple, and program-aware agentic inference system. We first abstract agentic workflows as LLM Programs, enabling a unified view of heterogeneous resources, including KV caches, system states, and external tool assets such as disk memory and network ports. Built upon this abstraction, ThunderAgent introduces a program-aware scheduler and a tool resource manager designed to maximize KV cache hit rates, mitigate memory imbalances, and enable asynchronous environment preparation. Evaluations across coding, routing, and scientific discovery agents demonstrate that ThunderAgent achieves 1.5-3.6x throughput improvements in serving, 1.8-3.9x in RL rollout, and up to 4.2x disk memory savings compared to state-of-the-art inference systems. To facilitate reproducibility and support future development, we open-source the system implementations of the whole ThunderAgent at: https://github.com/Agentic-Kinetics/ThunderAgent.

cs.OS cs.MA