ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL

TL;DR

ROSE利用合作弹性在服务GPU上进行Agentic RL,提升1.3-3.3倍吞吐量。

cs.DC 🔴 高级 2026-05-08 4 次浏览
Wei Gao Yuheng Zhao Dilxat Muhtar Dakai An Xuchun Shang Tianyuan Wu Lunxi Cao Shaopan Xiong Weixun Wang Ju Huang Teng Ma Siran Yang Jiamang Wang Lin Qu Bo Zheng Wei Wang
强化学习 GPU 弹性计算 大语言模型 资源优化

核心发现

方法论

ROSE系统通过合作弹性实现Agentic RL后训练,包含三部分:SLO安全的协同执行器,跨集群权重传输引擎,弹性rollout调度器。协同执行器在同一GPU上动态共享内存和计算资源,跨集群引擎利用分片路由和权重稀疏性快速同步,调度器动态路由rollout。

关键结果

  • ROSE在多种模型规模和集群规模下的实验显示,相较于固定资源基线,ROSE提高了1.3-3.3倍的端到端吞吐量,并在资源弹性基线下减少了1.2-1.5倍的rollout时间,无SLO违规。
  • 在不同模型和集群规模下,ROSE显著提高了训练效率,尤其是在资源需求变化大的情况下。
  • 通过跨集群权重传输引擎,ROSE实现了快速同步,减少了通信开销。

研究意义

ROSE通过共享服务GPU的闲置资源,解决了Agentic RL训练中资源需求波动的问题,显著提高了训练效率,减少了计算开销。这一方法在学术界和工业界均具有重要意义,尤其是在大规模语言模型的后训练优化中。

技术贡献

ROSE提出了一种新的合作弹性框架,突破了现有方法的资源固定限制,提供了动态资源分配的解决方案。通过创新的跨集群权重传输和协同执行机制,ROSE实现了更高效的计算资源利用。

新颖性

ROSE首次提出在服务GPU上共享rollout工作负载的合作弹性方法,与现有的资源弹性方法相比,显著减少了分配开销并提高了资源利用率。

局限性

  • 在高峰流量下,服务SLO可能面临挑战,尽管ROSE设计了优先级控制机制。
  • 跨集群通信仍存在一定延迟,可能影响实时性。
  • 需要进一步优化以适应更大规模的模型和集群。

未来方向

未来工作可以探索在更大规模集群上的应用,以及进一步优化跨集群通信机制,以减少延迟并提高实时性。

AI 总览摘要

ROSE系统通过合作弹性在服务GPU上进行Agentic RL后训练,解决了资源需求波动带来的挑战。传统的资源固定系统无法适应这种变化,而现有的资源弹性方法存在高分配开销和有限的可用性。ROSE通过共享服务集群的闲置GPU资源,实现了动态资源分配,显著提高了训练效率。实验结果显示,ROSE在多种模型规模和集群规模下提高了1.3-3.3倍的端到端吞吐量,并减少了1.2-1.5倍的rollout时间。尽管ROSE在保持服务SLO方面面临挑战,但其创新的协同执行机制和跨集群权重传输引擎为解决这些问题提供了有效的解决方案。未来的研究方向包括在更大规模集群上的应用,以及进一步优化跨集群通信机制。

深度分析

研究背景

Agentic RL正在改变大语言模型的后训练过程,传统的训练时间主要由计算密集的多轮rollout主导,资源需求在训练步骤间变化显著。固定资源系统无法适应这种变化,而资源弹性方法则面临高分配开销和有限的可用性。

核心问题

Agentic RL训练中的rollout阶段占据了超过70%的总时间,GPU计算和内存需求在训练步骤间变化显著。现有的资源固定系统无法适应这种需求变化,而资源弹性系统则面临高分配开销。

核心创新

ROSE通过合作弹性共享服务GPU的闲置资源,提出了一种新的动态资源分配方法。协同执行器在同一GPU上动态共享内存和计算资源,跨集群权重传输引擎利用分片路由和权重稀疏性快速同步,弹性rollout调度器动态路由rollout。

方法详解

  • �� SLO安全的协同执行器:动态共享内存和计算资源,保持服务SLO。
  • �� 跨集群权重传输引擎:利用分片路由和权重稀疏性快速同步。
  • �� 弹性rollout调度器:动态路由rollout至专用和机会性服务GPU。

实验设计

实验在多种模型规模和集群规模下进行,使用Qwen3-8B和Qwen3-32B模型,验证ROSE在不同资源配置下的性能提升。对比基线包括固定资源和资源弹性系统。

结果分析

ROSE在实验中提高了1.3-3.3倍的端到端吞吐量,并减少了1.2-1.5倍的rollout时间。跨集群权重传输引擎实现了快速同步,减少了通信开销。

应用场景

ROSE适用于大规模语言模型的后训练优化,尤其是在资源需求波动大的情况下。其动态资源分配方法可显著提高训练效率,减少计算开销。

局限与展望

尽管ROSE在保持服务SLO方面面临挑战,但其创新的协同执行机制和跨集群权重传输引擎为解决这些问题提供了有效的解决方案。未来的研究方向包括在更大规模集群上的应用,以及进一步优化跨集群通信机制。

通俗解读 非专业人士也能看懂

想象一个厨房,厨师需要在不同时间准备不同数量的菜肴。传统方法是为每个厨师分配固定的灶台和锅具,但这样会导致资源浪费,因为有时厨师不需要那么多设备。ROSE就像一个智能厨房管理系统,根据厨师的需求动态分配灶台和锅具,确保每个厨师在需要时都有足够的资源。这种方法不仅提高了效率,还减少了资源浪费。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,需要在不同关卡使用不同的武器和装备。传统方法是每次都给你固定的装备,但这样有时会不够用或者浪费。ROSE就像一个智能装备管理系统,根据关卡需求动态分配武器和装备,确保你在需要时有足够的资源。这种方法不仅提高了游戏效率,还减少了资源浪费。是不是很酷?

术语表

Agentic RL (代理强化学习)

一种强化学习方法,强调代理与环境的主动交互。

在论文中用于优化大语言模型的后训练过程。

SLO (服务级别目标)

服务性能的目标指标,如响应时间。

在论文中用于衡量服务集群的性能。

GPU (图形处理器)

一种用于加速计算的硬件设备,尤其在深度学习中。

在论文中用于执行Agentic RL的计算任务。

Rollout (展开)

在强化学习中,代理与环境的交互过程。

在论文中用于描述Agentic RL的训练阶段。

Elasticity (弹性)

资源根据需求动态调整的能力。

在论文中用于描述ROSE系统的核心特性。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化跨集群通信机制以减少延迟?
  • 2 在更大规模集群上应用ROSE的挑战是什么?
  • 3 如何在高峰流量下保持服务SLO?

应用场景

近期应用

大语言模型优化

ROSE可用于优化大语言模型的后训练过程,尤其在资源需求波动大的情况下。

远期愿景

智能资源管理

ROSE的动态资源分配方法可应用于更广泛的计算资源管理领域,推动智能化发展。

原文摘要

Agentic reinforcement learning (RL) is reshaping LLM post-training, but end-to-end training time is dominated by compute-intensive, multi-turn rollouts whose resource demand varies significantly across training steps. Resource-fixed systems cannot adapt to this variation, while resource-elastic approaches that provision external GPUs on demand suffer from high allocation overhead and limited availability. We observe that serving clusters leave substantial GPU compute and memory idle, and propose cooperative elasticity: sharing already-deployed serving GPUs with rollout workloads to provide on-demand elastic capacity. Realizing this is non-trivial, as it must preserve serving SLOs under bursty traffic while minimizing cross-cluster communication overhead. We present ROSE, a system that realizes cooperative elasticity for agentic RL post-training, comprising three components: (1) an SLO-safe co-serving executor that co-locates heterogeneous serving and rollout models on the same GPUs, dynamically sharing memory and compute while preserving serving SLOs; (2) a cross-cluster weight transfer engine that leverages shard-aware routing and weight sparsity for fast synchronization; and (3) an elastic rollout scheduler that dynamically routes rollouts across dedicated and opportunistic serving GPUs. Experiments across multiple model sizes and cluster scales show that ROSE improves end-to-end throughput by 1.3 - 3.3 x over resource-fixed baselines and reduces rollout time by 1.2 - 1.5 x over resource-elastic baselines, with no serving SLO violations.

cs.DC