ConfigSpec: Profiling-Based Configuration Selection for Distributed Edge--Cloud Speculative LLM Serving

TL;DR

ConfigSpec框架通过分析边缘设备和草稿模型的性能,优化分布式推理配置。

cs.DC 🔴 高级 2026-04-09 19 次浏览
Xiangchen Li Saeid Ghafouri Jiakun Fan Babar Ali Hans Vandierendonck Dimitrios S. Nikolopoulos
边缘计算 分布式推理 大语言模型 配置选择 能效优化

核心发现

方法论

ConfigSpec框架结合设备性能分析、草稿模型与目标模型的对齐度测量,以及分析性能模型来评估配置质量。通过分析草稿模型的吞吐量、接受率和设备功耗,ConfigSpec将这些数据映射到部署相关的指标,如有效吞吐量、验证成本效率和能效。

关键结果

  • 在Jetson AGX Orin上,Llama-3.2-1B模型的有效吞吐量达到约6.5 tok/s,而Qwen3-0.6B模型达到约5.8 tok/s。
  • Llama-3.1-8B的成本效率为913K tokens/$,而Qwen3-8B为1224K tokens/$,分别提高了19.4%和24.9%。
  • 在能效方面,Llama-3.2-1B-Instruct Q4_K_M在Jetson上为0.63 J/tok,而在RPi 5上为1.28 J/tok。

研究意义

ConfigSpec框架通过优化分布式推理配置,显著提高了边缘设备上的大语言模型推理效率。这一研究解决了在异构硬件上选择最佳配置的难题,推动了边缘计算与云计算协同工作的进步。

技术贡献

ConfigSpec通过系统化的设备分析和模型对齐度测量,提供了一种新的配置评估方法。与现有技术相比,它不仅提高了推理效率,还提供了新的理论保证和工程可能性。

新颖性

ConfigSpec首次系统化地结合设备性能分析和模型对齐度测量来优化分布式推理配置。与现有工作相比,它在配置选择上提供了更全面的评估方法。

局限性

  • 在资源受限的平台上,较大的草稿模型可能导致能效下降。
  • 验证延迟在所有设备上共享,可能限制了额外的草稿速度收益。

未来方向

未来研究可以探索更多的设备类型和模型组合,以进一步优化配置选择,并研究如何减少验证延迟对推理效率的影响。

AI 总览摘要

ConfigSpec框架通过分析边缘设备和草稿模型的性能,优化分布式推理配置。现有解决方案在异构硬件上选择最佳配置时面临挑战。ConfigSpec结合设备性能分析、草稿模型与目标模型的对齐度测量,以及分析性能模型来评估配置质量。实验结果显示,较小的草稿模型在边缘设备上实现了最高的有效吞吐量,而较大的草稿模型则在成本效率上表现更佳。这一研究显著提高了边缘设备上的大语言模型推理效率,推动了边缘计算与云计算协同工作的进步。尽管如此,验证延迟在所有设备上共享,可能限制了额外的草稿速度收益,未来研究可以探索更多的设备类型和模型组合,以进一步优化配置选择。

深度分析

研究背景

随着大语言模型在边缘设备上的应用需求增加,如何优化分布式推理配置成为一个重要问题。现有技术在异构硬件上选择最佳配置时面临挑战。通过分析设备性能和模型对齐度,ConfigSpec框架提供了一种新的解决方案。

核心问题

在异构硬件上选择最佳配置以优化分布式推理效率是一个复杂的问题。较大的草稿模型可能提高接受率,但会消耗更多计算资源,影响能效。

核心创新

ConfigSpec框架结合设备性能分析和模型对齐度测量,提供了一种新的配置评估方法。它通过分析草稿模型的吞吐量、接受率和设备功耗,将这些数据映射到部署相关的指标。

方法详解

  • �� 分析设备性能,测量草稿模型的吞吐量和接受率。
  • �� 测量设备功耗,评估能效。
  • �� 使用分析性能模型评估配置质量,优化有效吞吐量和成本效率。

实验设计

实验在三种边缘平台上进行,包括Raspberry Pi 4B、Raspberry Pi 5和NVIDIA Jetson AGX Orin。使用Databricks Dolly 15K数据集进行测试,评估不同草稿模型和目标模型的配置效果。

结果分析

实验结果显示,较小的草稿模型在边缘设备上实现了最高的有效吞吐量,而较大的草稿模型则在成本效率上表现更佳。能效分析显示,较小的草稿模型在能效方面表现最佳。

应用场景

ConfigSpec框架可用于优化边缘设备上的大语言模型推理配置,提高推理效率和成本效益。适用于需要高效推理的行业,如医疗、工业物联网等。

局限与展望

验证延迟在所有设备上共享,可能限制了额外的草稿速度收益。较大的草稿模型可能导致能效下降,未来研究可探索更多设备类型和模型组合。

通俗解读 非专业人士也能看懂

想象一个工厂,工人们需要快速生产产品并检查质量。工厂有两个部门:一个负责快速生产,另一个负责质量检查。ConfigSpec就像工厂的经理,负责选择最合适的生产线和检查流程,以确保产品质量和生产效率。通过分析工人的工作速度和质量检查的效率,ConfigSpec帮助工厂优化生产流程。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你需要选择不同的角色来完成任务。有些角色跑得快,但攻击力低;有些角色攻击力强,但速度慢。ConfigSpec就像游戏中的策略指南,帮助你选择最佳角色组合,以完成任务。通过分析角色的速度和攻击力,ConfigSpec帮助你在游戏中取得胜利。

术语表

Speculative Decoding (推测解码)

一种解码范式,使用轻量级草稿模型提前提出多个候选词,并由高容量目标模型验证。

在论文中用于优化分布式推理配置。

Goodput (有效吞吐量)

指经过验证的令牌的吞吐量,是推测解码轮次模型下的验证令牌吞吐量。

用于评估配置质量。

Verification Cost Efficiency (验证成本效率)

每美元接受令牌的数量,取决于接受率、推测长度和验证器价格。

用于评估配置的成本效益。

Energy Efficiency (能效)

每个验证令牌的能耗,计算为设备在草稿期间的平均功耗。

用于评估配置的能效。

Draft Model (草稿模型)

轻量级模型,用于提前提出候选词并与目标模型对齐。

在论文中用于推测解码。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步减少验证延迟对推理效率的影响仍是一个开放问题。
  • 2 探索更多设备类型和模型组合以优化配置选择仍需进一步研究。

应用场景

近期应用

医疗诊断

通过优化推理配置,提高医疗诊断的效率和准确性。适用于需要快速响应的医疗场景。

远期愿景

智能城市

通过优化边缘设备上的推理配置,提高智能城市的效率和响应能力。需要克服设备异构性和数据隐私问题。

原文摘要

Speculative decoding enables collaborative Large Language Model (LLM) inference across cloud and edge by separating lightweight token drafting from heavyweight verification. While prior systems show performance and cost benefits, practical deployment requires navigating a large configuration space spanning draft model variants, quantisation levels, speculative lengths, and heterogeneous edge devices. This paper presents ConfigSpec, a configurationselection framework for distributed speculative LLM serving. ConfigSpec profiles edge devices and draft-target alignment, and models drafting throughput, acceptance rate, and power to evaluate goodput, verification cost efficiency, and energy efficiency across the joint configuration space. Our analysis across three edge platforms and two LLM families reveals structurally conflicting optima. Firstly, goodput is maximised by the smallest, fastest draft model at device-dependent speculative lengths (K*=2-10). Secondly, both cost and energy efficiency converge to K=2 due to a dominant bonus-token effect-with cost favouring the largest drafter for its high acceptance rate and energy favouring the smallest for its low power draw. These conflicts confirm that no single fixed configuration can simultaneously optimise all objectives, underscoring the need for profiling-based configuration selection in disaggregated edge-cloud LLM inference.

cs.DC cs.AI