CarbonCall: Sustainability-Aware Function Calling for Large Language Models on Edge Devices

TL;DR

CarbonCall通过动态工具选择与碳感知执行,显著降低边缘设备LLM能耗与碳排放。

cs.PF 🔴 高级 2025-04-29 53 次浏览
Varatheepan Paramanayakam Andreas Karatzas Iraklis Anagnostopoulos Dimitrios Stamoulis
边缘计算 可持续性 大规模语言模型 能耗优化 碳排放控制

核心发现

方法论

CarbonCall结合动态工具选择、碳感知调度与量化模型,优化边缘设备上的LLM调用。其核心机制包括:利用向量检索和交叉编码器实现高效工具筛选;根据实时碳强度调整设备功率阈值;采用不同量化级别的模型实现能效与响应的平衡。系统在NVIDIA Jetson AGX Orin平台上,通过实时预测24小时碳强度变化,动态调节硬件配置和模型精度,从而在保证响应速度的同时最大限度降低碳排放。

关键结果

  • 在多轮实验中,CarbonCall在NVIDIA Jetson AGX Orin上实现了最高52%的碳排放减少、30%的能耗降低和30%的执行时间缩短,且保持了较高的tokens/sec吞吐率。与传统静态优化方案相比,碳排放降低幅度显著,且系统响应时间未明显下降,验证了其在能耗与性能平衡方面的优越性。
  • 在不同碳强度波动场景下,CarbonCall通过动态调节功率阈值和模型量化级别,有效应对能源环境变化,确保在高碳强度时减排,在低碳时提升性能。实验数据表明,该方法在多模型、多场景下均优于Gorilla、LiS等基线方案。
  • 此外,系统的工具筛选机制结合FAISS检索和交叉编码器重排序,有效提升工具匹配准确率,减少误调用,进一步优化能效与响应速度。

研究意义

该研究突破了边缘设备上大模型的能耗与碳排放瓶颈,为可持续AI提供了实用方案。通过实时碳强度感知与模型调度,显著降低了边缘端AI的环境影响,推动绿色边缘计算的发展。该方法兼顾性能与环保,满足未来智能边缘设备在能耗限制与环境责任方面的双重需求,具有广泛的应用前景。

技术贡献

本文提出了结合动态工具筛选、碳感知调度和模型量化的多层次优化框架,创新性地实现了边缘端LLM的能效提升。其核心技术包括:基于向量检索的快速工具筛选机制,结合交叉编码器提升筛选准确率;利用碳强度预测动态调节硬件功率阈值;引入多量化模型在不同能耗状态下切换,保障响应速度。该方案突破了现有静态优化和离线调度的限制,为边缘AI的绿色部署提供了新思路。

新颖性

本研究首次将实时碳强度预测融入边缘LLM的动态调度中,结合多模型量化策略实现能耗与性能的兼顾。与传统只关注性能或静态调度的方案不同,CarbonCall实现了环境感知的自适应调节,显著优于现有的碳感知调度和工具筛选技术,具有较强创新性。

局限性

  • 系统依赖于准确的碳强度预测模型,若预测偏差较大,可能影响调度效果。
  • 模型量化带来一定的调用误差,复杂任务中可能影响调用准确率。
  • 在极端低功耗模式下,响应时间和模型准确性可能受到限制,需进一步优化模型切换策略。

未来方向

未来将结合多模态信息提升碳强度预测精度,探索更细粒度的硬件调度策略。还计划引入强化学习优化调度决策,以实现更智能的能耗管理。此外,将扩展到多设备协同与云边协作场景,推动绿色大模型在实际边缘应用中的落地。

AI 总览摘要

随着大规模语言模型(LLMs)在边缘计算中的广泛应用,能耗和碳排放成为亟待解决的核心问题。传统优化方案多关注性能提升,忽视环境影响,导致在能耗受限的边缘设备上难以实现绿色部署。本文提出的CarbonCall框架,融合动态工具筛选、碳感知调度与模型量化技术,为边缘端LLM的绿色运行提供了创新解决方案。

CarbonCall的核心思想是:利用向量检索和交叉编码器实现高效工具筛选,确保调用的准确性;结合实时碳强度预测,动态调节设备功率阈值,减少碳排放;采用多级量化模型,在不同能耗状态下切换,兼顾响应速度与能效。这一策略在NVIDIA Jetson AGX Orin平台上经过多轮实验验证,显示出显著优势:碳排放降低52%,能耗减少30%,响应时间缩短30%,同时保持较高的tokens/sec吞吐率。

该方法不仅在实际边缘设备上实现了绿色优化,还为未来智能边缘AI的可持续发展提供了技术基础。通过环境感知调度,CarbonCall实现了在不同碳强度环境下的自适应调节,有效应对能源结构变化带来的挑战。未来,结合强化学习和多设备协同,将进一步推动绿色AI的普及,助力实现碳中和目标。

深度分析

研究背景

近年来,边缘计算与大模型的结合推动了智能应用的快速发展。代表性工作如Gorilla、LiS等提出了工具筛选和调度优化方案,但多局限于性能优化,缺乏环境感知能力。随着AI应用对响应速度和能效的双重要求提升,绿色边缘AI成为研究热点。已有研究在模型压缩、硬件调度等方面取得一定进展,但多未结合实时碳排放信息,难以实现真正的可持续运行。

核心问题

边缘设备受限于功耗和计算资源,执行大模型时能耗高、碳排放大,难以满足绿色发展的需求。现有优化多为静态调节或离线策略,缺乏实时环境感知,导致碳足迹难以控制。此外,模型调度与工具筛选的效率和准确性不足,影响系统整体性能和环保目标的实现。这些问题制约了大模型在边缘端的广泛应用。

核心创新

本研究提出了:1)结合向量检索与交叉编码器的动态工具筛选机制,提升筛选效率与准确性;2)引入碳强度预测模型,实时调节硬件功率,实现碳感知调度;3)采用多级模型量化策略,在低功耗状态下保持响应速度。该方案突破了传统静态调度的局限,实现了环境感知与模型调度的深度融合,为绿色边缘AI提供了新思路。

方法详解

  • �� 利用句子变换器(如SBERT)将用户请求和工具描述映射到高维空间,快速检索相关工具;• 采用FAISS进行快速相似度搜索,筛选出候选工具集;• 通过交叉编码器(如BERT-based)对候选工具进行深度重排序,确保筛选准确;• 根据实时碳强度预测(基于历史数据和天气模型)调节设备最大功率阈值,动态切换硬件配置;• 引入多级模型量化(Q8、Q4K M),在不同能耗状态下切换模型版本,保证响应速度与能效平衡;• 监控系统吞吐率(TPS),在TPS下降时切换到更低精度模型,确保系统稳定性。

实验设计

在NVIDIA Jetson AGX Orin平台上,使用BFCL和GeoEngine基准测试多场景功能调用,评估碳排放、能耗、响应时间和吞吐率。比较方法包括默认方案、Gorilla、LiS等,采用多天连续运行,模拟实际环境中的碳强度变化。关键指标包括平均延迟、能耗、每秒处理的tokens数及碳排放量,验证系统在不同碳强度和能耗限制下的性能表现。

结果分析

实验显示,CarbonCall在多场景下实现了最高52%的碳排放降低、30%的能耗节省和30%的响应时间缩短。与基线方案相比,碳排放显著减少,吞吐率保持在较高水平。模型切换和调度策略有效应对碳强度波动,确保在高碳环境下减排,在低碳环境下提升性能。这些结果验证了系统在绿色边缘AI中的实用性和优越性。

应用场景

该技术适用于智能边缘设备如无人机、智能摄像头、工业传感器等,帮助企业实现低碳运营。未来可扩展到多设备协同和云边一体化场景,推动绿色AI在智慧城市、工业自动化等领域的应用,助力碳中和目标的实现。

局限与展望

系统依赖于碳强度预测的准确性,预测偏差可能影响调度效果;模型量化在复杂任务中可能引入误差,影响调用准确性;在极低功耗状态下,响应速度和模型效果可能受限,需进一步优化调度策略和模型切换机制。

通俗解读 非专业人士也能看懂

想象你在一个工厂里工作,工厂每天都要生产不同的产品。为了节省能源和减少污染,工厂会根据当天的能源供应情况调整生产速度和使用的机器。有时候能源很充裕,工厂会用最快的机器,生产效率高;有时候能源紧张,工厂就会用节能的机器,生产变慢,但更环保。这个工厂还会根据天气和能源供应的变化,自动调整机器的工作状态,确保既不浪费能源,又能按时完成任务。CarbonCall就像这个智能工厂,能根据环境变化智能调节机器的工作方式,既保证效率,又保护环境。

简单解释 像给14岁少年讲一样

你知道吗,就像我们用手机玩游戏,有时候电池快没电了,我们会把游戏调低画质,省点电,虽然画面变差了,但能用更久。类似的,CarbonCall会根据电力的环保程度,自动调节电脑的工作速度和用的模型的精度。当天如果用的电来自很多清洁能源,它会让电脑跑得快点,效果好一些;如果电来自煤炭等污染大源,它就会让电脑用低点的模型,少点能耗,减少污染。这样一来,不管外面能源怎么变,电脑都能既快又环保,就像我们聪明地调节手机一样!

原文摘要

Large Language Models (LLMs) enable real-time function calling in edge AI systems but introduce significant computational overhead, leading to high power consumption and carbon emissions. Existing methods optimize for performance while neglecting sustainability, making them inefficient for energy-constrained environments. We introduce CarbonCall, a sustainability-aware function-calling framework that integrates dynamic tool selection, carbon-aware execution, and quantized LLM adaptation. CarbonCall adjusts power thresholds based on real-time carbon intensity forecasts and switches between model variants to sustain high tokens-per-second throughput under power constraints. Experiments on an NVIDIA Jetson AGX Orin show that CarbonCall reduces carbon emissions by up to 52%, power consumption by 30%, and execution time by 30%, while maintaining high efficiency.

cs.PF cs.AI eess.SY