核心发现
方法论
PowerChain把配电网任务表示为有向无环图(DAG)工作流:节点是工具调用及参数,边表示依赖。系统由编排器O与验证器V构成,利用三类结构化上下文——工具描述符Δ、专家标注且已验证的工作流-任务对Wv、以及错误反馈历史H——驱动LLM迭代生成、执行、纠错。它还用余弦相似度做Wv子集选择,并基于工具退出字符串形成可追踪的自我校验闭环。
关键结果
- 在真实公用事业数据上,PowerChain对复杂自然语言DG任务的表现较基线最高提升约144%。作者同时报告,pass@1绝对提升约0.04–0.29,折合相对增益约10%–60%;precision绝对提升约0.07–0.47,折合相对增益约30%–200%。
- 在Vermont Electric Cooperative(VEC)的真实馈线与AMI数据上,系统能自动完成三类任务:三相稳态潮流、动态Hosting Capacity(DHC,含ℓ1/ℓ2/ℓ∞削减形式)和电流不可行性分析,且在所有LLM与所有任务上都优于非结构化RAG基线。
- Wv子集选择不是简单检索,而是先用LLM扩写查询与示例,再用sentence-transformer嵌入和cosine similarity排序,保留Top-X示例即可获得更高准确率和更低token成本;作者强调其在轻量开源模型(如Qwen3 8b)上也能运行。
研究意义
这项工作把“会聊天的模型”推进到“能执行并自证正确的分析代理”。对配电网而言,过去许多关键分析依赖专家手工编排脚本、数据管线和求解器调用,尤其在农村合作社和市政公用事业中,人员与预算不足使规模化分析几乎不可行。PowerChain提供了一个可迁移、可本地部署、可验证的替代路径,使自然语言问题可被转化为可执行工作流,并通过工具级验证减少幻觉和错误传播。
技术贡献
技术上,PowerChain的关键贡献是把agentic workflow automation引入专家级配电网分析,并把“验证”从最终答案扩展到整条路径。它用MCP风格后端自动暴露经验证代码库中的工具,避免为每个任务手工设计模板;用动态上下文构建代替固定prompt;用错误上下文反馈形成build–verify–feedback–correct循环;再通过Wv优化子集选择平衡性能与token成本。与纯RAG或SFT相比,它更强调工具顺序、参数映射和可执行性,而非仅语义相似。
新颖性
新颖性主要在三点:一是面向配电网“未见过任务”的通用代理框架,而非单任务prompt方案;二是把专家验证轨迹作为结构化上下文,而不是大规模微调;三是把DAG工作流的中间步骤也纳入验证。相较于常见的web/code agent,这里处理的是三相不平衡潮流、DHC和不可行性分析等工程级任务。
局限性
- 论文主要展示基于真实VEC数据的任务,但公开信息中未给出完整基线表、每个任务的逐项数值和消融细节,因此对泛化边界的判断仍有限。
- 系统依赖高质量工具、专家标注轨迹和可执行代码库;若底层求解器、数据接口或网络模型本身不稳定,验证闭环会被放大为失败。
- 当前描述更偏向工作流生成与验证,尚未看到对极端异常场景、实时调度闭环或跨地区配电网迁移的系统性压力测试。
未来方向
作者指出的方向包括:进一步扩展专家标注工作流库,提升对子任务组合与新分析类型的覆盖;更系统地研究子集选择策略与成本-性能曲线;以及把PowerChain推广到更多自包含电力工具链和更复杂的在线分析场景。未来也可探索与更强的开源LLM、MCP生态及自动测试机制结合。
AI 总览摘要
在配电网迅速走向高渗透光伏、储能和电动汽车的背景下,电压越限、潮流反转和可接入容量评估等分析正变得更复杂。传统做法依赖专家手工拼接脚本、求解器和数据管线,既慢又贵;而现有LLM代理多半只适合“见过的题”,一旦面对新任务就容易失效。PowerChain试图把这一类工程分析变成可自动执行、可验证、可纠错的代理工作流。
它的核心不是简单检索答案,而是把任务组织成DAG工作流:编排器O读取自然语言问题、工具描述符Δ和专家验证示例Wv,生成候选工作流;验证器V实际调用工具并读取错误上下文;若失败,错误会回流给编排器,促使LLM重写路径,直到得到可执行的 his/hat workflow。系统还通过sentence-transformer嵌入和cosine similarity挑选最相关的Top-X示例,避免长prompt带来的噪声和token开销。论文展示的工具链包括fetch_ami、load_solar、load_network、init_model、add_constraints、add_objective、solve_model、update_voltages和check_voltage_violations。
实验基于Vermont Electric Cooperative(VEC)的真实馈线与AMI数据,覆盖三相稳态潮流、动态Hosting Capacity(DHC,含ℓ1、ℓ2、ℓ∞削减)和电流不可行性分析。作者报告,PowerChain相对基线在复杂DG任务上最高提升约144%;pass@1的绝对提升约0.04–0.29,precision的绝对提升约0.07–0.47,分别对应约10%–60%和30%–200%的相对增益。更重要的是,它在所有LLM与所有任务上都保持领先,并且可以在轻量开源模型如Qwen3 8b上本地部署。
深度分析
研究背景
分布式能源资源快速增长,使配电网从单向供电网络变成双向、动态、强耦合系统。运营侧要处理光伏波动、AMI负荷曲线、馈线不平衡和电压约束;规划侧则需要评估Hosting Capacity、韧性和扩容方案。过去相关分析依赖GridLAB-D、MATPOWER等工具,以及资深工程师手工搭建模型。已有工作尝试用LLM做电网仿真、太阳能预测和可视化,但多停留在固定prompt或单一任务上,难以泛化到未见任务。
核心问题
核心问题是:能否让一个工具增强的LLM代理,在没有为每个任务手工写模板的情况下,自动构造并执行配电网分析工作流?难点在于三相不平衡、电力求解器、数据接口和优化模块彼此异构;此外,工程任务没有像问答那样清晰的“对/错”标签,错误往往体现在中间步骤。若没有可验证机制,代理很容易生成看似合理、实则不可执行的流程。
核心创新
PowerChain的创新可概括为四层。第一,工作流DAG化:把分析视为工具调用序列及其依赖,而非单次回答。第二,专家轨迹结构化:用已验证的workflow-task pairs把工程知识压缩成可复用示例,替代大规模SFT。第三,动态筛选上下文:先扩写查询,再用嵌入相似度选Top-X示例,减少冗余。第四,错误驱动自纠:把工具返回的exit strings写入历史H,驱动LLM重试。与纯RAG相比,它提供可执行性;与SFT相比,它更轻量且更适合开放任务。
方法详解
- �� 任务输入:自然语言查询q,例如某时刻某馈线的L1-norm三相AC power flow infeasibility check。
- �� 上下文构建:将q与专家示例Wv、工具描述符Δ、历史Hk组合成Pk={q,Wv,Hk,Δ},再送入LLM生成wk。
- �� 工作流表示:wk=(V,C),其中V={(ti,Θi)},C表示依赖边;节点可包含fetch_ami、load_solar、load_network、init_model、add_constraints、add_objective、solve_model等。
- �� 执行与验证:验证器V按DAG路径执行工具,收集每步错误Yk=[y1k,...,ymk]。
- �� 反馈纠错:Hk+1=Hk⊕(wk,Yk),再用新历史重新提示LLM,直到产生可执行的 his/hat w。
- �� 示例选择:对Qv与q做LLM扩写,再用sentence transformer嵌入,按sim(q,qi^v)=cos(Mexp(q),Mexp(qi^v))排序,取Top-X组成Wsub_v。
- �� 实验后端:工具来自验证过的代码库和MCP式接口,面向真实VEC AMI、网络和光伏数据。
实验设计
实验使用Vermont Electric Cooperative(VEC)的真实配电馈线数据,配套工具包括fetch_ami(接入AMI服务器获取时序负荷)、load_solar(基于时间、地理位置和辐照估计光伏出力)、load_network(读取GeoJSON与GridLAB-D网络)。评测任务有三类:三相稳态潮流、Dynamic Hosting Capacity(ℓ1/ℓ2/ℓ∞削减)和current infeasibility analysis。对比对象包括非结构化RAG基线及不同LLM;指标覆盖pass@1、precision以及完整路径正确性。
结果分析
最重要的结果是:PowerChain在真实公用事业数据上对复杂DG任务最高提升约144%。作者还给出更细的区间:pass@1绝对增益0.04–0.29,对应约10%–60%相对提升;precision绝对增益0.07–0.47,对应约30%–200%相对提升。说明系统不仅“答对更多”,而且中间工作流更常正确。
应用场景
短期内,它可帮助小型公用事业、合作社和市政电力部门自动完成潮流校核、越限筛查和Hosting Capacity评估,减少对稀缺专家的依赖。中期看,它可嵌入规划与运营决策支持系统,把自然语言请求直接转为可审计的分析流程。由于支持本地开源模型,也适合对数据安全要求高的场景。
局限与展望
当前框架仍依赖高质量工具、专家轨迹和可验证代码库,因此覆盖不到的任务仍可能失败。它主要在离线分析场景中展示能力,对实时闭环控制、跨区域迁移和异常输入鲁棒性还缺少充分证据。另一个现实问题是,随着Wv增长,虽然子集选择能降成本,但示例库维护仍需要持续的人类专家投入。
通俗解读 非专业人士也能看懂
你可以把PowerChain想成一个会自己查资料、自己做、还会自己检查的电网“项目经理”。以前做一次配电网分析,就像要一位老师傅一边翻菜单、一边找锅铲、一边盯火候,还得记住每一步怎么做;人少、活多时,这就很难。PowerChain先看懂你的问题,再从一堆“做菜秘籍”里挑最相关的几条,然后按顺序把工具叫出来:先拿数据,再搭模型,再加限制,再求解,最后检查结果有没有越界。
如果中间哪一步出错了,它不会直接装作成功,而是把错误信息记下来,回头重新改流程,好比厨师发现盐放多了,就立刻重做这一步,而不是把菜端上桌。这样做的好处是,它不是只会背答案,而是真的能把一整套分析流程跑通。论文里它用的是Vermont Electric Cooperative的真实数据,所以不是玩具演示,而是接近真实工作环境。
更妙的是,它还会挑最有用的“参考案例”,避免把一大堆没用的例子一起塞进去。最后的效果是:更少的人工、更少的提示词、更高的成功率。对于电力公司来说,这意味着很多以前要靠专家熬夜完成的检查,未来可能只要一句自然语言就能启动。
简单解释 像给14岁少年讲一样
想象你在打游戏,队友不是只会说“我来帮你”,而是真的会看地图、开箱子、打Boss、还会复盘失误!PowerChain就有点像这种超级队友,不过它不是打怪,而是帮电网做分析。
以前做电网分析很像拼装一台复杂电脑:先找数据、再建模型、再调参数、再跑求解器,步骤一多就容易卡住。PowerChain把这些步骤变成一串“任务卡”,每张卡都是一个工具。它先看你的问题,再决定先做哪张卡、后做哪张卡。比如先把负荷和太阳能数据拉进来,再把网络搭好,再开始算电压有没有超标。
如果它发现自己走错了,比如工具报错了,它不会硬装没事,而是像游戏里“读档重来”一样,带着错误信息重新想办法。这样就更靠谱。论文里用的是Vermont Electric Cooperative的真实配电网数据,不是随便编的。结果也很强:最好的情况下,比基线提升大约144%。
所以,PowerChain的厉害之处不是“会说”,而是“会做、会改、还会检查”。如果以后电力公司想快速知道“这个地方能不能再接更多太阳能板?”、“这条线会不会超电压?”,这种系统就很像一个永远在线的电网助手!
术语表
DAG workflow(有向无环图工作流)
一种把任务拆成多个步骤并规定先后依赖关系的结构。用图来表示时,每个节点是一个工具调用,箭头表示先做谁、后做谁。
PowerChain把配电网分析表示为DAG,并在其上做生成、执行和纠错。
Tool descriptor(工具描述符)
对一个工具的结构化说明,通常包含工具名、参数集合和文本描述。它帮助LLM理解工具能做什么、怎么调用。
PowerChain把Δ加入提示词,提升工具选择和参数映射的准确性。
Verified workflow-task pair(已验证工作流-任务对)
由专家编写并验证正确的一组“自然语言任务+可执行流程”。它相当于高质量示例,让模型学习工程问题如何被拆解。
Wv是PowerChain的核心上下文来源之一。
Pass@1
模型第一次尝试就成功的比例。它衡量代理在不反复试错时的直接成功能力。
论文报告PowerChain在pass@1上绝对提升0.04–0.29。
Precision(精确率)
在所有被判定为正确或命中的结果中,真正正确的比例。对多步代理来说,它反映路径和动作是否可靠。
PowerChain在precision上绝对提升0.07–0.47。
开放问题 这项研究留下的未解疑问
- 1 尚不清楚PowerChain在更大规模、更多地区和更多厂商工具链上的迁移能力有多强。若工具接口、网络模型或数据质量变化明显,性能是否仍能稳定保持,论文未给出系统答案。
- 2 专家验证示例Wv很关键,但如何以最低人工成本持续扩充、更新并避免过拟合到少数典型场景,仍是开放问题。未来需要更自动化的示例构建与长期维护机制。
应用场景
近期应用
配电网自动分析助手
适合电力公司、合作社和咨询团队,用自然语言触发潮流、越限、Hosting Capacity和不可行性分析。前提是接入可信的AMI、网络和求解器工具链,输出可审计且可复现。
本地可部署的工程代理
适合对数据安全敏感的机构,在本地运行Qwen3 8b等开源模型,通过PowerChain调用内部工具完成分析,减少云端依赖并控制成本。
远期愿景
面向电网规划的“自动分析操作系统”
长期可把PowerChain扩展为统一分析层,把多类电力工具、数据源和验证器接成一个可组合平台,让自然语言逐步成为配电网工程工作的入口。
原文摘要
Rapid electrification and decarbonization are increasing the complexity of distribution grid (DG) operation and planning, necessitating advanced computational analyses to ensure reliability and resilience. These analyses depend on disparate workflows comprising complex models, function calls, and data pipelines that require substantial expert knowledge and remain difficult to automate. Workforce and budget constraints further limit utilities' ability to apply such analyses at scale. To address this gap, we build an agentic system PowerChain, which is capable of autonomously performing complex grid analyses. Existing agentic AI systems are typically developed in a bottom-up manner with customized context for predefined analysis tasks; therefore, they do not generalize to tasks that the agent has never seen. In comparison, to generalize to unseen DG analysis tasks, PowerChain dynamically generates structured context by leveraging supervisory signals from self-contained power systems tools (e.g., GridLAB-D) and an optimized set of expert-annotated and verified reasoning trajectories. For complex DG tasks defined in natural language, empirical results on real utility data demonstrate that PowerChain achieves up to a 144/% improvement in performance over baselines.