Bridging the Last Mile of Circuit Design: PostEDA-Bench, a Hierarchical Benchmark for PPA Convergence and DRC Fixing

TL;DR

提出PostEDA-Bench,包含145个任务,评估LLM在DRC修复与PPA优化中的表现。

cs.AR 🔴 高级 2026-05-08 43 次浏览
Pengju Liu Nuo Xu Jinwei Tang Yu Cao Caiwen Ding
EDA LLM DRC修复 PPA优化 基准测试

核心发现

方法论

本文构建了层级化的PostEDA-Bench基准,涵盖DRC-Essential、DRC-Reasoning、PPA-Mono和PPA-Multi四类任务,利用开源(OPENROAD)和商业(DC+INNOVUS)工具链进行评估。采用多模型、多代理架构(ReAct、Proposer-Critic、ORFS-Agent等),结合视觉增强技术,测试模型在合成与实际电路中的DRC修复和多目标PPA调优能力。通过机器可检验的评价指标(成功率、VRR、NIS)量化性能。

关键结果

  • 在合成DRC-Essential和单目标PPA-Mono任务中,模型表现较好,成功率最高达85.50%和64.56%;但在实际残余DRC修复(DRC-Reasoning)和多目标PPA优化(PPA-Multi)中,成功率显著下降,最高仅36.66%和20.00%。
  • 引入视觉增强显著提升DRC任务表现,尤其在复杂布局中,成功率提升约10-15%;而多目标调优中,模型在平衡多指标方面存在明显瓶颈,表现为负的NIS值。
  • 模型在几何推理和多目标权衡方面的能力不足,尤其在交互修复链和约束折中中表现欠佳,反映出当前LLM在复杂电路后端任务中的局限性。

研究意义

该研究填补了现有基准缺失DRC修复能力评估的空白,为后EDA阶段的自动化提供了量化工具。通过层级任务设计,揭示了模型在几何推理、约束折中和多目标优化中的瓶颈,为未来智能EDA工具的发展提供理论基础和实践验证,有望推动自动化设计的智能化升级,缩短芯片设计周期,降低成本。

技术贡献

提出层级化的PostEDA-Bench,结合多任务、多模型、多工具链的评估框架,创新性地引入视觉增强和多目标折中分析。设计了涵盖合成、布局、几何推理、约束修复的多层任务体系,提供了系统性评估平台。实现了基于机器可检验的自动化评价流程,推动了LLM在复杂EDA后端任务中的应用研究。

新颖性

首次系统性构建涵盖DRC修复与PPA调优的层级化基准,结合多模态输入和多目标折中分析,突破了现有单一任务或工具链的限制,提供了更贴近实际芯片设计场景的评估平台。这一框架为后EDA自动化提供了全面、细粒度的性能指标,是领域内的创新突破。

局限性

  • 模型在几何推理和多目标折中方面表现不足,特别是在复杂交互修复链中成功率偏低,反映出模型对几何关系和约束权衡理解的局限。
  • 评估依赖特定工具链(OPENROAD、DC+INNOVUS),在不同工具环境下的泛化能力尚未验证,且部分任务对硬件资源需求较高。
  • 当前方法主要关注后端修复与调优,尚未充分结合前端设计自动化,未来需整合全流程优化能力。

未来方向

未来将拓展多模态输入(如3D布局、工艺信息)以增强模型理解能力,结合强化学习优化多目标折中策略,提升几何推理和约束处理的鲁棒性。同时,计划引入更多真实工业设计案例,验证模型在实际芯片开发中的应用潜力,推动自动化设计向更高层次智能化迈进。

AI 总览摘要

芯片设计的最后一公里,常被称为“尾端”优化,涉及修复残留的设计规则检查(DRC)违规和满足功耗、性能、面积(PPA)目标。传统工具虽然高效,但在复杂布局和多目标折中中表现有限。本文提出了PostEDA-Bench,一个层级化的评估平台,包含145个任务,覆盖DRC修复和PPA调优的不同难度层次。

该基准通过结合合成布局、实际布局、几何推理和多目标折中任务,系统性地评估大语言模型(LLM)在后端自动化中的能力。采用多模态输入(包括布局图像)和多模型架构(ReAct、Proposer-Critic、ORFS-Agent),在开源(OPENROAD)和商业(DC+INNOVUS)工具链上进行测试。

实验结果显示,模型在合成和单目标任务中表现良好,成功率最高达85.50%和64.56%;但在实际残余违规修复和多目标折中中,成功率显著下降,最高仅36.66%和20%。引入视觉增强后,DRC任务性能提升明显,说明多模态输入有助于几何推理。

此外,模型在多目标折中任务中表现出明显瓶颈,尤其在平衡多个指标时出现负的NIS值,反映出当前LLM在复杂几何和约束折中中的不足。该研究强调了自动化芯片设计中智能模型的潜力与挑战,为未来智能EDA工具的发展提供了理论基础和实践验证。

整体而言,PostEDA-Bench为后端设计自动化提供了一个全面、细粒度的评估平台,推动了AI在芯片制造中的深度融合,预示着未来芯片设计将更趋智能化、自动化。

深度分析

研究背景

芯片设计流程经历从前端RTL编码到后端版图布局的多个阶段,近年来,自动化工具如Cadence Innovus、Synopsys Design Compiler极大提升了设计效率。早期研究集中在逻辑合成、布局优化,代表工作如OpenROAD、RePlAce等。随着规模扩大和工艺复杂度提升,设计规则检查(DRC)成为确保制造可行性的关键环节。尽管如此,残留违规仍需人工修复,且多目标PPA优化依赖大量调参,效率低下。近年来,LLM在代码生成、自动推理中展现潜力,逐渐被引入EDA后端任务,推动自动化向智能化迈进,但缺乏系统化评估平台。

核心问题

当前后端设计自动化面临两大难题:一是残余DRC违规的自动修复困难,涉及复杂几何关系和多层次规则理解;二是多目标PPA优化中的折中策略难以自动实现,模型难以平衡性能、功耗和面积的竞争关系。这些问题严重制约自动化设计的普及和效率提升,尤其在复杂布局和工艺节点下,传统算法难以应对多维约束的交互影响。

核心创新

本文提出层级化的PostEDA-Bench,创新点包括:1)多层任务设计,涵盖合成布局、实际布局、几何推理和多目标折中,模拟真实设计场景;2)引入多模态输入(布局图像),增强模型对几何关系的理解;3)结合多模型架构(ReAct、Proposer-Critic、ORFS-Agent),提升任务适应性和探索能力;4)机器可检验的自动评价体系,确保评估的客观性和可重复性。这些创新突破了现有单一任务、单一工具链的局限,为后端自动化提供了全面的技术支撑。

方法详解

  • �� 构建层级任务体系:包括DRC-Essential、DRC-Reasoning、PPA-Mono和PPA-Multi,分别测试规则理解、几何推理、单目标和多目标优化能力。
  • �� 数据采集:从公开RTL源(RTLLM、VERILOGEVAL-Human、OPENCORES)筛选设计,映射到ASAP7工艺库,确保符合规模和可审计标准。
  • �� 任务设计:利用合成布局、实际布局、违规注入和多目标折中策略,生成多样化测试案例。
  • �� 模型评估:采用多模态输入(布局图像、文本提示),结合ReAct、Proposer-Critic、ORFS-Agent等架构,在开源和商业工具链上进行多轮测试。
  • �� 评价指标:成功率(SR)、违规减免率(VRR)、归一化改进分(NIS)等,确保全面衡量模型性能。

实验设计

实验在OpenROAD和DC+INNOVUS工具链上进行,涵盖145个任务,分为DRC修复和PPA调优两个大类。模型包括GPT-5、Gemini-3-Flash、DeepSeek-V3.2等多种架构。每个任务重复5次,采用温度0的生成策略,统计成功率和VRR。还进行了多模态输入的对比实验,验证视觉增强的效果。通过不同难度层次(L1-L3)分析模型在规则理解、几何推理和交互修复中的表现差异。

结果分析

模型在合成布局和单目标任务中表现优异,成功率最高达85.50%(DRC-Essential)和64.56%(PPA-Mono);但在实际布局残余违规(DRC-Reasoning)和多目标折中(PPA-Multi)中,成功率下降至36.66%和20%。引入视觉输入后,DRC任务成功率提升10-15%,验证了多模态输入的有效性。多目标任务中,模型在平衡指标方面表现出明显瓶颈,出现负的NIS值,反映出模型在几何推理和约束折中中的不足。

应用场景

该平台可用于芯片设计公司评估自动化工具的智能水平,提升DRC修复和PPA调优的效率。未来可结合全流程设计优化,推动自动化设计向更高层次智能化发展,缩短芯片开发周期,降低成本。对于研究机构,该基准提供了系统化的评估工具,推动AI在EDA中的深度应用。

局限与展望

模型在几何推理和多目标折中方面仍存在明显不足,尤其在复杂布局和交互修复链中成功率偏低。评估依赖特定工具链,泛化能力有限。未来需增强模型的几何理解和多目标策略,降低对硬件资源的依赖,提升实际工业应用的适应性。

通俗解读 非专业人士也能看懂

想象你在厨房做菜,厨房里有很多不同的任务:准备食材、调味、烹饪、摆盘。每一步都需要按照一定规则操作,否则菜就做不好。现在,假设你有一个聪明的机器人助手,它可以帮你检查每一步是否符合规则,还能帮你调整调料的用量,确保菜的味道、色泽和份量都达标。

这个机器人就像论文中的模型,它要在复杂的厨房环境中,理解各种规则(DRC)和目标(PPA),比如菜要不太咸、不太淡、色泽鲜亮。它需要不断学习和调整,才能帮你做出完美的菜。论文提出了一个测试平台,让我们可以评估这个机器人在不同任务中的表现,从简单的规则修复到复杂的多目标平衡。就像厨房里,机器人要学会在保持菜的味道的同时,还能控制成本和时间。这项工作让我们离让厨房自动化更进一步,未来厨房可能会由智能机器人全权管理,帮我们做出更好吃、更健康的菜。

简单解释 像给14岁少年讲一样

想象你在学校的美术课上画画,你需要按照老师的要求画出漂亮的画,但有时候会出现一些错误,比如颜色不对或者线条不够漂亮。你有一个聪明的朋友,他可以帮你检查画作,指出哪里画得不对,还能帮你修正。这个朋友就像论文里的模型,它要在复杂的芯片设计中,检查布局是否符合规则,还要帮忙调整参数,让芯片既快又省电。

这个模型在测试平台上接受各种任务,比如修复布局中的违规,或者在性能和功耗之间找到最佳平衡。它就像你的朋友一样,学习了很多规则和技巧,试图帮你画出最完美的画。虽然它在简单任务上表现不错,但在复杂的设计中还会遇到困难,比如要同时考虑多个目标,做出折中。这个研究让我们知道,未来的芯片设计可能会由这些聪明的模型帮忙,大大提高效率,减少错误。

术语表

Design Rule Check (DRC) 设计规则检查

一种验证芯片布局是否符合制造工艺规则的方法,确保布局的可制造性。

论文中用于检测芯片布局违规的关键步骤。

Power-Performance-Area (PPA) 功耗-性能-面积

芯片设计中的三个核心指标,需在设计中权衡优化。

模型在PPA目标下进行调优的任务目标。

Multi-modal Input 多模态输入

结合多种数据类型(如图像和文本)以增强模型理解能力的方法。

引入布局图像以改善几何推理表现。

Pareto Front 帕累托前沿

多目标优化中,无法在不牺牲某一目标的情况下改善其他目标的解集。

用于多目标PPA折中任务的目标点选择。

VRR 违规减免率

衡量模型在修复违规后违规减少比例的指标。

评价DRC修复效果的重要指标。

开放问题 这项研究留下的未解疑问

  • 1 模型在复杂几何关系和多目标折中中的理解能力仍不足,特别是在多层交互修复链中表现欠佳,未来需结合强化学习和多模态信息提升模型鲁棒性。

应用场景

近期应用

芯片设计自动化评估

为芯片设计公司提供一套系统化评估工具,检测AI模型在DRC修复和PPA调优中的实际能力,提升设计效率和质量。

EDA工具集成测试

帮助工具开发者验证新算法在复杂布局和多目标环境中的表现,为工业应用提供决策依据。

远期愿景

全流程智能芯片设计

未来模型将整合前端、后端,实现从RTL到版图的全自动化设计,极大缩短开发周期。

原文摘要

LLM-based agents are increasingly applied to the "last mile" of Electronic Design Automation (EDA): repairing residual sign-off Design Rule Check (DRC) violations and converging Power-Performance-Area (PPA) targets after tool runs. Existing EDA-LLM benchmarks, however, omit DRC fixing entirely and rely on flat hierarchies tied to a single toolchain. We introduce PostEDA-Bench, a hierarchical benchmark with 145 tasks across DRC-Essential, DRC-Reasoning, PPA-Mono, and PPA-Multi, supported by EDA toolchains with machine-checkable evaluation. Across eight commercial and open-source LLMs under multiple agent scaffolds, we find that agents handle synthetic DRC-Essential and single-objective PPA-Mono reasonably well but degrade sharply on the more practical DRC-Reasoning, where the best success rate is 36.66%, and PPA-Multi, where the best success rate is 20.00%; vision augmentation consistently enhances DRC-Bench; and trade-off reasoning, rather than knob knowledge, is the dominant PPA-Multi bottleneck.

cs.AR cs.AI cs.MA