DiagramNet: An End-to-End Recognition Framework and Dataset for Non-Standard System-Level Diagrams
提出DiagramNet,结合多阶段训练和多智能体工作流,实现系统级电路图自动识别,显著优于现有模型。
核心发现
方法论
本文提出基于多阶段训练和解耦多智能体的端到端识别框架。利用DiagramNet数据集,结合检测、连接预测和问答任务,设计逐步训练流程,包括监督微调、强化学习和LoRA微调。多智能体工作流将感知、推理和知识阶段分离,提升复杂视觉推理能力。核心算法包括YOLOv11-nano目标检测、基于3B参数的视觉语言模型(VLM)进行关系预测,以及基于奖励机制的强化学习优化连接和推理精度。
关键结果
- 在DiagramNet基准测试中,结合3B模型和多智能体工作流的系统整体性能超过2025 EDA Elite冠军,端到端评估得分达0.671,优于GPT-5、Claude-Sonnet-4和Gemini-2.5-Pro两倍以上。
- 模型在仅用60张图像进行检测器适应后,成功迁移到AMSBench,达成零样本连接推理,与GPT-5和Claude-Sonnet-4表现相当,超越AMS现有最优Netlistify。
- 多智能体工作流在不同模型中均显著提升任务表现,Gemini-2.5-Pro提升128.7倍,GPT-5提升12.4倍,验证其模型无关性和泛化能力。
研究意义
该研究填补了系统级电路图自动理解的空白,提供了高质量多模态数据集和创新的多智能体推理架构,为电子设计自动化(EDA)中的图像理解和知识推理开辟新路径。其突破性方法不仅提升识别精度,也为未来复杂图形的自动分析提供了技术基础,有望推动芯片设计流程的智能化升级。
技术贡献
提出系统层级图像识别的层次化任务划分,结合多阶段训练策略,创新性引入解耦多智能体架构,有效解决符号多样性、隐性连接和数据稀缺问题。并设计了基于奖励机制的强化学习优化流程,显著提升关系推理和连接识别能力,超越现有单一模型端到端性能。
新颖性
首次构建面向系统级电路图的多模态数据集,涵盖连接、定位、识别和问答四大任务。提出多智能体工作流将复杂视觉推理拆解为感知、推理和知识阶段,结合多任务训练和强化学习,突破符号多样性和隐性连接的识别难题,显著优于传统端到端模型。
局限性
- 模型在极端复杂布局或符号极度非标准化场景下仍存在识别困难,主要由于符号多样性和连接模糊。
- 训练依赖大量标注数据,虽然迁移效果良好,但在极少样本条件下性能仍有限。
- 推理过程较为复杂,计算成本较高,实际应用中需优化推理效率。
未来方向
未来将结合自监督学习和更大规模的多模态数据,提升模型对极端复杂场景的鲁棒性。探索更高效的推理架构,降低计算成本,并将模型扩展到更广泛的电路设计任务和其他技术图示理解中,推动工业应用落地。
AI 总览摘要
系统级电路图作为芯片架构的蓝图,承载着模块功能、数据流和接口协议的关键信息。传统识别方法受限于符号非标准化和缺乏结构化数据,难以实现自动化理解。本文提出的DiagramNet框架,结合创新的数据集和多阶段训练策略,突破了这一瓶颈。
通过构建包含10,977个连接关系和15,515个链式推理问答的多模态数据集,研究者设计了层次化任务划分,将复杂视觉推理拆解为感知、关系推断和知识推理三个阶段。核心技术包括基于YOLOv11的目标检测、多模态视觉语言模型(VLM)关系预测,以及强化学习奖励机制优化连接识别。
在实际实验中,结合3B参数模型的多智能体工作流显著优于2025年EDA精英挑战赛冠军,端到端性能达0.671,超越GPT-5、Claude-Sonnet-4等多模态模型两倍以上。模型迁移到AMSBench,凭借少量数据实现零样本连接推理,表现与行业领先模型相当,超越现有最优方法Netlistify。
此研究不仅提升了系统级电路图的自动理解能力,也为电子设计自动化提供了强有力的技术支撑。未来,结合更大规模数据和更高效的推理架构,有望推动芯片设计的智能化、自动化进程,极大缩短设计周期,降低成本,推动行业创新。
深度分析
研究背景
随着芯片设计复杂度不断提升,系统级电路图成为芯片架构的核心表达形式。传统识别方法多依赖符号模板和规则,难以应对符号多样性和隐性连接问题。近年来,深度学习和多模态模型在图像理解和知识推理方面取得突破,但缺乏针对系统级图的高质量数据集,限制了自动识别技术的发展。现有的电路图数据集多局限于标准化的模拟电路,缺乏多层次、多任务的标注,难以满足复杂场景的需求。
核心问题
核心挑战在于系统级电路图符号多样、连接隐晦、语义层次丰富且数据稀缺。符号非标准化导致模板匹配困难,隐性连接增加关系推断难度,缺少结构化数据限制模型训练效果。如何在复杂图像中准确识别符号、推断连接关系并理解语义,成为亟待解决的问题。这不仅关系到芯片设计自动化,也影响到工业界的效率提升。
核心创新
提出层次化任务划分,将识别拆解为符号识别、空间定位、连接预测和语义问答,增强模型理解能力。构建多模态数据集,涵盖丰富连接和推理任务,填补行业空白。引入多智能体架构,将感知、推理和知识阶段解耦,提升复杂关系的推断能力。结合强化学习优化连接关系,显著提升模型在复杂场景中的表现。这些创新共同推动系统级电路图自动理解迈入新阶段。
方法详解
- �� 构建多模态数据集,结合专家标注和自动预标注,涵盖连接、定位、识别和问答任务。
- �� 设计多阶段训练流程:
- 监督微调:基于结构化标注进行多任务训练。
- 强化学习:利用奖励机制优化连接和推理。
- LoRA微调:实现模型任务适应性增强。
- �� 多智能体工作流:
- 感知智能体:使用YOLOv11检测符号位置。
- 推理智能体:基于3B模型预测连接关系。
- 知识智能体:加载任务特定知识,回答复杂问答。
- �� 训练过程中结合奖励函数,优化连接准确率、关系推断和问答性能。
实验设计
在DiagramNet基准上进行评估,比较多模型、多任务和迁移能力。采用指标包括F1、IoU、连接识别准确率和问答正确率。实验设计包括不同模型(如Qwen2.5-VL、GPT-5)和不同训练策略(微调、强化学习、LoRA微调)。通过消融实验验证多智能体架构的贡献,分析不同阶段训练对性能的影响。测试迁移到AMSBench,验证模型的泛化能力。
结果分析
模型在DiagramNet上整体得分达0.671,优于行业领先方法。结合多智能体工作流,Gemini-2.5-Pro提升128.7倍,GPT-5提升12.4倍。迁移到AMSBench,实现零样本连接推理,表现与GPT-5、Claude-Sonnet-4相当,超越Netlistify。多任务训练和强化学习显著改善关系推断和符号识别能力,验证了架构的有效性。
应用场景
该技术可应用于芯片设计自动化、电子工程教育、复杂电路图分析等场景。只需少量标注数据,即可实现高精度识别,降低人工成本。未来可结合工业流程,推动芯片设计的智能化和自动化,缩短开发周期,提升设计效率。
局限与展望
模型在极端复杂布局或符号极度非标准化场景下仍存在识别困难,主要由于符号多样性和连接模糊。训练依赖大量标注数据,迁移效果有限。推理过程较复杂,计算成本较高,实际应用中需优化效率。未来需增强模型鲁棒性,降低计算成本。
通俗解读 非专业人士也能看懂
想象你在一家工厂里,工厂里有许多不同的机器和管道。这些机器代表不同的功能模块,管道代表它们之间的数据流。工厂的设计图就像系统级电路图,告诉你哪些机器连接在一起,怎么工作。传统方法就像用模板匹配,只能识别一些标准的机器,但工厂里有各种不同的设备和连接方式,难以一一匹配。本文提出一种智能系统,像一个聪明的工厂管理员,能看懂各种不同的机器和管道,自动识别它们的连接关系。它通过学习大量不同工厂的设计图,逐步掌握识别技巧,最终能在新工厂的图纸上快速找到所有机器和连接。这个方法大大提高了工厂设计图的自动理解能力,让工厂的自动化管理变得更智能、更高效。
简单解释 像给14岁少年讲一样
想象你在玩一个超级复杂的拼图游戏,拼图上有很多不同的碎片,有的代表不同的机器,有的是连接线。以前的拼图软件只能识别一些标准的碎片,遇到特别的碎片就认不出来。而现在,这个新方法像一个聪明的朋友,能看懂各种不同的碎片和线条,帮你把拼图拼得更快更准。它先用一个“眼睛”找到所有碎片的位置,再用“脑袋”推断哪些碎片应该连接在一起,最后用“知识”确认拼图的完整性。这个朋友学了很多拼图的技巧,能在不同的拼图上都表现出色。这样一来,拼图变得简单多了,你可以专注于玩乐,而不用担心拼错。它让复杂的电路图变得像拼图一样容易理解,未来可以帮工程师们更快设计芯片,节省时间和精力!
原文摘要
System-level diagrams encode the architectural blueprint of chip design, specifying module functions, dataflows, and interface protocols. However, non-standardized symbols and the scarcity of structured training data hinder existing multimodal large language models (MLLMs) from recognizing these diagrams. To address this gap, we introduce DiagramNet, the first multimodal dataset for system-level diagrams, comprising 10,977 connection annotations and 15,515 chain-of-thought QA pairs across four tasks: Listing, Localization, Connection, and Circuit QA. Building on this dataset, we propose a progressive training pipeline together with a decoupled multi-agent workflow that decomposes complex visual reasoning into Perception, Reasoning, and Knowledge stages. On the DiagramNet benchmark, integrating our 3B-parameter model with the proposed workflow surpasses the 2025 EDA Elite Challenge winner and outperforms GPT-5, Claude-Sonnet-4, and Gemini-2.5-Pro by over 2x in end-to-end evaluation. Notably, the workflow generalizes beyond our model, boosting Task 1 performance by 128.7x for Gemini-2.5-Pro and 12.4x for GPT-5. Furthermore, with only 60 images for detector adaptation, the method transfers effectively to AMSBench, achieving zero-shot connectivity reasoning on par with GPT-5 and Claude-Sonnet-4 while surpassing the AMS state-of-the-art method Netlistify.