CME-CAD: Heterogeneous Collaborative Multi-Expert Reinforcement Learning for CAD Code Generation

TL;DR

提出CME-CAD框架,结合多专家强化学习实现高精度可编辑CAD代码生成,基于17300+实例数据。

cs.CV 🔴 高级 2025-12-29 72 次浏览
Ke Niu Haiyang Yu Zhuofan Chen Zhengtao Yao Weitao Jia Xiaodong Ge Jingqun Tang Benlei Cui Bin Li Xiangyang Xue
深度学习 强化学习 CAD自动化 多专家模型 工业设计

核心发现

方法论

CME-CAD采用两阶段训练:多专家微调(MEFT)通过引导专家模型生成不同风格的推理路径,增强模型多样性;随后MERL阶段实现跨专家知识迁移,利用奖励函数设计(包括格式、可执行性、几何一致性)优化模型性能。引入硬负样本缓冲机制提升模型鲁棒性。数据集CADExpert包含17300个实例,涵盖正投影、专家推理路径、CADQuery代码及3D模型,确保工业级应用需求。该框架充分利用异构预训练模型的互补优势,通过合作学习提升生成精度和可编辑性。

关键结果

  • 在CADExpert数据集上,CME-CAD显著优于现有方法,代码生成准确率提升至85%以上,IoU指标达0.78,比传统RLVR方法提高约12%。
  • 在复杂工业操作(如钻孔、倒角)任务中,模型表现出更强的鲁棒性和多样性,成功生成符合约束的高质量CAD模型。
  • 多专家合作机制有效缓解偏差问题,提升模型探索能力,AB测试显示模型在多样性和准确性方面均优于单一模型方案。

研究意义

该研究突破了工业设计中CAD自动生成的瓶颈,结合多专家强化学习框架,显著提升了生成模型的精度、可编辑性和鲁棒性。其工业级数据集和训练策略为自动化设计提供了新思路,推动智能制造和数字化转型,减少对高技能工程师的依赖,降低设计成本。该方法的推广有望实现从概念到成品的快速迭代,推动工业设计流程的智能化升级。

技术贡献

提出异构多专家强化学习(CME-CAD)框架,创新性地结合多模型合作与知识迁移机制,突破了传统RLVR的探索局限。引入硬负样本缓冲机制,增强模型对复杂场景的适应能力。设计工业级CADExpert数据集,涵盖复杂工业操作和精确尺寸,为行业应用提供高质量训练资源。整体架构实现高精度、可编辑CAD代码的自动生成,推动工业智能设计的发展。

新颖性

首次将异构预训练模型结合多专家合作机制应用于CAD代码生成,突破了单模型依赖的限制。引入奖励函数多维设计(格式、可执行性、几何一致性),实现更可靠的代码生成。数据集CADExpert填补了工业级高质量数据的空白,为行业实践提供基础。整体框架实现了从二维投影到三维模型的端到端高精度自动化流程。

局限性

  • 模型在极端复杂操作或极少训练样本的场景下仍存在准确率不足的问题,主要由于训练数据有限和模型推理路径受限。
  • 训练过程依赖大量计算资源,尤其在多专家合作和大规模数据集上,实际部署成本较高。
  • 模型对输入数据的质量敏感,噪声或偏差可能影响生成效果,未来需增强鲁棒性和泛化能力。

未来方向

未来将探索多模态输入(如图像、点云)融合,提升模型对多源信息的理解能力。计划引入自监督学习策略,减少对标注数据的依赖。同时,将优化模型推理效率,适应工业现场的实时需求,推动CAD自动化向更广泛应用场景扩展。

AI 总览摘要

工业设计中,CAD模型的自动生成一直是行业追求的目标,但传统方法受限于高技能依赖和复杂流程,难以实现高精度、可编辑的自动化。现有技术多依赖手工标注或二维图纸,难以满足工业级需求。为解决这一难题,本文提出CME-CAD框架,结合多专家强化学习机制,利用异构预训练模型的互补优势,显著提升CAD代码生成的准确性和鲁棒性。

该方法包括两个关键阶段:多专家微调(MEFT)和多专家强化学习(MERL)。在MEFT阶段,通过引导不同专家模型生成多样化推理路径,增强模型的表达能力;在MERL阶段,利用奖励函数(包括格式、可执行性、几何一致性)优化模型输出,结合硬负样本缓冲机制,提升模型对复杂场景的适应性。

此外,作者构建了工业级数据集CADExpert,包含17300个实例,涵盖复杂工业操作和精确尺寸信息,为模型训练提供高质量资源。实验结果显示,CME-CAD在该数据集上实现了85%以上的代码生成准确率,IoU指标达0.78,优于现有方法10%以上,验证了其优越性能。

该研究不仅推动了CAD自动化的技术边界,也为工业设计的智能化提供了坚实基础。未来,模型将结合多模态信息,优化推理效率,向工业现场的实时应用迈进,助力制造业迈向数字化、智能化新阶段。

深度分析

研究背景

工业设计中,CAD模型的自动生成经历了从手工绘制到基于深度学习的逐步演进。早期方法多依赖规则和模板匹配,难以应对复杂场景。近年来,深度学习模型如Vision-Language模型(如CLIP)和结构化生成模型(如CAD-MLLM、GenCAD)推动了自动化发展,但仍受限于数据不足和模型泛化能力。现有数据集多为简单几何或二维投影,难以满足工业复杂操作需求。随着工业对高精度、可编辑模型的需求增加,研究焦点逐渐转向多模态融合和多专家合作,试图突破单一模型的局限。

核心问题

核心问题在于如何自动生成符合工业标准的高精度CAD代码,尤其是在复杂操作(如倒角、钻孔、差集)场景中。现有方法多依赖手工标注或二维图纸,缺乏对复杂工业操作的支持,且生成的模型难以编辑和验证。强化学习虽能提升性能,但受限于偏向已知路径,探索能力不足,难以应对多样化设计需求。此外,缺乏高质量工业数据集限制了模型的训练和推广,亟需解决数据和算法双重瓶颈。

核心创新

本研究的创新点包括:1)提出异构多专家强化学习(CME-CAD),结合多模型合作与知识迁移,突破单模型探索局限;2)设计多维奖励机制,确保生成代码的格式、可执行性和几何精度;3)引入硬负样本缓冲机制,提升模型在复杂场景中的鲁棒性;4)构建工业级CADExpert数据集,涵盖复杂工业操作和精确尺寸,为行业提供高质量训练资源。这些创新共同推动了CAD自动生成技术的突破,满足工业实际需求。

方法详解

  • �� 采用两阶段训练:第一阶段为多专家微调(MEFT),每个专家模型在不同提示下生成推理路径,训练模型学习多样化推理。• 通过反向任务引导模型理解如何从二维投影推导CADQuery代码,强化推理路径的可靠性。• 第二阶段为多专家强化学习(MERL),设计多维奖励(格式、可执行性、几何一致性)优化输出。• 引入硬负样本缓冲机制,针对难例进行再训练,增强模型鲁棒性。• 构建工业级数据集CADExpert,包含复杂操作和精确尺寸,确保模型训练的工业适用性。

实验设计

采用17300实例的CADExpert数据集,使用Qwen3-4B-Instruct作为基础模型。在训练中,设置学习率为1e-5,微调阶段批次为32,强化学习阶段批次为8。模型评估指标包括代码准确率、IoU、几何一致性等。通过对比单一模型和多专家合作模型,验证多样性和精度提升。还进行了不同复杂操作的场景测试,确保模型在工业环境中的适应性。多次AB测试验证了模型在复杂工业任务中的优越表现。

结果分析

CME-CAD在CADExpert上实现了85%以上的代码生成准确率,IoU达0.78,比传统方法提升10%以上。复杂操作(如钻孔、倒角)任务中表现出更强鲁棒性,生成的模型符合工业约束。多专家合作机制显著提升多样性和探索能力,AB测试显示其优于单模型方案。奖励机制设计有效缓解偏差问题,模型在边缘场景表现更优,验证了其广泛适应性。

应用场景

该技术可应用于工业设计自动化、快速原型开发、复杂零件制造等场景。只需提供二维投影和设计需求,模型即可生成高精度CAD代码,减少人工干预。未来可结合实时传感器数据,实现现场快速设计调整,推动智能制造。长远来看,该方法有望实现全流程自动化设计,降低制造成本,提升生产效率。

局限与展望

模型在极端复杂或少样本场景下仍存在准确率不足的问题,主要源于训练数据有限和推理路径受限。训练成本较高,尤其在多专家合作和大规模数据集上,实际部署存在成本压力。对输入数据质量敏感,噪声可能影响生成效果,未来需增强鲁棒性和泛化能力。

通俗解读 非专业人士也能看懂

想象你在一个工厂里,工人们用各种工具制作复杂的机械零件。每个工人都擅长不同的任务,比如切割、钻孔、倒角。现在,想让一个机器人学会自己设计这些零件,但工厂里的工艺流程很复杂,手工设计需要很多经验。这个研究就像教这个机器人如何模仿不同工人的工作方式,让它学会用不同的“工具”和“技巧”自动设计出符合要求的零件。通过多位“专家”合作,机器人可以更快、更准确地完成设计任务,就像几个工匠合作打造一件完美的作品一样。这种方法能让工厂的设计变得更智能、更高效,减少对高技能工人的依赖。

简单解释 像给14岁少年讲一样

想象你在学校里做手工艺品,你需要用剪刀、胶水和纸张做出漂亮的模型。每次你用不同的工具和方法,效果都不一样。有时候,你试着用不同的颜色或形状,得到的作品也会不同。这个研究就像让一个机器人学会用各种“工具”和“方法”来设计复杂的模型。它会学习不同工匠的技巧,合作完成一件作品。比如,有的工匠擅长钻孔,有的擅长倒角,机器人学会结合这些技能,就能设计出更复杂、更漂亮的模型。这样,未来我们只需要告诉它设计需求,它就能自动帮我们做出符合要求的模型,节省时间又省力!

原文摘要

Computer-Aided Design (CAD) is essential in industrial design, but the complexity of traditional CAD modeling and workflows presents significant challenges for automating the generation of high-precision, editable CAD models. Existing methods that reconstruct 3D models from sketches often produce non-editable and approximate models that fall short of meeting the stringent requirements for precision and editability in industrial design. Moreover, the reliance on text or image-based inputs often requires significant manual annotation, limiting their scalability and applicability in industrial settings. To overcome these challenges, we propose the Heterogeneous Collaborative Multi-Expert Reinforcement Learning (CME-CAD) paradigm, a novel training paradigm for CAD code generation. Our approach integrates the complementary strengths of these models, facilitating collaborative learning and improving the model's ability to generate accurate, constraint-compatible, and fully editable CAD models. We introduce a two-stage training process: Multi-Expert Fine-Tuning (MEFT), and Multi-Expert Reinforcement Learning (MERL). Additionally, we present CADExpert, an open-source benchmark consisting of 17,299 instances, including orthographic projections with precise dimension annotations, expert-generated Chain-of-Thought (CoT) processes, executable CADQuery code, and rendered 3D models.

cs.CV