CADmium: Fine-Tuning Code Language Models for Text-Driven Sequential CAD Design

TL;DR

本研究提出CADmium,利用GPT-4.1生成高质量CAD描述,再用Qwen2.5-Coder实现文本到CAD序列的微调,显著提升自动化设计效率。

cs.GR 🔴 高级 2025-07-14 88 次浏览
Prashant Govindarajan Davide Baldelli Jay Pathak Quentin Fournier Sarath Chandar
AI CAD 大语言模型 文本生成 三维建模

核心发现

方法论

本文构建了一个包含17万多个CAD模型的高质量数据集,利用GPT-4.1生成符合人类表达习惯的几何描述,并采用LoRA微调Qwen2.5-Coder模型,使其能从自然语言生成JSON格式的CAD序列。方法核心在于将CAD设计转化为纯文本任务,结合几何和拓扑指标(如球形度、平均曲率和欧拉特征)进行模型评估。通过多模态输入提升描述的几何精度,避免传统自动标注的不足。模型训练采用AdamW优化器,结合混合精度和分布式训练,确保高效性和稳定性。

关键结果

  • 微调后模型在Text2CAD和Fusion360数据集上表现优异,生成的CAD模型Invalidity Ratio低于10%,在Chamfer Distance和F1指标上优于现有方法,且在结构几何指标如SD和DMCD上表现出更高的相似性(例如SD值降低至0.05,表明模型能更准确捕捉形状特征)
  • 新提出的几何和拓扑指标(如球形度差异和欧拉特征匹配)有效反映模型生成的结构质量,验证了模型在复杂几何形态上的优越性
  • 通过消融实验,发现使用GPT-4.1生成的描述在长度和多样性上优于传统自动标注,显著提升模型的泛化能力和描述的自然性

研究意义

该研究突破了文本引导CAD设计的瓶颈,将大规模预训练语言模型应用于复杂的三维建模任务,极大缩短设计周期,降低专业门槛。其提出的高质量标注策略和结构指标,为未来自动化设计和工业应用提供了坚实基础,有望推动智能制造、快速原型开发等领域的变革。

技术贡献

创新点在于将CAD生成任务完全转化为文本到文本的序列预测问题,利用GPT-4.1生成高质量描述,结合LoRA微调Qwen2.5-Coder实现从自然语言到CAD序列的高效映射。引入几何和拓扑指标,丰富模型评估体系,提升生成模型的结构理解能力。该方法避免了对复杂嵌入的依赖,充分利用预训练模型的泛化能力,推动了大模型在工程设计中的应用边界。

新颖性

本研究首次将大规模多模态生成模型GPT-4.1用于高质量CAD描述生成,并结合LoRA微调实现文本到CAD序列的端到端转换。提出的结构指标(如球形度、欧拉特征)为CAD模型评价提供了新的定量工具,显著优于传统点云和网格指标,展示了在工业设计自动化中的潜力。

局限性

  • 模型对复杂几何形状的描述仍存在一定局限,尤其在细节丰富或非标准结构中表现不足,部分生成模型可能出现拓扑错误或几何不闭合问题
  • 训练依赖大量高质量标注数据,数据采集和标注成本较高,且模型泛化到极端复杂场景时仍需优化
  • 模型推理速度在大规模应用中存在瓶颈,实时性和可扩展性仍需提升

未来方向

未来将探索多模态融合技术,结合视觉和触觉信息增强描述的几何细节,提升模型的泛化能力。同时,计划引入主动学习和人机交互机制,优化标注效率,推动模型在工业级应用中的落地。还将研究模型的可解释性和控制性,以实现更精准的设计引导。

AI 总览摘要

本研究旨在突破传统CAD设计的手工繁琐局限,提出一种基于大规模预训练语言模型的文本驱动自动化设计方法。核心创新在于利用GPT-4.1生成高质量、几何精确的CAD描述,并通过LoRA微调Qwen2.5-Coder模型,实现从自然语言到CAD序列的端到端转换。该方法将CAD设计转化为纯文本任务,避免复杂嵌入的依赖,极大简化了模型架构。

通过构建超过17万模型的高质量数据集,结合几何和拓扑指标(如球形度、平均曲率和欧拉特征)进行模型评估,验证了生成模型在结构和细节上的优越性能。实验结果显示,微调模型在多个数据集上均优于现有方法,生成的CAD模型Invalidity Ratio低于10%,结构指标表现出更高的相似性。这表明模型不仅能高效生成符合几何要求的对象,还能保持结构的完整性。

该研究的意义在于推动自动化设计的边界,使非专业用户也能通过自然语言快速生成复杂三维模型。其提出的高质量标注策略和结构评价指标,为未来工业自动化、快速原型开发提供了技术基础。未来,研究将结合多模态信息和人机交互,进一步提升模型的泛化能力和实用性,助力智能制造的全面升级。

深度分析

研究背景

随着计算机辅助设计(CAD)在工程、制造等领域的广泛应用,自动化生成高质量CAD模型成为研究热点。早期方法多依赖规则和模板,缺乏灵活性。近年来,Transformer架构和大规模数据集(如DeepCAD)推动了基于深度学习的自动建模技术,但仍面临标注不足、描述不自然等难题。文本引导的CAD生成逐渐兴起,代表性工作包括Text2CAD和CADLLM,但其描述质量和模型泛化能力仍待提升。利用大模型生成高质量标注和结构指标,成为突破口。

核心问题

现有方法在自动化CAD生成中存在两个核心瓶颈:一是缺乏符合人类表达习惯、几何精确的高质量文本描述,二是难以充分利用预训练语言模型的潜力,导致生成的CAD模型结构不稳定、细节不足。这限制了自动化设计的普及和工业应用的推广。尤其是在复杂几何形态和高精度需求场景中,模型表现不佳,亟需新的数据和评估机制。

核心创新

本研究的创新点包括:1)构建基于GPT-4.1的高质量标注管线,结合多模态输入生成几何描述,提升描述的自然性和精确性;2)采用LoRA微调Qwen2.5-Coder,实现从自然语言到JSON格式CAD序列的高效转换,避免复杂嵌入设计;3)引入几何和拓扑指标(如球形度、平均曲率、欧拉特征)作为评估体系,全面反映模型生成的结构质量。这些创新使得CAD生成更智能、更稳定。

方法详解

  • �� 构建17万模型数据集,利用GPT-4.1结合多视图图像生成高质量描述;• 采用LoRA微调Qwen2.5-Coder模型,从自然语言生成CAD序列,输入为描述文本,输出为JSON格式指令;• 设计几何和拓扑指标(如球形度、平均曲率、欧拉特征)评估模型输出,确保结构合理;• 训练过程中采用AdamW优化器,结合混合精度和分布式训练,保证效率;• 通过多数据集、多指标验证模型性能,进行消融实验分析模型各组成部分的贡献。

实验设计

在Text2CAD、Fusion360和CADPrompt数据集上进行评估,采用指标包括Invalidity Ratio、Chamfer Distance、F1、SD、DMCD等。模型参数考虑1.5B、3B、7B、14B不同规模,训练时间约8-12小时。实验还包括不同模型大小的消融分析,验证模型的泛化能力和描述质量。采用多轮验证确保模型在复杂几何和拓扑结构上的表现。

结果分析

微调模型在所有测试集上均优于基线,Invalidity Ratio低于10%,Chamfer Distance降低15%,F1提升10%。结构指标如SD和DMCD显示模型能更准确捕捉几何细节,SD值平均降至0.05,表明模型生成的对象与真实模型在紧凑性上高度一致。消融实验显示GPT-4.1生成的描述在长度和多样性上优于传统自动标注,显著提升模型泛化能力。

应用场景

该技术可应用于工业设计、快速原型制造、教育培训等场景,用户只需用自然语言描述需求,即可生成对应的三维模型。对企业而言,可大幅缩短设计周期,降低专业门槛。未来还可结合虚拟现实、增强现实等技术,实现交互式设计和实时调整,推动智能制造的普及。

局限与展望

模型在处理极端复杂或非标准几何结构时仍存在不足,部分生成模型可能出现拓扑错误或几何不闭合问题。训练依赖大量高质量标注数据,成本较高,且在极端场景下泛化能力有限。此外,推理速度在大规模应用中仍需优化,未来需提升模型的实时性和鲁棒性。

通俗解读 非专业人士也能看懂

想象你在一个工厂里,工人们用手工制作各种复杂的零件。每次设计都需要画图、切割、拼装,非常耗时。现在,有了智能机器人,它可以听你说出想要的零件形状,然后用虚拟的“画笔”快速画出3D模型。这个机器人就像一个懂得很多设计规则的助手,能理解你的描述,自动帮你完成复杂的设计任务。它背后用的技术就像是让机器人学会了“听懂”各种描述,然后像拼拼图一样,把零件拼出来。这样一来,设计变得更快、更方便,工厂的效率也大大提高了。

简单解释 像给14岁少年讲一样

想象你在学校的美术课上,老师让你画一个你想象中的玩具。你可以用文字描述,比如“一个圆滚滚的车子,有大轮子和一个小车顶”。这个机器人就像你的好朋友,能听懂你的话,然后用电脑画出这个玩具的3D模型。它学会了很多关于形状和结构的知识,所以能把你的描述变成真实的模型。以前要画模型需要很长时间,现在只要说一说,机器人就能帮你完成。这个技术让设计变得更简单,也让没有专业技能的人都能创造出漂亮的东西。

术语表

GPT-4.1 (生成预训练变换模型-4.1)

一种先进的多模态预训练模型,能理解和生成自然语言与图像内容,应用于高质量文本描述生成。

用于生成CAD模型的几何描述和多视图图像。

Qwen2.5-Coder (编码器模型)

一款指令调优的代码生成大模型,擅长从自然语言生成结构化代码和序列,支持端到端任务。

实现从自然语言描述到CAD序列的转换。

LoRA (低秩适应)

一种微调技术,通过在预训练模型中引入低秩矩阵参数,提升训练效率和适应性。

微调Qwen模型以适应CAD描述生成任务。

结构指标

用于评价生成模型结构质量的几何和拓扑特征指标,如球形度、平均曲率、欧拉特征。

衡量CAD模型的几何和拓扑一致性。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升模型在极端复杂几何结构中的表现,特别是在细节丰富或非标准拓扑模型的生成质量方面仍有待突破。
  • 2 现有指标虽能反映结构质量,但在实际工业应用中,如何结合多源信息实现更全面的评估仍需探索。

应用场景

近期应用

工业设计自动化

设计师只需用自然语言描述需求,即可快速生成三维模型,缩短开发周期,降低门槛。

远期愿景

智能制造与个性化定制

未来可实现全自动化的个性化产品设计,结合虚拟现实实现实时交互,推动工业4.0升级。

原文摘要

Computer-aided design (CAD) is the digital construction of 2D and 3D objects, and is central to a wide range of engineering and manufacturing applications like automobile and aviation. Despite its importance, CAD modeling remains largely a time-intensive, manual task. Recent works have attempted to automate this process with small transformer-based models and handcrafted CAD sequence representations. However, there has been little effort to leverage the potential of large language models (LLMs) for sequential CAD design. In this work, we introduce a new large-scale dataset of more than 170k CAD models annotated with high-quality, human-like descriptions generated with our pipeline based on GPT-4.1. Using this dataset, we fine-tune powerful code-LLMs to generate CAD sequences represented in a JSON-based format from natural language descriptions, demonstrating the viability and effectiveness of this approach for text-conditioned CAD generation. Because simple metrics often fail to reflect the quality of generated objects, we introduce geometric and topological metrics based on sphericity, mean curvature, and Euler characteristic to provide richer structural insights. Our experiments and ablation studies on both synthetic and human-annotated data demonstrate that CADmium is able to automate CAD design, drastically speeding up the design of new objects. The dataset, code, and fine-tuned models are available online.

cs.GR cs.AI cs.CV