CADBench: A Multimodal Benchmark for AI-Assisted CAD Program Generation

TL;DR

CADBench评估11个模型在6类指标与18,000样本上的多模态CAD程序生成性能。

cs.CV 🔴 高级 2026-05-12 59 次浏览
Anna C. Doris Jacob Thomas Sony Ghadi Nehme Era Syla Amin Heyrani Nobari Faez Ahmed
AI CAD 多模态 基准测试 3D重建

核心发现

方法论

该研究构建了包含六类样本、五种输入模态和六项指标的CADBench基准。通过面数分层控制几何复杂度,采用多样性采样确保样本代表性。评估模型包括CAD专用与通用视觉-语言模型,生成超过140万CAD程序。指标涵盖几何保真度、可执行性与紧凑性。实验证明,Mesh-to-CAD模型在理想输入下优于VLMs,但在复杂几何和模态转移中表现不佳。研究还分析了模型的失败模式和性能变化。

关键结果

  • 在理想输入条件下,CAD专用模型如CADFit的IoU最高达0.859,VLMs表现显著落后,IoU平均低于0.2。模型性能随几何复杂度增加而下降,面数越高,重建质量越差。多模态转移导致模型性能显著下降,尤其在噪声Mesh条件下,部分模型IoU下降超过0.5。不同指标间存在排名差异,表明多维评价更全面。
  • 模型在复杂几何和多模态场景下的鲁棒性不足,揭示了当前技术的瓶颈。CADBench提供了详细的诊断工具,有助于理解模型在不同场景下的表现差异。
  • 大规模实验显示,模型在高复杂度和模态转移环境中仍存在较大改进空间,未来需结合多模态训练与鲁棒性增强策略。

研究意义

该研究填补了CAD程序生成评估的空白,提供了统一、多维、多模态的基准平台,推动AI在工程设计中的应用。通过细致的性能分析,揭示了模型在复杂几何、多模态环境下的局限,为未来模型优化提供了方向。该基准的公开发布,有望促进学术界与工业界共同攻关,提高CAD自动化水平,降低工程设计成本,推动智能制造与数字孪生的发展。

技术贡献

该工作提出了多模态、多层次的CAD性能评估框架,结合几何、执行性与紧凑性指标,创新性地引入复杂度与多样性采样策略,确保评估的代表性与诊断性。构建了覆盖多类CAD数据集的统一基准,支持跨模型、跨场景的性能对比。实验验证了模型在不同输入模态与复杂度下的表现差异,为未来多模态CAD理解提供了技术基础。

新颖性

首次系统性引入多模态、多指标的CAD程序生成评估体系,结合复杂度与多样性控制,突破了以往单一几何或单一指标的局限。提出了多模态鲁棒性分析方法,为CAD生成模型的实际应用提供了全面诊断工具。这些创新极大丰富了CAD自动化评估的理论体系,推动了多模态深度学习在工程中的应用落地。

局限性

  • 模型在高复杂度几何和噪声条件下性能显著下降,表明鲁棒性不足,需进一步优化模型结构与训练策略。
  • 当前评估主要依赖几何指标,尚未充分考虑设计的功能性与制造可行性,未来应引入更多工程实用指标。
  • 大规模实验虽覆盖多模型,但仍未涵盖所有主流方法,未来需扩展评估范围以增强代表性。

未来方向

未来将结合多模态训练与自适应鲁棒性增强技术,提升模型在复杂场景中的表现。计划引入更多真实工业数据,优化指标体系,增强模型的实用性与泛化能力。同时,推动跨领域合作,结合制造、材料等多学科知识,推动AI在工程设计中的深度融合。

AI 总览摘要

CAD技术的快速发展推动了工程设计的智能化,但现有评估体系多依赖单一几何指标,难以全面反映模型性能。CADBench作为一个多模态、多指标的统一基准,填补了这一空白。通过18,000个样本、六大类别和五种输入模态,结合几何、执行性与紧凑性指标,系统评估了11个模型的表现。实验显示,Mesh-to-CAD模型在理想输入下表现优异,但在复杂几何和噪声环境中性能迅速下降,IoU从0.86降至0.4左右。多模态转移带来显著性能退化,尤其在噪声Mesh条件下,IoU下降超过50%。不同指标间排名差异明显,表明单一指标难以全面评估模型能力。CADBench还揭示了模型在高复杂度场景下的脆弱性、模态转移的敏感性,以及性能的多维差异。该基准的公开发布,为未来AI在CAD中的应用提供了强有力的工具,推动工程自动化与智能制造的发展。未来,结合多模态训练和鲁棒性优化,将进一步提升模型的实用性和可靠性。

深度分析

研究背景

随着AI技术在三维重建和工程设计中的应用不断深入,基于深度学习的CAD程序生成逐渐成为研究热点。早期工作如DeepCAD、Fusion 360 Gallery等提供了丰富的CAD样本,但多局限于简单操作和理想输入。近年来,模型开始尝试从多模态输入(图像、点云)生成可编辑CAD程序,推动了自动化设计的发展。然而,评估体系缺乏统一标准,现有指标多偏重几何相似度,忽视了模型的实用性和鲁棒性。多模态场景下的性能表现仍不理想,模型在复杂几何和噪声条件下表现不稳定,限制了其工业应用潜力。

核心问题

当前CAD程序生成模型面临多重挑战,包括几何复杂度高导致的重建精度下降、模态转移带来的性能不稳定,以及多指标评估体系的缺失。这些问题严重制约了模型在实际工程中的应用,尤其是在复杂机械零件或日常物体的重建任务中。缺乏统一、全面的评估平台,使得模型性能难以量化和比较,阻碍了技术的快速发展和落地推广。

核心创新

本研究提出了CADBench,结合复杂度与多样性采样策略,构建了多模态、多指标的评估体系。创新点包括:• 设计六大类别样本,覆盖多样化几何与操作类型;• 引入面数分层控制复杂度,确保模型在不同难度下的表现;• 采用多模态输入(包括噪声Mesh和多视图渲染),测试模型鲁棒性;• 设计六项指标,涵盖几何、执行性与紧凑性,提供多维评价。通过大规模实验验证模型在不同场景下的表现差异,为未来模型优化提供诊断依据。

方法详解

  • �� 选择六类CAD数据集,涵盖不同操作和复杂度;• 利用面数分层策略划分低、中、高复杂度样本;• 采用多样性采样确保样本代表性,使用嵌入向量进行k-means聚类,选取代表样本;• 构建五种输入模态,包括单视图、多视图、真实渲染、干扰Mesh和干扰Mesh;• 设计六项指标:IoU、SIoU、Chamfer Distance、有效Shape率、Token数、操作数;• 评估11个模型,统计性能差异,分析失败模式。

实验设计

  • �� 使用多模态输入测试Mesh-conditioned和Image-conditioned模型;• 以理想输入为基线,比较不同模型的几何重建性能;• 在复杂度分层和模态转移场景中,分析性能变化;• 进行ablation,验证多样性采样对难度的影响;• 统计模型在不同指标上的排名差异,揭示多维性能特征。

结果分析

  • �� CADFit在理想条件下IoU达0.859,显著优于VLMs(IoU<0.2);• 模型性能随面数增加而下降,IoU从0.86降至0.4;• 多模态转移导致性能大幅退化,噪声Mesh条件下IoU下降超50%;• 不同指标排名差异明显,表明多指标评估更全面;• 复杂几何和噪声环境中模型鲁棒性不足,指向未来改进方向。

应用场景

  • �� 在工业设计中实现自动化CAD建模,减少设计时间;• 结合机器人制造,实现从扫描到CAD的快速转换;• 支持个性化定制和快速原型开发,降低成本。未来,结合多模态训练和鲁棒性增强,有望推动智能制造与数字孪生的深度融合。

局限与展望

  • �� 高复杂度和噪声条件下性能仍不足,需优化模型结构;• 评估指标偏重几何,缺乏功能性和制造性指标;• 实验范围有限,未来需扩展多样化场景和模型类型。

通俗解读 非专业人士也能看懂

想象你在一家工厂里,工人们用各种工具和材料制造一件复杂的产品。这个工厂有很多不同的设计图(类似CAD模型),工人们根据图纸制作零件,然后组装成完整的产品。现在,想让一台智能机器人也能根据图片或模型,自动生成详细的制造步骤和零件清单。这个过程就像让机器人学会看图画,然后写出一份详细的制造说明书。为了让机器人变得更聪明,研究人员设计了一个评估系统,就像给机器人打分,看看它是否能正确理解图纸、生成的说明是否完整、是否能装配成功。这个系统可以帮助机器人不断改进,未来能让工厂的生产变得更快、更智能。

简单解释 像给14岁少年讲一样

想象你在学校的美术课上,要画一幅复杂的画。老师给你一张图片,你需要用画笔画出画中的东西,但你还得确保画得像、能用。现在,科学家们也在教电脑做类似的事:让它根据图片或模型,自动画出一份详细的设计说明,像是给机械零件写的说明书。这个过程很难,因为零件可以很复杂,光线、角度不同,都会影响电脑的判断。研究人员开发了一个叫CADBench的“评分系统”,用来检测这些电脑模型的表现。它会看模型是不是画得像、能不能用、是不是简洁。通过这个系统,电脑可以不断学习,未来能帮工程师更快设计出复杂的机械或物品,就像你用更厉害的工具画画一样。

原文摘要

Recovering editable CAD programs from images or 3D observations is central to AI-assisted design, but progress is difficult to measure because existing evaluations are fragmented across datasets, modalities, and metrics. We introduce CADBench, a unified benchmark for multimodal CAD program generation. CADBench contains 18,000 evaluation samples spanning six benchmark families derived from DeepCAD, Fusion 360, ABC, MCB, and Objaverse; five input modalities including clean meshes, noisy meshes, single-view renders, photorealistic renders, and multi-view renders; and six metrics covering geometric fidelity, executability, and program compactness. STEP-based families are stratified by B-rep face count and all families are diversity-sampled to support controlled analysis across complexity and object variation. We benchmark eleven CAD-specialized and general-purpose vision-language systems, generating more than 1.4 million CAD programs. Under idealized inputs, specialized mesh-to-CAD models substantially outperform code-generating VLMs, which remain far from reliable CAD program reconstruction. CADBench further reveals three recurring failure modes: reconstruction quality degrades with geometric complexity, CAD-specialized models can be brittle under modality shift, and model rankings change across metrics. Together, these results position CADBench as a diagnostic testbed for measuring progress in editable 3D reconstruction and multimodal CAD understanding. The benchmark is publicly available at https://github.com/anniedoris/CADBench.

cs.CV cs.AI