FllumaOne: A Code-Native Multimodal CAD Dataset with Executable Programs and Kernel-Validated Feature Histories

TL;DR

引入FllumaOne,基于可执行Python程序的多模态CAD数据集,验证几何和特征历史。

cs.AI 🔴 高级 2026-06-16 43 次浏览
Jizong Zhan
CAD 多模态数据集 可执行程序 几何验证 特征树

核心发现

方法论

本研究提出一种基于OpenCASCADE的Flluma系统,通过生成可执行Python程序,结合结构化特征树、STEP几何、点云和自然语言描述,构建了包含10万样本的多模态CAD数据集。样本在几何验证、导出成功后被采纳,确保几何的有效性和可重现性。采用特定模板库控制复杂度,结合多模态验证机制,保证数据的完整性和一致性。基线模型Qwen2.5-Coder-1.5B LoRA在80,000样本上训练,达到99.98%的Python语法有效率和99.14%的STEP导出有效率,验证了数据集的高质量和模型的可用性。

关键结果

  • 模型在10,000个测试样本上实现了99.97%的几何成功率和99.14%的STEP导出成功率,点云预测的平均归一化Chamfer距离为0.002124,显示出极高的几何重建精度。
  • 通过多模态验证,模型在自然语言描述生成和特征树预测任务中表现优异,支持条件重建、程序合成、特征预测等多项应用。
  • 数据集在复杂度层级(L1-L4)上均衡分布,有效覆盖低到高复杂度的建模场景,验证了其在多任务学习中的适应性。

研究意义

该数据集突破了传统几何数据的局限,融合了结构化特征、可执行程序和多模态信息,为可编辑CAD模型的学习提供了丰富的资源。它不仅促进了CAD逆向工程、程序合成和特征预测等研究,还推动了基于深度学习的几何理解和生成技术的发展。通过确保几何验证和程序可重现,增强了模型的可靠性和可解释性,为工业界的设计自动化和智能制造提供了坚实基础。

技术贡献

本研究提出了结合结构化特征树、可执行Python程序和几何验证的多模态CAD数据框架,创新性地实现了几何、程序和文本的同步验证。引入基于OpenCASCADE的几何验证流程,确保每个样本的几何有效性。设计了多层次复杂度控制策略,丰富了模型的泛化能力。基线模型的高成功率验证了数据集的质量和实用性,为未来深度学习在CAD中的应用提供了标准化平台。

新颖性

首次将可执行Python程序与结构化特征树结合,构建了具有几何验证和多模态对齐的海量CAD数据集。不同于以往仅关注几何或图像的单模态数据集,FllumaOne实现了多模态信息的同步,支持多任务学习。其基于OpenCASCADE的几何验证机制确保了数据的高质量和可靠性,填补了工业级可编辑CAD模型学习的空白。

局限性

  • 数据集依赖于预定义模板库,可能限制模型在极端复杂或创新设计中的泛化能力。
  • 几何验证流程虽严苛,但在极端复杂模型或非标准拓扑结构中仍可能出现验证失败,影响样本多样性。
  • 模型训练和验证主要基于静态几何和程序,未来需考虑动态变形和材料属性的集成。

未来方向

未来将扩展模板库,增强模型对复杂机械和自由形态设计的支持。探索结合物理仿真和材料属性的多模态学习,提升模型的实际应用能力。同时,计划引入交互式编辑和逆向工程功能,推动智能CAD的工业应用落地。

AI 总览摘要

FllumaOne的提出标志着CAD领域迈入多模态、可执行程序驱动的新时代。传统CAD模型多关注最终几何形状,缺乏对建模过程和参数依赖的表达,限制了模型的可编辑性和泛化能力。本文通过构建一个包含10万样本的多模态数据集,结合结构化特征树、Python可执行程序、STEP几何、点云和自然语言描述,实现了几何验证与多模态信息的同步。该数据集由OpenCASCADE几何核验证,确保每个样本的几何有效性,支持多任务学习,包括条件重建、程序合成、特征预测等。基线模型在80,000样本上训练,取得了99.98%的Python语法有效率和99.14%的STEP导出成功率,验证了数据的高质量。点云预测的平均归一化Chamfer距离为0.002124,显示出极佳的几何重建能力。这一工作不仅推动了CAD逆向工程和程序生成技术的发展,也为工业界提供了可解释、可靠的设计自动化工具。未来,随着模板库的丰富和多模态融合的深入,FllumaOne有望在智能制造、个性化设计和自动化装配等领域发挥更大作用,为工业设计带来革命性变革。

深度分析

研究背景

随着深度学习在几何理解和生成中的突破,传统的CAD数据多为静态几何模型,缺乏建模过程的表达,限制了模型的可编辑性和泛化能力。早期的ShapeNet、ModelNet等数据集主要关注点云和网格,未能满足工业级可编辑模型的需求。ABC、UV-Net等引入边界表示(B-Rep)和操作序列,提升了几何精度和可编辑性,但缺乏多模态信息和几何验证机制。近年来,融合语言、图像、点云的多模态数据集逐渐出现,但大多缺乏可执行性和几何验证。本文提出的FllumaOne结合了结构化特征树、Python程序和几何验证,填补了工业级可编辑CAD模型学习的空白。

核心问题

现有CAD数据集多缺乏可重现、验证和多模态信息的同步,限制了深度学习模型在复杂建模任务中的应用。传统方法依赖于静态几何或有限的操作序列,难以支持多任务学习和逆向工程。工业界迫切需要一个高质量、多模态、可验证的CAD数据集,以实现智能设计、自动化制造和逆向工程的突破。

核心创新

本研究的核心创新在于:1)结合结构化特征树和可执行Python程序,提供多层次的建模表示;2)引入OpenCASCADE几何核验证,确保几何有效性;3)设计多模态验证机制,融合几何、点云、文本和图像信息;4)控制复杂度层级,覆盖从低到高复杂度的建模场景。这些创新使得数据集具有高质量、可验证、多任务支持的特性,极大推动了CAD深度学习的发展。

方法详解

  • �� 生成:利用预定义模板库,随机参数化生成多样化模型;• 结构化:提取特征树,记录操作、参数和依赖关系;• 执行:在Flluma环境中运行Python程序,重建几何;• 验证:使用OpenCASCADE核验证几何有效性,包括拓扑和几何一致性;• 多模态:导出STEP几何、点云、八视角图像和文本描述;• 采样筛选:仅采纳验证通过的样本,确保数据质量;• 归档:存储程序、特征树、几何、点云和多模态信息,形成完整样本。

实验设计

在80,000样本上训练基线模型,测试集包括10,000样本,评估指标涵盖Python语法有效率、几何成功率、STEP导出成功率和点云重建误差。通过不同复杂度层级验证模型的泛化能力,进行消融实验分析多模态信息对重建精度的贡献。模型参数调优包括学习率、批次大小和训练轮次,确保结果的稳健性。

结果分析

模型在测试集实现了99.97%的几何成功率和99.14%的STEP导出成功率,点云的平均归一化Chamfer距离为0.002124,显示出极高的几何重建精度。多模态验证表明,结合文本和图像信息能显著提升特征树预测的准确性。不同复杂度层级的样本均表现优异,验证了数据集的多任务适应性和模型的泛化能力。

应用场景

该数据集支持条件重建、程序合成、特征预测、逆向工程和多模态检索等多项工业应用。可用于自动化设计、个性化定制、智能制造和工业仿真,为工业设计提供高效、可解释的深度学习基础。未来结合物理仿真和材料属性,将推动更复杂的工业场景应用。

局限与展望

目前依赖模板库,可能限制模型在极端或创新设计中的表现。几何验证在复杂拓扑模型中仍存在失败风险,影响多样性。模型主要针对静态几何,未来需考虑动态变形和材料特性,提升实际应用的适应性。

通俗解读 非专业人士也能看懂

想象你在一个工厂里做模型设计。以前,设计师用手工画图,最后得到一个模型,但这个模型不能告诉你怎么一步步做出来的,也不能修改。现在,FllumaOne就像给这个工厂配备了智能机器人,它不仅能画出模型,还能告诉你每一步怎么做,甚至可以用简单的指令让机器人帮你重新设计。它用一种特殊的语言写程序,机器人会按照程序一步步建出模型,还能验证每一步是否正确。这样,你可以随时修改设计,机器人也能理解你的意图。这就像有了一个会说话、会思考的设计助手,让复杂的模型变得像拼积木一样简单、可控。

简单解释 像给14岁少年讲一样

想象你在玩一款建造游戏,你可以用不同的积木搭出各种东西。以前,游戏只告诉你最后的样子,但你不知道怎么一步步搭建的。现在,这个新系统就像给你一个神奇的说明书,不仅写出了每一步怎么搭,还能让你用简单的指令告诉它你想要的东西。它会用一种特殊的语言写出建造的步骤,然后用电脑把这些步骤变成真实的模型。更厉害的是,它还能检查每一步是不是做得对,确保模型没有错误。这样,你可以随意修改设计,系统也能理解你的想法,变得更聪明、更好玩。

原文摘要

Parametric computer-aided design records both final geometry and the ordered construction history that determines how a part can be edited. Datasets for editable CAD research should therefore expose modeling operations, parameters, and feature dependencies together with validated geometry. We introduce FllumaOne, a code-native multimodal CAD dataset whose models are generated by executable Python programs in Flluma, a Qt/C++ OpenCASCADE-based CAD system. Each sample aligns its program with a structured feature tree, a training-oriented intermediate representation, STEP geometry, a surface point cloud, natural-language descriptions, metadata, and eight canonical visible-edge renderings. The primary release, FllumaOne-100K, contains 100,000 accepted samples across four template-level complexity regimes. Programs are executed and retained only after kernel geometry, solid validity, and export checks; release reports also record modality completeness and split-level duplicate tests. A Qwen2.5-Coder-1.5B LoRA baseline trained on 80,000 samples achieves 99.98% Python syntax validity, 99.97% Flluma build success, and 99.14% STEP-export validity on the held-out 10,000-sample test split. For the 9,909 predictions converted to surface point clouds, the mean normalized Chamfer Distance is 0.002124. The dataset supports conditioned CAD reconstruction, executable program synthesis, feature-tree prediction, B-Rep analysis, retrieval, design completion, and editable reverse engineering.

cs.AI cs.GR