GIFT: Bootstrapping Image-to-CAD Program Synthesis via Geometric Feedback

TL;DR

GIFT通过几何反馈实现图像到CAD程序的自我增强,提升IoU12%,减少80%推理计算。

cs.LG 🔴 高级 2026-03-29 70 次浏览
Giorgio Giannone Anna Clare Doris Amin Heyrani Nobari Kai Xu Akash Srivastava Faez Ahmed
图像到程序合成 几何反馈 数据增强 生成模型 工程设计

核心发现

方法论

GIFT采用几何验证机制,将推理过程中的候选程序转化为高质量训练样本。结合软拒绝采样(GIFT-REJECT)和失败驱动增强(GIFT-FAIL),实现多样性和鲁棒性提升。通过离线几何验证,筛选出符合几何一致性的多样程序,扩展训练集,缓解数据稀缺问题。模型在GenCAD数据集上,IoU提升12%,推理计算降低80%,无需额外标注或复杂架构。

关键结果

  • GIFT模型在GenCAD测试集上平均IoU达0.781,比强监督基线提升12%,且推理计算减少80%。
  • 结合SRS和FDA策略,训练样本从16万扩展至37万,显著增强模型鲁棒性,尤其在复杂几何结构中表现优越。
  • 在外推样本和困难几何上,模型表现优于传统SFT和复杂多模态系统,解决多样性不足和模型崩溃问题。

研究意义

该方法突破了工程设计中数据稀缺的瓶颈,通过几何验证实现自我增强,极大提升图像到CAD程序的生成质量与鲁棒性。推动了生成模型在复杂工程任务中的应用,为工业自动化和智能设计提供新路径,降低了高质量数据集的依赖,增强了模型的实用性和推广潜力。

技术贡献

提出基于几何反馈的自我增强框架GIFT,创新性地将推理时搜索转化为离线数据增强,结合软拒绝采样和失败驱动增强机制,显著提升模型多样性和鲁棒性。该方法在不增加标注成本的情况下,优化了训练数据分布,减少推理复杂度,提升了模型的泛化能力。技术上实现了几何验证的高效集成,为工程设计中的生成模型提供了新范式。

新颖性

首次系统性引入几何验证作为自我增强机制,结合软拒绝采样和失败驱动策略,显著改善图像到CAD程序的多样性和鲁棒性。不同于传统的监督微调和强化学习,GIFT利用几何反馈实现无标注成本的自我优化,开启了基于几何验证的生成模型新方向。

局限性

  • 依赖几何核(OpenCASCADE)进行验证,计算成本仍较高,尤其在大规模应用中可能受限。
  • 模型在极端复杂几何或极度模糊图像下仍存在崩溃风险,验证机制对几何验证的准确性敏感。
  • 当前方法主要针对二维图像到参数化程序的转换,扩展到三维复杂场景仍需进一步研究。

未来方向

未来将探索多模态信息融合,提升模型对复杂场景的理解能力。计划引入端到端训练策略,减少验证环节的计算负担。同时,结合强化学习优化验证流程,增强模型在极端条件下的表现。还将扩展到更多工业应用场景,如机械装配和结构优化,推动生成模型的工业化落地。

AI 总览摘要

GIFT提出了一种创新的几何反馈驱动的自我增强框架,解决了图像到CAD程序生成中数据稀缺和多样性不足的问题。传统方法依赖有限的标注数据,或复杂的后训练流程,难以应对复杂设计需求。GIFT通过在推理过程中利用几何验证机制,将候选程序转化为高质量的训练样本,实现离线数据扩充。核心机制包括软拒绝采样(GIFT-REJECT)和失败驱动增强(GIFT-FAIL),前者扩展程序多样性,后者增强模型鲁棒性。实验在GenCAD数据集上,IoU提升12%,推理计算降低80%,无需额外标注或复杂架构,表现出优越的性能和实用性。该方法不仅提升了模型在复杂几何上的表现,也为工程设计中的自动化提供了新思路。未来,GIFT有望结合多模态信息和强化学习,进一步突破工业应用的限制,推动智能设计的普及。

深度分析

研究背景

工程设计的数字化始于几何建模,随着几何核的发展,CAD已成为工业标准。早期方法依赖规则和模板,难以应对复杂场景。近年来,深度生成模型如Point Cloud、Image到3D的研究兴起,但多采用有限数据和特定格式,存在多样性和鲁棒性不足的问题。符号程序作为中间表达,因其紧凑和可编辑性逐渐受到关注,但缺乏有效的训练数据和验证机制,限制了其应用范围。

核心问题

现有图像到程序的生成方法面临数据稀缺、模型多样性不足和鲁棒性差的挑战。微调依赖少量标注,容易过拟合;强化学习成本高,难以规模化。复杂几何结构和多样化设计需求未被充分满足,导致模型在实际工程中表现有限。如何在有限数据基础上提升模型的泛化能力和多样性,成为亟待解决的问题。

核心创新

GIFT创新性地引入几何验证机制,将推理时候的候选程序作为自我增强的来源。通过离线验证筛选多样且符合几何的程序,结合软拒绝采样和失败驱动增强,显著扩展训练数据,提升模型鲁棒性。该方法突破了传统监督微调的局限,无需额外标注,优化了数据分布,减少推理成本,增强模型泛化能力,为工程设计中的图像到程序转换提供新思路。

方法详解

  • �� 采样:用预训练模型生成多个候选程序。• 验证:利用OpenCASCADE核验证几何一致性,计算IoU。• 扩充:筛选高质量多样程序,加入训练集。• 软拒绝:保留符合几何标准的多样程序,避免模型崩溃。• 失败增强:将近失误样本渲染成图像,训练模型修正错误。• 训练:结合原始和增强数据,优化模型参数,提升多样性和鲁棒性。

实验设计

在GenCAD数据集上,采用不同推理预算(8-128)采样候选程序,验证其几何一致性。通过IoU指标筛选高质量样本,扩充训练集至37万样本。对比传统微调和增强策略,评估模型在复杂几何和外推样本上的表现。采用平均IoU、问题解决比例等指标,验证GIFT在鲁棒性和效率上的优势。多次消融实验确认软拒绝和失败驱动策略的有效性。

结果分析

GIFT模型在GenCAD测试集IoU达0.781,较基线提升12%,推理成本降低80%。结合多样性增强策略,模型在复杂几何和困难样本上表现优越,问题解决比例提升53%。验证机制显著减少模型崩溃和误差,增强泛化能力。实验结果显示,离线几何验证有效缓解数据不足问题,提升模型鲁棒性和多样性。

应用场景

该方法适用于工业设计、机械制造和结构优化等场景,能够自动从图像生成参数化CAD程序。无需大量标注,适合有限数据环境。未来可结合多模态信息,支持更复杂的设计任务,推动智能制造和自动化设计的实现。

局限与展望

依赖几何核验证,计算成本较高,限制大规模应用。在极端复杂或模糊图像下,验证准确性不足,模型仍存在崩溃风险。当前主要针对二维图像,三维复杂场景的扩展仍需研究。未来需优化验证流程,降低成本,增强模型在多模态和复杂场景中的适应性。

通俗解读 非专业人士也能看懂

想象你在厨房做菜,菜单上写着各种菜谱,但每次你做菜时,可能会用不同的调料或方法。GIFT就像一个聪明的厨师,它不仅根据菜单做菜,还会用厨艺检测菜的味道是否符合标准。每次尝试后,它会记住哪些做法味道好,哪些需要改进。通过不断试验和检测,它逐渐学会做出更好吃的菜。这个过程不用额外请厨师帮忙,只靠自己不断试错和改进。最终,它能在没有人指导的情况下,自己做出美味的菜肴,甚至能应对各种复杂的菜谱和食材。这就像GIFT在工程设计中,自己用几何验证不断改进,从而生成更准确、更丰富的CAD程序。

简单解释 像给14岁少年讲一样

想象你在学校里画画,但你不确定你的画是不是像老师的样子。每次你画完后,老师会用放大镜检查,告诉你哪里画得好,哪里还需要改。你会记住老师的建议,下次画得更像。慢慢地,你的画越来越像老师的作品,而且还能画出不同风格的画。GIFT就像这个聪明的学生,它会自己检查画的内容,找到哪里画得好,哪里不够好,然后自己改进。它不用别人帮忙,只靠自己不断试错和学习,最后能画出非常漂亮的画。这在工程设计里,就是让电脑自己用几何验证不断改进,从而生成更准确的CAD模型。

原文摘要

Generating executable CAD programs from images requires alignment between visual geometry and symbolic program representations, a capability that current methods fail to learn reliably as design complexity increases. Existing fine-tuning approaches rely on either limited supervised datasets or expensive post-training pipelines, resulting in brittle systems that restrict progress in generative CAD design. We argue that the primary bottleneck lies not in model or algorithmic capacity, but in the scarcity of diverse training examples that align visual geometry with program syntax. This limitation is especially acute because the collection of diverse and verified engineering datasets is both expensive and difficult to scale, constraining the development of robust generative CAD models. We introduce Geometric Inference Feedback Tuning (GIFT), a data augmentation framework that leverages geometric feedback to turn test-time compute into a bootstrapped set of high-quality training samples. GIFT combines two mechanisms: Soft-Rejection Sampling (GIFT-REJECT), which retains diverse high-fidelity programs beyond exact ground-truth matches, and Failure-Driven Augmentation (GIFT-FAIL), which converts near-miss predictions into synthetic training examples that improve robustness on challenging geometries. By amortizing inference-time search into the model parameters, GIFT captures the benefits of test-time scaling while reducing inference compute by 80%. It improves mean IoU by 12% over a strong supervised baseline and remains competitive with more complex multimodal systems, without requiring additional human annotation or specialized architectures.

cs.LG cs.AI cs.CE