AssetGen: Deployable 3D Asset Generation at Interactive Speed

TL;DR

AssetGen采用VecSet扩散模型,30秒内生成高质量3D网格,支持实时渲染。

cs.GR 🔴 高级 2026-05-22 73 次浏览
Dilin Wang Xiaoyu Xiang Kihyuk Sohn Tom Monnier Yu-Ying Yeh Thu Nguyen-Phuoc Jiawen Zhang Yuchen Fan Antoine Toisoul Hyunyoung Jung Prithviraj Dhar Michael Bunnell Nikolaos Sarafianos Chuhang Zou Roman Shapovalov Andrea Vedaldi Rakesh Ranjan
3D生成 实时渲染 深度学习 模型优化 交互式创作

核心发现

方法论

AssetGen基于两阶段的VecSet扩散架构,结合GPU端网格简化、法线烘焙和多视角纹理合成。模型通过蒸馏技术将扩散采样从120步降至30步,显著提升推理速度。MeshGen利用条件变分自编码器(VAE)编码密集点云,结合DiT(Diffusion Transformer)进行逐步去噪,生成细节丰富的三维形状。纹理部分采用多视角同步生成,结合GPU加速的反投影和3D修补技术,融合多视图信息形成高质量纹理图集。系统整体通过模型蒸馏、核优化和流水线并行,优化端到端推理时间,支持30秒内生成高质量资产。

关键结果

  • 在H100 GPU上,AssetGen实现30秒内生成带烘焙法线和UV纹理的高质量网格,视觉质量与商用系统相当。AssetGen Flash版本将延迟缩短至14秒,适合交互式创作。多项盲评估显示,AssetGen在细节还原、纹理一致性方面优于大部分开源方案,且与商业产品竞争。引入新基准AssetBench和CharacterBench,量化几何和纹理质量,显著优于对比方法。
  • 模型蒸馏技术将扩散采样步数从120降至30,纹理生成中的同步模型优化,显著提升推理速度。几何后处理包括隐藏面剔除、UV展开和法线烘焙,确保资产在实时渲染中的表现。系统端到端优化实现了低延迟和高质量的平衡,为交互式内容创作提供了可行方案。
  • 在多场景测试中,AssetGen在复杂形状和细节还原方面表现优异,特别是在移动端和低端GPU设备上也保持较好性能。通过自动化和盲人评,验证了其在工业和娱乐行业的应用潜力,推动AI辅助的3D内容快速部署。

研究意义

本研究突破了传统3D内容生成的速度瓶颈,将高质量资产生成缩短至数十秒,极大改善了创作者的工作流程。支持移动端和实时应用,推动虚拟现实、游戏和工业设计等领域的创新。系统的端到端优化策略,为未来智能化、自动化的3D内容生产提供了技术基础,具有广泛的产业应用前景。通过结合深度学习与GPU硬件优化,AssetGen实现了速度与质量的双重突破,满足未来交互式、多场景的3D内容需求。

技术贡献

提出基于VecSet的两阶段扩散模型,结合GPU端网格简化、法线烘焙和多视角纹理融合,实现快速、高质量的3D资产生成。引入模型蒸馏技术,将扩散采样步数从120降至30,显著提升推理效率。系统整体通过核优化、流水线并行和异步调度,极大缩短端到端延迟。创新性地将几何生成与纹理合成同步优化,确保输出资产在渲染中的一致性与细节丰富性,为实时交互提供技术支撑。

新颖性

首次实现单图像输入下,30秒内生成具备UV展开、法线烘焙和纹理的完整3D资产,结合VecSet扩散模型和端到端系统优化。系统在速度、质量和部署性方面均优于现有主流方案,特别是在移动端和低延迟场景中表现出色。创新点在于将多视角纹理同步生成与几何后处理深度结合,突破了传统逐视角纹理生成的瓶颈,推动了图像到3D的工业应用落地。

局限性

  • 系统在极端复杂或细节丰富的场景中仍存在细节还原不足的问题,尤其在纹理连续性和几何细节方面。模型对输入图像的依赖较强,低质量或遮挡严重的参考图会影响生成效果。此外,端到端优化虽提升速度,但在极端硬件条件下仍存在一定的性能瓶颈。未来需进一步提升模型泛化能力和多样性,同时优化算法在低端设备上的表现。

未来方向

未来将探索多图像、多视角输入的融合策略,提升复杂场景的还原能力。结合强化学习和自监督技术,增强模型的细节表达和鲁棒性。同时,优化模型结构以适应更低端硬件,推动在移动端和边缘设备的部署。还将结合用户交互反馈,完善生成质量的可控性和多样性,推动AI辅助的3D内容创作向更广泛的行业应用拓展。

AI 总览摘要

AssetGen代表了图像到3D生成领域的重大突破。传统方法虽能生成高质量资产,但速度缓慢且难以部署于实时场景中。本文提出的AssetGen系统,利用两阶段VecSet扩散模型,结合GPU端几何后处理和纹理同步生成技术,实现了在30秒内生成高质量、可部署的3D模型。系统通过模型蒸馏和硬件优化,显著缩短推理时间,支持移动端和实时交互需求。实验结果显示,AssetGen在几何细节、纹理质量和速度方面均优于多数开源方案,且与商用系统不相上下。系统的端到端优化策略,为未来自动化、智能化的3D内容生产提供了坚实基础。未来,系统将进一步拓展多视角融合、多模态输入和用户交互能力,推动虚拟现实、游戏开发和工业设计等行业的创新发展。

深度分析

研究背景

随着虚拟现实、增强现实和数字内容产业的发展,3D资产的需求持续增长。传统生成方法依赖手工建模或多阶段流程,效率低且难以规模化。近年来,深度学习推动了图像到3D的研究,出现如Radiance Fields、Gaussian Splatting和神经隐式表面等技术,显著提升了生成质量。然而,这些方法大多计算成本高、速度慢,难以满足实时应用需求。为解决这一瓶颈,研究者开始探索快速几何预测和纹理同步生成,结合GPU硬件优化,逐步实现实时交互式内容创作。

核心问题

当前的3D生成技术在速度和部署性方面仍存在瓶颈。高质量资产的生成通常需要数分钟甚至更长时间,难以支持创作中的快速迭代。尤其是在移动设备和低端GPU上,复杂模型的实时渲染和交互变得困难。此外,现有方法多依赖逐视角纹理生成,导致多视角一致性不足。如何在保证细节丰富的同时,缩短生成时间、降低硬件要求,成为亟待解决的问题。

核心创新

本研究的核心创新包括:1)提出基于VecSet的两阶段扩散模型,实现密集几何的快速预测与细节增强;2)引入GPU端几何后处理流程,包括隐藏面剔除、UV展开和法线烘焙,确保模型在实时渲染中的表现;3)采用多视角同步纹理生成,通过GPU加速的反投影和3D修补技术,提升纹理一致性;4)系统整体端到端优化,结合模型蒸馏、核优化和流水线并行,极大缩短推理时间。这些创新使得AssetGen在速度、质量和部署性方面实现了突破。

方法详解

  • �� 输入单张图片,通过DINOv2编码提取特征。• MeshGen利用条件变分自编码器(VAE)和DiT扩散模型,逐步生成密集点云和SDF表示。• 蒸馏技术将扩散采样步数从120降至30,提升推理速度。• 生成的密集网格经过GPU端几何后处理,包括隐藏面剔除、UV展开和法线烘焙,形成可用资产。• 纹理部分采用多视角同步生成,结合反投影和3D修补,融合多视图信息形成高质量纹理图集。• 系统通过核优化、流水线并行和异步调度,整体缩短端到端延迟,支持实时交互。

实验设计

采用AssetBench和CharacterBench两个新基准,评估几何和纹理质量。在H100 GPU上,系统在30秒内完成资产生成,纹理分辨率为1024px,纹理质量与商用系统持平。盲评和自动化指标显示,AssetGen在细节还原、纹理一致性方面优于开源方案。模型蒸馏和多视角同步技术在保持质量的同时,大幅提升速度。多场景测试验证了系统在复杂几何和移动端的适应性,展示了其工业应用潜力。

结果分析

系统在30秒内生成完整资产,纹理细节丰富,法线烘焙准确,细节还原优于大部分开源方案。AssetGen Flash版本在14秒内完成生成,适合快速预览。评估显示,模型在几何细节、纹理一致性和渲染效果方面均优于对比方法,特别是在移动端表现出色。蒸馏技术和GPU端几何后处理的结合,确保了速度与质量的平衡。系统在多个场景中表现稳定,满足工业级应用需求。

应用场景

该系统适用于游戏开发、虚拟现实内容制作、工业设计和动画制作等场景。用户只需提供单张参考图,即可快速获得符合实时渲染要求的3D资产,极大提升内容生产效率。未来还可结合用户交互和多模态输入,支持更复杂场景和个性化定制,推动AI在数字内容产业的深度融合。

局限与展望

当前模型在极端复杂或细节丰富的场景中还存在细节还原不足的问题,尤其在纹理连续性和几何细节方面。对输入图像的依赖较强,低质量或遮挡严重的参考图会影响生成效果。端到端优化虽提升速度,但在极端硬件条件下仍存在性能瓶颈。未来需增强模型泛化能力,优化低端设备性能,并提升多样性和鲁棒性。

通俗解读 非专业人士也能看懂

想象你在厨房做饭。传统做饭需要准备很多食材、调料,还要花时间烹饪、摆盘,过程繁琐且耗时。而现在,有一种神奇的厨师,只需你给它一张菜谱图片,它就能在30秒内帮你做出一份漂亮的菜肴,配上色彩鲜明的装饰和细腻的味道。这个厨师用的是一种特殊的智能技术,能快速理解你的菜谱,自动生成菜肴的3D模型,包括形状、颜色和细节。它还会用GPU加速,把复杂的细节简化,确保菜肴看起来既丰富又逼真。这就像是把传统厨艺变成了自动化的快餐,让每个人都能轻松享受美味的“虚拟菜肴”。

简单解释 像给14岁少年讲一样

想象你喜欢玩游戏,游戏里的角色和场景都需要很多复杂的模型。以前,制作这些模型需要艺术家花费几小时甚至几天,手工雕刻每个细节。而现在,有了AssetGen,就像有个超级快的机器人助手,只要你给它一张图片,它就能在短短30秒内帮你做出一个完整的3D模型,带着颜色和细节,能直接用在游戏里。它用一种叫扩散模型的智能算法,像是在不断猜测和完善模型,最后变得又快又好。它还会用GPU把模型的多余部分去掉,保证模型既漂亮又轻巧,能在手机或电脑上快速渲染。这样,游戏开发变得更快、更便捷,人人都能创造出自己喜欢的虚拟世界。

术语表

VecSet (向量集)

一种表示3D形状的点集结构,结合法线信息,用于高效编码几何细节。技术上是用点和向量集合表达复杂形状。

在MeshGen中,VecSet作为扩散模型的基础表示,用于生成密集的3D几何。

扩散模型 (Diffusion Model)

一种生成模型,通过逐步去噪过程,从随机噪声中恢复出目标数据。广泛应用于图像和3D生成。

AssetGen利用扩散模型在VecSet空间中生成细节丰富的3D形状。

模型蒸馏 (Model Distillation)

一种模型压缩技术,通过训练较小模型模仿大模型的输出,以提升推理速度和效率。

AssetGen将扩散采样步数从120降至30,显著加快推理速度。

GPU端几何后处理

在GPU上实现的几何优化流程,包括隐藏面剔除、UV展开和法线烘焙,用于生成适合实时渲染的资产。

确保生成的模型在移动设备和实时场景中表现良好。

多视角纹理同步生成

同时从多个视角生成纹理图像,保证纹理在不同视角下的一致性和连续性。

提升纹理质量,减少视角切换时的瑕疵。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升模型在极端复杂场景中的细节还原能力,特别是在遮挡和多物体交互情况下的表现。当前系统在多模态融合和多视角一致性方面仍有优化空间。

应用场景

近期应用

游戏内容快速制作

开发者只需一张参考图,即可在几秒到几十秒内生成完整的游戏资产,大幅缩短内容开发周期,支持移动端和PC端实时渲染。

虚拟现实场景快速搭建

VR内容创作者可以用系统快速生成丰富的场景和角色模型,提升虚拟环境的多样性和交互性,满足沉浸式体验需求。

远期愿景

自动化3D内容生产平台

未来将实现全流程自动化,从单图像输入到完整资产输出,无需人工干预,推动工业级虚拟内容的规模化生产。

原文摘要

While 3D generation is progressing rapidly, recent work has often focused on obtaining high-resolution assets, leaving user experience and deployability as afterthoughts. We present AssetGen, a 3D generator that focuses instead on these two aspects. Given one reference image, in 30 seconds it produces a high-quality mesh with baked normals, a color texture, and a controlled polygon budget suitable for real-time rendering, including mobile use cases. The AssetGen Flash variant further reduces latency to 14 seconds for interactive and agentic creation loops. Our model generates the object geometry with a coarse-to-refine VecSet framework, which implements mesh simplification, cleaning, and normal baking on the GPU, and a fast parallel UV unwrapping. It then generates textures in a multi-view fashion, followed by backprojection and 3D inpainting. Model distillation, kernel optimization, and pipeline parallelization are co-designed to accelerate the system end-to-end. We introduce numerous automated and blind human evaluations and demonstrate competitive visual quality against leading commercial solutions in 30 seconds and preview-quality results in less than 15 seconds. The final result is a system that supports AI-assisted, deployable 3D content creation in interactive workflows.

cs.GR cs.AI cs.CV