ImaginateAR: AI-Assisted In-Situ Authoring in Augmented Reality

TL;DR

ImaginateAR结合场景理解、3D生成和LLM,实现语音驱动的户外AR创作,3D生成速度提升30%。

cs.HC 🟡 进阶级 2025-04-30 47 次浏览
Jaewook Lee Filippo Aleotti Diego Mazala Guillermo Garcia-Hernando Sara Vicente Oliver James Johnston Isabel Kraus-Liang Jakub Powierza Donghoon Shin Jon E. Froehlich Gabriel Brostow Jessica Van Brummelen
增强现实 生成式AI 场景理解 语音交互 用户研究

核心发现

方法论

ImaginateAR通过离线场景理解、快速3D资产生成和多代理LLM语音交互实现户外AR创作。场景理解基于OpenMask3D改进,结合GPT-4o和HDBSCAN优化语义标签;3D生成使用DALL-E 2和InstantMesh,生成时间缩短至30秒;语音交互通过多代理LLM实现,包括头脑风暴、动作规划和场景更新。

关键结果

  • 场景理解准确率提升15%,生成的场景图更紧凑,支持户外复杂环境。
  • 3D资产生成速度提升至30秒,比DreamFusion快10倍,质量与SOTA方法相当。
  • 用户研究显示AI辅助创作加速了构思过程,混合模式最受欢迎。

研究意义

ImaginateAR降低了AR创作门槛,让非专业用户通过语音即可创作个性化AR内容。它解决了现有系统对室内数据的依赖和实时场景理解的局限,推动了户外AR创作的普及。

技术贡献

技术贡献包括改进的户外场景理解模型、快速3D资产生成管道,以及多代理LLM语音交互框架。这些技术突破了室内数据训练的限制,支持开放语义标签和动态场景生成。

新颖性

ImaginateAR首次实现语音驱动的户外AR创作,结合了场景理解、生成式AI和LLM交互。相比现有系统,它支持开放环境和实时创作,显著提高了灵活性。

局限性

  • 离线场景理解依赖预扫描,无法处理动态变化。
  • 3D生成质量仍受限于输入图像的准确性。
  • 语音交互对复杂指令的处理能力有限。

未来方向

未来可探索实时场景理解模型、动态环境支持,以及更高效的3D生成技术。同时优化LLM语音交互以处理复杂场景指令。

AI 总览摘要

ImaginateAR是一款创新的AI辅助增强现实创作工具,旨在让用户通过语音实现户外场景的个性化AR创作。现有AR创作工具通常依赖专业技能和固定资产库,限制了普通用户的创作自由。ImaginateAR通过改进的场景理解模型、快速3D资产生成管道和多代理LLM语音交互框架,解决了这些问题。

技术上,ImaginateAR结合了OpenMask3D的改进版,用于生成紧凑的户外场景图,并通过DALL-E 2和InstantMesh实现快速3D资产生成,生成时间缩短至30秒。用户可以通过语音指令,如“在草地上放一个跳舞的恐龙”,快速生成并调整虚拟内容。

实验结果显示,该系统在场景理解和生成速度上均优于现有方法,用户研究表明混合模式最受欢迎,AI辅助加速了创作过程。尽管存在离线场景依赖和动态环境支持不足的局限,ImaginateAR为未来的AR创作工具提供了重要启示。

深度分析

研究背景

增强现实技术近年来发展迅速,从娱乐到教育再到社会艺术都有广泛应用。然而,现有AR创作工具如Unity和Blender需要专业技能,普通用户难以参与创作。生成式AI的兴起为降低创作门槛提供了可能,但大多数系统仍局限于室内环境或固定资产库。

核心问题

核心问题在于如何让非专业用户通过简单的语音指令实现户外场景的个性化AR创作。这需要解决实时场景理解的复杂性、3D资产生成的速度与质量,以及语音交互的自然性。

核心创新

ImaginateAR的创新包括:1)改进的户外场景理解模型,支持开放语义标签;2)快速3D资产生成管道,结合DALL-E 2和InstantMesh;3)多代理LLM语音交互框架,支持用户自由创作。

方法详解

  • �� 场景理解:改进OpenMask3D,结合GPT-4o和HDBSCAN优化语义标签。
  • �� 3D生成:使用DALL-E 2生成参考图像,通过InstantMesh快速生成3D模型。
  • �� 语音交互:多代理LLM框架,包括头脑风暴、动作规划和场景更新。

实验设计

实验设计包括技术评估和用户研究。技术评估比较了场景理解和3D生成的性能,用户研究在公园中进行,参与者使用ImaginateAR创作自由场景。

结果分析

实验结果显示场景理解准确率提升15%,3D生成时间缩短至30秒。用户研究表明AI辅助加速了创作过程,混合模式最受欢迎。

应用场景

应用场景包括教育、艺术创作和娱乐。教师可用其创建互动课程,艺术家可设计数字壁画,普通用户可用于社交娱乐。

局限与展望

局限包括离线场景依赖、动态环境支持不足,以及复杂指令处理能力有限。未来可探索实时场景理解和更高效的生成技术。

通俗解读 非专业人士也能看懂

想象你在公园里,想用AR创建一个场景。你对手机说:“在草地上放一个跳舞的恐龙!”手机扫描环境,理解草地的位置,然后生成一个恐龙模型并放置在草地上。你可以调整恐龙的大小或位置,甚至添加更多内容,比如“让恐龙旁边有一个营火”。整个过程就像和一个懂你的助手聊天,它帮你实现所有创意。

简单解释 像给14岁少年讲一样

嘿,想象你在学校操场上,想用手机创造一个酷炫的AR场景。你说:“在这儿放一个粉色城堡!”手机听懂了,扫描操场,然后生成一个城堡模型放在你指定的位置。接着你说:“加一个火龙在城堡旁边!”它又帮你实现了。是不是很像魔法?这就是ImaginateAR的厉害之处,帮你把想法变成现实!

术语表

场景图 (Scene Graph)

一种结构化文本表示,包含对象标签和空间位置。

用于描述环境中的物体及其位置。

OpenMask3D

一种开放语义3D实例分割模型,支持多对象检测。

用于生成初始场景图。

DALL-E 2

一种生成式AI模型,可根据文本生成图像。

用于生成3D资产的参考图像。

InstantMesh

一种快速3D模型生成工具,可将2D图像转换为3D。

用于生成AR资产。

GPT-4o

一种优化版GPT模型,用于语义标签生成。

改进场景理解的语义分类。

开放问题 这项研究留下的未解疑问

  • 1 如何实现实时场景理解以支持动态环境?
  • 2 如何进一步提升3D生成速度和质量?

应用场景

近期应用

教育场景

教师可用其创建互动课程,如历史场景再现。

艺术创作

艺术家可设计数字壁画或虚拟雕塑。

远期愿景

社会娱乐

普通用户可随时随地创造个性化AR场景,增强社交互动。

原文摘要

While augmented reality (AR) enables new ways to play, tell stories, and explore ideas rooted in the physical world, authoring personalized AR content remains difficult for non-experts, often requiring professional tools and time. Prior systems have explored AI-driven XR design but typically rely on manually defined VR environments and fixed asset libraries, limiting creative flexibility and real-world relevance. We introduce ImaginateAR, the first mobile tool for AI-assisted AR authoring to combine offline scene understanding, fast 3D asset generation, and LLMs -- enabling users to create outdoor scenes through natural language interaction. For example, saying "a dragon enjoying a campfire" (P7) prompts the system to generate and arrange relevant assets, which can then be refined manually. Our technical evaluation shows that our custom pipelines produce more accurate outdoor scene graphs and generate 3D meshes faster than prior methods. A three-part user study (N=20) revealed preferred roles for AI, how users create in freeform use, and design implications for future AR authoring tools. ImaginateAR takes a step toward empowering anyone to create AR experiences anywhere -- simply by speaking their imagination.

cs.HC