核心发现
方法论
提出了一种将世界状态演化与视觉生成解耦的框架。通过自然语言指令生成可执行程序,定义实体状态和状态转移规则。轻量引擎执行这些规则并维护全局状态,使用增强的3D定向包围盒(OBB)作为中间表示,结合目标摄像机轨迹生成时空条件信号,驱动预训练视频模型进行渲染。
关键结果
- 在CombatStateBench基准上,模型实现了94%的计数准确率和98%的状态准确率,显著优于现有方法。
- 支持长时间一致的生成,解决了现有视频世界模型在长期交互中的一致性问题。
- 通过消融实验验证了状态与生成解耦设计的有效性。
研究意义
该研究解决了现有视频世界模型缺乏持久状态和可编程规则的痛点,为可编程世界的创建提供了新范式。其方法在游戏开发、虚拟现实和模拟训练等领域具有广泛潜力。
技术贡献
首次提出将状态演化与生成解耦的框架,采用状态增强的3D OBB作为中间表示,并引入CombatStateBench基准测试,推动了可编程生成世界的研究。
新颖性
该方法是首个通过轻量引擎维护显式状态并结合生成模型实现可编程规则的框架,与现有隐式状态预测方法形成鲜明对比。
局限性
- 依赖预训练视频模型,可能限制开放领域的泛化能力。
- 对复杂几何和动态细节的生成依赖于生成模型的能力。
未来方向
未来可探索更复杂的规则定义、更高效的状态表示,以及在多玩家环境中的扩展。
AI 总览摘要
现有视频世界模型在生成逼真视觉体验方面取得了显著进展,但缺乏持久状态管理和可编程规则支持。Programmable World Model通过将世界状态演化与视觉生成解耦,提出了一种新颖的框架。该框架利用自然语言指令生成可执行程序,定义实体状态和交互规则。轻量引擎维护显式、持久的全局状态,包括屏幕外实体和非视觉属性。通过状态增强的3D定向包围盒(OBB)作为中间表示,结合目标摄像机轨迹生成时空条件信号,驱动预训练视频模型进行渲染。
在CombatStateBench基准测试中,该方法实现了94%的计数准确率和98%的状态准确率,显著优于现有方法,并支持长时间一致的生成。这一设计允许用户创建具有预定义机制的可玩游戏,直接控制个体实体,并在整个游戏过程中保持持久的世界状态。
该研究为虚拟现实、游戏开发和模拟训练等领域提供了新的可能性。然而,方法对生成模型的依赖可能限制其在开放领域的泛化能力。未来研究可探索更复杂的规则定义、更高效的状态表示,以及多玩家环境中的扩展。
深度分析
研究背景
视频世界模型近年来取得了显著进展,能够生成逼真的交互式视觉环境。然而,这些模型通常缺乏显式的全局状态管理,难以支持持久的多实体交互和复杂规则定义。例如,现有方法主要依赖隐式状态预测,难以在长时间交互中保持一致性。
核心问题
现有模型在长期交互中缺乏持久状态和可编程规则支持,导致生成的视觉内容在复杂场景中缺乏一致性。此外,用户无法直接控制个体实体或定义复杂的交互规则。
核心创新
提出Programmable World Model,通过将世界状态演化与视觉生成解耦,解决了上述问题。核心创新包括:1) 使用轻量引擎维护显式、持久的全局状态;2) 引入状态增强的3D定向包围盒(OBB)作为中间表示;3) 通过自然语言指令生成可执行规则,支持复杂交互。
方法详解
- �� 使用自然语言指令生成可执行程序,定义实体状态和交互规则。
- �� 轻量引擎执行规则,维护显式全局状态,包括屏幕外实体和非视觉属性。
- �� 使用状态增强的3D OBB作为中间表示,结合目标摄像机轨迹生成时空条件信号。
- �� 利用预训练视频模型作为生成渲染器,合成视觉内容。
实验设计
实验在CombatStateBench基准上进行,评估模型在长期交互中的一致性和准确性。基准包含多种战斗场景,测试模型在角色计数和状态变化中的表现。对比实验包括现有视频世界模型,消融实验验证了状态与生成解耦的有效性。
结果分析
模型在CombatStateBench上实现了94%的计数准确率和98%的状态准确率,显著优于现有方法。消融实验表明,状态与生成解耦设计是性能提升的关键。
应用场景
该方法可用于虚拟现实、游戏开发和模拟训练等领域,特别适合需要复杂交互和持久状态的场景。
局限与展望
方法对预训练视频模型的依赖可能限制其在开放领域的泛化能力。此外,复杂几何和动态细节的生成依赖于生成模型的表现。
原文摘要
Recent video world models generate increasingly realistic and interactive visual experiences, yet lack reliable mechanisms for maintaining persistent world state and enforcing programmable rules over extended interactions. We introduce Programmable World Model, a framework that decouples world-state evolution from visual observation generation. An agent translates natural-language instructions into executable programs that specify entity states and state-transition rules, enabling direct control over individual entities and their interactions. A lightweight engine executes these programs to update and maintain an explicit, persistent global world state, including off-screen entities and non-visual attributes. To connect world state with visual generation, we introduce state-augmented 3D oriented bounding boxes (OBBs) as an intermediate representation. This representation, together with the target camera trajectory, is deterministically compiled into pixel-aligned spatiotemporal conditioning signals for a pretrained video model serving as the generative renderer. This design allows users to create playable games with predefined mechanics, direct control over individual entities, and persistent world state throughout gameplay. We further introduce CombatStateBench, a benchmark for evaluating programmable world models. On CombatStateBench, our method achieves 94% Count Accuracy and 98% State Accuracy, substantially outperforming existing interactive video world models while supporting coherent long-horizon generation. These results demonstrate the effectiveness of separating explicit state evolution from generative rendering for building persistent, programmable worlds.