Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning

TL;DR

Code-as-World通过可执行代码表示物理世界,在QuantiPhy上表现优异。

cs.CV 🔴 高级 2026-08-28 2 次浏览
Hanyang Wang Yimo Cai Weiliang Chen Jiawei Chi Haowen Sun Qiyu Dai Yi-Hsin Hung Xingzhuo Guo Jinshan Ren Runmao Yao Ziwei Liu Mingsheng Long Yueqi Duan Jun Gao Jiangran Lyu Fangfu Liu Jialong Wu
物理推理 可执行表示 视觉语言模型 多模态 物理监督

核心发现

方法论

该研究提出了Code-as-World,通过可执行代码表示物理世界。方法包括物理组成、动态演化和视觉外观的表达。使用启发式的代理发现循环,结合归纳推理,逐步优化可执行世界假设。

关键结果

  • Code-as-World-VL在QuantiPhy上超越Gemini-3.1-Flash,显示出显著的性能提升。
  • 在物理推理任务中,Code-as-World-VL-27B超过9B版本和所有基线模型。
  • 通过验证的可执行世界提供了可扩展的物理监督,显著提高了定量物理推理能力。

研究意义

该研究为物理智能提供了可扩展的基础,解决了现有视觉语言模型缺乏明确物理机制表示的问题。通过可执行世界表示,能够更好地理解和推理物理现象。

技术贡献

技术贡献包括提出了一种新的物理世界表示方法,结合了代码的可执行性和物理机制的明确性,提供了新的工程可能性和理论保证。

新颖性

Code-as-World首次将物理世界表示为可执行代码,与传统的视觉或语言表示相比,提供了更精确的物理机制建模。

局限性

  • 在复杂场景下,模型可能无法捕捉所有物理细节。
  • 对高质量输入数据的依赖较大。
  • 需要进一步优化计算效率。

未来方向

未来工作包括扩展到更复杂的物理场景,改进模型的计算效率,以及探索更多的应用领域。

AI 总览摘要

物理理解和推理需要形成紧凑且可推广的世界表示。现代视觉语言模型虽然能识别和解释多种物理事件,但常缺乏对底层机制的明确表示,如物体状态、物理参数和动态。Code-as-World通过可执行代码表示物理世界,提供了一种紧凑、定量基础和可控的物理世界抽象。通过多模态观察构建这种表示,我们开发了一种受归纳推理启发的代理发现循环,逐步优化可执行世界假设。实验表明,Code-as-World-VL在QuantiPhy上实现了最先进的性能,超越了领先的专有模型,展示了可执行世界表示作为物理智能可扩展基础的潜力。

Code-as-World的核心在于通过代码表示物理世界的组成、动态演化和视觉外观。这种方法不仅保留了物理推理所需的机制结构,还抽象掉了个体观察的偶然细节。通过代理发现循环,模型能够从不完整的观察中恢复物理机制,支持物理数据生成、定量监督和更广泛的下游物理推理。

在应用方面,验证过的可执行世界为定量物理推理提供了可扩展的物理监督。Code-as-World-VL显著提高了定量物理推理能力,超越了Gemini-3.1-Flash等更大规模的模型。这些结果表明,可执行世界表示可以为视觉模型提供可扩展的监督,帮助其理解物理机制。未来的工作将包括扩展到更复杂的物理场景,改进模型的计算效率,以及探索更多的应用领域。

深度分析

研究背景

物理理解是智能的标志。人类能够在不熟悉的物理情境中进行推理,而不是简单地记忆个别观察。现代视觉语言模型在描述物理世界方面表现出色,但缺乏对底层机制的明确表示。Code-as-World通过可执行代码提供了一种新的物理世界表示方法,能够更好地理解和推理物理现象。

核心问题

现有的视觉语言模型虽然能识别和解释多种物理事件,但常缺乏对底层机制的明确表示,如物体状态、物理参数和动态。这限制了模型在物理推理中的应用。

核心创新

Code-as-World通过可执行代码表示物理世界的组成、动态演化和视觉外观。这种方法不仅保留了物理推理所需的机制结构,还抽象掉了个体观察的偶然细节。通过代理发现循环,模型能够从不完整的观察中恢复物理机制。

方法详解

  • �� 物理组成:描述世界中的物体及其物理属性。
  • �� 动态演化:描述物体的初始状态及其随时间的变化。
  • �� 视觉外观:描述物理世界的观察和呈现方式。
  • �� 代理发现循环:通过提议、实例化、执行、渲染和验证的循环,逐步优化可执行世界假设。

实验设计

实验在QuantiPhy数据集上进行,使用Code-as-World-VL模型进行定量物理推理。与Gemini-3.1-Flash等基线模型进行比较,评估模型在物理推理任务中的性能提升。

结果分析

Code-as-World-VL在QuantiPhy上实现了最先进的性能,超越了Gemini-3.1-Flash等更大规模的模型。验证过的可执行世界为定量物理推理提供了可扩展的物理监督。

应用场景

Code-as-World可用于训练视觉语言模型进行定量物理推理,适用于需要理解和推理物理机制的应用场景,如自动驾驶和机器人。

局限与展望

模型在复杂场景下可能无法捕捉所有物理细节,对高质量输入数据的依赖较大。未来工作将包括改进模型的计算效率和扩展到更复杂的物理场景。

通俗解读 非专业人士也能看懂

想象一个厨房,Code-as-World就像是一个可以执行的食谱。每个食材(物体)都有其特定的属性,如重量和形状。食谱(代码)描述了食材如何相互作用和变化。通过这个食谱,我们可以预测菜肴的最终外观和味道,而不必每次都亲自尝试。这样,我们就能在不浪费食材的情况下,快速调整和优化食谱,达到理想的效果。

简单解释 像给14岁少年讲一样

想象一下你在玩一个游戏,你需要建造一个虚拟世界。Code-as-World就像是你手中的魔法工具,可以帮助你创建一个真实的世界。你可以用它来设置物体的属性,比如大小和重量,然后观察它们如何相互作用。这样,你就能在游戏中做出更聪明的决策,比如如何让一个球滚得更快。是不是很酷?

术语表

可执行世界表示 (Executable World Representation)

通过代码表示物理世界的组成、动态演化和视觉外观。

用于表示物理世界的结构和机制。

代理发现循环 (Agentic Discovery Loop)

一种通过提议、实例化、执行、渲染和验证的循环来优化可执行世界假设的方法。

用于逐步优化物理世界表示。

物理监督 (Physical Supervision)

通过验证的可执行世界为定量物理推理提供的监督。

用于训练视觉语言模型进行物理推理。

QuantiPhy

一个用于评估定量物理推理能力的数据集。

用于测试Code-as-World-VL模型的性能。

视觉语言模型 (Vision-Language Model)

能够同时处理视觉和语言信息的模型。

用于识别和解释物理事件。

开放问题 这项研究留下的未解疑问

  • 1 如何在复杂场景中提高模型的物理细节捕捉能力?
  • 2 如何减少对高质量输入数据的依赖?
  • 3 如何进一步优化模型的计算效率?

应用场景

近期应用

自动驾驶

通过理解物理机制,提升自动驾驶系统的决策能力。

机器人

提高机器人在复杂环境中的操作能力。

远期愿景

智能家居

通过物理推理,提升智能家居设备的交互能力。

原文摘要

Physical understanding and reasoning depend on forming compact and generalizable representations of the world. While modern vision-language models can recognize and explain diverse physical events, they often lack explicit representations of the underlying mechanisms-such as object states, physical parameters, and governing dynamics-needed for reliably reasoning how the world evolves and responds to interventions. In this work, we introduce Code-as-World, a paradigm that represents physical worlds through executable world representations. By expressing physical composition, dynamic evolution, and visual appearance as executable code, Code-as-World provides a compact, quantitatively grounded, and controllable abstraction of the physical world. To construct such representations from multimodal observations, such as natural-language descriptions or real-world videos, we develop an agentic discovery loop inspired by abductive reasoning, where an agent proposes, executes, renders, verifies, and iteratively refines executable world hypotheses. As a concrete application, we use verified executable worlds to provide scalable physical supervision for training vision-language models on quantitative physical reasoning. Experiments show that Code-as-World-VL achieves state-of-the-art performance on QuantiPhy and surpasses leading proprietary models, highlighting the potential of executable world representations as a scalable foundation for physical intelligence.

cs.CV