核心发现
方法论
UniVR以34B参数的Emu3.5为基础,将指令、查询图像与视觉轨迹编码进统一离散词表,并预测下一帧p(x_{t+1}|x_{1:t})。训练先进行视觉任务冷启动SFT,再采用VR-GRPO强化学习:全局奖励Rg评估任务完成度,Step-Focal奖励Rs利用CLIP特征跨轨迹方差定位高不确定步骤,最终以Rreason=Rg−λ|Rg−Rs|融合,默认λ=2。
关键结果
- 在VR-X上,UniVR总体得分58.2,较Emu3.5的39.8提升18.4%;长程规划由42.4升至63.8,提升25.2%,一般推理由46.2升至64.3。其JEPA距离为13.01,显著低于Emu3.5的33.62,说明物理动态更接近真实轨迹。
- UniVR在Guidance、Robot、Editing、Spatial、Puzzle、Search六类任务上分别达到59.5、68.0、48.5、46.5、62.2和64.3,整体接近或超过部分文本推理流水线;在34B规模下,长程操作能力超过Gemini 3的相关表现。
- 消融显示,仅全局奖励时VR-X为48.2;加入Step-Focal与成对评价后达到63.8,JEPA降至13.01。UniVR还使MMMU从0.292升至0.337、MM-Vet从28.0升至35.6。
研究意义
论文把世界建模的学习媒介从语言扩展到原始视觉轨迹,针对机器人操作、物理变化和空间关系等难以文字化的知识提供了统一训练范式。它回应了现有MLLM依赖文本链式推理、生成模型只重视画质的长期痛点。对学术界而言,VR-X和JEPA评估推动了视觉空间推理的可测量化;对产业而言,该方向可能降低机器人示范数据对人工语言标注的依赖。
技术贡献
核心贡献是VR-GRPO及其双层奖励机制。与PPO、普通GRPO或HPSv3、CLIP式单步质量奖励不同,VR-GRPO先用Qwen3-VL-30B进行全局与局部成对比较,再根据CLIP嵌入方差σ(t)选择轨迹分歧最大的窗口。公式Rreason=Rg−λ|Rg−Rs|惩罚终点正确但过程错误的捷径,使逻辑连贯性和物理一致性共同进入优化目标。
新颖性
论文声称首次在无语言监督的统一视觉空间中,同时学习长程规划、细粒度物理动力学与一般视觉认知。其基本创新不是简单提高图像质量,而是把视觉状态转移本身作为推理链,并用不确定性驱动的局部奖励弥补全局VLM评分无法发现中间错误的问题。
局限性
- 奖励仍依赖Qwen3-VL-30B和Qwen3.5-397B等VLM评估器,可能继承文本知识偏置;CLIP方差只是错误风险的代理,并不保证真正识别物理因果。
- VR-X规模为1.8k评测样本,来源虽达16个但任务分布仍由现有视频与演示数据决定;模型训练使用全参数SFT/RL、20k令牌上限和512像素短边,成本较高。
未来方向
后续可引入更强的视觉物理评估器、因果状态表示和可执行机器人闭环验证,减少VLM裁判依赖。还应扩展真实环境、非固定长度轨迹、多主体交互和跨域泛化测试,并研究更高效的参数更新与在线数据采集。
AI 总览摘要
人工和动物能够直接从视觉变化中预测下一步动作,但主流AI通常先把世界翻译成文字,再依靠语言模型推理。Gemini、GPT等系统虽能生成细致文本计划,却在打结、折衣、烹饪和机器人操作中出现物理违规、步骤跳跃与状态不连续;统一生成模型也常被艺术编辑目标限制。
UniVR提出直接“在视觉空间思考”。它以Emu3.5为基础,给模型输入指令和图像序列,要求其预测下一帧。冷启动SFT提供视觉轨迹先验,随后VR-GRPO用全局奖励判断是否完成任务,再用Step-Focal奖励寻找不同候选轨迹分歧最大的片段。该设计避免模型只生成漂亮的最终画面,而要保持整个过程合理。其核心融合式为Rreason=Rg−λ|Rg−Rs|,默认λ=2。
在16个来源构成的VR-X上,UniVR总体得分58.2,较Emu3.5的39.8提升18.4%;长程规划提升25.2%,JEPA距离从33.62降至13.01。它还将MMMU从0.292提升至0.337、MM-Vet从28.0提升至35.6。结果表明,视觉轨迹不仅能改善生成,也能反过来增强多模态理解。不过,模型仍依赖VLM裁判、有限规模评测集和高训练成本;真正机器人闭环中的安全性、因果理解与跨环境泛化仍待验证。
深度分析
研究背景
现有MLLM主要从文本学习世界知识,并用Chain-of-Thought进行推理;Gemini、GPT-5等再把文字计划交给Nano Banana或GPT-image生成画面。该流程擅长语言表达,却难以保持连续物理状态。Emu3.5等统一模型能处理图像、文本和视频,但训练仍大量依赖图文对,且多聚焦艺术生成。UniVR转向原始视觉轨迹,试图学习动作、空间和动力学。
核心问题
目标是在同一模型中统一长程操作、空间谜题、视觉搜索和物理推理,并让生成轨迹既完成终点任务,又保持中间步骤合理。难点在于任务时间尺度差异大、错误常发生在细粒度中间帧,而全局VLM评分容易只看终态和画质;同时,语言描述无法完整表达连续接触、形变与遮挡。
核心创新
第一,提出无语言依赖的视觉空间下一帧预测。第二,提出VR-GRPO,将全局任务奖励与Step-Focal局部奖励结合。第三,利用CLIP特征跨轨迹方差σ(t)自动定位最不确定窗口,而非设计任务专用规则。第四,构建VR-X,覆盖六类任务、16个数据源,并以VLM分数和JEPA物理相似度共同评价。
方法详解
- �� 输入:查询图像、任务指令和视觉演示轨迹。
- �� 模型:Emu3.5的VQ-VAE式统一离散词表,建模p(x_{t+1}|x_{1:t})。
- �� 冷启动:对310k样本进行视觉任务SFT,统一轨迹格式。
- �� 采样:verl框架每组生成8条候选轨迹;视频短边缩放至512像素,最多20k令牌。
- �� 局部奖励:计算σ(t)=sqrt(1/K∑||z_k(t)-z̄(t)||²),取峰值附近4帧窗口;变长轨迹先分段对齐。
- �� 优化:使用Qwen3-VL-30B进行全局和局部成对比较,并按Rreason=Rg−λ|Rg−Rs|更新策略。
实验设计
VR-X从AgiBot、Action100M、EgoDex、VisualCoT等16个来源整理1.5M原始样本,形成310k冷启动、3k RL和1.8k测试样本。比较对象包括Qwen、Gemini、GPT-5加图像生成器,以及Janus-pro、Bagel、Emu3.5等统一模型。指标为0—100的Qwen3.5-397B VLM分数和JEPA距离;同时进行奖励组件、文本RL、联合训练及多模态理解消融。
结果分析
UniVR六项任务分别为59.5、68.0、48.5、46.5、62.2、64.3,总分58.2;Emu3.5为39.8。长程规划从42.4升至63.8,一般推理从46.2升至64.3。JEPA由33.62降至13.01。奖励消融表明成对全局加Step-Focal最有效;在MMMU、MME(P)、MME(C)、MMBench、MathVista、MM-Vet上均有提升。
应用场景
直接应用包括机器人示范学习、家庭服务、烹饪和手工操作规划、导航及视觉编辑。使用者需提供图像轨迹或视频与简短指令,不必为每个中间动作编写文字。工业部署仍需真实传感器闭环、动作安全约束和更低延迟推理,以避免生成画面与实际执行脱节。
局限与展望
当前方法把VLM评价器作为奖励来源,可能受语言偏置和视觉幻觉影响;CLIP嵌入分歧只能近似错误位置,无法替代真实物理模拟。VR-X虽多样但规模有限,且主要是离线轨迹。全参数34B训练、8路采样和20k令牌带来较高成本。未来应加入因果物理模型、真实机器人反馈、在线纠错和跨环境泛化评测。
通俗解读 非专业人士也能看懂
把UniVR想成一个学做菜的机器人。传统机器人先读一份很长的文字菜谱,再让另一个系统把文字变成动作。这样可能知道“最后要端出蛋糕”,却在中途把鸡蛋打到锅外,最后仍被误判为成功。
UniVR直接观看许多完整的做菜录像,学习锅、手、食材在每一刻怎样变化。它一次只预测下一幅画面,因此必须让前后画面接得上。训练时,一位老师先看整段录像,判断是否完成任务;另一位老师专门寻找不同学生录像分歧最大的几秒,检查那里有没有把食材、工具或动作弄错。
最后,机器人不能只追求漂亮结局,还必须让整道菜的过程可信。VR-X就像一套考试,既考打结、折衣和机器人操作,也考迷宫、搜索和空间判断。实验显示,UniVR比原来的Emu3.5更会完成长任务,生成的动作也更接近真实世界。它仍需要更可靠的老师和真实机器人测试,但方向很清楚:有些知识,看比说更重要。
简单解释 像给14岁少年讲一样
想象你在玩一个需要连续操作的游戏:先拿钥匙、绕过障碍、打开门,最后救出角色。普通AI可能会写出一篇超详细攻略,再让画图AI一帧一帧照着画。问题是,攻略说得对,不代表每一帧真的连得上:钥匙可能突然消失,角色可能穿过墙,最后画面却看起来很漂亮。
UniVR的做法像直接看高手录像学操作。它不要求每个动作都配一段文字,而是观察画面怎样变化,并预测下一帧。它先用很多视觉示范训练,再让多个候选答案互相竞争。一个评分看“有没有完成任务”,另一个专门检查大家意见最不一致的片段,比如手是否真的抓住了东西、球是否遵守路线。
这就像游戏里不只看你有没有到终点,还检查你有没有作弊穿墙。VR-X包含打结、做饭、机器人、谜题、搜索和空间任务。UniVR总分58.2,而Emu3.5只有39.8;长程规划提升25.2%。它甚至让MMMU和MM-Vet等理解测试变好。
当然,它还不是万能的。评分老师本身可能看错,训练也很贵,而且实验主要是离线视频,不是真机器人。下一步是让它在现实中边看边做、做错能纠正,并真正学会物理规律。这样,AI才不只是会描述动作,而是会可靠地完成动作!
术语表
Visual Reasoning(视觉推理)
直接依据图像和视频状态进行判断、预测与规划,而非先转成语言。技术上表现为对连续视觉状态转移的建模。
UniVR以视觉轨迹作为推理链。
VR-GRPO(视觉推理组相对策略优化)
面向视觉轨迹的强化学习方法,通过候选组相对比较优化生成策略。它结合全局奖励和局部Step-Focal奖励。
UniVR的核心RL算法。
Step-Focal Reward(步骤聚焦奖励)
集中评估轨迹中最可能出错的局部时间窗口。窗口由候选轨迹CLIP特征的高方差位置确定。
用于补足全局评分遗漏的中间错误。
JEPA Similarity(JEPA相似度)
在潜在表示空间比较生成轨迹与真实轨迹的分布差异。论文使用最大均值差异,数值越低越接近真实物理动态。
VR-X的物理一致性指标。
VR-X
覆盖六类视觉推理任务的大型基准,整合16个来源并提供冷启动、RL和评测划分。
用于训练和比较UniVR。
开放问题 这项研究留下的未解疑问
- 1 VLM裁判能否真正理解接触、摩擦和因果关系仍不确定;未来需要可验证的物理模拟器、传感器反馈或人类闭环评价。
- 2 离线视频学到的策略能否迁移到未见环境、不同物体和真实机器人,论文尚未充分回答。
- 3 如何在保持18.4%总体提升的同时降低34B模型和多候选采样的训练成本,仍是工程难题。
应用场景
近期应用
机器人示范学习
机器人可从操作视频和简短指令学习抓取、折叠、打结等流程,减少逐步文字标注。部署前仍需动作控制器、碰撞检测和真实环境验证。
视觉任务规划
家庭服务、导航、烹饪和手工系统可利用视觉轨迹生成多步计划,并用局部检查发现中间状态错误,适合作为离线规划或人机协作助手。
远期愿景
视觉世界模型
未来模型可能直接从大规模视频学习可执行的世界知识,统一感知、预测和行动。关键障碍是因果物理、跨环境泛化、安全验证与实时计算。
原文摘要
Learning broad world knowledge directly from raw visual data is a fundamental capability of intelligence. We introduce UniVR, the first investigation into simultaneously learning complex reasoning, fine-grained physical dynamics, and long-term planning from pure visual demonstrations. At its core, UniVR features VR-GRPO, a reinforcement learning paradigm with complementary global and step-level rewards. This approach enforces logical coherence and physical consistency throughout the reasoning process without requiring task-specific heuristics or image-text pairs. To train and evaluate UniVR, we construct VR-X, a large-scale benchmark curated from 16 diverse sources spanning long-horizon manipulation, spatial puzzles, and physical reasoning. It is the first comprehensive suite to assess these heterogeneous capabilities under a purely visual protocol. Remarkably, UniVR achieves up to a 25% improvement on VR-X, and its superior visual reasoning also boosts performance on various multimodal understanding benchmarks. These findings underscore the vast potential of reasoning within visual spaces, with all code, data, and models are open-sourced for further research.