Back to the Features: DINO as a Foundation for Video World Models

TL;DR

提出DINO-world,基于DINOv2特征预测未来帧,提升视频理解与规划能力。

cs.CV 🔴 高级 2025-07-26 45 次浏览
Federico Baldassarre Marc Szafraniec Basile Terver Vasil Khalidov Francisco Massa Yann LeCun Patrick Labatut Maximilian Seitzer Piotr Bojanowski
视频预测 世界模型 深度学习 自监督学习 迁移学习

核心发现

方法论

本文提出以预训练的DINOv2图像编码器为基础,构建视频潜在空间中的未来预测模型。模型采用变换器架构,通过交叉注意力机制预测未来帧的特征,训练在约60M未标注视频数据上。模型可处理不同帧率和分辨率,利用大规模无标注数据学习场景动态。还引入观察-动作轨迹微调,实现动作条件规划。实验涵盖密集预测、物理理解和规划任务,验证模型优于现有方法。

关键结果

  • 在VSPW分割预测任务中,模型在预测0.5秒后mIoU提升6.3%,超越V-JEPA和COSMOS。深度预测误差显著低于对比模型,表现出优异的场景理解能力。通过在大规模未标注视频上预训练,模型在多个数据集上展现出强泛化能力。微调后在强化学习环境中的规划任务中表现优异,验证了其控制潜力。
  • 在物理理解任务中,模型在IntPhys和GRASP基准测试中表现出与V-JEPA相当的预测误差,显示其对物理规律的理解。多任务评估表明,该模型在多样场景下均具备良好的预测和推理能力。训练规模和数据多样性是模型优越性能的关键因素。
  • 消融研究显示,模型大小和预训练数据规模对性能影响显著。采用更大变换器和更丰富数据集,模型在密集预测和物理理解任务中表现更佳。微调策略证明,动作条件微调能有效提升规划性能,减少训练成本。

研究意义

该研究突破了视频世界模型的效率瓶颈,通过在预训练的语义特征空间中进行未来预测,显著降低训练复杂度,提升泛化能力。其结合大规模无标注视频数据与预训练图像模型,为自主系统、机器人和虚拟环境中的场景理解提供了新途径。模型在多任务、多场景中的优越表现,推动了无监督学习在复杂动态环境中的应用前沿,为未来智能体的自主规划和控制奠定基础。

技术贡献

提出基于DINOv2特征的潜在空间未来预测架构,采用变换器交叉注意力机制,支持变量帧率和分辨率。模型在大规模未标注视频上预训练,显著减少参数规模(<1B),提升训练效率。引入观察-动作微调策略,实现动作条件规划。整体架构简洁高效,兼具多任务适应性和迁移能力,优于现有像COSMOS和V-JEPA的复杂模型。

新颖性

首次在预训练的自监督图像特征空间中构建大规模视频未来预测模型,结合变换器架构实现高效预测。区别于以像素为基础的生成模型,此方法在保持语义信息的同时降低计算成本。创新点在于模型的通用性、多任务适应性及动作微调机制,为视频理解和规划提供新范式。

局限性

  • 模型依赖预训练特征的语义丰富性,可能在极端场景或细粒度任务中表现不足。训练仍需大量计算资源,尽管比像COSMOS更高效,但对硬件要求仍较高。对复杂物理或极端动态场景的预测能力有限,未来需增强模型的物理推理能力。

未来方向

未来将探索多模态融合,结合文本或声音信息增强场景理解。计划引入更复杂的物理和动力学模型,提升对真实世界的模拟能力。还将研究模型在实际机器人和自主系统中的迁移应用,推动从模拟到现实的无缝迁移。

AI 总览摘要

随着视频数据的爆炸式增长,如何高效理解和预测动态场景成为人工智能领域的重要挑战。传统像素级模型虽能生成高质量视频,但计算成本高昂且难以泛化。为突破这一瓶颈,本文提出DINO-world,一种基于预训练图像特征的潜在空间未来预测模型。该模型利用大规模未标注视频数据,通过变换器架构学习场景的时间动态,显著提升预测准确性和泛化能力。

核心创新在于在强大的DINOv2特征空间中进行未来帧预测,避免像素级复杂度,降低训练成本。模型采用交叉注意力机制,支持多尺度、多帧率输入,兼容多任务场景。实验结果显示,在VSPW、Cityscapes和KITTI等多个数据集上,模型在密集预测和物理理解任务中均优于现有方法,尤其在预测未来0.5秒的场景中,mIoU提升6.3%。此外,模型通过观察-动作微调,展现出良好的控制和规划能力,验证了其在自主系统中的潜力。

该研究为视频理解提供了新思路:利用预训练的语义特征空间进行高效预测,结合大规模无标注数据,推动无监督学习在复杂动态环境中的应用。未来,将结合多模态信息,增强模型的物理推理和迁移能力,助力自主机器人和虚拟环境的发展。尽管如此,模型仍面临在极端场景和细粒度任务中的挑战,需持续优化算法和数据策略,推动其更广泛的实际应用。

深度分析

研究背景

视频理解与预测技术近年来快速发展,代表性工作包括V-JEPA、COSMOS和SORA等。这些模型在像素生成、场景理解和物理推理方面取得一定成果,但普遍存在计算资源消耗大、泛化能力不足的问题。深度学习的进步推动了自监督预训练方法,尤其是DINO系列模型,显著提升了图像特征的语义表达能力。当前研究多集中在像素级生成或有限域的场景,缺乏在大规模未标注视频上的通用模型。如何在保持高效性的同时,提升模型的场景理解和预测能力,成为学界关注焦点。

核心问题

现有视频预测模型多依赖像素重建,计算成本高,难以扩展到大规模场景。像素级模型在复杂环境中容易捕捉到无关细节,导致泛化能力差。此外,缺乏统一的评估标准和多任务能力,限制了模型在实际应用中的推广。如何利用预训练的语义特征空间,构建高效、泛用的未来预测模型,成为亟待解决的问题。

核心创新

本研究提出在预训练的DINOv2特征空间中进行未来帧预测,避免像素级复杂度,提升效率。采用变换器交叉注意力机制,实现多尺度、多时间点的预测,支持变量帧率和分辨率。引入观察-动作微调策略,增强模型的控制能力。整体架构简洁,参数规模小于1B,训练在大规模未标注视频上,显著优于像COSMOS和V-JEPA等模型。此方法实现了高效、多任务和迁移能力,为未来视频理解提供新范式。

方法详解

  • �� 以预训练的DINOv2模型作为图像编码器,将每帧映射到潜在特征空间。• 构建变换器架构的未来预测器,利用交叉注意力机制,输入过去帧的特征和时间信息,预测未来帧的特征。• 采用变量时间间隔采样策略,增强模型对不同预测距离的适应性。• 训练目标为逐帧预测未来特征,使用平滑L1损失,支持多帧、多尺度预测。• 通过在大规模未标注视频集上预训练,学习丰富的场景动态和语义信息。• 微调阶段加入动作条件,提升控制和规划能力。• 训练过程中采用多尺度、多帧率输入,确保模型的泛化和适应性。

实验设计

使用约66M未标注视频数据,涵盖多场景和动态。在VSPW、Cityscapes、KITTI等数据集上评估密集预测性能,指标包括mIoU和深度RMSE。对比V-JEPA、COSMOS等基线,验证模型在未来0.2秒和0.5秒的预测中优越表现。通过消融实验分析模型大小、数据规模和微调策略对性能的影响。还在物理理解任务中测试模型的合理性,验证其对物理规律的掌握。多任务评估显示模型在场景理解和控制方面具有广泛适应性。

结果分析

模型在VSPW预测任务中,未来0.5秒的mIoU比第二名高出6.3%,达68.6%。在深度预测中,RMSE降低至3.214,优于V-JEPA和COSMOS。密集预测和物理理解任务中,模型表现出强大泛化能力。微调后在强化学习环境中实现有效规划,验证了动作条件微调的优势。消融研究显示,模型参数规模和训练数据的丰富性对性能影响显著。整体结果表明,基于预训练特征空间的未来预测模型在效率和效果上均优于传统像素级模型。

应用场景

该模型可广泛应用于自主驾驶、机器人控制、虚拟环境模拟等场景,依赖大规模未标注视频数据,具备良好的迁移能力。通过微调实现动作规划,支持在线决策和路径优化。未来结合多模态信息,将推动智能体在复杂环境中的自主学习和适应能力。模型的高效性也使其适合边缘设备部署,为实际工业应用提供技术基础。

局限与展望

模型依赖预训练特征的语义丰富性,在极端或细粒度场景中表现有限。训练仍需大量计算资源,硬件要求较高。对复杂物理场景的推理能力不足,未来需引入更强的物理模型。此外,模型在极端动态或遮挡场景中的预测准确性仍待提升。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,食材代表视频中的场景。传统模型像是用手去抓每个菜叶,既费力又容易出错。而本文的方法像是用一个聪明的厨师助手,他提前学习了所有食材的特性,知道哪些菜叶会动、什么时候会变色。这个助手不用每次都看每个菜叶的细节,而是用他学到的“菜的特征”来预测未来的变化。这样,他可以更快、更准地告诉你下一步该做什么,也能帮你规划整个菜肴的流程。这个“助手”就是用大规模未标注视频学习到的“菜的特征”,在潜在空间中预测未来的场景变化。它比传统的像素级模型更聪明、更高效,能在不同菜肴和厨房环境中都表现出色。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,每次你都要记住很多细节,比如角色的位置、动作、环境变化。以前的模型就像是用放大镜看每一帧画面,试图一一复制,但这样既慢又费力。现在,这个新方法就像是你有一个聪明的朋友,他提前学会了游戏的规则和场景的特点,知道每个角色会怎么动、环境会怎么变。你只需要告诉他你想要预测的时间点,他就能用自己学到的“游戏的秘密”快速告诉你未来会发生什么。这个朋友用的是“场景的抽象特征”——不用每个像素都看清楚,而是用更聪明的“游戏规则”来预测未来。这样一来,不仅快,还能在不同的游戏中都用得上,甚至还能帮你制定最好的策略!

原文摘要

We present DINO-world, a powerful generalist video world model trained to predict future frames in the latent space of DINOv2. By leveraging a pre-trained image encoder and training a future predictor on a large-scale uncurated video dataset, DINO-world learns the temporal dynamics of diverse scenes, from driving and indoor scenes to simulated environments. We show that DINO-world outperforms previous models on a variety of video prediction benchmarks, e.g. segmentation and depth forecasting, and demonstrates strong understanding of intuitive physics. Furthermore, we show that it is possible to fine-tune the predictor on observation-action trajectories. The resulting action-conditioned world model can be used for planning by simulating candidate trajectories in latent space.

cs.CV