EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation

TL;DR

EgoVid-5M以500万片段和EgoDreamer实现文本—运动联合的第一人称视频生成。

cs.CV 🟡 进阶级 2024-11-13 27 次浏览
Xiaofeng Wang Kang Zhao Feng Liu Jiayu Wang Guosheng Zhao Xiaoyi Bao Zheng Zhu Yingya Zhang Xingang Wang
第一人称视频 视频生成 动作控制 VIO 扩散模型

核心发现

方法论

论文从Ego4D构建EgoVid-5M,使用ParticleSfM、IMU滤波、最小二乘与Kalman Filter估计相机平移和旋转,并用LLaVA-NeXT-Video-32B-Qwen与Qwen2生成动作文本。数据清洗结合EgoVideo、CLIP、RAFT和DOVER,筛选文本一致性、帧稳定性、运动强度及清晰度。EgoDreamer通过Unified Action Encoder和Adaptive Alignment联合注入文本与运动条件。

关键结果

  • EgoVid-train含4.9M样本,EgoVid-val含1.2K样本,1080p视频平均约120帧;EgoVid-65K提供准确IMU运动标注,规模约为此前最大运动标注集的5倍。
  • 相较未使用EgoVid的SVD、DynamiCrafter和OpenSora,微调后CD-FVD分别由591.61降至548.32、243.63降至236.82、809.46降至718.32;三者语义、动作、清晰度和运动指标均提升。
  • DynamiCrafter的动作一致性由0.481升至0.494,运动强度由9.357升至18.329;实验显示过度清洗导致静止,弱清洗造成剧烈抖动,综合策略更能保留手部局部动作。

研究意义

该工作填补了大规模第一人称视频生成数据的空白。Ego4D和Ego-Exo4D主要服务感知任务,存在噪声运动和简单叙述;EgoVid-5M则把视频、动作文本、相机运动与清洗元数据统一起来,为VR、AR、游戏和具身智能提供可复用训练基础。

技术贡献

技术上,论文将VIO运动估计系统化为生成控制信号:ParticleSfM提供尺度不确定位姿,IMU积分补充尺度与动态信息,再通过Butterworth滤波、质量筛选、最小二乘优化和Kalman融合获得平滑轨迹。EgoDreamer以Plücker embedding编码几何运动,以CLIP和交叉注意力编码文本,并用多尺度参数对齐替代简单的ControlNet零初始化。

新颖性

论文声称EgoVid-5M是首个专为第一人称视频生成构建的高质量公开数据集。其根本新意不是单纯扩大规模,而是同时提供低层运动控制、高层动作语义和逐视频清洗元数据;EgoDreamer进一步显式建模二者耦合,区别于许多只控制平滑镜头或分离编码条件的方法。

局限性

  • 完整数据的精确IMU并不普遍,作者仅为65K个具有可靠IMU的视频标注运动控制;因此大规模训练仍可能依赖估计轨迹。
  • 数据源于Ego4D,场景和佩戴设备分布受原数据限制;自动生成文本可能继承MLLM误识别,且论文尚未充分报告跨数据集泛化。
  • 实验主要验证短视频微调与指标改善,长期物理一致性、交互闭环和真实VR部署仍未证明。

未来方向

未来可扩大真实同步IMU与多视角标注,改进文本事实核验和长时段轨迹建模,并研究动作规划、对象状态及用户反馈的闭环生成。公开清洗元数据也有助于比较不同筛选阈值、训练策略与跨数据集迁移效果。

AI 总览摘要

视频生成正从视觉合成走向“世界模拟器”,但第一人称视角更难:摄像机随头部和身体快速运动,手部动作细碎,家庭、户外、办公室和运动场景差异巨大。传统WebVid-10M、Panda-70M等通用数据集缺少可靠动作控制;Ego4D虽规模可观,却包含噪声运动和与画面不一致的简单叙述,难以直接训练生成模型。

Wang等人提出EgoVid-5M,包含500万第一人称视频片段,分辨率最高1080p,并配备高层动作文本和低层VIO运动信号。其流程以ParticleSfM、IMU、Butterworth滤波、最小二乘和Kalman Filter重建轨迹;LLaVA-NeXT-Video-32B-Qwen与Qwen2生成细致描述;EgoVideo、CLIP、RAFT和DOVER则评估动作语义、帧一致性、运动与清晰度。基于数据,EgoDreamer用Unified Action Encoder和Adaptive Alignment联合控制文本动作与相机运动。

结果显示,EgoVid微调普遍改善SVD、DynamiCrafter和OpenSora:CD-FVD分别下降43.29、6.81和91.14,DynamiCrafter动作一致性升至0.494、运动强度升至18.329。研究意义在于建立了从数据清洗到可控生成的完整基础设施,但精确运动标注仅覆盖65K片段,长期物理一致性和真实交互仍是开放问题。

深度分析

研究背景

扩散模型与DiT推动视频生成发展,Sora等工作展示了视觉模型作为世界模拟器的潜力。现有数据集如WebVid-10M、Panda-70M面向通用文本—视频生成;Ego4D和Ego-Exo4D主要服务第一人称理解。它们缺少适合生成训练的运动平滑性、帧一致性和精确动作描述,因此第一人称动作驱动生成仍明显不足。

核心问题

第一人称生成需同时回答两个问题:视频中“做了什么”,以及摄像机和身体“如何移动”。噪声IMU、未知尺度、相机—惯导外参、初始速度和剧烈镜头运动会破坏训练;简单旁白又不能准确对应画面。若清洗过强,局部手部动作消失;清洗过弱,则出现抖动和语义断裂。

核心创新

  • ��构建500万片段的EgoVid-5M,并释放标注与清洗元数据。
  • ��用VIO融合ParticleSfM和IMU,产生平移、旋转控制。
  • ��用MLLM加LLM生成覆盖主体、背景和动作的文本。
  • ��结合EgoVideo、CLIP、RAFT、DOVER建立第一人称专用筛选体系。
  • ��EgoDreamer以Unified Action Encoder耦合文本和运动,以Adaptive Alignment进行多尺度控制。

方法详解

  • ��运动估计:ParticleSfM得到尺度含糊的相机位姿;IMU经高低通Butterworth滤波去除重力与高频噪声,并以Np≥Nthres及方差阈值筛选质量。
  • ��轨迹优化:通过min||TI PI(T−1)−λPc||²估计初速度、外参和尺度,随后用Kalman Filter融合。
  • ��文本标注:LLaVA生成详细视频描述,Qwen2压缩为动作叙述,并提取名词和动词类别。
  • ��清洗评估:CLIP/EgoVideo测语义与动作对齐,帧CLIP测一致性,RAFT测光流,DOVER测清晰度。
  • ��生成:Plücker embedding编码几何;CLIP与交叉注意力编码文本;AA按Li=αLi+(Ai−μL)/σL注入多尺度控制。

实验设计

数据划分为EgoVid-train 4.9M、EgoVid-val 1.2K及具备可靠IMU的EgoVid-65K。模型包括U-Net架构SVD、DynamiCrafter和DiT架构OpenSora,采用预训练权重并持续训练480p视频。指标包括CD-FVD、CLIP语义一致性、EgoVideo动作一致性、DOVER清晰度、帧插值运动平滑度和RAFT运动强度;同时比较不同清洗策略。

结果分析

SVD使用EgoVid后CD-FVD从591.61降至548.32,语义一致性从0.258升至0.266;DynamiCrafter从243.63降至236.82,动作一致性从0.481升至0.494;OpenSora从809.46降至718.32。清洗消融表明,策略1缺少局部运动,策略2运动过强,策略3在动作保真与稳定性间取得更好平衡。

应用场景

EgoVid-5M可用于VR和AR中的第一人称环境预演、游戏中的动作条件场景生成,以及具身智能的视觉想象与策略训练。实际应用需要可靠动作输入、目标对象状态和安全验证;EgoDreamer还可作为从语言指令到视觉结果的中间模拟器,辅助机器人和交互代理规划。

局限与展望

数据继承Ego4D的设备、场景和参与者偏差,自动文本存在语义幻觉风险。精确IMU只覆盖65K样本,VIO在纹理不足、快速旋转或遮挡场景中可能失效。训练与清洗需要大量GPU资源,实验主要关注短视频和离线指标,尚未证明长时物理规律、真实动作闭环及跨数据集泛化。

通俗解读 非专业人士也能看懂

把这项研究想成训练一位“第一人称电影导演”。普通视频数据像大量电影片段,只告诉导演画面大概讲什么,却没有告诉他摄影机每一秒向哪里转、移动多远。EgoVid-5M像一所更严格的导演学校:它从500万段视频中保留画面清楚、动作连贯、镜头不过度摇晃的片段,并给每段视频配上“打开门、拿起工具”这样的说明,以及摄影机移动轨迹。

研究者先像修理测量仪器一样,把摄像机画面和身体上的惯性传感器结合起来,估计真实运动;再让视觉语言模型描述人物、物体、背景和动作。随后,系统检查文字是否真的符合画面、相邻画面是否跳变、镜头是否太快、视频是否清晰。

EgoDreamer则像一位能听懂剧本、又能按轨道移动摄影机的导演。文字告诉它要做什么,运动信号告诉它镜头和身体怎样动。实验表明,这种训练能让生成视频更连贯、更符合动作。不过它仍可能误读复杂场景,且并非每段视频都有同样准确的运动测量。

简单解释 像给14岁少年讲一样

想象你在做一个超酷的游戏:玩家说“打开浴室门”,电脑不只是生成一张图片,而是生成一段像玩家亲眼看到的连续视频。难点是,玩家的视角会跟着头部晃动,手会伸出去,门会移动,背景还可能很乱。普通网络视频只会告诉电脑“这里有个人”或“有人在洗车”,却不一定说明镜头怎么移动。

EgoVid-5M就是给电脑准备的超大练习册,里面有500万段第一人称短视频。每段视频都尽量配上两类提示:一句人类能读懂的动作说明,以及一条记录镜头移动和旋转的路线。研究者还像老师批改作业一样,删除文字不符合画面、画面跳来跳去或太模糊的视频。

EgoDreamer像游戏里的导演。你给它一句动作指令,再给它运动路线,它就尝试生成符合要求的第一人称视频。它把“做什么”和“怎么移动”一起学习,而不是分别死记。

结果很有意思:用这套数据训练后,SVD、DynamiCrafter和OpenSora都变好了。例如DynamiCrafter的动作一致性从0.481提高到0.494,运动强度从9.357提高到18.329。当然,它还不是完美模拟器:快速转身、遮挡和长时间动作仍可能出错。未来它或许能帮助游戏、VR和机器人更聪明地想象世界!

术语表

EgoVid-5M(第一人称视频数据集)

专为第一人称视频生成构建的500万片段集合。它同时包含动作文本、运动控制和清洗元数据。

作为训练、验证和数据筛选研究的核心数据源。

Visual-Inertial Odometry(视觉惯性里程计)

融合视频与惯性传感器估计相机运动的技术。它可补充单目视觉的尺度和动态信息。

用于生成平移、旋转等低层运动标注。

Unified Action Encoder(统一动作编码器)

同时编码文本动作与几何运动的模块。它通过CLIP、Plücker embedding和注意力建模条件耦合。

EgoDreamer的动作条件入口。

Adaptive Alignment(自适应对齐)

将多尺度动作特征按参数化方式对齐到扩散网络特征的机制。公式为Li=αLi+(Ai−μL)/σL。

增强文本和运动对生成分支的控制。

CD-FVD

衡量生成视频空间与时间质量的分布距离指标,数值越低通常越好。

比较三种基线微调前后的整体视频质量。

开放问题 这项研究留下的未解疑问

  • 1 如何在数百万段视频中获得普遍可靠的同步IMU与对象状态标注,仍缺少低成本方案;现有VIO在遮挡、弱纹理和快速旋转时会失效。
  • 2 短视频指标改善是否能转化为长时物理一致性与真实交互能力,尚未由跨数据集、闭环机器人或VR实验充分验证。

应用场景

近期应用

VR/AR场景预演

开发者可用动作文本和相机轨迹生成第一人称草案,快速测试用户视角、镜头运动与交互流程。前提是提供合理的文本和运动条件,预期可减少人工制作原型的成本。

游戏动作生成

游戏团队可将“拿起工具、打开抽屉”等指令转成第一人称视频参考,用于关卡设计、动作原型和沉浸式过场。生成结果仍需人工审核碰撞、物理和角色一致性。

远期愿景

具身智能世界模拟器

未来可把EgoDreamer接入机器人或智能体规划器,让系统先预测执行动作后的视觉结果,再选择策略。关键障碍是长时记忆、对象状态、真实动力学和安全闭环。

原文摘要

Video generation has emerged as a promising tool for world simulation, leveraging visual data to replicate real-world environments. Within this context, egocentric video generation, which centers on the human perspective, holds significant potential for enhancing applications in virtual reality, augmented reality, and gaming. However, the generation of egocentric videos presents substantial challenges due to the dynamic nature of egocentric viewpoints, the intricate diversity of actions, and the complex variety of scenes encountered. Existing datasets are inadequate for addressing these challenges effectively. To bridge this gap, we present EgoVid-5M, the first high-quality dataset specifically curated for egocentric video generation. EgoVid-5M encompasses 5 million egocentric video clips and is enriched with detailed action annotations, including fine-grained kinematic control and high-level textual descriptions. To ensure the integrity and usability of the dataset, we implement a sophisticated data cleaning pipeline designed to maintain frame consistency, action coherence, and motion smoothness under egocentric conditions. Furthermore, we introduce EgoDreamer, which is capable of generating egocentric videos driven simultaneously by action descriptions and kinematic control signals. The EgoVid-5M dataset, associated action annotations, and all data cleansing metadata will be released for the advancement of research in egocentric video generation.

cs.CV