核心发现
方法论
LeVJEPA基于单一编码器,通过最大化全局与局部视图的表示不变性,结合SIGReg正则化,避免崩溃问题。模型架构仅由编码器与投影头组成,无需目标编码器、预测器或停止梯度机制。训练过程中,随机丢弃部分token,减少计算负担,同时提升下游性能。采用块因果注意力,确保时间序列的因果性,增强模型的预测能力。该方法在多尺度视图下进行,利用单一超参数实现目标简化,极大提升预训练效率。
关键结果
- 在相同训练轮次和数据集条件下,LeVJEPA在ViT-S/B/L模型上,预训练计算量比V-JEPA 2少5.6到20.8倍,性能持平或超越,ImageNet-1K线性探测精度提升7.6个百分点。通过随机token丢弃,模型在保持较低计算成本的同时,显著改善了下游任务表现。
- 在匹配总FLOPs条件下,LeVJEPA在动作识别和静态图像识别任务中均优于现有最强基线,特别是在运动理解任务中表现优异,几乎翻倍提升运动相关的准确率。
- 采用块因果注意力后,模型无需额外的时间序列建模或重编码,能够实现逐帧扩展,符合自回归世界模型的需求,展现出良好的推理和流式处理能力。
研究意义
该研究突破了视频预训练的高成本瓶颈,提出了无需复杂架构和辅助机制的简洁方案,极大降低了训练门槛。其在效率和性能上的双重提升,为大规模视频理解和多模态学习提供了新思路,有望推动自动驾驶、视频分析等行业的快速发展。同时,模型的因果性设计也为未来自回归视频生成和实时推理奠定基础,具有深远的学术与应用价值。
技术贡献
LeVJEPA的核心创新在于引入崩溃无关的目标函数,摒弃传统的目标编码器、预测器和停止梯度机制,采用单一编码器与正则化手段实现稳定训练。通过随机token丢弃和单超参数设计,极大简化了预训练流程。模型采用块因果注意力,确保时间序列的因果性,支持逐帧推理。实验验证其在多任务、多模型规模上的优越性,展示了预训练效率的飞跃。
新颖性
这是首个在视频预训练中完全摆脱架构不对称和复杂机制的方案,利用SIGReg正则化实现崩溃预防,结合随机token丢弃提升效率。相较于传统的自监督方法如V-JEPA、VideoMAE,LeVJEPA在简洁性和效率上实现了质的飞跃,开创了视频表示学习的新范式。
局限性
- 当前方法依赖大量未标注视频数据,仍需大量预训练时间,尽管比传统方法更高效,但对硬件资源依赖仍较大。
- 模型在极端稀疏token设置下可能出现性能下降,特别是在运动理解任务中,稀疏观察可能影响动态信息捕获。
- 对复杂场景中的长时依赖建模能力有限,未来需结合更强的时间建模机制以提升长序列理解。
未来方向
未来将探索多尺度、多模态预训练策略,结合视频生成模型,提升模型的长时依赖和推理能力。同时,研究更智能的token丢弃策略,以在保证效率的同时增强动态信息捕获。还计划将模型应用于实时视频分析和机器人交互场景,推动自回归视频生成与理解的结合。
AI 总览摘要
视频作为自然界的动态表现形式,蕴含丰富的时间信息,但其高昂的计算成本一直限制了大规模预训练的普及。传统方法依赖复杂的架构设计,如目标编码器、预测器和结构化遮挡,既增加了训练复杂度,也限制了模型的扩展性。本文提出LeVJEPA,一种简洁高效的无崩溃目标的视频预训练框架,彻底颠覆了这一局面。
LeVJEPA核心在于引入崩溃无关的目标函数,通过最大化全局与局部视图的表示一致性,结合SIGReg正则化,确保表示的多样性与稳定性。模型架构仅由编码器和投影头组成,无需目标编码器、预测器或停止梯度机制,极大简化了训练流程。随机丢弃部分token,降低计算负担的同时,增强模型的鲁棒性和泛化能力。
实验结果显示,在相同训练轮次和数据集条件下,LeVJEPA在ViT-S/B/L模型上,预训练计算量比V-JEPA 2少5.6到20.8倍,性能表现不输甚至超越。采用块因果注意力后,模型实现了逐帧推理,符合自回归模型的需求,且在运动理解任务中表现出色,几乎翻倍提升运动相关准确率。这些成果表明,视频预训练的门槛已被大幅降低,未来有望在自动驾驶、视频分析等领域得到广泛应用。
整体而言,LeVJEPA不仅在效率上实现突破,还在模型简洁性和推理能力上带来新可能,为视频理解和多模态学习开启了新的路径。其设计理念和技术手段,为未来大规模、低成本的视频预训练提供了宝贵的参考。
深度解读
原文摘要
Video carries the temporal structure of the physical world, yet learning representations from it has remained computationally expensive: prevailing self-supervised methods either prevent representation collapse through architectural asymmetries, coupling an exponential-moving-average target encoder, a stop-gradient, and a capacity-limited predictor, or circumvent it by reconstructing masked content in pixel space. We introduce LeVJEPA, the first video encoder trained under LeJEPA's collapse-free objective, which dispenses with both. A single encoder is trained with an invariance loss over global and local views of a clip, regularized by SIGReg, which excludes collapse with a provable guarantee. The architecture reduces to an encoder and a projector, and the objective to a single hyperparameter. This formulation admits two properties. First, the cost of pretraining is governed by the number of tokens the encoder observes; uniform random token dropping renders this number small while simultaneously improving downstream accuracy. At matched epochs on identical data, LeVJEPA matches or surpasses V-JEPA 2 across ViT-S/B/L at 5.6 to 20.8x less pretraining compute, and at matched total FLOPs it exceeds the strongest video baseline by 7.6 points on ImageNet-1K while remaining competitive on motion-centric benchmarks. Second, since no asymmetry between branches is required, the encoder can be trained with block-causal attention at no measurable accuracy cost: temporal ordering becomes a property of the encoder itself. Against a compute-matched DINOv2 trained on frames of the same videos, LeVJEPA approaches the image-pretrained encoder on appearance-centric evaluation while nearly doubling its motion-centric accuracy. These results indicate that, once its computational overhead is removed, video becomes a viable and in several respects preferable substrate for general-purpose visual pretraining.