JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation

TL;DR

JavisDiT++通过MS-MoE和TA-RoPE实现高质量音视频生成,超越现有方法。

cs.CV 🔴 高级 2026-02-22 33 次浏览
Kai Liu Yanhao Zheng Kai Wang Shengqiong Wu Rongjunchen Zhang Jiebo Luo Dimitrios Hatzinakos Ziwei Liu Hao Fei Tat-Seng Chua
音视频生成 多模态 深度学习 人类偏好 同步

核心发现

方法论

JavisDiT++采用了一种模块化的MS-MoE设计,提升了单模态生成质量,并通过TA-RoPE策略实现音视频令牌的帧级同步。此外,AV-DPO方法用于对齐模型输出与人类偏好,涵盖质量、一致性和同步性维度。基于Wan2.1-1.3B-T2V,模型在仅使用约100万条公共训练数据的情况下实现了最先进的性能。

关键结果

  • 在JavisBench上,JavisDiT++在音视频质量和一致性方面显著超越UniVerse-1,FVD降至141.5,FAD降至5.5。
  • 在同步性方面,TA-RoPE策略使得音视频同步性指标显著提升,DeSync值降至0.832。
  • 通过消融研究验证了MS-MoE和TA-RoPE模块的有效性,证明了其在不同维度上的贡献。

研究意义

这项研究在音视频联合生成领域树立了新的里程碑,显著提升了生成质量和同步性。通过引入人类偏好对齐,模型生成的音视频内容更符合人类审美和需求,为多模态生成技术在影视、游戏和虚拟现实等领域的应用提供了新的可能性。

技术贡献

JavisDiT++通过MS-MoE和TA-RoPE策略在模型架构上实现了创新,与现有复杂的双流模型相比,提供了更简洁高效的解决方案。此外,首次将人类偏好对齐引入音视频生成,显著提升了生成内容的质量和一致性。

新颖性

JavisDiT++首次将人类偏好对齐应用于音视频联合生成,并通过TA-RoPE实现了精确的时间同步,与传统的ST-Prior和交叉注意机制相比,更加直接和高效。

局限性

  • 模型在处理长时间音视频生成时可能存在性能下降的问题,需进一步优化。
  • 当前的偏好数据集可能不够全面,影响模型的普适性。

未来方向

未来工作可以扩展到更大规模的数据集,探索更复杂的多模态交互机制,并进一步优化人类偏好对齐策略,以提升生成内容的多样性和适应性。

AI 总览摘要

音视频联合生成是多模态生成领域的重要任务,现有开源方法在生成质量和同步性上仍存在不足。JavisDiT++通过引入MS-MoE设计和TA-RoPE策略,显著提升了音视频生成的质量和同步性。此外,通过AV-DPO方法对齐模型输出与人类偏好,使得生成内容更符合人类审美和需求。实验结果表明,JavisDiT++在多个指标上超越了现有方法,特别是在音视频同步性和一致性方面表现突出。尽管如此,模型在处理长时间生成任务时仍需进一步优化,未来工作将继续探索更复杂的多模态交互机制。

深度分析

研究背景

近年来,人工智能生成内容(AIGC)从文本到图像生成快速扩展到视频和音频领域。音视频联合生成(JAVG)作为一种重要任务,旨在从文本描述中生成同步且语义对齐的声音和视觉内容。尽管已有研究在这方面取得进展,但现有开源方法在生成质量和同步性上仍存在不足。

核心问题

现有音视频生成方法在生成质量、时间同步性和与人类偏好的一致性方面存在不足。特别是在生成高质量、同步且符合人类审美的音视频内容方面,仍面临技术挑战。

核心创新

JavisDiT++引入了MS-MoE设计,提升了单模态生成质量,并通过TA-RoPE策略实现音视频令牌的帧级同步。此外,AV-DPO方法用于对齐模型输出与人类偏好,涵盖质量、一致性和同步性维度。

方法详解

  • �� MS-MoE设计:通过多头自注意力层实现跨模态信息交换,并通过单独的FFN层聚合模态内信息。• TA-RoPE策略:在统一时间轴上对齐音视频令牌的位置ID,实现帧级时间同步。• AV-DPO方法:通过多种奖励模型评估生成的音视频样本,并采用归一化的模态感知排名选择优胜劣汰对。

实验设计

实验采用JavisBench和JavisBench-mini进行评估,涵盖音视频质量、一致性和同步性等多个维度的11个指标。模型在仅使用约100万条公共训练数据的情况下,显著超越现有方法。

结果分析

JavisDiT++在音视频质量和一致性方面显著超越UniVerse-1,FVD降至141.5,FAD降至5.5。在同步性方面,TA-RoPE策略使得音视频同步性指标显著提升,DeSync值降至0.832。

应用场景

JavisDiT++在影视制作、游戏开发和虚拟现实等领域具有广泛应用潜力,能够生成高质量、同步且符合人类偏好的音视频内容。

局限与展望

模型在处理长时间音视频生成时可能存在性能下降的问题,需进一步优化。此外,当前的偏好数据集可能不够全面,影响模型的普适性。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,JavisDiT++就像一个智能厨师助手。它能根据你的口味偏好,自动调整食材的搭配和烹饪时间,确保每道菜都色香味俱全。MS-MoE设计就像是不同的厨师,各自负责不同的菜系,而TA-RoPE策略则确保每道菜都能在最佳时间上桌。AV-DPO方法则像是一个品尝小组,确保每道菜都符合你的口味。

简单解释 像给14岁少年讲一样

想象你在玩一个超级酷的游戏,JavisDiT++就像是游戏里的智能助手。它能帮你生成超逼真的音效和画面,让你感觉身临其境。MS-MoE就像是游戏里的不同角色,各自有不同的技能,而TA-RoPE就像是让这些角色完美配合的魔法。AV-DPO就像是一个超级厉害的裁判,确保游戏体验符合你的喜好。

术语表

MS-MoE (模态特定专家混合)

一种模块化设计,提升了单模态生成质量。

用于提升音视频生成的质量。

TA-RoPE (时间对齐旋转位置编码)

一种策略,用于实现音视频令牌的帧级同步。

用于确保音视频的时间同步。

AV-DPO (音视频直接偏好优化)

一种方法,用于对齐模型输出与人类偏好。

用于提升生成内容的质量和一致性。

FVD (弗雷谢视频距离)

衡量生成视频与真实视频之间的距离。

用于评估生成视频的质量。

FAD (弗雷谢音频距离)

衡量生成音频与真实音频之间的距离。

用于评估生成音频的质量。

开放问题 这项研究留下的未解疑问

  • 1 如何在长时间音视频生成中保持高质量和同步性?
  • 2 如何扩展偏好数据集以提高模型的普适性?

应用场景

近期应用

影视制作

可用于生成高质量的音视频内容,提升影视作品的制作效率和效果。

远期愿景

虚拟现实

在虚拟现实中应用,提供更加沉浸式的体验,需解决实时生成的计算挑战。

原文摘要

AIGC has rapidly expanded from text-to-image generation toward high-quality multimodal synthesis across video and audio. Within this context, joint audio-video generation (JAVG) has emerged as a fundamental task that produces synchronized and semantically aligned sound and vision from textual descriptions. However, compared with advanced commercial models such as Veo3, existing open-source methods still suffer from limitations in generation quality, temporal synchrony, and alignment with human preferences. To bridge the gap, this paper presents JavisDiT++, a concise yet powerful framework for unified modeling and optimization of JAVG. First, we introduce a modality-specific mixture-of-experts (MS-MoE) design that enables cross-modal interaction efficacy while enhancing single-modal generation quality. Then, we propose a temporal-aligned RoPE (TA-RoPE) strategy to achieve explicit, frame-level synchronization between audio and video tokens. Besides, we develop an audio-video direct preference optimization (AV-DPO) method to align model outputs with human preference across quality, consistency, and synchrony dimensions. Built upon Wan2.1-1.3B-T2V, our model achieves state-of-the-art performance merely with around 1M public training entries, significantly outperforming prior approaches in both qualitative and quantitative evaluations. Comprehensive ablation studies have been conducted to validate the effectiveness of our proposed modules. All the code, model, and dataset are released at https://JavisVerse.github.io/JavisDiT2-page.

cs.CV cs.MM cs.SD