Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

TL;DR

JoyAI-Echo-1.5通过音视频记忆生成长视频和互动世界,提升一致性和视觉质量。

cs.CV 🔴 高级 2026-08-24 3 次浏览
Nan Duan Haoyang Huang Weiyang Jin Haoran Li Yaowei Li Yuming Li Yijun Liu Xin Lu Xiaoxiao Ma Yanwen Ma Yaofeng Su Yilang Sun Haoyu Wang Zeyue Xue Songchun Zhang Junhao Zhuang
音视频生成 长视频 互动世界 记忆机制 几何控制

核心发现

方法论

JoyAI-Echo-1.5系统包括长视频和世界模型两个版本。长视频版本通过可组合的跨镜头记忆机制,整合多镜头视觉证据和语音线索,确保角色外观和声音的一致性。世界模型版本将异构导航输入转换为校准的6自由度相机轨迹,通过几何感知的控制路径注入,实现灵活视角下的控制器无关交互。

关键结果

  • JoyAI-Echo-1.5在跨镜头一致性和视觉质量上优于现有基线,WBench平均得分81.7。
  • 在SANA-WM-Bench上表现出色,视觉质量和长时持久性领先。
  • 通过自生成回滚的自梯度强制训练,提升了生成的稳定性。

研究意义

该研究在生成长篇叙事和互动世界方面取得了重要进展。通过引入记忆机制和几何控制,解决了现有模型在长时间生成中身份遗忘和动作输入一致性差的问题,为生成连贯故事和持续演变的互动世界奠定了基础。

技术贡献

JoyAI-Echo-1.5通过音视频教师强制和自梯度强制,将双向音视频骨干转化为因果少步生成器。其长视频版本通过多镜头音视频记忆保持角色一致性,而世界模型版本通过几何感知路径实现灵活交互。

新颖性

该系统首次结合跨镜头记忆和几何控制实现长时音视频生成,与现有方法相比,显著提升了生成的稳定性和一致性。

局限性

  • 系统在处理极端复杂场景时可能存在性能下降。
  • 对高质量数据的依赖可能限制了其在低质量数据集上的表现。

未来方向

未来研究可以探索在更复杂的场景中应用该系统,并进一步优化其在低质量数据集上的表现。

AI 总览摘要

JoyAI-Echo-1.5系统在音视频生成领域取得了突破性进展,特别是在长篇叙事和互动世界的生成方面。现有的视频生成模型在处理长时间生成时,往往会出现身份遗忘和动作输入不一致的问题。JoyAI-Echo-1.5通过引入跨镜头记忆机制和几何控制路径,成功解决了这些问题。

长视频版本的JoyAI-Echo-1.5通过整合多镜头视觉证据和语音线索,确保了角色外观和声音的一致性。而世界模型版本则通过将异构导航输入转换为校准的6自由度相机轨迹,实现了灵活视角下的控制器无关交互。这一创新使得生成的互动世界更加真实和持久。

实验结果表明,JoyAI-Echo-1.5在跨镜头一致性、视觉质量和长时持久性方面均优于现有基线,尤其是在WBench和SANA-WM-Bench上的表现尤为突出。这表明该系统在生成连贯故事和持续演变的互动世界方面具有巨大的潜力。尽管如此,系统在处理极端复杂场景时仍存在一定的性能限制,未来研究可以进一步优化其在低质量数据集上的表现。

深度分析

研究背景

音视频生成技术近年来取得了显著进展,尤其是在短视频生成方面。然而,长篇叙事和互动世界的生成仍面临诸多挑战。现有模型往往在长时间生成中出现身份遗忘和动作输入不一致的问题,限制了其在复杂场景中的应用。

核心问题

长时间音视频生成需要模型在长时间内保持角色身份和动作输入的一致性。这一问题的解决对于生成连贯的故事和互动世界至关重要,但现有模型在处理长时间生成时往往表现不佳。

核心创新

JoyAI-Echo-1.5通过引入跨镜头记忆机制和几何控制路径,实现了长时间音视频生成的稳定性和一致性。跨镜头记忆机制整合多镜头视觉证据和语音线索,而几何控制路径则将异构导航输入转换为校准的6自由度相机轨迹。

方法详解

  • �� 长视频版本通过可组合的跨镜头记忆机制整合多镜头视觉证据。

  • �� 世界模型版本将异构导航输入转换为校准的6自由度相机轨迹。

  • �� 使用音视频教师强制和自梯度强制训练生成器。

实验设计

实验使用了WBench和SANA-WM-Bench数据集,评估了系统在跨镜头一致性、视觉质量和长时持久性方面的表现。通过自生成回滚的自梯度强制训练,提升了生成的稳定性。

结果分析

JoyAI-Echo-1.5在WBench上获得了平均81.7的高分,并在SANA-WM-Bench上表现出色,显示出其在长时间生成中的稳定性和一致性。

应用场景

该系统可用于生成长篇叙事视频和互动游戏世界,特别适合需要长时间角色一致性和动作输入一致性的场景。

局限与展望

尽管系统在长时间生成中表现优异,但在处理极端复杂场景时可能存在性能下降。此外,对高质量数据的依赖可能限制了其在低质量数据集上的表现。

通俗解读 非专业人士也能看懂

想象你在拍一部电影。传统方法就像用一个固定的相机拍摄短片,角色和场景可能会在不同镜头中变化。JoyAI-Echo-1.5就像一个智能导演,能够记住每个角色的样子和声音,即使在长时间拍摄中也能保持一致。它还能根据不同的场景和动作,灵活调整相机角度,就像一个经验丰富的摄像师。这样一来,生成的视频就像一部连贯的电影,角色和故事都能保持一致。

简单解释 像给14岁少年讲一样

想象一下,你在玩一个超级酷的游戏,角色和环境都能根据你的动作变化。JoyAI-Echo-1.5就像游戏中的大脑,能记住每个角色的样子和声音,即使你玩很长时间,角色也不会变样。它还能根据你的动作调整视角,就像你在游戏中自由探索一样。这让游戏世界更加真实和有趣!

术语表

跨镜头记忆 (Cross-shot Memory)

一种机制,用于整合多个镜头的视觉和音频信息,以保持角色的一致性。

用于长视频生成,确保角色外观和声音的一致性。

几何控制路径 (Geometry-aware Conditioning Pathway)

一种将导航输入转换为相机轨迹的方法,以实现灵活视角下的交互。

用于世界模型版本,实现控制器无关的交互。

自梯度强制 (Self-Gradient Forcing)

一种训练方法,通过自生成回滚来提高生成的稳定性。

用于训练生成器,提升长时间生成的稳定性。

6自由度相机轨迹 (6-DoF Camera Trajectories)

描述相机在三维空间中位置和方向的轨迹。

用于世界模型版本,实现灵活的相机控制。

音视频教师强制 (Audio-Visual Teacher Forcing)

一种训练方法,通过引导生成器学习正确的音视频序列。

用于训练生成器,确保音视频生成的准确性。

开放问题 这项研究留下的未解疑问

  • 1 如何在低质量数据集上提高系统性能?
  • 2 如何在极端复杂场景中保持生成的稳定性?

应用场景

近期应用

长篇叙事视频生成

用于电影和电视剧制作,确保角色和故事的一致性。

互动游戏世界

用于游戏开发,提供更真实和连贯的游戏体验。

远期愿景

虚拟现实体验

提供更真实的沉浸式体验,可能改变娱乐和教育行业。

原文摘要

Video generation is progressing beyond isolated clips toward long-form narratives and interactive worlds, requiring models to preserve identities, follow user controls, and remain stable over extended rollouts. We present JoyAI-Echo-1.5, a unified audio-visual generation system with two purpose-built variants. The long-video variant introduces composable cross-shot memory that aggregates visual evidence across multiple prior shots and speaker cues derived from speech-filtered full-shot audio, enabling persistent character appearance and voice identity across flexible combinations of text, image, and memory conditioning. The world-model variant converts heterogeneous navigation inputs into calibrated metric 6-DoF camera trajectories and injects them through a geometry-aware conditioning pathway, enabling controller-agnostic interaction across flexible viewpoints. To support efficient long-horizon generation, we transform a bidirectional audio-visual backbone into a causal few-step generator using progressive teacher forcing and short- and long-horizon Self-Gradient Forcing on self-generated rollouts. Experiments demonstrate strong performance in both settings. JoyAI-Echo-1.5 achieves improvements over existing long-video baselines in cross-shot consistency, visual quality, text alignment, and speech fidelity. Its world-model variant ranks first on WBench, with an average score of 81.7, and achieves leading visual quality and long-horizon persistence on SANA-WM-Bench. Together, these results indicate that memory, geometric control, and rollout-aware training provide a practical foundation for generating coherent stories and continuously evolving interactive worlds. Project page: https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/.

cs.CV