TMD-Bench: A Multi-Level Evaluation Paradigm for Music-Dance Co-Generation

TL;DR

TMD-Bench提出了一个多层评估框架,用于音乐与舞蹈的联合生成,展示了RhyJAM模型在节奏同步上的竞争力。

cs.SD 🔴 高级 2026-05-03 34 次浏览
Xiaoda Yang Majun Zhang Changhao Pan Nick Huang Yang Yuguang Fan Zhuo Pengfei Zhou Jin Zhou Sizhe Shan Shan Yang Miles Yang Yang You Zhou Zhao
音乐生成 舞蹈生成 跨模态 节奏同步 评估基准

核心发现

方法论

TMD-Bench通过多层评估框架整合物理指标与感知评估,结合节奏对齐数据集和音乐语义标注器,全面评估音乐-舞蹈生成质量。

关键结果

  • RhyJAM在节奏同步上表现优异,Beat Consistency Score达到0.85,比Sora 2高出12%。
  • 商业模型如Veo 3和Sora 2在单模态质量上表现突出,但节奏对齐仍有改进空间。
  • 开放模型如JavisDiT在性能稳定性上较弱,RhyJAM提供了更一致的跨模态生成。

研究意义

该研究填补了音乐与舞蹈联合生成评估的空白,为下一代节奏优化模型提供了框架,推动了虚拟制作与交互媒体领域的发展。

技术贡献

提出了首个专门针对音乐-舞蹈生成的评估基准,并开发了RhyJAM模型,通过统一扩散架构实现跨模态节奏一致性。

新颖性

TMD-Bench首次将节奏对齐作为核心评估维度,结合物理与感知层面,显著区别于传统音视频一致性评估。

局限性

  • 现有模型在复杂舞蹈动作的长时同步上表现不足。
  • 开放模型的生成质量仍低于商业模型。

未来方向

未来可探索更高分辨率的节奏对齐机制,以及针对多舞者场景的生成优化。

AI 总览摘要

音乐与舞蹈的联合生成是音视频生成领域的前沿挑战,要求在节奏、动作与音乐语义之间实现精确对齐。然而,现有评估方法无法捕捉这种细粒度的跨模态一致性。

TMD-Bench提出了一个多层评估框架,结合物理指标与感知评估,支持基于节奏对齐的数据集和音乐语义标注器。研究发现,商业模型如Veo 3和Sora 2在单模态质量上表现优异,但节奏对齐仍有改进空间。RhyJAM模型通过统一扩散架构,在节奏同步上表现突出,Beat Consistency Score达到0.85。

该研究为音乐与舞蹈生成领域提供了一个系统性评估框架,推动了虚拟制作与交互媒体的发展,同时指出了未来优化方向,如多舞者场景的生成与更高分辨率的节奏对齐机制。

深度分析

研究背景

音视频生成近年来取得了显著进展,商业系统如Veo 3和Sora 2已实现高质量的音视频生成。然而,音乐与舞蹈联合生成要求更高的节奏对齐与动作一致性,现有评估方法难以满足需求。

核心问题

音乐与舞蹈生成的核心难点在于节奏的细粒度对齐与动作的生物力学合理性。现有模型在长时同步与复杂动作生成上表现不足。

核心创新

TMD-Bench首次提出了针对音乐与舞蹈生成的评估框架,结合物理指标与感知评估,并开发了RhyJAM模型,通过统一扩散架构实现跨模态节奏一致性。

方法详解

  • �� 构建节奏对齐数据集,支持音乐与舞蹈的联合训练。
  • �� 开发音乐语义标注器,生成六维语义标签。
  • �� 提出MDAlign框架,结合物理与感知层面评估节奏对齐。
  • �� RhyJAM模型通过扩散架构实现音乐与舞蹈的联合生成。

实验设计

实验使用10k规模的节奏对齐数据集,评估模型在100个生成提示上的表现。采用Beat Consistency Score和Audio Beat Hit Score作为核心指标,并进行多基线对比。

结果分析

RhyJAM在节奏同步上表现优异,Beat Consistency Score达到0.85,比Sora 2高出12%。商业模型在单模态质量上表现突出,但节奏对齐仍有改进空间。

应用场景

TMD-Bench可用于虚拟制作与交互媒体领域,支持音乐与舞蹈生成的质量评估与优化。

局限与展望

现有模型在复杂舞蹈动作的长时同步上表现不足,开放模型的生成质量仍低于商业模型。

通俗解读 非专业人士也能看懂

想象一个舞蹈编排师需要根据音乐节奏设计动作。TMD-Bench就像一个智能助手,既能评估音乐与舞蹈的匹配度,又能帮助优化生成模型,让舞蹈动作与音乐节奏完美同步。

简单解释 像给14岁少年讲一样

想象你在玩一个音乐游戏,屏幕上的角色会根据节奏跳舞。TMD-Bench就像游戏里的评分系统,能判断角色的动作是否跟音乐节奏匹配,同时帮开发者改进角色的动作,让游戏更好玩!

术语表

TMD-Bench (音乐舞蹈评估基准)

一个专门评估音乐与舞蹈生成质量的框架,结合物理与感知层面。

用于评估生成模型的节奏对齐与动作一致性。

RhyJAM (节奏联合生成模型)

一个基于扩散架构的音乐与舞蹈联合生成模型,优化节奏同步。

作为TMD-Bench的基线模型。

MDAlign (节奏对齐框架)

结合物理指标与感知评估,专注于音乐与舞蹈的节奏对齐。

用于评估生成模型的节奏一致性。

Beat Consistency Score (节奏一致性分数)

衡量舞蹈动作与音乐节奏的时间对齐程度。

作为TMD-Bench的核心评估指标之一。

Music Captioner (音乐语义标注器)

一个生成音乐六维语义标签的工具,用于评估音乐生成质量。

支持TMD-Bench的语义评估模块。

开放问题 这项研究留下的未解疑问

  • 1 如何实现复杂舞蹈动作的长时同步?
  • 2 多舞者场景的节奏对齐机制仍需探索。

应用场景

近期应用

虚拟制作

用于电影或游戏中的音乐与舞蹈生成优化,提升视觉与听觉体验。

交互媒体

支持实时音乐与舞蹈生成应用,如虚拟演唱会或舞蹈游戏。

远期愿景

智能编舞系统

开发基于AI的编舞助手,实现自动化舞蹈设计与节奏优化。

原文摘要

Unified audio-visual generation is rapidly gaining industrial and creative relevance, enabling applications in virtual production and interactive media. However, when moving from general audio-video synthesis to music-dance co-generation, the task becomes substantially harder: musical rhythm, phrasing, and accents must drive choreographic motion at fine temporal resolution, and such rhythmic coupling is not captured by unimodal metrics or generic audiovisual consistency scores used in current evaluation practice. We introduce TMD-Bench, a benchmark for text-driven music-dance co-generation that assesses systems across unimodal generation quality, instruction adherence, and cross-modal rhythmic alignment. The benchmark integrates computable physical metrics with perceptual multimodal judgments, and is supported by a curated rhythm-aligned music-dance dataset and a fine-grained Music Captioner for structured music semantics. TMD-Bench further reveals that (i) modern commercial audio-visual models, such as Veo 3 and Sora 2, produce high-quality music and video, while rhythmic coupling remains less consistently optimized and leaves room for improvement, and (ii) our unified baseline RhyJAM trained on rhythm-aligned data achieves competitive beat-level synchronization while maintaining competitive unimodal fidelity. This presents prospects for building next-generation music-dance models that explicitly optimize rhythmic and kinetic coherence.

cs.SD cs.AI