AVENUE: Audio-Video EditiNg Understanding and Evaluation

TL;DR

AVENUE通过1,291个片段和7,957条编辑指令,评估音视频编辑模型的选择性编辑能力。

cs.MM 🔴 高级 2026-08-31 7 次浏览
Hayeon Kim Yoojin Jang Jaejun Yoo
音视频编辑 多模态 数据集 模型评估 选择性编辑

核心发现

方法论

AVENUE提供了一个包含1,291个源片段和7,957条编辑指令的基准,涵盖音频、视频和音视频耦合编辑类型。评估框架为每个样本提供了具体的编辑和保留内容说明,支持选择性编辑能力的评估。

关键结果

  • 发现现有模型在编辑一种模态时,常引入另一种模态的非预期变化。
  • 在音视频耦合编辑中,联合模型在编辑准确性和一致性上表现出色。
  • 分离模型在音频和视频的单独编辑中表现更好。

研究意义

该研究通过提供一个全面的基准和评估框架,填补了现有音视频编辑模型评估中的空白,有助于推动更可控的音视频编辑模型的发展。

技术贡献

AVENUE首次系统分析了不同编辑范式下的模态选择性问题,并引入了选择性可控性指标,评估模型在保持未编辑模态完整性方面的能力。

新颖性

AVENUE是第一个提供全面编辑类型和模态覆盖的音视频编辑基准,解决了现有评估系统模态盲和样本无关的问题。

局限性

  • 现有模型在编辑一种模态时,难以避免对另一模态的非预期影响。
  • 评估框架需要进一步验证其在不同数据集上的适用性。

未来方向

未来工作可探索更精细的模态选择性控制机制,并扩展基准至更多样化的数据集。

AI 总览摘要

音视频编辑是一个复杂的任务,要求模型根据目标提示修改音频和视频内容。现有的评估系统常常忽视模态选择性和样本特异性,难以有效评估模型的编辑能力。AVENUE通过提供一个包含1,291个源片段和7,957条编辑指令的基准,填补了这一空白。该基准涵盖音频、视频和音视频耦合编辑类型,并提供了一个样本特异性、模态感知的评估框架,明确了每个样本的预期变化和必须保持不变的内容。

通过对代表性音视频编辑模型的评估,研究发现现有模型在编辑一种模态时,常引入另一种模态的非预期变化。AVENUE的评估框架引入了选择性可控性指标,首次系统分析了不同编辑范式下的模态选择性问题。

AVENUE的研究意义在于推动了更可控的音视频编辑模型的发展,为学术界和工业界提供了一个新的评估标准。未来工作可探索更精细的模态选择性控制机制,并扩展基准至更多样化的数据集。

深度分析

研究背景

音视频编辑的研究背景涵盖了多模态生成模型的最新进展,这些模型不仅用于内容创作,还应用于内容编辑任务。现有的音视频编辑框架提出了多种架构,但在模态选择性编辑范围的推理上面临挑战。

核心问题

音视频编辑要求模型不仅要确定需要改变的内容,还要决定哪个模态应被保留。现有评估系统往往忽视模态选择性和样本特异性,难以有效评估模型的编辑能力。

核心创新

AVENUE的核心创新在于提供了一个全面的基准和评估框架,涵盖多种编辑类型和模态组合,解决了现有评估系统模态盲和样本无关的问题。

方法详解

  • �� 提供1,291个源片段和7,957条编辑指令
  • �� 涵盖音频、视频和音视频耦合编辑类型
  • �� 样本特异性、模态感知的评估框架
  • �� 引入选择性可控性指标

实验设计

实验设计包括对代表性音视频编辑模型的评估,涵盖联合、顺序和分离三种编辑范式。评估指标包括编辑准确性、模态选择性、感知质量和音视频一致性。

结果分析

研究发现现有模型在编辑一种模态时,常引入另一种模态的非预期变化。联合模型在音视频耦合编辑中表现出色,而分离模型在单独编辑中更具优势。

应用场景

AVENUE的应用场景包括推动更可控的音视频编辑模型的发展,为学术界和工业界提供一个新的评估标准。

局限与展望

现有模型在编辑一种模态时,难以避免对另一模态的非预期影响。评估框架需要进一步验证其在不同数据集上的适用性。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。音频就像是你正在煮的汤,而视频就像是你在烤的面包。你想要加点盐到汤里,但不希望面包的味道改变。音视频编辑就像是这个过程,模型需要知道什么时候只改变汤的味道,而不影响面包。AVENUE就像是一个食谱,它告诉你如何在不影响面包的情况下,完美地给汤加盐。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你可以改变角色的声音或外观。你想让角色的声音更酷,但不希望外观改变。音视频编辑就像这样,模型需要知道什么时候只改变声音,而不影响外观。AVENUE就像是一个指南,帮助你在不改变外观的情况下,完美地调整声音。

术语表

音视频编辑 (Audio-Video Editing)

根据目标提示修改音频和视频内容的过程。

在论文中指模型根据提示进行的编辑任务。

模态选择性 (Modality Selectivity)

模型在编辑时选择性地改变某一模态而保留另一模态的能力。

评估模型在编辑一种模态时是否能保持另一模态不变。

选择性可控性 (Selective Controllability)

评估模型在保持未编辑模态完整性方面的能力。

作为评估指标,用于衡量模型的编辑精确性。

联合模型 (Joint Model)

同时处理音频和视频流的统一框架。

在论文中指AvED模型。

分离模型 (Separate Model)

独立应用于音频和视频的单模态模型。

在论文中指RAVE+ZETA和RAVE+SDEdit模型。

开放问题 这项研究留下的未解疑问

  • 1 如何在编辑一种模态时完全避免对另一模态的非预期影响?
  • 2 现有评估框架在不同数据集上的适用性如何?

应用场景

近期应用

视频编辑软件

可以用于开发更精细的音视频编辑工具,帮助用户实现更精准的编辑效果。

远期愿景

智能媒体制作

推动智能媒体制作的发展,实现更高效的内容创作和编辑。

原文摘要

Audio-video (AV) editing aims to modify audio and video content according to a target prompt. Unlike single-modality editing, AV editing requires models to infer a modality-selective edit scope from the prompt alone: determining not only what should change, but also which modality should be preserved. Faithfully evaluating such models therefore requires both (i) benchmarks that span diverse edit types and modality categories, and (ii) evaluation that is itself modality-aware and sample-specific. However, existing AV editing benchmarks provide limited coverage of edit types and modality combinations, while current evaluation systems are often modality-blind and sample-agnostic, making it difficult to assess whether models faithfully preserve the unintended modality. To address these gaps, we introduce AVENUE, Audio-Video EditiNg Understanding and Evaluation, comprising two contributions: (1) a benchmark of 1,291 source clips and 7,957 editing instructions across audio-targeted, video-targeted, and AV-coupled edit types, curated and human-verified from VGGSound; and (2) a sample-specific, modality-aware evaluation framework that specifies, for each sample, both the intended change and the content that must remain intact. We evaluate representative AV editing models spanning three editing paradigms : joint, sequential, and separate, providing the first systematic analysis of modality-selectivity across paradigms. Our findings reveal a fundamental open challenge: when editing one modality, existing models frequently induce unintended changes in the other, regardless of paradigm. AVENUE provides a benchmark and modality-aware evaluation framework to drive progress toward more controllable AV editing models. Our dataset is publicly available on Hugging Face: https://huggingface.co/datasets/AVENUE-dataset/AVENUE.

cs.MM cs.CV cs.SD