Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing

TL;DR

SIEDD模型在RealEdit基准上实现最佳语音编辑性能,超越自回归基线。

cs.SD 🔴 高级 2026-08-06 5 次浏览
Iftach Shoham Tali Dror Oren Gal Haim Permuter Gilad Katz Eliya Nachmani
语音修复 离散扩散 语音编辑 文本引导 多编解码器

核心发现

方法论

SIEDD采用离散扩散框架进行文本引导的语音修复和编辑。核心架构HiCoDD遵循RVQ生成顺序,将已生成的码本视为干净的声学上下文,仅对当前精炼码本应用扩散。模型结合了音素级条件、跨度定位的无分类器引导和时长预测,支持固定时长修复和可变时长文本编辑。

关键结果

  • 在RealEdit基准上,SIEDD在所有评估方法中实现了最低的WER和MCD,以及最高的说话人相似度。
  • 在语音修复设置中,SIEDD在单个和多个间隙上均优于评估的自回归基线。
  • 实验表明,显式建模编解码器层次结构显著改善了上下文保留的语音重建和编辑。

研究意义

SIEDD在语音修复和编辑领域具有重要意义。它不仅在RealEdit基准上表现出色,还展示了在多种语音修复设置中的优越性。通过显式建模编解码器层次结构,该模型在保留上下文的同时实现了更高质量的语音重建和编辑。

技术贡献

SIEDD的技术贡献在于其离散扩散框架,该框架通过显式建模编解码器层次结构,实现了上下文保留的语音重建和编辑。与传统自回归方法相比,SIEDD在多个语音修复设置中表现出色。

新颖性

SIEDD首次将离散扩散应用于文本引导的语音修复和编辑,显式建模编解码器层次结构。这一创新使得模型能够在保留上下文的同时实现高质量的语音重建。

局限性

  • 模型在长时间间隙的修复性能可能下降。
  • 对多样化的语音数据集的适应性有待验证。

未来方向

未来研究可以探索SIEDD在多语言环境中的应用,以及在更复杂的语音编辑任务中的性能。

AI 总览摘要

语音录音常常包含缺失、损坏或错误的区域,这些区域需要在不重新合成整个语句的情况下进行重建或修改。SIEDD模型通过离散扩散框架实现了文本引导的语音修复和编辑,其核心架构HiCoDD遵循RVQ生成顺序,将已生成的码本视为干净的声学上下文,仅对当前精炼码本应用扩散。该模型在RealEdit基准上实现了最佳的语音编辑性能,超越了评估的自回归基线。SIEDD通过显式建模编解码器层次结构,显著改善了上下文保留的语音重建和编辑。尽管在长时间间隙的修复性能可能下降,但SIEDD在多种语音修复设置中表现出色。未来研究可以探索其在多语言环境中的应用,以及在更复杂的语音编辑任务中的性能。

深度分析

研究背景

语音修复和编辑是语音处理领域的重要研究方向。传统方法依赖于信号处理假设,如局部平稳性、自回归预测等,但在处理跨越音素、音节或单词的缺失区域时常常失败。近年来,研究逐渐转向基于生成模型的方法,如扩散、流匹配和神经编解码语言模型。

核心问题

语音修复和编辑需要生成的语音既能表达预期的词语,又能与周围的说话人身份、韵律、时序和录音条件保持一致。传统方法在处理长时间缺失区域时常常失败,因此需要新的方法来解决这一问题。

核心创新

SIEDD通过离散扩散框架实现了文本引导的语音修复和编辑。其核心创新在于显式建模编解码器层次结构,使得模型能够在保留上下文的同时实现高质量的语音重建。

方法详解

  • �� SIEDD采用离散扩散框架进行文本引导的语音修复和编辑。 • HiCoDD遵循RVQ生成顺序,将已生成的码本视为干净的声学上下文。 • 模型结合了音素级条件、跨度定位的无分类器引导和时长预测。

实验设计

实验在RealEdit基准上进行,评估了SIEDD在多种语音修复设置中的性能。使用的评估指标包括WER、MCD和说话人相似度。

结果分析

SIEDD在RealEdit基准上实现了最佳的语音编辑性能,超越了评估的自回归基线。实验表明,显式建模编解码器层次结构显著改善了上下文保留的语音重建和编辑。

应用场景

SIEDD可用于修复损坏的录音、去除局部噪声或伪影、恢复丢失的数据包以及恢复遗漏的语音。

局限与展望

尽管SIEDD在多种语音修复设置中表现出色,但在长时间间隙的修复性能可能下降。未来研究可以探索其在多语言环境中的应用。

通俗解读 非专业人士也能看懂

想象一个拼图游戏,你有一个完整的拼图,但有些地方缺失了。SIEDD就像一个聪明的拼图大师,它能根据周围的拼图块,完美地填补这些缺失的部分。它不仅能修复缺失的部分,还能根据你的指示,修改拼图中的某些部分,使其看起来更加完美。就像在一个音乐会中,乐队的某个乐器突然失声,SIEDD就像一个万能乐手,能无缝地补上缺失的音符,让音乐继续流畅地演奏下去。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的拼图游戏,有些拼图块不见了!SIEDD就像一个超级聪明的拼图大师,它能根据周围的拼图块,完美地填补这些缺失的部分。它不仅能修复缺失的部分,还能根据你的指示,修改拼图中的某些部分,使其看起来更加完美。就像在一个音乐会中,乐队的某个乐器突然失声,SIEDD就像一个万能乐手,能无缝地补上缺失的音符,让音乐继续流畅地演奏下去。是不是很酷?

术语表

离散扩散 (Discrete Diffusion)

一种生成模型,通过逐步去噪来重建数据。

用于生成和修复语音片段。

RVQ (Residual Vector Quantization)

一种编码技术,用于逐层细化音频信号。

用于表示语音的层次结构。

音素级条件 (Phoneme-level Conditioning)

在音素级别上对生成过程进行约束。

用于提高语音生成的准确性。

无分类器引导 (Classifier-free Guidance)

一种生成技术,通过结合条件和无条件预测来提高生成质量。

用于增强语音编辑的准确性。

RealEdit基准 (RealEdit Benchmark)

一个用于评估语音编辑性能的基准数据集。

用于测试SIEDD的性能。

开放问题 这项研究留下的未解疑问

  • 1 如何在多语言环境中应用SIEDD?
  • 2 SIEDD在长时间间隙的修复性能如何提升?

应用场景

近期应用

录音修复

SIEDD可用于修复损坏的录音,去除局部噪声或伪影。

远期愿景

多语言语音编辑

探索SIEDD在多语言环境中的应用,提升跨语言语音编辑的性能。

原文摘要

Speech recordings often contain missing, corrupted, or incorrect regions that must be reconstructed or modified without re-synthesizing the entire utterance. Speech inpainting restores missing segments, whereas speech editing replaces spoken content according to an edited transcript. Both tasks require the generated speech to express the intended words while remaining consistent with the surrounding speaker identity, prosody, timing, and recording conditions. Discrete diffusion is particularly well suited to these tasks because it can iteratively refine masked tokens while jointly conditioning on both left and right acoustic context. We introduce SIEDD, a discrete diffusion framework for text-guided speech inpainting and editing over hierarchical codec tokens. Its core architecture, HiCoDD, follows the RVQ generation order by representing previously generated codebooks as clean, committed acoustic context and applying diffusion only to the current refinement codebook. This separation enables leakage-free joint training while matching sequential coarse-to-fine inference. The model further combines phoneme-level conditioning, span-localized classifier-free guidance, and duration prediction to support both fixed-duration inpainting and variable-duration text edits. On the RealEdit benchmark, SIEDD achieves the best overall speech-editing performance among the evaluated methods. It also outperforms the evaluated autoregressive baselines across all speech-inpainting settings, on both single and multiple gaps. These results demonstrate that explicitly modeling the codec hierarchy substantially improves context-preserving speech reconstruction and editing. See our full code at https://github.com/iftachShoham/SIEDD.

cs.SD cs.CL cs.LG