FAMA: The First Large-Scale Open-Science Speech Foundation Model for English and Italian

TL;DR

FAMA是首个大规模开源的英语和意大利语语音基础模型,速度提升8倍。

cs.CL 🟡 进阶级 2025-05-29 7 次浏览
Sara Papi Marco Gaido Luisa Bentivogli Alessio Brutti Mauro Cettolo Roberto Gretter Marco Matassoni Mohamed Nabih Matteo Negri
语音处理 开源 自动语音识别 语音翻译 模型训练

核心发现

方法论

FAMA使用开源数据集进行训练,包含150k小时的语音数据。模型架构采用Conformer编码器和Transformer解码器,分别有12和6层(小模型)或24和12层(中模型)。训练过程分为ASR预训练和ASR+ST联合训练两个阶段。

关键结果

  • FAMA中模型在ASR任务中平均提高4.4 WER(英语)和6.4 WER(意大利语),与Whisper中等模型相比。
  • 与OWSM v3.1中等模型相比,FAMA中模型在意大利语上提高了7.3 WER。
  • FAMA模型在计算效率上比Whisper快5-8倍。

研究意义

FAMA的推出填补了语音处理领域开源模型的空白,促进了研究的透明性和可重复性。通过提供开源的代码和数据集,FAMA使得研究人员能够更公平地评估和比较不同的语音模型,推动了语音技术的开放科学发展。

技术贡献

FAMA的技术贡献在于其完全基于开源数据和代码进行训练,避免了数据污染问题。与现有的封闭模型相比,FAMA在保持高性能的同时,显著提高了计算效率。

新颖性

FAMA是首个完全基于开源数据和代码的语音基础模型,解决了现有模型在可重复性和数据透明性上的不足。

局限性

  • FAMA在语音翻译任务中的表现仍落后于一些非开源模型。
  • 模型在多语言扩展性上仍需进一步研究。

未来方向

未来的研究方向包括扩展FAMA至更多语言,并开发新的开源数据集以提高语音翻译性能。

AI 总览摘要

近年来,语音基础模型(SFM)如Whisper和SeamlessM4T在语音处理领域取得了显著进展。然而,这些模型的封闭性限制了其可重复性和公平评估。FAMA的推出填补了这一空白,成为首个大规模开源的英语和意大利语语音基础模型。FAMA在150k小时的开源语音数据上进行训练,采用Conformer编码器和Transformer解码器架构,显著提高了计算效率。

FAMA在自动语音识别(ASR)任务中表现出色,与现有模型相比,平均提高了4.4 WER(英语)和6.4 WER(意大利语)。此外,FAMA在计算效率上比Whisper快5-8倍。所有的代码、数据集和模型均在开源许可下发布,促进了语音技术研究的开放性。

尽管FAMA在ASR任务中表现优异,但在语音翻译(ST)任务中仍需改进。未来的研究将专注于扩展FAMA至更多语言,并开发新的开源数据集以提高ST性能。这将进一步推动语音技术的开放科学发展,促进更广泛的参与和包容性应用。

深度分析

研究背景

语音处理技术近年来取得了显著进展,尤其是在自动语音识别(ASR)和语音翻译(ST)领域。现有的语音基础模型如Whisper和SeamlessM4T虽然性能优异,但由于其封闭性,限制了研究的可重复性和公平评估。其他领域已经通过开发完全透明的模型取得了显著进展,而语音处理领域在这方面的努力仍然有限。

核心问题

现有的语音基础模型由于其封闭性,导致训练数据和代码不可访问,阻碍了模型的可重复性和公平评估。此外,数据污染问题也使得现有模型的评估结果不够可靠。

核心创新

FAMA的核心创新在于其完全基于开源数据和代码进行训练,确保了数据的透明性和模型的可重复性。通过使用Conformer编码器和Transformer解码器架构,FAMA在保持高性能的同时,显著提高了计算效率。

方法详解

  • �� 使用150k小时的开源语音数据进行训练
  • �� 架构采用Conformer编码器和Transformer解码器
  • �� 训练过程分为ASR预训练和ASR+ST联合训练两个阶段
  • �� 使用多种损失函数组合进行优化,包括标签平滑交叉熵损失和CTC损失

实验设计

实验设计包括使用CommonVoice、MLS和VoxPopuli等数据集进行评估。基线模型包括Whisper和OWSM等。关键超参数包括学习率、采样概率等。实验还进行了消融研究,以评估不同训练策略的影响。

结果分析

FAMA在ASR任务中表现优异,与Whisper中等模型相比,平均提高了4.4 WER(英语)和6.4 WER(意大利语)。在计算效率上,FAMA比Whisper快5-8倍。尽管在ST任务中仍需改进,但FAMA在ASR任务中的表现已接近非开源模型。

应用场景

FAMA的直接应用场景包括语音识别和翻译系统,尤其适用于需要高效处理大规模语音数据的场合。其开源特性使得研究人员能够在此基础上进行进一步的研究和开发。

局限与展望

FAMA在语音翻译任务中的表现仍落后于一些非开源模型。此外,模型在多语言扩展性上仍需进一步研究。未来的改进方向包括开发新的开源数据集以提高ST性能。

通俗解读 非专业人士也能看懂

想象你在一个大型图书馆里,FAMA就像一个超级图书管理员,它能快速找到你想要的书(语音数据),并且能用多种语言给你讲解(语音识别和翻译)。传统的图书管理员虽然也很优秀,但由于他们的工作方法是保密的,其他人无法学习和改进。而FAMA则是完全公开的,任何人都可以了解它的工作原理,并在此基础上进行改进。这就像是把图书馆的管理方法公开给所有人,让大家都能参与进来,提高整个图书馆的服务效率。

简单解释 像给14岁少年讲一样

想象一下,你在玩一个超级酷的游戏,这个游戏可以让你用声音来控制角色!但问题是,游戏的开发者不告诉你他们是怎么做到的,所以你不能自己创建类似的游戏。FAMA就像是一个开源的游戏引擎,任何人都可以看到它的代码,并用它来创建自己的游戏。它不仅让游戏运行得更快,还能让你用多种语言来玩游戏!这是不是很酷?

术语表

Conformer编码器

一种结合了卷积和自注意力机制的编码器,用于处理语音信号。

FAMA模型使用Conformer编码器来提高语音识别的准确性。

Transformer解码器

一种基于自注意力机制的解码器,用于生成目标序列。

FAMA模型采用Transformer解码器来生成翻译结果。

开源数据集

公开可用的数据集,任何人都可以访问和使用。

FAMA使用开源数据集进行训练,确保数据的透明性。

自动语音识别(ASR)

将语音信号转换为文本的技术。

FAMA在ASR任务中表现优异,显著提高了识别准确性。

语音翻译(ST)

将一种语言的语音转换为另一种语言的文本。

FAMA在语音翻译任务中仍需改进,但已取得一定进展。

开放问题 这项研究留下的未解疑问

  • 1 如何提高FAMA在语音翻译任务中的性能?目前的模型在翻译准确性上仍有不足,需要开发新的数据集和训练方法。
  • 2 FAMA在多语言扩展性上的表现如何?需要进一步研究以评估其在其他语言上的适用性。

应用场景

近期应用

语音识别系统

FAMA可用于开发高效的语音识别系统,适用于需要处理大规模语音数据的场合。

语音翻译应用

FAMA可用于开发多语言语音翻译应用,帮助用户在不同语言间进行交流。

远期愿景

多语言语音助手

FAMA的开源特性使其成为开发多语言语音助手的理想基础,未来有望支持更多语言和功能。

原文摘要

The development of speech foundation models (SFMs) like Whisper and SeamlessM4T has significantly advanced the field of speech processing. However, their closed nature--with inaccessible training data and code--poses major reproducibility and fair evaluation challenges. While other domains have made substantial progress toward open science by developing fully transparent models trained on open-source (OS) code and data, similar efforts in speech remain limited. To fill this gap, we introduce FAMA, the first family of open science SFMs for English and Italian, trained on 150k+ hours of OS speech data. Moreover, we present a new dataset containing 16k hours of cleaned and pseudo-labeled speech for both languages. Results show that FAMA achieves competitive performance compared to existing SFMs while being up to 8 times faster. All artifacts, including code, datasets, and models, are released under OS-compliant licenses, promoting openness in speech technology research.

cs.CL cs.AI cs.SD