Unified Audio Intelligence Without Regressing on Text Intelligence
提出Audex,基于Nemotron-Cascade-2-30B-A3B的统一音频文本大模型,实现音频理解、识别、翻译及生成,保持文本推理能力。
核心发现
方法论
Audex采用单一Transformer解码器架构,将音频输入通过音频编码器映射到文本嵌入空间,音频和文本输出采用统一的离散token预测机制。训练过程中,结合157.4B音频tokens和320.5B文本tokens的多阶段监督学习,后续通过文本RL和多域策略蒸馏,确保模型在音频理解、语音识别、翻译、TTS等任务中达到SOTA水平,同时保持其文本推理和知识能力。
关键结果
- Audex在音频理解、语音识别、翻译等任务中表现优异,音频理解指标接近Step-Audio-R1.1-33B和Qwen-Omni-30B-A3B-Thinking,语音识别WER达到7.91%,优于对比模型。其在长上下文理解(64K到1M tokens)方面表现出色,推理能力与原文本模型基本持平,且支持多模态生成,涵盖语音、音乐和环境声。
- 在多项推理和知识测评中,Audex保持或超越其文本基础模型的表现,如IMO AnswerBench、AIME 2026和HMMT Feb2025,显示出多模态融合不影响文本推理能力。
- 模型架构创新在于单一Transformer解码器处理音频和文本,利用扩展词汇表和离散音频token,结合多阶段训练策略,有效融合多模态信息,提升多任务性能,且兼容现有大模型训练基础设施。
研究意义
该研究突破了多模态大模型在保持文本推理能力同时实现音频理解和生成的瓶颈,为未来通用人工智能迈出关键一步。模型架构简洁,兼容性强,极大推动了多模态融合技术的发展,满足实际应用中对多任务、多模态的需求,具有广泛的工业和学术价值。
技术贡献
提出单一Transformer解码器架构,将音频编码映射到文本空间,统一处理音频和文本tokens,创新性地扩展词汇表以支持多模态任务。结合多阶段监督训练、文本RL和多域蒸馏,有效融合多模态信息,保持文本推理能力,显著优于现有多模态模型的性能退化问题。
新颖性
首次在单一Transformer解码器架构中实现音频与文本的无缝融合,利用扩展词汇表和离散音频tokens,突破多模态模型在推理和知识保持上的性能退化难题,展现出强大的多任务、多模态能力。
局限性
- 模型在极端噪声环境下的音频理解仍存在一定性能下降,主要由于音频编码器对复杂环境的鲁棒性不足。
- 训练成本较高,依赖大规模多模态数据集,未来需优化模型参数效率和数据采样策略。
- 多模态输出的质量在某些非语音音频生成任务中仍有提升空间,尤其是在高保真度和多样性方面。
未来方向
未来将探索更高效的模型架构以降低训练成本,增强模型在极端环境下的鲁棒性。同时,扩展多模态输出能力,支持更多样的音频生成任务,推动多模态理解与生成的深度融合,朝着更通用的人工智能方向发展。
AI 总览摘要
随着人工智能技术的发展,音频作为人类感知和交流的重要媒介,其理解和生成能力成为衡量智能水平的重要标志。传统模型多在单一任务或模态中表现优异,但难以兼顾多模态融合与推理能力。本文提出Audex,一种基于Nemotron-Cascade-2-30B-A3B的统一音频文本大模型,创新性地采用单一Transformer解码器架构,将音频输入映射到文本嵌入空间,统一处理音频和文本tokens,实现多模态融合与生成。模型通过多阶段监督学习,结合157.4B音频tokens和320.5B文本tokens的海量数据,训练出在音频理解、语音识别、翻译、TTS等任务中表现优越的模型,且在长上下文推理和知识保持方面与原文本模型基本持平。实验证明,Audex在多个公开基准中达到了SOTA水平,尤其在语音识别(WER 7.91%)和多模态生成任务中表现突出。该模型架构简洁、兼容性强,为多模态AI的发展提供了新思路。未来,模型将进一步优化鲁棒性和生成质量,推动多模态融合技术的广泛应用,助力实现更通用的人工智能。
深度分析
研究背景
音频作为人类感知和交流的核心媒介,经历了从传统信号处理到深度学习的演变。早期工作如DeepMind的WaveNet、OpenAI的Jukebox在音频生成方面取得突破,但多模态融合仍受限于模型复杂度和推理能力。近年来,诸如Audio Flamingo、Qwen-Audio等模型在音频理解和生成方面表现出色,但多模态融合过程中,模型往往在保持文本推理能力方面出现退化,限制了其应用范围。多模态大模型的目标是实现音频、视觉与文本的无缝融合,满足复杂场景的多任务需求,但现有方法多依赖堆叠模型或多阶段训练,架构复杂,难以扩展。
核心问题
核心问题在于如何在保证文本推理和知识能力的基础上,实现音频理解、识别和生成的多模态融合。现有模型在多模态任务中常出现性能退化,特别是在推理、长上下文理解和知识保持方面。此外,模型架构复杂,训练成本高,限制了大规模应用。解决这一瓶颈,需设计简洁高效的统一架构,充分利用已有文本模型的能力,同时融合音频信息,避免性能退化。
核心创新
本研究的创新点包括:1)提出单一Transformer解码器架构,将音频编码映射到文本嵌入空间,实现音频与文本的无缝融合;2)扩展词汇表以支持离散音频tokens,提升多模态生成能力;3)采用多阶段监督训练策略,结合157.4B音频tokens和320.5B文本tokens,确保模型在多任务中的表现;4)结合文本RL和多域蒸馏,强化模型的推理、知识和长上下文理解能力。这些创新突破了多模态融合的性能瓶颈,兼顾多任务、多模态需求。
方法详解
- �� 音频输入通过AF-Whisper编码器提取特征,映射到模型维度。• 扩展词汇表,加入音频专用token。• 使用单一Transformer解码器,输入音频和文本tokens,进行自回归预测。• 训练过程中,结合多阶段监督学习,利用157.4B音频tokens和320.5B文本tokens,覆盖多任务场景。• 采用多域蒸馏和文本RL,强化推理和知识能力。• 在训练中引入辅助loss和类别无关指导,提升多模态融合效果。• 训练后,模型支持多模态任务,包括音频理解、识别、翻译、TTS和音频生成。
实验设计
模型在多个公开数据集上进行评估,包括LibriSpeech、Fleurs、AudioCaps等,比较基线模型如Step-Audio、Qwen-Omni等。指标涵盖WER、BLEU、Fréchet距离等。采用不同上下文长度(64K到1M tokens)验证长上下文能力。通过消融实验验证多阶段训练、词汇扩展和蒸馏策略的贡献。模型在音频理解、语音识别、翻译、TTS和音频生成任务中均达到了或超过SOTA水平,验证了架构的有效性。
结果分析
Audex在音频理解和识别任务中表现优异,WER低至7.91%,优于对比模型。长上下文理解能力显著提升,支持1M tokens的推理。多模态生成方面,支持语音、音乐和环境声的高质量生成,且保持文本推理能力。模型在多个推理和知识测评中表现与文本基础模型一致,验证了多模态融合的成功。整体来看,模型在保持文本能力的同时,极大增强了音频任务的表现。
应用场景
该模型可广泛应用于智能音箱、语音助手、多模态内容创作、自动字幕生成、环境监测等场景。只需配备相应的音频输入设备,即可实现高效的多模态交互和内容生成,推动智能交互和内容理解的行业升级。未来还可结合视觉信息,构建更全面的多模态智能系统。
局限与展望
模型在极端噪声环境下表现仍有限,音频编码器鲁棒性不足。训练成本高,依赖大规模多模态数据集,硬件资源消耗大。多模态输出质量在某些高保真场景中仍需提升,尤其在音乐和环境声的多样性方面。未来需优化模型结构和训练策略,以实现更高效、更鲁棒的多模态融合。
通俗解读 非专业人士也能看懂
想象你有一个超级智能的工厂,工厂里不仅可以听到各种声音,还能理解这些声音代表的意思。这个工厂有一个特别的机器人,它可以听到音乐、环境声甚至人说的话,然后告诉你它听到了什么,还能用声音表达出来。这个机器人不用很多不同的机器,而是用一个聪明的“大脑”——就像一个超级大脑一样,把所有声音和文字都放在一起理解。它还可以记住很长时间的对话内容,像和朋友聊天一样自然。这个技术的厉害之处在于,它能同时理解和生成多种声音和文字内容,不仅仅局限于单一任务,就像一个全能的助手,帮你做各种事情,比如翻译、讲故事、唱歌或帮你找东西。未来,这样的机器人会变得越来越聪明,能帮我们解决很多复杂的问题,让生活变得更方便、更有趣。
简单解释 像给14岁少年讲一样
想象你有个超级厉害的朋友,他不仅能听懂你说的话,还能听懂各种不同的声音,比如鸟叫、汽车声、音乐等等。更神奇的是,他还能用声音帮你讲故事、唱歌,甚至帮你翻译不同的语言。这个朋友用的不是普通的耳朵,而是一个特别聪明的大脑,能把所有声音变成文字,再用文字表达出来。它还可以记住很长的对话,不会忘记之前说过的话。以前的机器人只能做单一任务,比如只会翻译或只会唱歌,但现在这个技术让它变得像个全能的助手,能同时理解和创造各种声音和文字。未来,这样的技术会让我们的生活变得更方便、更有趣,就像有个超级助手随时帮你解决问题一样。
原文摘要
Audio intelligence involves understanding, reasoning about, and generating both audio and speech. In this work, we introduce Nemotron-Labs-Audex-30B-A3B (Audex), a unified audio-text LLM built on Nemotron-Cascade-2-30B-A3B, a strong text-only MoE LLM. Audex adopts a simple unified design with a single Transformer decoder: audio inputs are encoded and projected into the text embedding space, while text tokens and quantized audio output tokens are treated uniformly during generation. This architecture enables strong audio-text fusion, seamless multimodal generation, and compatibility with standard LLM training and inference infrastructure. For training, we meticulously curate audio-text datasets comprising 157.4B audio tokens and 320.5B text tokens. We apply multi-stage supervised training on these datasets, followed by text-only Cascade RL and multi-domain on-policy distillation. Audex delivers state-of-the-art audio understanding, speech recognition and translation, text-to-speech, audio generation, and speech-to-speech generation, while preserving very compelling reasoning, alignment, knowledge, long-context, and agentic capabilities of its text-only LLM backbone with marginal or no regression. We release the model checkpoints to facilitate open research.