NemotronLabs VoiceChat: An Open Full-duplex Speech-to-Speech Model with Tool Calling Capabilities
NemotronLabs VoiceChat是一个全双工语音模型,具有工具调用功能,在Full-Duplex-Bench上表现优异。
核心发现
方法论
该模型结合了流媒体语音编码器和仅解码语言模型,支持代理文本和结构化函数调用的并行输出流。辅助RNN-T分支用于增量用户转录,流媒体TTS解码器用于语音生成。
关键结果
- 在Full-Duplex-Bench 1.0上,NemotronLabs VoiceChat实现了最低的暂停处理接管率,用户中断后100%接管,响应质量得分为4.33/5。
- 在Full-Duplex-Bench 1.5上,用户反馈后93%的情况下恢复响应。
- 在VoiceBench上获得55.1的标准化平均分,在Full-Duplex-Bench 3.0上工具选择F1为82.5%。
研究意义
NemotronLabs VoiceChat展示了在一个开放的语音到语音模型中集成全双工交互、语音识别和生成、通用语言能力以及外部工具使用的可能性,而不牺牲实时对话行为。
技术贡献
该模型通过统一架构实现了全双工、实时、无缝的语音交互,消除了多模型或API切换的需要,从而降低了端到端延迟。
新颖性
NemotronLabs VoiceChat首次在一个开放模型中实现了全双工语音交互和工具调用的无缝集成,与传统的级联架构相比,显著减少了延迟。
局限性
- 工具调用的参数准确性和端到端工具执行仍需改进。
- 模型在某些复杂对话场景中可能表现不佳。
未来方向
未来工作可以集中在提高工具调用的参数准确性和端到端执行效率,以及扩展模型在更多复杂对话场景中的适用性。
AI 总览摘要
NemotronLabs VoiceChat是一个创新的全双工语音到语音模型,结合了流媒体语音编码器和解码器,仅解码语言模型,支持工具调用。现有的语音代理通常依赖级联架构,导致延迟较高,而NemotronLabs VoiceChat通过统一架构实现了实时、无缝的语音交互。
该模型在Full-Duplex-Bench 1.0上实现了最低的暂停处理接管率,用户中断后100%接管,响应质量得分为4.33/5。在Full-Duplex-Bench 1.5上,用户反馈后93%的情况下恢复响应。在VoiceBench上获得55.1的标准化平均分,在Full-Duplex-Bench 3.0上工具选择F1为82.5%。
尽管NemotronLabs VoiceChat在集成全双工交互和工具调用方面取得了显著进展,但工具调用的参数准确性和端到端执行仍需改进。未来的研究可以集中在提高这些方面的性能,并扩展模型在更多复杂对话场景中的适用性。
深度分析
研究背景
语音代理是与智能系统交互的自然接口,传统方法通过级联架构连接自动语音识别、大型语言模型和文本到语音系统。然而,这种方法在动态对话中表现不佳,因为它们需要检测用户停止说话后才开始响应。NemotronLabs VoiceChat通过统一的神经系统解决了这一问题,允许直接的语音条件推理和生成。
核心问题
现有的语音代理在处理实时对话动态方面存在挑战,特别是在用户中断和反馈时。NemotronLabs VoiceChat旨在解决这些问题,通过全双工交互和工具调用功能实现无缝语音交互。
核心创新
NemotronLabs VoiceChat的核心创新在于其统一架构,结合流媒体语音编码器和解码器,仅解码语言模型,支持工具调用。这种设计消除了多模型或API切换的需要,显著降低了延迟。
方法详解
- �� 流媒体语音编码器处理用户音频。
- �� 仅解码语言模型跟踪对话并生成代理响应和函数调用。
- �� 辅助RNN-T分支用于增量用户转录。
- �� 流媒体TTS解码器将响应转换为语音。
实验设计
实验在Full-Duplex-Bench 1.0和1.5上进行,评估模型的暂停处理、用户中断和反馈恢复能力。在VoiceBench上测试单次响应智能,在Full-Duplex-Bench 3.0上评估工具调用。
结果分析
NemotronLabs VoiceChat在Full-Duplex-Bench 1.0上实现了最低的暂停处理接管率,用户中断后100%接管,响应质量得分为4.33/5。在Full-Duplex-Bench 1.5上,用户反馈后93%的情况下恢复响应。
应用场景
NemotronLabs VoiceChat可用于实时语音助手、客户服务和其他需要自然对话的场景。其工具调用功能使其在需要外部信息或操作的应用中尤为有用。
局限与展望
尽管NemotronLabs VoiceChat在集成全双工交互和工具调用方面取得了进展,但工具调用的参数准确性和端到端执行仍需改进。未来的研究可以集中在提高这些方面的性能。
通俗解读 非专业人士也能看懂
想象一个厨房,NemotronLabs VoiceChat就像一个能同时听和说的厨师。这个厨师不仅能听到你的指令,还能在你说话时继续做饭。他能在你需要时调用工具,比如打开烤箱或搅拌器,而不必停下来。这种能力让厨房工作更加高效,就像NemotronLabs VoiceChat让语音交互更加流畅。
简单解释 像给14岁少年讲一样
想象你在玩一个游戏,你的角色可以同时听到队友的指令并做出反应,而不需要暂停游戏。这就是NemotronLabs VoiceChat的工作方式!它能同时处理语音输入和输出,就像你在游戏中同时听和说一样。它还能在需要时调用工具,就像在游戏中使用特殊技能一样酷!
术语表
全双工 (Full-duplex)
一种通信方式,允许同时发送和接收信号。
在NemotronLabs VoiceChat中,实现了全双工语音交互。
工具调用 (Tool Calling)
在对话中调用外部工具或服务的能力。
该模型可以在对话中无缝调用工具。
流媒体编码器 (Streaming Encoder)
实时处理音频输入的组件。
用于处理用户的音频输入。
RNN-T
一种用于语音识别的递归神经网络架构。
辅助分支用于增量用户转录。
TTS (Text-to-Speech)
将文本转换为语音的技术。
用于将生成的响应转换为语音。
开放问题 这项研究留下的未解疑问
- 1 如何提高工具调用的参数准确性仍是一个开放问题。
- 2 在复杂对话场景中的表现需要进一步研究。
应用场景
近期应用
客户服务
NemotronLabs VoiceChat可以用于实时客户服务,提供快速响应和工具调用。
远期愿景
智能家居
在智能家居中,NemotronLabs VoiceChat可以实现更自然的语音控制和设备管理。
原文摘要
We introduce NemotronLabs VoiceChat, an open full-duplex speech-to-speech model with native tool-calling capabilities. NemotronLabs VoiceChat combines a streaming speech encoder and decoder-only language model with parallel specialized output streams for agent text and structured function calls, an auxiliary RNN-T branch for incremental user transcription, and a streaming TTS decoder. This design enables the model to listen, transcribe, reason, invoke tools, and speak within a unified streaming architecture while preserving the temporal behavior required for natural conversation. On Full-Duplex-Bench 1.0, NemotronLabs VoiceChat achieves the lowest pause-handling takeover rates among evaluated open-weight systems, 100\% takeover following user interruptions, and a 4.33/5 post-interruption response-quality score. On Full-Duplex-Bench 1.5, it resumes its response after user backchannels in 93\% of cases. NemotronLabs VoiceChat obtains a 55.1 normalized average on VoiceBench and, on Full-Duplex-Bench 3.0 (FDB 3.0), achieves 82.5\% tool-selection F1, while argument accuracy and end-to-end tool execution remain areas for improvement. These results demonstrate that full-duplex interaction, speech recognition and generation, general language capabilities, and external tool use can be integrated in a single open speech-to-speech model without sacrificing real-time conversational behavior.