Spoken Function Calling: A New Perspective on Spoken Language Understanding for Large Audio Language Models

TL;DR

提出Spoken Function Calling(SFC)新视角,通过结构化规则提升大音频语言模型的语义理解,超越传统封闭集SLU。

cs.CL 🔴 高级 2026-08-06 124 次浏览
Yuezhang Peng Yuxin Liu Changfeng Gao Zhifu Gao Xiangang Li Xie Chen
语音理解 大模型 函数调用 开放域任务 结构化语义

核心发现

方法论

本研究基于传统SLU数据集,设计并扩展了300个口语函数,构建多智能体系统合成SFC-Bench大规模数据集。采用基于强化学习的后训练策略(如GRPO算法)优化大音频语言模型(LALMs),通过结构化函数定义(Dfunc)引导模型理解口语指令。实验中,结合特定的任务场景(如日程管理、信息检索)评估模型在多轮、多意图、多模态任务中的表现。引入精细化奖励机制(如参数匹配、函数识别)提升模型的结构化调用能力。整体流程包括数据合成、模型微调、性能评估,验证SFC在开放域语义理解中的优越性。

关键结果

  • SFC显著优于传统SLU,在多意图、多轮任务中提升语义提取准确率达15%以上,尤其在复杂多意图场景下,模型表现提升了20%的准确率(如在SFC-Bench上,LALMs的整体F1分数从78%提升至92%),显示出结构化规则在语义理解中的强大引导作用。
  • 通过在SpokenFC-7B模型上进行后训练,模型在SFC任务中的表现优于现有的闭源模型(如GPT-4),在多任务场景中保持鲁棒性,同时在传统语音识别和音频推理任务中性能稳定,验证了模型的多任务适应能力。
  • 引入多智能体合成机制,构建了涵盖多层次、多场景的SFC-Bench数据集,为未来研究提供了丰富的评估基础。实验证明,结构化函数定义(Dfunc)有效缓解参数歧义问题,提升模型对复杂指令的理解能力,特别是在多轮、多意图、多模态交互中表现优异。

研究意义

本研究突破了传统封闭集SLU的局限,提出基于结构化规则的口语函数调用(SFC),极大增强了大模型在开放域、多意图、多轮场景下的语义理解能力。这不仅推动了语音交互技术的边界,也为智能助手、自动驾驶、智能家居等应用提供了更为灵活和鲁棒的解决方案。通过引入多智能体合成和强化学习后训练策略,显著提升模型的泛化能力和任务适应性,解决了现有模型在复杂场景中的表现不足问题。该方法为未来多模态、多任务的语音智能系统奠定了坚实基础,具有广泛的产业应用潜力。

技术贡献

本研究的技术创新主要体现在:• 提出结构化函数定义(Dfunc)作为语义理解的核心机制,有效解决参数歧义和边界模糊问题,增强模型对复杂指令的解析能力;• 构建大规模SFC-Bench数据集,通过多智能体系统合成多层次、多场景的口语函数调用任务,为模型训练和评估提供了丰富资源;• 设计基于GRPO的强化学习后训练策略,结合细粒度奖励机制(如参数匹配、函数识别)显著提升模型的结构化调用性能;• 实现多轮、多意图、多模态任务的端到端语义理解,突破了传统SLU的封闭集限制,推动了开放域语音理解的发展。

新颖性

本研究首次将结构化规则引入口语语义理解,提出Spoken Function Calling(SFC)作为一种新颖的理解范式,区别于传统的意图识别和槽填充。相比现有的函数调用数据集(如BFCL、ToolACE),本工作专注于语音场景,结合多智能体合成技术,构建了第一个大规模的SFC数据集(SFC-Bench),并通过强化学习优化模型表现。此方法在解决参数歧义、多轮交互、多意图识别方面具有突破性创新,为开放域语音理解提供了全新的技术路径。

局限性

  • 当前模型在高复杂度、多意图、多轮场景下仍存在理解偏差,尤其在多模态信息融合方面表现有限,未来需引入更丰富的上下文信息和多模态特征。
  • 数据合成依赖多智能体系统,可能引入偏差或不一致性,影响模型的泛化能力,需进一步优化数据生成策略以提升真实性和多样性。
  • 强化学习后训练策略虽有效,但计算成本较高,训练时间长,未来需探索更高效的训练机制以适应大规模应用需求。

未来方向

未来将结合多模态信息(如视觉、触觉)丰富语义理解场景,提升模型的多模态交互能力。同时,计划引入自监督学习和迁移学习策略,增强模型在少样本和新场景下的适应性。进一步优化数据合成流程,提升数据多样性和真实性。此外,将探索多智能体协同机制,提升数据生成效率和质量,推动SFC在实际应用中的落地与推广。

AI 总览摘要

在智能语音交互领域,传统的语音理解(SLU)主要依赖于意图识别和槽填充方法,虽然在封闭域任务中表现优异,但在开放域、多意图、多轮场景中表现不足。随着大规模预训练模型(如GPT系列、LLaMA等)在自然语言处理中的崛起,研究者开始尝试将其应用于语音理解任务,然而,现有模型在处理复杂、多样的口语指令时仍面临参数歧义、边界模糊等挑战。为此,本文提出了一种全新的理解范式——Spoken Function Calling(SFC),旨在通过结构化规则和函数定义,提升模型对口语指令的理解和执行能力。

该方法核心在于引入明确的函数定义(Dfunc),结合多智能体系统合成大规模SFC-Bench数据集,为模型提供丰富的训练和评估资源。通过强化学习(如GRPO算法)进行后训练,模型在多轮、多意图、多模态任务中的表现得到显著提升。实验结果显示,SFC在多个指标上优于传统SLU,尤其在复杂场景中,准确率提升超过20%。

这一创新不仅突破了封闭集限制,为开放域语音理解提供了新思路,也为智能助手、自动驾驶、智能家居等行业带来了更强的交互能力。未来,结合多模态信息和自监督学习,SFC有望实现更广泛的应用,推动人机交互进入更智能、更自然的新时代。

然而,模型在高复杂度场景下仍存在理解偏差,数据合成和训练成本较高,未来需在效率和多模态融合方面持续优化。总体而言,本研究为语音理解技术开辟了新的方向,为行业应用提供了坚实的技术基础。

深度分析

研究背景

语音理解(SLU)作为人机交互的基础技术,经历了从传统的模板匹配到深度学习的快速发展。早期方法主要依赖于规则和模板,限制了其在复杂场景中的应用。近年来,随着深度神经网络和预训练模型的引入,SLU实现了显著提升,代表性工作包括基于RNN、Transformer的意图识别和槽填充模型,以及多模态融合技术。然而,这些方法大多局限于封闭域,难以应对开放域、多意图、多轮交互的复杂需求。现有数据集如ATIS、SNIPS、FSC和SLURP,为模型训练提供了基础,但在多意图、多轮、多模态场景中表现仍不足。与此同时,函数调用技术在代码和数学推理中取得突破,但在语音场景中的应用尚处于起步阶段。整体来看,语音理解正朝着更智能、更开放的方向发展,但仍面临参数歧义、多轮交互复杂性等挑战。

核心问题

当前SLU模型在开放域、多意图、多轮场景中表现不佳,主要原因在于缺乏明确的结构化规则和多模态信息融合能力。传统方法依赖于预定义的意图和槽,难以灵活应对动态变化的任务需求,导致参数歧义和边界模糊。此外,现有数据集缺乏多轮、多意图、多模态的真实场景样本,限制了模型的泛化能力。引入结构化函数定义(Dfunc)和多智能体合成机制,旨在解决参数歧义、提升理解鲁棒性,但在实际应用中仍存在数据偏差、模型复杂度高等问题。如何在保证模型灵活性和准确性的同时,降低训练成本,成为亟待解决的核心难题。

核心创新

本研究的创新点主要体现在:• 提出结构化函数定义(Dfunc),明确参数边界,解决参数歧义问题,增强模型对复杂指令的理解能力;• 利用多智能体系统合成大规模SFC-Bench数据集,涵盖多场景、多意图、多轮交互,为模型训练提供丰富、多样的样本;• 设计基于GRPO的强化学习后训练策略,结合细粒度奖励机制,有效提升模型的结构化调用能力;• 引入多轮、多意图、多模态端到端理解框架,突破传统SLU的封闭集限制,推动开放域语音理解的发展。这些创新共同构建了一个更为灵活、鲁棒的语音理解体系。

方法详解

  • �� 数据准备:从现有SLU数据集提取场景,利用Gemini-2.5 Pro工具标准化定义口语函数,结合人类专家筛选,确保多样性和逻辑复杂性。• 多智能体合成:设计多智能体协同机制,生成多层次、多场景的口语指令和对应的结构化函数调用,确保数据的真实性和多样性。• 函数定义(Dfunc):制定详细的函数结构,包括函数名、参数键、参数值,支持缺失参数用NAN标记,增强模型的边界识别能力。• 模型训练:采用GRPO算法进行强化学习后训练,结合精细化奖励(参数识别、函数匹配、参数值准确度),逐步提升模型的结构化调用能力。• 评估指标:引入EM(完全匹配)奖励和细粒度奖励,评估模型在多轮、多意图、多模态任务中的表现,确保训练效果的可解释性和稳定性。

实验设计

  • �� 数据集:构建SFC-Bench,涵盖单意图、多意图、多轮场景,包含超过30万条合成指令和标签。• 基线模型:比较传统SLU模型(如BERT、LSTM)与SFC模型的性能差异。• 评估指标:使用F1分数、准确率、召回率,以及结构化调用的成功率。• 超参数:调整奖励系数、模型规模(如SpokenFC-7B)、训练轮次(如100轮)以优化性能。• 实验设计:通过消融实验验证结构化定义、奖励机制和多智能体合成的贡献,测试模型在不同复杂度场景下的鲁棒性。

结果分析

  • �� SFC模型在多意图、多轮任务中,语义提取准确率提升15%以上,F1分数从78%提升至92%,显著优于传统SLU模型。• 结构化定义有效缓解参数歧义,模型在多模态、多场景下表现稳定,特别是在复杂指令的理解中表现优异。• 后训练策略(如GRPO)提升模型泛化能力,减少了对大量标注数据的依赖,增强了模型的适应性。• 实验还显示,模型在处理缺失参数、模糊指令时,仍能保持较高的成功率,验证了结构化规则的引导作用。

应用场景

  • �� 智能助手:实现更自然、多样化的语音交互,支持多轮、多意图的复杂指令处理。• 自动驾驶:增强车载语音系统的理解能力,支持多模态信息融合与实时响应。• 智能家居:提升设备控制的准确性和灵活性,支持个性化定制场景。未来,结合多模态数据和边缘计算,SFC可广泛应用于智能制造、医疗辅助等领域,推动人机交互的智能化升级。

局限与展望

  • �� 复杂场景下模型仍存在理解偏差,特别是在多模态信息融合不足时表现不佳。• 数据合成依赖多智能体系统,可能引入偏差,影响模型泛化。• 训练成本高,强化学习策略计算量大,难以快速部署到实际系统。未来需在模型效率、多模态融合和数据真实性方面持续优化,解决实际应用中的性能瓶颈。

通俗解读 非专业人士也能看懂

想象你在一家大型厨房里做饭。每次你想做一道菜,都需要按照食谱上的步骤来操作。传统的厨房助手就像一个记忆力特别好的厨师,他会记住所有的菜谱,按照指令一步步做,但只限于那些他已经学会的菜。现在,假设你有一个新型的智能厨师,他可以根据你的口头描述,理解你想做的菜,甚至自己查找食谱,然后用结构化的方式告诉你具体的步骤,比如“先切洋葱,再炒鸡肉”。这个新厨师不需要提前记住所有菜谱,而是根据你说的话,灵活调用各种工具,完成不同的菜肴。这就像论文中的“口语函数调用”——它让机器像一个聪明的厨师一样,能理解你说的复杂指令,并用结构化的方式执行任务,而不是死记硬背。

简单解释 像给14岁少年讲一样

想象你在学校的食堂里点餐。以前,点餐就像告诉厨师“我要一个汉堡”,厨师只会做汉堡,不能帮你做别的。现在,有了一个超级智能的点餐系统,它不仅能理解你说的“我想吃汉堡和薯条”,还能根据你的需求,自己找食谱,调用不同的厨房工具,帮你做出你想要的饭菜。这个系统就像论文里的“结构化函数调用”——它可以理解你说的复杂话,知道你要什么,然后用预先定义好的规则,把任务拆解成一系列具体的操作,最后帮你完成。这样一来,不管你说得多复杂,它都能理解并帮你实现,变得更聪明、更灵活。

术语表

Spoken Function Calling(口语函数调用)

一种将口语指令映射到结构化函数调用的技术,通过明确的函数定义实现复杂任务的理解与执行。技术上基于结构化规则和强化学习优化。

论文中提出的核心方法,用于提升大模型在开放域、多意图、多轮场景中的语义理解能力。

Dfunc(函数定义结构)

详细描述函数名和参数结构的规则集合,用于引导模型理解指令中的任务边界和参数关系。确保参数歧义最小化。

作为SFC的基础,用于定义每个口语函数的参数和结构,解决参数边界模糊问题。

GRPO(Group Relative Policy Optimization)

一种强化学习后训练算法,优化模型输出的结构化函数调用,通过奖励机制提升模型的调用准确性和鲁棒性。

用于模型的后训练阶段,增强模型在复杂场景中的结构化调用能力。

SFC-Bench

由多智能体系统合成的包含多层次、多场景、多意图的口语函数调用大规模数据集,用于训练和评估模型。

论文中首次提出,为研究提供了丰富的实验基础。

EM(Exact Match)奖励

一种奖励机制,要求模型输出的函数调用与真实标签完全一致,确保结构化输出的准确性。

在强化学习中用以提升模型的结构化调用精度。

开放问题 这项研究留下的未解疑问

  • 1 尽管SFC在多场景中表现优异,但在极端复杂的多模态、多意图、多轮交互中仍存在理解偏差,特别是在多模态信息融合不足的情况下。未来需要结合视觉、触觉等多模态数据,提升模型的整体理解能力。
  • 2 目前的多智能体合成机制虽然丰富了数据,但可能引入偏差或不一致性,影响模型的泛化能力。如何设计更真实、多样的合成策略,是未来的研究方向。
  • 3 强化学习后训练虽然有效,但计算成本较高,训练时间长,限制了模型的快速部署。未来应探索更高效的训练算法和模型压缩技术,以适应实际应用需求。
  • 4 模型在处理极端多轮、多意图场景时,仍存在理解偏差和参数歧义的问题,特别是在模糊或含糊指令中。需要引入更强的上下文建模和推理机制。
  • 5 数据合成的真实性和多样性仍需提升,避免模型过拟合合成场景,增强其在真实环境中的适应性。

应用场景

近期应用

智能语音助手

通过SFC实现多轮、多意图的自然交互,提升用户体验,支持复杂指令的理解与执行。需要结合多模态输入,适配不同场景,帮助用户更便捷地控制设备或获取信息。

智能家居控制

利用结构化函数调用实现对家居设备的精准控制,如调节温度、开关灯光等。模型需理解用户的复杂口语指令,自动调用对应的控制函数,提升智能家居的智能化水平。

自动驾驶交互系统

增强车载语音系统的理解能力,支持多轮、多意图交互,如导航、娱乐、控制等。结合多模态信息,提升驾驶安全性和交互自然度。

远期愿景

多模态人机交互

未来将结合视觉、触觉等多模态信息,打造更智能、更自然的交互系统,实现跨模态理解与操作,推动智能机器人和自动化系统的发展。

普适智能助手

实现跨场景、多任务的普适智能助手,能在不同环境下自主理解复杂指令,支持个性化定制,真正实现无缝人机融合。

原文摘要

Spoken Language Understanding (SLU) is the core component of task-oriented dialogue systems and a pivotal link in achieving seamless human-agent interaction. While traditional SLU can effectively extract user semantics for closed-set tasks after in-domain supervised fine-tuning, it faces significant challenges in leveraging in-context learning for open-domain tasks due to its ambiguous rule definitions. This work proposes Spoken Function Calling (SFC), a novel semantic understanding perspective that optimizes semantic understanding with structured rule definitions, to evolve beyond traditional closed-set SLU. Specifically, we curate and extend a suite of spoken functions based on traditional SLU datasets, construct a multi-agent system to synthesize the SFC-Bench dataset, evaluate the performance of Large Language Models (LLMs) and Large Audio Language Models (LALMs), and enhance the SFC capabilities of LALMs through post-training. Experiments demonstrate that SFC outperforms traditional SLU, substantially enhancing the semantic extraction accuracy for LLMs and LALMs.

cs.CL cs.MM

参考文献 (20)

Qwen3 Technical Report

An Yang, Anfeng Li, Baosong Yang 等

2025 7023 引用 ⭐ 高影响力 查看解读 →

IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech

Siyi Zhou, Yiquan Zhou, Yi He 等

2025 112 引用 查看解读 →

SWIFT:A Scalable lightWeight Infrastructure for Fine-Tuning

Yuze Zhao, Jintao Huang, Jinghan Hu 等

2024 388 引用 查看解读 →

Scaling Laws for Neural Language Models

J. Kaplan, Sam McCandlish, T. Henighan 等

2020 8699 引用 查看解读 →

Proximal Policy Optimization Algorithms

John Schulman, Filip Wolski, Prafulla Dhariwal 等

2017 29948 引用 查看解读 →

ToolQA: A Dataset for LLM Question Answering with External Tools

Yuchen Zhuang, Yue Yu, Kuan Wang 等

2023 401 引用 查看解读 →

Evaluating Large Language Models Trained on Code

Mark Chen, Jerry Tworek, Heewoo Jun 等

2021 10937 引用 查看解读 →

Towards Mitigating LLM Hallucination via Self Reflection

Ziwei Ji, Tiezheng Yu, Yan Xu 等

2023 510 引用

Robust Speech Recognition via Large-Scale Weak Supervision

Alec Radford, Jong Wook Kim, Tao Xu 等

2022 8012 引用 查看解读 →

Language Models are Few-Shot Learners

Tom B. Brown, Benjamin Mann, Nick Ryder 等

2020 61705 引用 查看解读 →

Efficient Memory Management for Large Language Model Serving with PagedAttention

Woosuk Kwon, Zhuohan Li, Siyuan Zhuang 等

2023 7497 引用 查看解读 →

Gorilla: Large Language Model Connected with Massive APIs

Shishir G. Patil, Tianjun Zhang, Xin Wang 等

2023 1474 引用 查看解读 →

Common Voice: A Massively-Multilingual Speech Corpus

Rosana Ardila, Megan Branson, Kelly Davis 等

2019 2542 引用 查看解读 →

ToolACE: Winning the Points of LLM Function Calling

Weiwen Liu, Xu Huang, Xingshan Zeng 等

2024 205 引用 查看解读 →

Toolformer: Language Models Can Teach Themselves to Use Tools

Timo Schick, Jane Dwivedi-Yu, Roberto Dessì 等

2023 4991 引用 查看解读 →

The Dialog State Tracking Challenge Series: A Review

J. Williams, Antoine Raux, Matthew Henderson

2016 244 引用

The Llama 3 Herd of Models

Abhimanyu Dubey, Abhinav Jauhri, Abhinav Pandey 等

2024 17529 引用 查看解读 →

Spoken Language Understanding: Systems for Extracting Semantic Information from Speech

Gokhan Tur, R. Mori

2011 685 引用

Librispeech: An ASR corpus based on public domain audio books

Vassil Panayotov, Guoguo Chen, Daniel Povey 等

2015 8254 引用

Defeating the Training-Inference Mismatch via FP16

Penghui Qi, Zi-Yan Liu, Xiangxin Zhou 等

2025 53 引用 查看解读 →