PACE: Perceived-Latency-Aware Cascading Service Routing and Filler Control for QoE-Efficient Retrieval-Augmented Dialogue Serving

TL;DR

PACE框架通过感知延迟优化对话服务,P95延迟从0.53秒降至0.29秒。

cs.CV 🔴 高级 2026-09-10 81 次浏览
Lin Huang Yujuan Tan Weisheng Li Lixiang Zeng Kun Yang Suihan Xiao
感知延迟 级联路由 对话服务 语义缓存 检索增强生成

核心发现

方法论

PACE框架整合了负载自适应级联路由、路径与填充控制器以及波动感知缓存准入机制。通过感知的首次响应时间(PTFR)作为QoE目标,优化质量和成本约束下的对话服务。

关键结果

  • 结果1: 在75,000个CarQA请求中,级联机制将纯LLM的P95 PTFR从0.53秒减少到0.29秒。
  • 结果2: 自适应控制器在高负载下达到0.41秒P95,比RAG性能提升2.4倍,且质量相当。
  • 结果3: 填充控制器减少94%的小模型调用,且填充与答案冲突率为0%。

研究意义

该研究首次将感知首次响应时间(PTFR)量化为对话服务的QoE目标,提出了联合控制回答源选择和等待窗口填充的新方法。其在汽车零售的实际部署中显著提高了用户体验,解决了传统对话服务中延迟高、质量不稳定的问题。

技术贡献

PACE提出了负载自适应的级联路由器和联合路径-填充控制器,创新性地将感知延迟作为优化目标,并通过波动感知缓存准入机制减少陈旧答案的比例,显著提升了对话服务的响应速度和质量。

新颖性

PACE首次提出了填充与答案冲突风险的量化方法,并通过联合控制路径和填充策略实现了感知延迟的最小化,与现有的RAG和语义缓存方法相比具有显著创新性。

局限性

  • 局限1: PACE依赖于特定的负载信号,如TTFT和到达率,可能在极端负载变化下表现不稳定。
  • 局限2: 填充模型的选择和训练需要额外的计算资源。
  • 局限3: 波动感知缓存机制可能对某些非时间敏感的查询引入额外开销。

未来方向

未来研究可以探索更复杂的负载预测模型以提高适应性,并研究填充模型在多模态对话服务中的扩展应用。

AI 总览摘要

在对话服务中,用户对首次响应时间的感知直接影响体验。传统优化方法多关注生成速度或成本,而忽略了用户感知延迟。PACE框架通过引入感知首次响应时间(PTFR)作为质量体验(QoE)目标,提出了一种联合优化回答源选择与等待窗口填充的新方法。

PACE框架包含三个核心机制:负载自适应级联路由器、联合路径与填充控制器以及波动感知缓存准入机制。在汽车零售场景的实际部署中,PACE显著降低了对话服务的感知延迟,同时保持了较高的回答质量和较低的计算成本。

实验结果表明,PACE在75,000个CarQA请求中将纯LLM的P95 PTFR从0.53秒减少到0.29秒,自适应控制器在高负载下性能提升2.4倍,填充控制器将小模型调用减少94%,且填充与答案冲突率为0%。尽管存在负载信号依赖性等局限,PACE为未来对话服务的优化提供了重要方向。

深度分析

研究背景

近年来,大型语言模型(LLM)在对话服务中的应用日益广泛,如聊天机器人和虚拟助手。然而,传统优化方法多关注生成速度、吞吐量或成本,而忽略了用户感知的首次响应时间(PTFR)。在实际场景中,尤其是人机交互中,用户对延迟的容忍度有限,长时间的等待可能导致用户流失。

核心问题

现有方法如级联路由、语义缓存和自适应检索各自优化成本、命中率或质量,但未能联合控制回答源选择和等待窗口填充。如何在质量和成本约束下最小化感知延迟成为一个关键挑战。

核心创新

PACE框架的核心创新包括:

  • �� 将感知首次响应时间(PTFR)正式化为QoE优化目标。
  • �� 提出负载自适应级联路由器,动态调整语义缓存和检索阈值。
  • �� 设计联合路径与填充控制器,动态决定是否使用填充模型。
  • �� 引入波动感知缓存准入机制,减少陈旧答案的比例。

方法详解

PACE框架的实现包括以下步骤:

  • �� 使用负载信号(TTFT和到达率)动态调整语义缓存和检索阈值。
  • �� 在LLM生成过程中,填充模型并行运行以占据等待窗口。
  • �� 使用轻量级词汇分类器识别波动性查询,并为其设置短时限或拒绝缓存。
  • �� 所有请求的路径、延迟和决策均记录为结构化日志以便分析。

实验设计

实验在75,000个CarQA请求上进行,比较了PACE与传统RAG、语义缓存和固定阈值方法的性能。评估指标包括P95 PTFR、回答质量和填充与答案冲突率。

结果分析

实验结果显示:

  • �� PACE将纯LLM的P95 PTFR从0.53秒减少到0.29秒。
  • �� 自适应控制器在高负载下性能提升2.4倍,质量与RAG相当。
  • �� 填充控制器减少94%的小模型调用,且冲突率为0%。

应用场景

PACE适用于需要低延迟高质量对话服务的场景,如零售机器人、客户服务和在线教育。其机制还可扩展到其他多模态对话系统。

局限与展望

PACE的局限性包括对负载信号的依赖、填充模型的额外计算开销以及波动感知缓存机制可能引入的开销。未来研究可优化这些方面。

通俗解读 非专业人士也能看懂

想象你在餐厅点餐,服务员需要时间准备菜品。在等待过程中,服务员会先给你端上一杯水或小吃,让你感觉时间过得快一些。PACE框架的填充模型就像这杯水,它在后台准备主菜(答案)时,先提供一个小的回应(填充),让你感觉对话没有中断。同时,PACE还会根据餐厅的繁忙程度调整服务策略,比如优先提供简单的菜品(语义缓存或检索答案),以减少等待时间。

简单解释 像给14岁少年讲一样

想象你在玩游戏时,突然卡住了,屏幕一片空白,你会不会觉得很烦?PACE就像一个聪明的游戏助手,它会在你等待加载的时候,先给你一个小提示或者动画,让你觉得时间过得快点。而且它还会判断什么时候需要给你提示,什么时候可以直接给你答案,超级智能!是不是很酷?

术语表

PTFR (感知首次响应时间)

用户从发出请求到收到第一个有意义回复所需的时间,是QoE的关键指标。

用来评价对话服务的用户体验。

RAG (检索增强生成)

一种结合知识检索和LLM生成的技术,用于生成高质量回答。

PACE框架中的L1和L2路径使用了RAG。

语义缓存

基于查询语义相似度的缓存机制,用于快速返回答案。

PACE的L0路径使用语义缓存实现近零延迟。

填充模型

一个小型模型,用于在主答案生成前提供短暂的社会性回应。

PACE用填充模型占据用户的等待窗口。

波动感知缓存

一种根据查询波动性动态调整缓存策略的机制。

用于减少陈旧答案的比例。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端负载变化下提高系统的稳定性?
  • 2 是否可以设计更高效的填充模型以减少计算开销?

应用场景

近期应用

零售机器人

在汽车展厅等场景中,提供低延迟的客户对话服务,提高客户体验。

在线教育

在教育平台中,快速响应学生问题,减少等待时间。

远期愿景

多模态对话系统

扩展PACE到语音和视觉对话场景,实现更自然的人机交互。

原文摘要

We present the PACE, a framework for retrieval-augmented dialogue serving that formalizes Perceived Time-to-First-Response (PTFR) as a QoE objective and minimizes it under quality/cost constraints. Unlike prior work on cascaded routing, semantic caching, or adaptive retrieval, PACE jointly controls which answer source composes the response and what fills the waiting window. Deployed on a humanoid-robot sales service, it combines three mechanisms: a load-adaptive cascading router, a joint path-filler controller, and volatility-aware cache admission. On 75k CarQA requests, the cascade halves pure-LLM PTFR at P95 (0.29 vs 0.53s at c16). The adaptive controller reaches 0.41s P95, outperforming RAG by 2.4 times at high load with equal quality. The filler controller cuts calls by 94% with zero conflict. Volatility-aware admission reduces stale answers from 86% to 0%. A gating rule ensures the controller never worse than the baseline, with exposure bounded by one hold period. This is the first quantification of filler-answer conflict risk in deployed services.

cs.CV cs.AI cs.RO