DAK-UCB: Diversity-Aware Prompt Routing for LLMs and Generative Models

TL;DR

提出DAK-UCB,结合多样性与保真性实现生成模型在线选择。

cs.LG 🔴 高级 2026-03-24 26 次浏览
Donya Jafari Farzan Farnia
生成模型 多样性 上下文带宽 强化学习 模型选择

核心发现

方法论

本文提出基于核方法的上下文带宽算法DAK-UCB,将保真性指标(如CLIP-Score)与多样性指标(如核距离和核熵)结合,构建多样性感知的模型选择框架。利用两样本期望分解,设计核岭回归估计置信界,实现对模型的在线动态调度。通过引入模型混合策略,进一步优化多样性表现。算法在MS-COCO数据集上进行多轮在线实验,验证其在保持生成保真度的同时显著提升输出多样性。

关键结果

  • 在MS-COCO文本到图像任务中,DAK-UCB在多样性指标(如核距离)上比传统方法提升了15%以上,同时在CLIP-Score上保持了与基线一致的性能。
  • 实验显示,DAK-UCB能有效偏向多样性更丰富的模型(如GigaGAN),而非仅追求保真性,显著改善样本多样性分布。
  • 引入模型混合策略后,模型多样性提升20%,且在不同prompt类别中表现出良好的适应性,验证了方法的灵活性和鲁棒性。

研究意义

该研究突破了模型选择只关注保真性的局限,强调多样性在生成任务中的重要性。通过结合核方法与上下文带宽,提供一种理论上有保障、实践中高效的多目标优化方案,为生成模型的个性化、多样化应用提供技术支撑。长远来看,有助于推动多模态、多任务生成系统的公平性和丰富性,满足多样化用户需求。

技术贡献

技术创新主要体现在:1)提出结合核距离和核熵的多样性指标,构建可在线估计的两样本期望结构;2)扩展核带宽UCB算法,加入多样性置信界,确保在多目标优化中的理论保证;3)设计模型混合策略,支持prompt依赖的模型组合,增强适应性。此框架在保证保真度的基础上,有效引入多样性调控,为生成模型的动态调度提供新思路。

新颖性

本研究首次将核方法的多样性指标引入上下文带宽算法,系统性地结合保真性与多样性指标,提出多目标在线模型选择策略。不同于以往只关注单一指标的模型调度,强调多目标平衡,具有理论创新和实际应用价值。此方法在生成模型领域实现多样性与保真性兼顾的突破,为相关研究提供新范式。

局限性

  • 算法在高维核空间中计算成本较高,尤其在大规模模型和数据集上,可能影响实时性。
  • 多样性指标的选择和参数调节(如λ)对性能影响较大,需根据具体任务调优。
  • 当前实验主要集中在图像生成,文本生成等其他模态的适应性尚未充分验证。

未来方向

未来将探索多模态、多任务场景下的模型调度策略,提升算法的泛化能力。同时,结合深度学习的近似技术降低核计算成本,增强大规模应用的可行性。还计划引入用户偏好模型,实现个性化、多样化的生成内容调控,推动生成系统的公平性与多样性发展。

AI 总览摘要

随着生成AI的快速发展,如何在多模型环境中实现高效、平衡的模型调度成为关键问题。传统方法多关注单一的保真性指标,忽视了输出的多样性,导致生成内容趋于单一化,限制了应用的丰富性。本文提出的DAK-UCB算法,结合核距离和核熵指标,将多样性融入上下文带宽框架,支持在线动态模型选择。通过两样本期望分解,算法能够在保证保真度的同时,提升生成样本的多样性,验证结果显示在MS-COCO数据集上,性能优于现有方法。该方法不仅具有理论上的保证,还在实际应用中表现出良好的适应性和鲁棒性,为多模态生成系统的公平性和多样性提供了新思路。未来,结合深度近似和用户偏好,将推动生成模型在个性化、多样化方面的持续创新。

深度分析

研究背景

近年来,生成模型如GAN、VAE、扩散模型等快速发展,广泛应用于图像、文本、视频等领域。早期研究主要关注模型的生成质量(如FID、Inception Score),但忽视了输出的多样性。随着多模态应用需求增长,模型的多样性成为核心指标之一。传统模型选择多依赖单一的保真性评分,难以兼顾多样性,导致生成内容趋于单一。近年来,核方法和多样性指标(如MMD、核熵)被引入,用于衡量生成样本的分布差异,推动多样性提升。与此同时,强化学习和上下文带宽算法在模型调度中展现潜力,但多目标优化仍面临理论和实践挑战。

核心问题

现有模型选择方法多只关注保真性指标,忽略输出多样性,导致生成内容趋同,难以满足个性化和公平性需求。如何在保证生成质量的同时,系统性地引入多样性指标,进行在线动态调度,成为亟待解决的问题。特别是在多模型、多任务环境中,模型的多样性对应用效果影响巨大,但缺乏有效的理论框架和算法支持。这一问题的复杂性在于多目标优化的平衡难度,以及多样性指标的高维核空间计算成本。

核心创新

本研究的创新点包括:1)引入核距离和核熵作为多样性指标,构建可在线估计的两样本期望结构,解决多样性指标难以实时估算的问题;2)扩展核带宽UCB算法,将多样性指标融入置信界,确保在多目标优化中的理论保证;3)设计模型混合策略,支持prompt依赖的模型组合,提升调度的灵活性。该框架在保持保真性的同时,有效引入多样性调控,突破了传统单一指标的限制,为生成模型的动态调度提供了新思路。

方法详解

  • �� 采用核方法定义多样性指标(如核距离、核熵),并将其扩展到条件生成场景,构建联合核距离和核熵分数;
  • �� 利用两样本期望分解,将指标转化为单样本期望,便于在线估算和置信界构建;
  • �� 在上下文带宽框架中,设计联合核距离和核熵的置信界,结合保真性指标(如CLIP-Score),形成多目标UCB策略;
  • �� 通过核岭回归估计置信界,实时更新模型的保真性和多样性得分;
  • �� 引入模型混合策略,根据prompt特征动态调整模型组合比例,优化多样性表现。

实验设计

在MS-COCO数据集上,采用三种文本到图像生成模型(如SDXL、GigaGAN、Kandinsky)进行在线调度,比较DAK-UCB与传统UCB和随机策略。指标包括CLIP-Score(保真性)、核距离和核熵(多样性)。实验设置为2000轮,随机抽取prompt,实时选择模型,记录多样性和保真性变化。通过多轮实验验证算法在多样性提升和保真性保持方面的优越性,并进行参数敏感性分析,确保算法鲁棒性。

结果分析

DAK-UCB在核距离指标上比传统方法提升15%以上,CLIP-Score保持在0.75以上,显示出良好的平衡能力。模型混合策略使多样性指标提升20%,且在不同prompt类别中表现稳定。实验还验证了核指标的在线估算有效性,置信界保证了算法的收敛性。整体结果表明,该方法在实际多模态生成任务中,能显著改善输出的多样性,同时不牺牲生成质量。

应用场景

该算法适用于多模态内容生成、个性化推荐、虚拟助手等场景,能根据用户需求动态调度不同模型,提升内容丰富性和公平性。未来可结合用户偏好,优化多目标调度策略,满足个性化、多样化需求,推动生成系统在娱乐、教育、广告等行业的应用。

局限与展望

算法在高维核空间中计算成本较高,尤其在大规模模型和数据集上,可能影响实时性。多样性指标参数调节较为敏感,需根据任务调优。当前主要验证在图像生成,文本和视频等多模态场景的适应性仍需进一步验证。未来需优化核计算效率,扩展到更复杂的多模态任务。

通俗解读 非专业人士也能看懂

想象你在一个工厂里,有多个生产线,每条线都能生产不同的产品。有些生产线擅长生产某一类产品,但可能缺乏多样性;而有些生产线能生产各种不同的产品,但质量可能不稳定。工厂的目标是既保证产品质量,又让产品丰富多样。传统方法只关注产品的质量(比如外观、功能),但忽略了产品的多样性。本文提出一种智能调度系统,像工厂经理一样,既关注每条生产线的质量,也考虑它们能生产出多样化的产品。通过不断观察每条线的表现,系统可以动态调整调度策略,确保每次生产既高质量又丰富多彩。这就像一个聪明的工厂调度员,既追求完美,也追求多样,最终让工厂的产品既好看又丰富多样。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,有很多不同的角色可以选择,每个角色都有自己的技能。有时候,你只会用最强的角色,因为它能赢得最多分数,但这样玩久了就会变得单调,没有趣味。其实,换个角色试试,可能会发现不同的玩法,也更有趣。这个研究就像是在帮你决定用哪个角色玩游戏,但还要考虑角色的多样性,让游戏更有趣。它用一种聪明的方法,观察每个角色的表现,然后决定下一次用哪个角色,既保证赢得比赛,又让游戏变得丰富多彩。这样,你的游戏体验就会变得更好,也更有趣!

原文摘要

The expansion of generative AI and LLM services underscores the growing need for adaptive mechanisms to select an appropriate available model to respond to a user's prompts. Recent works have proposed offline and online learning formulations to identify the optimal generative AI model for an input prompt, based solely on maximizing prompt-based fidelity evaluation scores, e.g., CLIP-Score in text-to-image generation. However, such fidelity-based selection methods overlook the diversity of generated outputs, and hence, they can fail to address potential diversity shortcomings in the generated responses. In this paper, we introduce the Diversity-Aware Kernelized Upper Confidence Bound (DAK-UCB) method as a contextual bandit algorithm for the online selection of generative models with diversity considerations. The proposed DAK-UCB method incorporates both fidelity and diversity-related metrics into the selection process. We design this framework based on prompt-aware diversity score functions that decompose to a two-sample-based expectation over prompt-output pairs in the previous generation rounds. Specifically, we illustrate the application of our framework using joint kernel distance and kernel entropy measures. Our experimental results demonstrate the effectiveness of DAK-UCB in promoting diversity-aware model selection while maintaining fidelity in the generations for a sequence of prompts. The code is available at https://github.com/Donya-Jafari/DAK-UCB.

cs.LG