Make Prompt-based Black-Box Tuning Colorful: Boosting Model Generalization from Three Orthogonal Perspectives

TL;DR

提出BBT-RGB,结合两阶段无梯度优化、多重Verbalizer和指令搜索,提升黑箱调优性能。

cs.CL 🔴 高级 2023-05-14 41 次浏览
Qiushi Sun Chengcheng Han Nuo Chen Renyu Zhu Jingyang Gong Xiang Li Ming Gao
自然语言处理 黑箱优化 提示调优 少样本学习 模型泛化

核心发现

方法论

本文提出的BBT-RGB框架包括三大核心组件:第一,采用两阶段无梯度优化策略,结合演化算法(CMA-ES)和搜索方法,快速收敛并减缓过拟合;第二,设计多重Verbalizer,通过TF-IDF和神经网络自动生成,充分利用模型输出信息;第三,结合指令搜索和示范选择,优化提示初始化。该方法在少样本场景下,通过多角度提升黑箱优化效率和效果。具体算法包括:利用演化策略进行粗粒度搜索,再用梯度无关的搜索细化解,确保优化稳定性。Verbalizer采用多样化构建策略,提升类别判别能力。指令+示范的In2初始化策略,增强提示的语境适应性。实验在GLUE任务集上验证,显著优于现有gradient-free方法,部分任务甚至超越全参数微调。

关键结果

  • 在16-shot设置中,BBT-RGB在SST-2、Yelp、AGNews、DBPedia、SNLI、RTE等任务上平均准确率达81.30%,优于BBTv2(79.01%)和其他无梯度调优方法,表现出优异的泛化能力。
  • 在少样本条件下,采用两阶段优化和Verbalizer多样性策略,有效缓解过拟合,提升模型稳定性,标准差明显低于对比方法。
  • 消融实验显示,三大技术组件均对性能提升贡献显著,尤其是Verbalizer多样化构建和In2初始化策略,分别提高了约1-2%的准确率。

研究意义

该研究突破了商业化大模型参数不可调的限制,提出的无梯度提示调优方案极大降低调优成本,兼具高效性与稳定性,为模型泛化和少样本学习提供新思路。其在实际应用中可实现无需访问模型内部参数即可快速适应多任务,推动大模型在工业界的落地应用。同时,提出的多角度优化策略丰富了黑箱优化理论体系,有助于未来多模态、多任务场景的研究发展。

技术贡献

本文在黑箱调优领域提出创新性两阶段优化策略,结合演化算法与搜索方法,显著提升收敛速度与稳定性。引入多重Verbalizer,有效利用模型输出信息,增强类别判别能力。提出In2初始化策略,结合指令与示范,优化提示起点。整体框架实现了无梯度优化的高效性,突破了传统单一优化算法的局限。实验证明,该方法在少样本任务中可媲美甚至超越全参数微调,为参数高效调优提供新范式。

新颖性

本研究首次系统性结合两阶段无梯度优化、多Verbalizer策略及In2初始化,全面提升黑箱提示调优的效率与效果。与现有方法(如BBTv2)仅在输入层或单一Verbalizer基础上不同,本文实现了多角度、多层次的优化,显著缓解过拟合问题,增强模型泛化能力。这种多维度融合策略在少样本学习中展现出优越性能,代表了黑箱调优技术的前沿创新。

局限性

  • 尽管两阶段策略缓解了过拟合,但在极少样本或类别数极多的任务中仍存在性能瓶颈,需进一步优化优化策略。
  • 算法依赖API调用次数,成本较高,特别是在大模型商业服务中,可能限制实际部署。
  • Verbalizer多样化构建和示范搜索耗时较长,增加了调优的计算负担,未来需提升效率。

未来方向

未来将探索自适应优化策略以进一步减少API调用,提升调优速度。结合多模态信息,扩展到视觉、语音等多模态任务,增强模型的泛化能力。还计划引入强化学习或元学习机制,自动调整Verbalizer和指令搜索策略,以实现更高效的少样本学习。

AI 总览摘要

在大规模预训练语言模型(LLMs)广泛应用的背景下,模型调优成本不断攀升,尤其是在商业API封闭的情况下,传统微调方法变得不可行。为此,本文提出了BBT-RGB,一套融合两阶段无梯度优化、多Verbalizer构建和In2初始化的创新策略,有效应对少样本场景中的调优难题。

该方法通过演化算法与搜索算法的结合,实现快速收敛和过拟合缓解;多Verbalizer策略充分利用模型输出信息,提升类别判别能力;In2初始化结合指令和示范,优化提示起点。这些技术的结合,使得黑箱提示调优在多个NLP任务中表现优异,部分任务甚至优于全参数微调。

实验结果显示,BBT-RGB在GLUE任务集上平均准确率达81.30%,优于现有无梯度调优方法,验证了其高效性和稳定性。该研究不仅降低了模型调优的门槛,也为模型泛化提供了新思路,推动大模型在工业界的广泛应用。未来,作者计划结合多模态信息和自适应策略,进一步提升调优效率与效果,开启参数高效调优的新篇章。

深度分析

研究背景

近年来,Transformer架构推动了大规模预训练语言模型(如BERT、GPT系列)的快速发展。这些模型在多项NLP任务中取得突破性进展,但调优成本逐年增加,尤其是在模型参数庞大、商业API封闭的背景下,微调变得不现实。现有研究如Prompt Tuning、LoRA、BitFit等,试图在参数效率和性能之间找到平衡,但仍面临过拟合、泛化不足等挑战。黑箱优化作为一种无需访问模型内部参数的调优策略,逐渐受到关注。Sun等(2022b)提出的BBT在少样本调优中表现出一定优势,但仍存在优化不稳定和效果有限的问题。本文旨在突破这些瓶颈,提出更高效、稳定的黑箱调优方案。

核心问题

当前大模型调优面临两个核心难题:一是参数微调成本高昂,二是模型作为服务(API封闭)限制了参数访问,导致传统微调方法不可行。在少样本条件下,提示调优易过拟合,优化过程不稳定。此外,单一Verbalizer难以充分利用模型输出信息,影响类别判别。如何在有限资源和信息约束下,实现高效、稳定的模型调优,成为亟待解决的问题。

核心创新

本文提出三大创新:第一,采用两阶段无梯度优化策略,结合演化算法和搜索方法,提升收敛速度与稳定性;第二,设计多重Verbalizer,通过TF-IDF和神经网络自动生成,增强类别判别能力,充分利用模型输出;第三,结合指令搜索和示范选择,优化提示初始化,改善少样本调优效果。这些创新共同解决了现有方法中的过拟合和优化不稳定问题,显著提升了黑箱调优的性能。

方法详解

  • �� 输入:预训练模型(如RoBERTa-Large)和任务数据。• 第一阶段:利用演化算法(CMA-ES)进行粗粒度搜索,快速逼近最优提示;• 第二阶段:采用搜索算法(如随机搜索)细化提示,避免过拟合。• Verbalizer构建:结合手工选择、TF-IDF筛选和神经网络自动生成多Verbalizer,提升类别判别能力。• In2初始化:结合任务指令和示范样本,优化提示起点。• 优化流程:在API调用预算内,交替进行两阶段优化,确保模型调优的稳定性与效率。

实验设计

在GLUE基准任务(如SST-2、Yelp、AGNews、SNLI、RTE)上,采用16-shot少样本设置,比较多种调优方法,包括全参数微调、Prompt Tuning、LoRA、BitFit、BBTv2和本文方法。指标主要为准确率和F1值,进行多次随机初始化和交叉验证,确保结果稳健。超参数包括API调用次数、Verbalizer数量、搜索步数等。还进行了消融实验,验证各技术组件的贡献。

结果分析

实验显示,BBT-RGB在所有任务中均优于对比方法,平均准确率达81.30%,在少样本场景中表现出极强的泛化能力。特别是在SNLI和RTE任务中,超越了全微调的性能,验证了其稳定性和效率。消融分析表明,多Verbalizer和In2初始化分别提升了1-2%的准确率,验证了技术的有效性。标准差较低,说明调优过程更稳定。

应用场景

该方法适用于需要快速部署多任务模型的场景,如客服问答、内容筛选等。只需少量示例和指令,即可在封闭API环境中实现高性能调优。未来可结合多模态信息,扩展到视觉、语音等多模态应用,推动智能系统的普及。

局限与展望

尽管效果显著,但算法依赖API调用次数,成本较高,尤其在大模型商业服务中可能限制应用。此外,Verbalizer多样化和示范搜索耗时较长,影响调优效率。未来需优化搜索策略,降低计算成本,提升算法的实用性。

通俗解读 非专业人士也能看懂

想象你在厨房做菜,要用不同的调料和方法调出一道美味佳肴。传统做法是按照食谱一步步操作,但如果你没有完整的食谱,只能试错。本文就像教你用一种聪明的调料包(提示),不用看菜谱(模型内部参数),只通过不断尝试和调整,找到最合适的味道。它还教你用多种调料(Verbalizer)组合,确保味道更丰富。最后,还会根据你喜欢的口味(指令和示范),提前帮你准备好调料和步骤。这样,即使没有完整的食谱,也能做出美味的菜肴,而且效率还很高。这就像用智慧和经验,巧妙地调出最棒的味道。

简单解释 像给14岁少年讲一样

想象你在学校的厨房里,想做一道特别的菜,但没有完整的食谱,只能靠自己试试。你可以用不同的调料(Verbalizer)试出最合适的味道,也可以根据朋友的建议(示范)提前准备好材料。这个方法就像给你一套聪明的工具,让你不用看详细的菜谱,也能做出好吃的菜。它还会帮你快速找到最好的调料组合,避免反复试错。这样一来,即使没有经验,也能轻松做出美味的菜肴,而且速度还很快。就像你用聪明的办法,轻松搞定厨房大作战!

术语表

Black-Box Optimization (黑箱优化)

一种无需访问模型内部参数或梯度的优化方法,通过输入输出关系进行调优。

本文采用黑箱优化策略调节提示参数。

Verbalizer (Verbalizer)

将模型输出的类别概率映射到具体标签词的策略,用于分类任务。

多Verbalizer设计提升类别判别能力。

In2 Initialization (In2初始化)

结合指令和示范样本,优化提示的起始点,提高少样本调优效果。

提升提示初始化的效果和稳定性。

Two-Stage Derivative-Free Optimization (两阶段无梯度优化)

结合演化算法和搜索方法的分阶段优化策略,提升收敛速度和避免过拟合。

核心技术之一。

Prompt Tuning (提示调优)

通过调整提示词或参数,适应模型完成特定任务的技术。

本文的调优目标。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端少样本或类别极多的任务中进一步提升优化稳定性和效果,仍需探索更高效的算法设计。
  • 2 未来需研究多模态环境下的黑箱调优策略,以应对复杂场景。

原文摘要

Large language models (LLMs) have shown increasing power on various natural language processing (NLP) tasks. However, tuning these models for downstream tasks usually needs exorbitant costs or is unavailable due to commercial considerations. Recently, black-box tuning has been proposed to address this problem by optimizing task-specific prompts without accessing the gradients and hidden representations. However, most existing works have yet fully exploited the potential of gradient-free optimization under the scenario of few-shot learning. In this paper, we describe BBT-RGB, a suite of straightforward and complementary techniques for enhancing the efficiency and performance of black-box optimization. Specifically, our method includes three plug-and-play components: (1) Two-stage derivative-free optimization strategy that facilitates fast convergence and mitigates overfitting; (2) Automatic verbalizer construction with its novel usage under few-shot settings; (3) Better prompt initialization policy based on instruction search and auto-selected demonstration. Extensive experiments across various tasks on natural language understanding and inference demonstrate the effectiveness of our method. Our codes are publicly available at https://github.com/QiushiSun/BBT-RGB.

cs.CL cs.AI