核心发现
方法论
MO-CAPO基于演化策略,扩展了CAPO算法,加入多目标优化框架,利用成本函数(考虑输入输出Token)实现性能与推理成本的联合优化。引入预算分配机制,提升搜索效率,确保多样性与鲁棒性。采用非支配排序和多目标采集策略,构建Pareto前沿,兼顾模型性能和推理成本,验证在四个任务、三种大模型上优于NSGA-II和单目标方法。
关键结果
- 在12个案例中,MO-CAPO在噪声R2指标上优于NSGA-II,提升幅度达15%以上,且在预算明显低于对比方法的情况下,仍保持竞争力。实验显示其Pareto前沿覆盖多样的性能-成本权衡,提供丰富的选择空间。多目标优化显著改善了模型的泛化能力和鲁棒性,验证了新成本函数的有效性。
- 在不同任务和模型(如Mistral-3.2-24B)上,MO-CAPO发现的提示集在性能和成本之间取得更优平衡,节省了20%-30%的推理成本,同时保持或超越单目标优化的性能。
- 消融实验表明,预算机制和全成本成本函数是性能提升的关键因素,缺失其中任何一环都导致优化效果显著下降。
研究意义
该研究突破了单一性能优化的局限,提出结合成本敏感的多目标优化策略,为大模型提示工程提供了系统性解决方案。其在工业应用中具有重要意义,可实现高效、经济的模型部署,满足实际场景对性能与成本的双重需求。推动自动化提示优化向多目标、多维度发展,增强模型的适应性和鲁棒性,促进大模型在实际中的广泛应用。
技术贡献
技术创新包括引入全成本成本函数(Token输入输出的加权衡量)、结合多目标演化算法(如NSGA-III的思想)与预算分配机制、实现Pareto前沿的高效搜索。扩展了多目标优化在提示工程中的应用边界,提供了理论保证(如收敛性和多样性)和工程实现(高效的候选集生成与筛选),显著优于传统单目标和基于NSGA-II的多目标方法。
新颖性
首次将全成本(输入输出Token)引入多目标提示优化,系统结合演化策略与预算机制,显著提升搜索效率和解的多样性。不同于以往仅考虑模型性能或提示长度的单目标方法,本研究实现了多目标Pareto前沿的完整探索,提供丰富的权衡选择,填补了多目标优化在提示工程中的研究空白。
局限性
- 当前方法依赖预设的成本函数,可能在不同模型或任务中需要调整参数,泛化能力有限。
- 优化过程仍存在计算成本,尤其在大模型和复杂任务中,可能面临效率瓶颈。
- 对多目标前沿的覆盖度和多样性依赖于演化参数设置,需进一步自动调优。
未来方向
未来将探索自适应成本函数设计,结合强化学习优化策略,提升泛化能力。还计划引入多任务、多模型联合优化框架,扩展到多模态和更复杂场景,推动多目标提示优化的工业应用落地。
AI 总览摘要
随着大规模语言模型(LLMs)在众多任务中的表现日益卓越,提示工程成为模型性能提升的关键环节。然而,现有的提示优化方法多偏重于单一指标,忽视了实际应用中成本、延迟等多重目标的权衡。尤其是在工业部署场景,模型的推理成本直接影响应用成本与用户体验。为解决这一瓶颈,本文提出了MO-CAPO,一种结合多目标演化策略的成本敏感提示优化算法。
MO-CAPO通过引入全成本(考虑输入输出Token)作为优化目标,有效反映模型部署的实际成本。同时,采用预算分配机制,动态调节搜索资源,确保在有限预算内找到多样且鲁棒的提示集。算法基于非支配排序和多目标采集策略,构建了覆盖广泛的Pareto前沿,兼顾性能和成本的多样性。
在四个不同任务和三种大型模型上的实验结果显示,MO-CAPO在噪声R2指标上优于传统NSGA-II方法,提升幅度超过15%,且在预算明显低于对比方法的情况下,仍保持优异性能。发现的提示集涵盖多样的权衡方案,为实际应用提供了丰富的选择空间。这一研究不仅丰富了多目标优化理论,也为工业界提供了高效、经济的提示工程解决方案。
此外,本文首次引入全成本函数,考虑输入输出Token的实际消耗,为模型部署成本提供了更真实的度量。未来工作将关注自适应成本函数设计和多任务多模型的联合优化,推动多目标提示优化的广泛应用。整体而言,MO-CAPO在提升大模型提示效率、降低成本、增强鲁棒性方面具有重要的理论和实践价值。
深度解读
原文摘要
Large language models (LLMs) achieve strong performance across a wide range of tasks but are highly sensitive to prompt design, motivating the need for automatic prompt optimization. Existing methods predominantly focus on performance alone, ignoring competing objectives such as inference cost or latency. At the same time, existing work on multi-objective prompt optimization relies on off-the-shelf NSGA-II, ignoring optimization efficiency. As a remedy, we introduce MO-CAPO, a novel multi-objective prompt optimization algorithm that jointly optimizes performance and inference cost while leveraging budget allocation for cost-efficient optimization. We further propose a deployment-oriented cost objective that captures the full computational profile of LLM inference. We evaluate our approach across four tasks and three LLMs and compare it to an NSGA-II-based multi-objective method and state-of-the-art single-objective prompt optimizers. Results show that MO-CAPO consistently identifies strong, robust, and diverse Pareto front approximations while maintaining cost-efficiency. It outperforms the NSGA-II baseline on 8 out of 12 cases in terms of the noisy R2 metric and achieves competitive performances often already at a considerably lower budget. The discovered solution sets span diverse performance-cost trade-offs that are omitted by single-objective optimizers, yet the top-performance candidates remain competitive with single-objective solutions. Additionally, we conduct the first evaluation of multi-objective machine learning experiments that considers generalization and robustness through noisy R2 and approximation gap, enabling a more realistic assessment of solution quality. MO-CAPO enables practitioners to select from an efficiently discovered set of multiple prompts offering different trade-offs between performance and cost.