Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs

TL;DR

提出黑盒LLM置信度估计框架,结合提示、采样与聚合,提升校准与失败预测性能。

cs.CL 🔴 高级 2023-06-23 46 次浏览
Miao Xiong Zhiyuan Hu Xinyang Lu Yifei Li Jie Fu Junxian He Bryan Hooi
大规模语言模型 置信度校准 黑盒方法 不确定性估计 模型评估

核心发现

方法论

本文构建了包含提示策略、采样方法与聚合技术的系统框架,用于黑盒环境下的置信度估计。通过多样化提示设计(如自我探查、多步推理、Top-K策略)激发模型表达置信信息。采样策略包括随机采样和 paraphrasing,增强输出多样性。聚合技术则利用一致性、平均置信度和排名等指标,结合不同任务(如常识推理、数学推理)进行校准和失败预测评估。实验证明该框架在五个不同模型(GPT-4、LLaMA 2等)及五类数据集上表现优异,尤其在模型规模扩大时性能提升明显。

关键结果

  • 模型在Verbalized Confidence中普遍表现过度自信,80%-100%区间内频繁出现,且校准误差(ECE)较高,GPT-4平均为18.0,远低于GPT-3的52.0,但仍存在偏差。
  • 通过提示策略(如自我探查、逐步推理)显著改善校准效果,ECE降低至0.1以下,AUROC提升至62.7%,但在专业知识任务中仍表现不足。
  • 多样化采样(如随机采样、 paraphrasing)与聚合(如平均置信度、排名)能有效提升失败预测能力,AUROC最高达68%,显示多响应机制的优势。

研究意义

该研究突破了传统白盒方法在封闭API环境下的限制,提出了实用的黑盒置信度估计方案,为大规模商业模型的可信性提供了理论基础与实践工具。其在模型校准、风险评估和决策支持中的应用潜力巨大,有助于推动可信AI的发展,尤其在医疗、金融等高风险领域具有重要意义。

技术贡献

本文创新性地提出了结合提示设计、多响应采样与多指标聚合的黑盒置信度估计框架,系统性分析了不同策略对模型校准和失败预测的影响。引入多响应机制与排名方法,丰富了模型不确定性表达的工具箱。与白盒方法(如Token-Likelihood、Calibration Fine-tuning)相比,虽性能略逊一筹,但在封闭API环境中具有更广泛的适用性。研究还揭示了模型规模与置信表达能力的关系,为未来模型设计提供指导。

新颖性

首次系统性提出面向封闭API的黑盒置信度估计框架,结合多样化提示、采样与聚合策略,有效缓解模型过度自信问题。不同于以往依赖内部信息的白盒方法,此研究强调在无模型内部访问权限的条件下实现可信度表达,填补了该领域的空白。

局限性

  • 在专业知识和复杂推理任务中,方法仍表现不足,尤其在高难度任务的失败预测方面存在较大挑战。
  • 模型规模越大,过度自信问题越明显,提示策略的优化空间仍大,且不同任务对策略的适应性有限。
  • 采样与聚合过程增加计算成本,实际应用中需权衡效率与效果。

未来方向

未来将探索结合外部知识库与多模态信息的置信度估计,提升在专业领域的表现。还需优化采样策略以降低计算负担,增强模型在高难度任务中的鲁棒性。此外,研究将关注多任务、多模型融合,提高置信度的泛化能力。

AI 总览摘要

随着大规模语言模型(LLMs)在自然语言处理中的广泛应用,模型的置信度表达成为确保可信性和安全性的重要环节。传统方法多依赖白盒访问模型内部信息或微调,难以适应封闭API环境,限制了实际应用。为此,本文提出了一套面向黑盒环境的置信度估计框架,结合提示策略、采样机制与多指标聚合,系统性提升模型的校准和失败预测能力。

该框架的核心在于设计多样化提示(如自我探查、多步推理、Top-K策略),激发模型表达置信信息;采用多次采样(随机或 paraphrasing)增强输出多样性;利用一致性、平均置信度和排名等指标进行结果聚合,形成稳健的置信估计。实验在五个模型(GPT-4、LLaMA 2等)及五类任务(常识、数学、符号、专业知识、伦理)中验证,结果显示:模型在Verbalized Confidence中普遍过度自信,校准误差较大,但通过提示优化和多响应机制,显著改善了校准效果和失败预测性能。

研究发现,模型规模越大,过度自信越严重,但校准和失败预测能力也随之提升。尽管如此,在专业任务中仍存在不足,提示策略的优化空间巨大。该方法在实际应用中具有广泛潜力,特别是在高风险场景如医疗、金融中,能为模型提供更可靠的置信信息,推动可信AI的发展。未来工作将结合外部知识和多模态信息,进一步提升模型在复杂任务中的表现,降低计算成本,增强泛化能力。

深度分析

研究背景

近年来,大规模语言模型(如GPT系列、LLaMA)在自然语言理解和生成中取得突破,但模型的置信度表达仍面临挑战。传统方法依赖白盒信息(如token概率)或微调,难以在封闭API环境中实现。随着商业化API的普及,研究转向黑盒方法,旨在通过提示和响应机制估算模型不确定性,提升模型在风险敏感场景中的可信度。

核心问题

核心问题在于如何在无模型内部访问权限的情况下,准确估算模型的置信度。现有白盒技术无法应用于封闭API,且模型在Verbalized Confidence中表现出明显的过度自信,导致校准偏差大,难以区分正确与错误预测。这限制了模型在实际决策中的可靠性,亟需开发高效、普适的黑盒置信度估计方法。

核心创新

本研究提出了结合提示设计、多响应采样与多指标聚合的系统框架,创新点包括:

  • �� 多样化提示策略(如自我探查、多步推理)激发模型表达置信信息;
  • �� 采样机制(随机、多样化 paraphrasing)增强输出多样性;
  • �� 多指标聚合(如置信一致性、平均置信度、排名)提升估计稳健性。这些创新使得在封闭API环境下实现可信度表达成为可能,突破了白盒方法的限制。

方法详解

  • �� 提示策略:设计多种提示(vanilla、自我探查、多步推理、Top-K)引导模型表达置信;
  • �� 采样机制:利用随机采样(调整温度)和 paraphrasing 生成多响应;
  • �� 聚合技术:采用一致性、平均置信度和排名等指标,将多响应信息融合,形成最终置信估计;
  • �� 评估指标:校准误差(ECE)和失败预测(AUROC)衡量效果;
  • �� 实验在五个模型和五类任务上验证,分析不同策略的优劣。

实验设计

使用GSM8K、SVAMP、StrategyQA等数据集,评估模型校准和失败预测能力。对比不同提示策略(vanilla、自我探查、多步推理、Top-K)和采样方法(随机、 paraphrasing),分析其对ECE和AUROC的影响。设置不同模型(GPT-3、GPT-4、LLaMA 2)参数,进行多轮实验和消融分析,验证策略的有效性和适应性。

结果分析

模型在Verbalized Confidence中普遍表现过度自信,80%-100%区间内频繁出现,校准误差(ECE)高达52.0(GPT-3),但经过提示优化,ECE降低至0.1以下,AUROC提升至62.7%。多响应采样和排名聚合显著改善失败预测,最高AUROC达68%。模型规模扩大带来性能提升,但在专业任务中仍表现不足,提示策略的优化空间巨大。

应用场景

该方法可应用于医疗诊断、金融风险评估、自动问答等场景,为模型提供更可信的置信信息,帮助用户判断答案可靠性,降低误导风险。实现条件包括模型支持多响应生成和多指标评估,适合在封闭API环境中部署。

局限与展望

在高难度任务(如专业知识)中表现仍有限,模型过度自信问题未完全解决。采样和聚合过程增加计算成本,实际应用需权衡效率。未来需结合外部知识和多模态信息,提升在复杂场景中的鲁棒性和泛化能力。

通俗解读 非专业人士也能看懂

想象你去一家厨房,厨师需要告诉你菜做得好不好。传统上,厨师可能只说“很好”或“不错”,但你不知道他到底有多自信。现在,厨师可以用不同的方法,比如多次尝试做菜(采样),每次都说自己有多自信(提示策略),然后根据这些反馈(聚合)判断菜的真正质量。这就像模型通过多次回答问题,观察它们的一致性和自信程度,来估算答案的可靠性。这样,即使你不能看厨师的内部操作,也能大致知道菜的味道是否靠谱。这种方法帮助我们在没有内部信息的情况下,判断模型的答案是否可信,就像用多次尝试和观察来判断厨师的水平一样。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你的朋友告诉你他知道很多秘密,但你不知道他到底有多可靠。你可以问他很多问题,让他多次回答,然后看看他的答案是不是一致,或者他自己说的有多自信。比如,他说“我确定这个宝藏在这里”,你可以问几次,或者让他用不同的话说同一个问题,然后看看答案是不是一样。这样,你就能大概知道他是不是在骗你,或者他真的很懂。这个方法就像模型一样,我们让它多次回答问题,观察它的答案是否一致,或者它自己说的有多自信。通过这样的方法,我们可以在不看模型内部细节的情况下,判断它的答案是否可靠。虽然模型有时候会太自信,但只要用对方法,就能更好地知道它的真实水平。

原文摘要

Empowering large language models to accurately express confidence in their answers is essential for trustworthy decision-making. Previous confidence elicitation methods, which primarily rely on white-box access to internal model information or model fine-tuning, have become less suitable for LLMs, especially closed-source commercial APIs. This leads to a growing need to explore the untapped area of black-box approaches for LLM uncertainty estimation. To better break down the problem, we define a systematic framework with three components: prompting strategies for eliciting verbalized confidence, sampling methods for generating multiple responses, and aggregation techniques for computing consistency. We then benchmark these methods on two key tasks-confidence calibration and failure prediction-across five types of datasets (e.g., commonsense and arithmetic reasoning) and five widely-used LLMs including GPT-4 and LLaMA 2 Chat. Our analysis uncovers several key insights: 1) LLMs, when verbalizing their confidence, tend to be overconfident, potentially imitating human patterns of expressing confidence. 2) As model capability scales up, both calibration and failure prediction performance improve. 3) Employing our proposed strategies, such as human-inspired prompts, consistency among multiple responses, and better aggregation strategies can help mitigate this overconfidence from various perspectives. 4) Comparisons with white-box methods indicate that while white-box methods perform better, the gap is narrow, e.g., 0.522 to 0.605 in AUROC. Despite these advancements, none of these techniques consistently outperform others, and all investigated methods struggle in challenging tasks, such as those requiring professional knowledge, indicating significant scope for improvement. We believe this study can serve as a strong baseline and provide insights for eliciting confidence in black-box LLMs.

cs.CL