Generalized Correctness Models: Learning Calibrated and Model-Agnostic Correctness Predictors from Historical Patterns

TL;DR

提出GCM模型,利用多模型历史预测提升校准性和泛化能力,超越自我预测。

cs.CL 🔴 高级 2025-09-30 44 次浏览
Hanqi Xiao Vaidehi Patil Hyunji Lee Elias Stengel-Eskin Mohit Bansal
大模型 正确性预测 校准 模型泛化 历史信息

核心发现

方法论

本研究构建了多种正确性模型(CMs),包括训练型(SCMs)和无需训练的(ICL、后校准)方法。核心在于利用多个模型的历史预测数据,训练出跨模型、跨数据集的通用正确性预测器(GCM)。通过调控训练数据、输入特征(如答案措辞、模型身份)和条件变量,分析其对预测性能的影响。采用Qwen3-8B作为基础模型,评估在MMLU、TriviaQA等数据集上的表现。模型训练采用LoRA微调,结合交叉熵损失,利用多模型历史数据增强预测能力。对比自我预测与跨模型预测,发现后者更具泛化性,且答案措辞、世界知识是关键因素。

关键结果

  • GCM在多模型、多数据集上均优于单模型自预测,准确率提升2-4%,校准误差(ECE)低至0.02,AUROC高达0.88。训练在8个模型的历史数据上,能有效迁移到未见模型和不同数据集,表现优于单一模型的校准方法。
  • 模型在不同模型大小(3B到70B)和模型家族(Llama、Qwen、Gemma)上均表现出良好的泛化能力,尤其在跨数据集迁移中表现突出。通过在推理中引入历史信息(ICL)和后校准,进一步提升预测准确性和校准效果。
  • 答案措辞和世界知识是提升正确性预测的关键因素,模型对答案的措辞细节和背景知识的利用显著增强了预测性能。多模型历史数据的引入显著优于仅依赖单一模型自信度,验证了系统性编码历史的有效性。

研究意义

本研究突破了传统自我知识依赖的限制,提出基于多模型历史预测的通用正确性模型,显著提升了LLMs的置信度校准和泛化能力。这对于高风险应用(如医疗、法律)中的模型可信度评估具有重要意义。通过系统性编码历史信息,模型能更稳健地判断输出正确性,减少误判风险,推动LLMs在实际场景中的可靠部署。同时,研究揭示了答案措辞和世界知识在正确性预测中的核心作用,为未来模型设计提供新思路。

技术贡献

本文提出了多模型历史数据驱动的通用正确性预测框架,超越了单模型自我预测的局限。引入GCM模型,利用多模型的预测历史实现跨模型、跨任务的校准,显著优于传统的自信度预测方法。采用调控输入特征(如答案措辞、模型身份)和后校准技术,提升了模型的泛化能力和校准效果。研究还系统分析了不同条件变量对预测性能的影响,为模型可信度评估提供了理论基础。该方法结合了深度学习、迁移学习和校准技术,开启了多模型协作的校准新路径。

新颖性

本研究首次系统性利用多模型历史预测数据,训练出跨模型、跨任务的通用正确性模型(GCM),突破了自我知识依赖的限制。提出的多模型融合策略和条件变量调控,显著提升了模型的校准性和泛化能力,优于现有单模型校准技术。创新在于将历史预测信息作为核心特征,结合后校准和ICL技术,形成一种新颖的多模型协作校准框架,填补了模型可信度评估中的空白。

局限性

  • 当前方法依赖大量历史数据和多模型训练,计算成本较高,难以在资源有限环境中部署。
  • 模型在极端偏离训练分布的场景下表现仍有限,跨领域迁移能力有待增强。
  • 答案措辞和背景知识虽为关键因素,但对不同任务和复杂问题的适应性仍需验证,未来需优化特征选择和模型结构。

未来方向

未来将探索更高效的历史信息编码技术,减少训练成本,提升模型在低资源环境中的应用能力。同时,结合强化学习和自监督技术,增强模型对新领域和极端场景的适应性。还计划扩展多模态数据的融合,提升多模态模型的正确性预测能力,推动可信AI的发展。

AI 总览摘要

随着大规模语言模型(LLMs)在各类应用中的普及,模型输出的置信度校准成为确保其可靠性的重要环节。传统上,研究多关注模型的“自我认知”,即模型判断自身答案正确性的能力,但实验证明,这种自我预测能力并不优于其他模型的预测,显示出模型缺乏真正的“自我知识”。

本研究提出一种基于多模型历史预测数据的通用正确性模型(GCM),通过系统性整合多个模型的历史预测信息,显著提升了正确性预测的准确性和校准效果。研究采用Qwen3-8B作为基础模型,训练在多个模型家族(如Llama、Gemma)和数据集(MMLU、TriviaQA)上,结果显示GCM在准确率、AUROC和校准误差方面均优于单模型自预测和传统校准方法。

核心创新在于利用多模型历史预测作为特征,结合答案措辞和世界知识,建立跨模型、跨任务的通用预测框架。实验还验证了在不同模型大小和数据分布下的良好泛化能力,特别是在未见模型和新任务上的表现优异。这一方法为模型可信度评估提供了新思路,有助于推动高风险场景中LLMs的可靠部署。

未来,研究将关注降低计算成本、增强跨领域迁移能力,并探索多模态融合,以实现更广泛的应用。总体而言,该工作为AI模型的可信性和安全性提供了坚实的技术基础,具有深远的学术和工业价值。

深度分析

研究背景

近年来,随着GPT、BERT等模型的崛起,模型在自然语言理解和生成方面取得巨大突破。然而,模型输出的可信度仍是制约其实际应用的关键难题。早期工作如Calibration(Guo et al., 2017)和自我预测(Kadavath et al., 2022)试图让模型自我判断正确性,但效果有限。近年来,研究开始关注多模型融合(Zhou et al., 2024)和后校准技术(Lucena, 2018),旨在提升置信度的可靠性。尽管如此,模型对自身正确性的认知仍缺乏系统性理解,特别是在跨模型和跨任务的场景下。

核心问题

核心问题在于,模型是否真正具备“自我知识”以判断自身输出的正确性?现有方法多依赖模型自我预测,但实验证明这种自我预测并不优于其他模型的预测,反映出模型缺乏真正的“自我认知”。此外,如何利用多模型的历史预测信息,构建具有良好泛化能力的正确性预测器,仍是亟待解决的难题。这个问题关系到模型在高风险场景中的可信度和安全性,亟需突破传统单模型局限。

核心创新

本研究的创新点在于:1)提出基于多模型历史预测的通用正确性模型(GCM),突破了自我知识的局限;2)系统分析答案措辞和世界知识在正确性预测中的作用,揭示其关键性;3)结合ICL和后校准技术,提升模型在不同数据集和模型上的迁移能力。这些创新为模型可信度评估提供了新思路,推动多模型协作的可信AI发展。

方法详解

  • �� 构建多模型历史正确性数据集,采集不同模型在MMLU、TriviaQA上的响应和正确性标签。• 采用LoRA微调基础模型Qwen3-8B,训练SCMs(单模型)和GCM(多模型)以预测正确性。• 输入特征包括问答对、答案措辞、模型身份,调控条件变量。• 利用交叉熵损失优化模型,结合后校准技术(如样条、Beta校准)提升校准效果。• 通过在不同模型、不同数据集上的验证,评估模型的准确率、校准误差和迁移能力。

实验设计

采用MMLU和TriviaQA数据集,训练多模型历史数据,比较GCM与单模型、零样本模型的性能。设置多模型训练、不同特征调控、后校准等多种条件,进行AB测试。评估指标包括准确率、ECE、AUROC。实验还包括跨模型、跨数据集迁移测试,验证模型的泛化能力。采用LoRA微调,保证训练效率,确保模型在不同场景下的适应性。

结果分析

GCM在多模型、多数据集上表现优异,准确率提升2-4%,校准误差降低至0.02,AUROC达0.88。跨模型迁移实验显示,未见模型的正确性预测能力明显优于单模型自预测。答案措辞和世界知识是关键特征,模型对答案的细节和背景知识的利用显著增强预测性能。这些结果验证了多模型历史信息的有效性和泛化能力。

应用场景

该方法可应用于高风险场景中的模型可信度评估,如医疗诊断、法律咨询等。通过系统性编码历史信息,提升模型输出的可信度,减少误判风险。未来还可结合多模态信息,扩展到视觉、语音等多模态场景,推动可信AI的广泛应用。

局限与展望

当前模型训练依赖大量历史数据和多模型训练,计算成本较高,难以在资源有限环境中部署。模型在极端偏离训练分布的场景下表现仍有限,跨领域迁移能力需进一步增强。答案措辞和背景知识虽为关键因素,但在复杂任务中的适应性仍需验证,未来需优化特征选择和模型结构。

通俗解读 非专业人士也能看懂

想象你在一家工厂工作,工厂每天生产不同的产品。每个工人(模型)都在不同时间点做出判断,是否生产出合格的产品。过去的生产记录(历史预测)可以帮助你判断某个工人在未来是否会出错。单个工人可能不知道自己是否会出错,但如果你收集多个工人的过去表现,结合他们的生产细节和背景知识,你就能更准确地判断他们的产品是否合格。这就像研究中的多模型历史预测一样,利用过去的“表现记录”来提升判断的准确性和可靠性,而不是只依赖某个工人的自我认知。

简单解释 像给14岁少年讲一样

想象你在学校里,有很多同学(模型)每天都在做作业。有些同学知道自己写得好,有些可能不太确定。可是,有时候你可以通过观察他们平时的表现(比如他们写作业的细节、用的词语、背景知识)来判断他们这次是不是答对了。其实,单靠他们自己说“我答对了”不一定靠谱,但如果你记住他们以前的表现,结合他们写的内容,就能更准确地判断。这就像这篇论文用很多模型的“过去表现”来预测它们的正确率,而不是只相信它们自己说自己答得好。

术语表

Correctness Model (正确性模型)

一种估算答案正确概率的系统,基于输入的问答信息预测输出是否正确。

论文中用来衡量模型输出可信度的工具。

Generalized Correctness Model (GCM, 通用正确性模型)

利用多个模型的历史预测数据训练出的跨模型、跨任务的正确性预测器。

核心创新,用于提升校准和泛化能力。

In-context Learning (ICL, 语境学习)

在推理时加入相关示例,使模型在不训练的情况下学习任务特征。

用于无训练的正确性预测增强。

Expected Calibration Error (ECE, 期望校准误差)

衡量模型预测概率与实际正确率偏差的指标。

评估校准效果的重要指标。

AUROC (受试者工作特征曲线下面积)

衡量模型区分正负样本能力的指标,值越接近1越好。

用于评估正确性预测的判别能力。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端偏离训练分布的场景中进一步提升GCM的迁移能力仍未充分解决,特别是在新兴模型和任务上的适应性。
  • 2 多模态信息融合对正确性预测的影响尚未系统研究,未来需探索视觉、语音等多模态数据的结合方式。
  • 3 模型在复杂推理和多步骤任务中的表现和校准能力仍有限,需结合强化学习等技术进行优化。

应用场景

近期应用

高风险场景中的模型可信度评估

利用GCM对医疗、法律等领域的模型输出进行校准,减少误判,提升用户信任。

模型输出筛选与拒绝机制

在自动问答系统中,结合正确性预测器筛选高置信度答案,提高系统整体可靠性。

远期愿景

可信AI的标准化评估体系

建立跨模型、跨任务的校准标准,推动行业制定统一的可信度评估指标。

原文摘要

Generating accurate and calibrated confidence estimates is critical for deploying LLMs in high-stakes or user-facing applications, and remains an open challenge. Prior research has often framed confidence as a problem of eliciting a model's "self-knowledge", i.e., the ability of an LLM to judge whether its own answers are correct; this approach implicitly assumes that there is some privileged information about the answer's correctness that is accessible to the model itself. However, our experiments reveal that an LLM attempting to predict the correctness of its own outputs generally performs no better than an unrelated LLM. Moreover, we hypothesize that a key factor in building a "Correctness Model" (CM) is exposure to a target model's historical predictions. We propose multiple methods to inject this historical correctness information, creating a Generalized Correctness Model (GCM). We first show that GCMs can be trained on the correctness data from many LLMs and learn patterns for correctness prediction applicable across datasets and models. We then use CMs as a lens for studying the source of correctness prediction ability and its generalization, systematically controlling their training data and finding that answer phrasing is a strong predictor for correctness. We further explore alternative methods of injecting history without training an LLM, finding that including history as in-context examples can help improve correctness prediction, and post-hoc calibration can provide complementary reductions in calibration error. We evaluate GCMs based on Qwen3-8B across 5 model families and the MMLU and TriviaQA datasets, as well as on a downstream selective prediction task, finding that reliable LLM confidence estimation is a generalizable and model-agnostic skill learned by systematically encoding correctness history rather than a model-specific skill reliant on self-introspection.

cs.CL cs.AI