核心发现
方法论
C3RL将正确性奖励、校准奖励和数据集参考准确率奖励相加:R=R_correctness+R_calibration+R_reference。模型输出答案及1–10置信度;以t=5区分确定与不确定。CAS按不同答案的置信度总和计算最大值c1与次大值c2,并利用Beta分布停止概率动态决定是否继续采样。
关键结果
- 在Qwen2.5VL-7B-Instruct上,C3RL在多模态数据平均准确率为53.3%、AUROC为0.644、ECE为0.109;在MMMU上ECE为0.096,在MathVista上为0.074,优于RLCR的0.182平均ECE。
- CAS在保持多数投票准确率水平的条件下显著节省采样:域外文本平均仅需5.19次、节省12.33倍;域内平均10.91次、节省5.87倍;多模态平均7.13次、节省8.98倍。
- 去除参考准确率奖励后,Qwen模型平均ECE由0.107升至0.142;说明该奖励可抑制“低置信度但错误”的投机策略,并帮助保持原本正确样本的正确性。
研究意义
论文把“模型是否答对”和“模型是否知道自己可能答错”统一到同一训练—推理框架中。它回应了RLVR只奖励正确答案、却可能产生过度自信幻觉的长期问题,也证明校准置信度不仅是评估指标,还能直接用于计算资源分配。对高风险问答、智能辅导和多模态代理而言,这意味着系统可以在不确定时投入更多计算,在可靠时提前停止。
技术贡献
C3RL以三类互补奖励避免单独优化Brier式校准带来的退化:正确性奖励维持任务性能,阈值式校准奖励学习确定/不确定边界,参考准确率奖励利用十次采样形成的“全对、部分正确、全错”标签。CAS进一步将口头置信度转为Beta停止概率,而非依赖频率或熵,从而形成可调的自适应测试时扩展机制。
新颖性
相较SaySelf、RLCR和Adaptive-Consistency,本文首次在统一流程中连接细粒度置信度RL与自适应测试时扩展。关键创新不是简单增加置信度输出,而是把数据集级参考准确率用于防止校准—正确性脱钩,并用校准后的置信度直接决定停止时机。
局限性
- 训练数据主要来自NuminaMath-TIR、WebInstruct-verified、LogicNLI和LogiQA,参考标签依赖Qwen或Llama的十次采样,可能把基模型偏差带入校准。
- 置信度采用1–10离散口头分数,t=5、α、β及Pstop需要调节;在开放式生成、长对话或分布剧烈变化的任务上,校准稳定性尚未充分验证。
- 实验规模和模型范围有限,尚未系统评估更大模型、真实并行服务成本及安全关键领域的错误代价。
未来方向
后续可研究连续概率或区间置信度、跨任务自动调节阈值,以及不依赖基模型采样的参考标签。还应扩大到代码、长文本和真实代理任务,联合研究并行CAS、延迟—成本—准确率三目标优化,并测试人类拒答、人工接管和安全审计效果。
AI 总览摘要
大语言模型在数学、科学和视觉推理上的能力快速提升,但它们经常在不确定时给出语气笃定的错误答案。传统RLVR主要奖励“答对”,SaySelf等方法强调校准,却可能诱导模型用低置信度掩饰错误。于是,准确率与可信度之间出现了难以兼顾的张力。
Yang等人提出C3RL,将正确性、校准和数据集参考准确率共同纳入强化学习。模型输出1–10的口头置信度;正确答案获得正确性奖励,置信度与实际对错匹配时获得校准奖励,并依据十次采样得到的“全对、部分正确、全错”标签施加参考奖励。基于训练出的可信信号,CAS计算不同候选答案的置信度总和,以Beta分布停止概率判断是否继续生成。
在文本和多模态数据上,C3RL保持准确率并降低ECE;Qwen模型在MMMU和MathVista上的ECE分别为0.096和0.074。CAS达到多数投票准确率时,域外文本平均只需5.19次采样,节省12.33倍预算。研究显示,置信度可以从“解释性输出”变成推理控制器;不过其参考标签、离散分数和有限模型覆盖仍需更大规模验证。
深度分析
研究背景
LLM已能完成复杂问答,但过度自信幻觉限制了可靠部署。提示式置信度依赖措辞,采样一致性如Self-Consistency较昂贵;SaySelf和RLCR尝试用Brier或正确性奖励校准,却可能牺牲准确率。本文将校准与测试时计算分配结合起来。
核心问题
目标不是单纯提高准确率,而是让置信度反映真实正确概率,同时避免模型通过“低置信度答错”降低校准损失。另一个问题是,多数投票通常固定生成64个样本,无法把更多计算精准分配给困难样本。
核心创新
- �� C3RL:整合三种奖励,兼顾答对、置信度匹配和参考准确率。
- �� 分级信号:用1–10分及t=5学习比二元标签更细的信心。
- �� CAS:以置信度加权答案竞争,并用Beta停止概率提前终止。
- �� 统一管线:训练获得可靠信号,推理阶段据此节省预算。
方法详解
- �� 数据:组合NuminaMath-TIR 69k、WebInstruct-verified 4.5k、LogicNLI 16k和LogiQA 8,678题,形成106k训练样本与1,073测试样本。
- �� 标注:基模型温度0.7生成10次,计算Accq=ΣI(ai=a*)/10,并标为全对、部分正确或全错。
- �� C3RL:R_correctness=I(a=a*);确定正确/不确定错误得+β,反之得−β;全错题答对得+α,全对题答错得−α。
- �� CAS:对每个唯一答案累加conf/10,取c1、c2,计算Beta积分概率;若Prob≥Pstop则停止并返回最高置信度答案。
实验设计
评测覆盖AGIEval、MMLU、MMMU、MathVista和LogicVista,并以MMLU验证集、FOLIO、GSM8K及多模态集测试CAS。基线包括Base、Self-Consistency、SFT+Ref、RLVR、SaySelf和RLCR。指标为Accuracy、AUROC和20箱ECE;CAS与多数投票N=64及Adaptive-Consistency比较,并开展去除参考奖励的消融。
结果分析
Qwen模型C3RL在域内平均准确率64.5%、AUROC 0.696、ECE 0.107;多模态平均为53.3%、0.644、0.109。相较SaySelf,OOD文本准确率提高7.9个百分点、OOD多模态提高19.2个百分点。CAS在OOD文本用5.19次采样达到MV准确率,较AC的12.87次更省;去除参考奖励后ECE恶化。
应用场景
可用于医疗或法律问答中的低置信度转人工、教育系统中对难题增加推理次数、视觉问答和智能代理中的动态算力分配。部署前需验证置信度在目标领域的校准,并设置最大采样次数、拒答规则和安全审计。
局限与展望
方法依赖十次采样产生的参考标签,可能继承基模型偏差;1–10分和t=5并非普适最优。Beta停止概率虽降低生成量,但仍需逐步更新候选答案,服务端延迟和并行实现成本未充分报告。未来应扩展模型、任务和连续概率表示,并进行真实风险加权评测。
通俗解读 非专业人士也能看懂
把模型想成一位参加考试的学生。普通训练只给“答对或答错”的分数,所以学生可能即使没把握,也装得很自信。C3RL像一位更细心的老师:答对是基本分;如果学生答对且说“我很有把握”,或答错且承认“不确定”,还能得到额外奖励。老师还会参考这道题过去十次练习的表现,提醒学生不要把原本会做的题答错。
CAS像考试中的智能监考员。它先让学生做几次题,比较不同答案及其自信程度。如果一个答案不仅出现得多,而且每次都非常有把握,就提前收卷;如果答案分散、信心低,就继续给时间。这样简单题少花时间,难题多花时间。论文中,CAS在域外文本任务平均只需5.19次尝试,却达到固定64次多数投票的准确率,最高节省12.33倍计算量。
简单解释 像给14岁少年讲一样
想象你在玩答题游戏,系统让你回答问题,还要说自己有多确定,1分代表“完全不会”,10分代表“稳了”。如果你答错却喊10分,当然很糟;如果你答对却总说1分,系统也不知道什么时候该相信你。C3RL就是训练一个更诚实的玩家:答对很重要,信心和结果匹配也很重要。
它还会看你以前做这类题的表现。要是十次里经常做对,就别突然乱答;要是经常做错,就应该降低信心。CAS则像队友帮你决定是否继续刷题:当某个答案既常见又特别自信,就停止;如果几个答案打得难分难解,就继续尝试。
论文测试了数学、逻辑、科学和图片题。C3RL在MathVista上的ECE是0.074,表示信心和实际表现更接近。CAS在某些域外文字题上平均只需5.19次采样,而普通方法固定用64次。也就是说,简单关卡快速通关,困难关卡认真思考!
术语表
Confidence calibration(置信度校准)
模型给出的信心应接近其答对的真实概率。例如信心80%的题目,长期准确率应接近80%。
论文用AUROC和ECE评估口头置信度是否可靠。
C3RL(正确性与置信度校准强化学习)
同时奖励答案正确、信心匹配和参考准确率的强化学习算法。
它是论文训练阶段的核心方法。
CAS(基于置信度的自适应测试时扩展)
根据候选答案的置信度动态决定继续生成还是提前停止。
它把C3RL产生的置信度用于推理预算控制。
ECE(期望校准误差)
将样本分箱后,比较每箱平均准确率与平均置信度的差距;越低越好。
论文采用20个箱计算ECE。
AUROC
衡量置信度区分正确答案和错误答案的能力,越高越好。
用于评估不同置信度阈值下的判别性能。
开放问题 这项研究留下的未解疑问
- 1 离散1–10置信度是否能稳定迁移到开放式写作、代码和长对话?连续概率、区间预测或校准后的token概率可能更适合这些任务。
- 2 参考标签来自基模型十次采样,仍可能带有系统性偏差。未来需要独立人工标注、外部验证器或不确定性模型来检验因果效果。
- 3 CAS节省的样本数能否转化为真实服务端成本下降,取决于并行生成、批处理、延迟和缓存机制,论文尚未完整回答。
应用场景
近期应用
教育答题助手
系统可让简单且高置信度的问题快速返回,把更多生成次数分配给数学证明、逻辑题或学生反复出错的题目;同时对低置信度答案提示复核,减少误导。
多模态问答与人工接管
在图表、医学影像或产品图片问答中,CAS可对高信心答案提前停止,对低信心答案继续采样或转交人工。部署必须先在目标数据上测ECE并设安全阈值。
远期愿景
风险感知的智能代理
未来代理可依据校准置信度联合决定推理深度、工具调用、人工审批和拒答,使算力预算与错误代价匹配,适用于金融、医疗和安全运营。
原文摘要
Training large language models (LLMs) with reinforcement learning (RL) has significantly advanced their performance on reasoning and question-answering tasks. However, prevailing RL reward designs typically prioritize response correctness, neglecting to incentivize models to express their confidence accurately. This leads to a critical problem: performance gains are often accompanied by poor calibration between confidence and accuracy, misleading models to overconfidently hallucinate when uncertain. To address this limitation, we propose $\textbf{C}$orrectness and $\textbf{C}$onfidence $\textbf{C}$alibration $\textbf{R}$einforcement $\textbf{L}$earning ($\textbf{C3RL}$), a novel RL algorithm integrating correctness, calibration and dataset-informed reference accuracy rewards together. Comprehensive evaluation across 8 text and multimodal datasets demonstrates that C3RL enhances calibration without sacrificing accuracy, outperforming the current state-of-the-art method in both performance and calibration metrics. Utilizing the well-calibrated verbalized confidence from C3RL, we further introduce $\textbf{C}$onfidence-based $\textbf{A}$daptive Test Time $\textbf{S}$caling ($\textbf{CAS}$), an adjustable inference-time strategy that allocates computational resources based on response confidence. Experiments show that CAS surpasses majority voting on both in-domain and out-of-domain datasets while reducing the inference budget by up to 12.33 times. We believe the synergy of C3RL and CAS paves the way for deploying more reliable and resource-efficient LLMs. The code, data and models will be released.