Diagnosing Correctness Probes under Self-Judgement Confounding

TL;DR

本研究提出区分客观正确性(OC)与自我判断(SJ),发现SJ方向在跨域迁移中表现优于OC,揭示语义模糊性。

cs.CL 🔴 高级 2026-07-18 57 次浏览
Yi-Long Lu
自然语言处理 模型解释 正确性检测 迁移学习 认知偏差

核心发现

方法论

本文构建OC与SJ的四类响应模型,利用隐藏状态向量通过线性方向进行因子分析,评估不同层次的迁移能力。采用数学推理与事实回忆两个任务,测试四个指令调优模型(最高14B参数),通过AUC指标衡量OC与SJ方向的迁移效果。实验设计包括跨域迁移、层次分析、null控制和外推测试,确保结果的稳健性。利用特征方向的线性分解,区分OC与SJ的语义偏好,验证其在不同任务和模型中的表现差异。

关键结果

  • 在所有模型中,SJ相关方向(Wmeta)在跨域迁移中表现显著优于OC方向(Wtruth),AUC值普遍超过0.5,说明迁移方向能较好保持SJ极性。而OC方向在所有条件下的迁移效果均低于0.5,显示其迁移能力不足,甚至出现反转。
  • 中后层层次分析显示,SJ方向的迁移效果在中层到后层逐渐增强,且在不同任务(数学推理、事实回忆、MMLU、TruthfulQA)中均表现出一致性,验证了其稳健性。对比控制实验表明,迁移效果不受回答长度、概率、null方向或外推目标的影响。
  • 在未针对目标领域进行方向拟合的情况下,SJ方向在多个任务中的迁移表现依然优异,特别是在跨域测试中,AUC值均显著高于0.5,表明SJ信号具有较强的泛化能力,而OC信号则表现平平甚至反向,提示其语义解释的局限性。

研究意义

该研究揭示了模型内部表示中关于正确性与自我判断的本质差异,强调迁移中的语义偏差问题。结果表明,单纯依赖迁移能力不足以证明模型的客观正确性,提示未来需结合多模态、多任务的验证机制以提升模型的可靠性。这对于模型解释、信任度评估及安全应用具有重要意义,有助于推动更具鲁棒性和可解释性的AI系统设计。

技术贡献

本文首次系统性区分OC与SJ的线性方向,提出基于因子分析的迁移评估框架,利用层次分析揭示中后层迁移效果的差异。引入多任务、多域的验证策略,强化迁移方向的泛化能力。技术上结合了线性可解的因子模型与多任务迁移验证,为理解模型内部语义表示提供了新工具,拓展了模型解释的理论边界。

新颖性

创新点在于首次明确区分OC与SJ的线性方向,揭示迁移中SJ信号的稳健性和OC信号的局限性。不同于以往仅关注模型输出的准确性,本研究关注模型内部的认知偏差和语义模糊性,提出了跨域迁移中的语义验证新方法,为模型解释提供了新的视角。

局限性

  • 实验主要基于指令调优模型,尚未覆盖未调优或微调模型的表现,可能影响迁移的普遍性。
  • 线性方向的假设可能忽略更复杂的非线性关系,未来可考虑非线性方法增强解释能力。
  • 迁移测试集中部分任务的样本偏差可能影响结果的泛化,需要更大规模、多样化数据验证。

未来方向

未来将探索非线性方向的迁移特性,结合多模态信息提升正确性判别的鲁棒性。同时,研究如何结合模型的元认知机制,设计更精细的自我评估指标,增强模型的自我校正能力。此外,扩展到更复杂的任务和多任务场景,验证迁移方向的普适性和解释性,为构建可信AI提供理论基础。

AI 总览摘要

近年来,大型语言模型(LLMs)在生成自然流畅的文本方面取得了巨大突破,但其输出的事实正确性仍面临挑战。传统方法多依赖模型输出的表面指标或外部校验,但这些指标常受到模型自我判断(SJ)与客观正确性(OC)之间的偏差影响。本文提出一种基于隐藏状态线性方向的诊断框架,区分OC与SJ的内在语义偏好。通过构建四类响应模型,利用因子分析揭示不同层次的迁移能力,特别关注中后层的表现。实验证明,SJ相关方向(Wmeta)在跨域迁移中表现出强大的泛化能力,AUC值普遍超过0.5,而OC方向(Wtruth)则表现平平甚至反转。这一发现表明,模型的自我判断信号具有更强的迁移稳定性,揭示了模型内部关于正确性认知的复杂性。研究结果对模型解释、信任评估和安全应用具有深远影响,提示未来应结合多模态、多任务验证机制,提升模型的可靠性和解释性。尽管如此,研究仍存在局限,如线性假设和样本偏差,未来工作将探索非线性方向和更大规模的多任务验证体系,推动可信AI的发展。

深度分析

研究背景

随着深度学习技术的发展,大型语言模型(LLMs)在自然语言处理领域展现出卓越能力。早期研究如GPT系列、BERT等,推动了模型在文本生成、理解和推理方面的突破。近年来,学界开始关注模型的事实可靠性和解释性,尝试从内部激活中解码知识和正确性指标(如Azaria和Mitchell,2023;Li et al.,2023)。然而,模型内部的表示是否真正反映客观事实,仍存争议。部分研究发现,模型的知识和真值信息具有一定的线性可解性(Marks和Tegmark,2024),但其迁移能力和语义一致性尚未充分验证。尤其在跨任务、跨域环境下,模型的正确性信号容易受到自我判断(SJ)偏差的影响,导致解释困难。当前研究多集中于输出层的表现,缺乏对模型内部认知偏差的系统分析。

核心问题

核心问题在于,模型的内部表示中,关于正确性(OC)和自我判断(SJ)是否共享相同的线性方向,影响其迁移和解释能力。传统方法多假设迁移方向代表客观正确性,但实际中,模型的自我判断信号可能偏离OC,导致迁移效果不稳定。如何区分OC与SJ的语义偏差,成为理解模型认知机制的关键。特别是在高置信度错误和自我判断偏差普遍存在的情况下,单一指标难以反映真实的正确性。这限制了模型在安全、可信等应用中的可靠性,也阻碍了模型内部机制的深入理解。

核心创新

本研究创新在于提出区分OC与SJ的线性方向,利用因子分析方法,系统性评估迁移能力。通过构建四类响应模型,结合层次分析,揭示中后层迁移效果的差异,特别强调SJ信号的稳健性。引入跨域迁移验证机制,验证方向的泛化能力,突破了以往仅关注输出准确率的局限。实验中,利用数学推理和事实回忆任务,结合不同模型(最高14B参数)进行多维验证,展示了SJ信号在迁移中的优势。这为理解模型的认知偏差和语义模糊性提供了新工具。

方法详解

  • �� 构建OC与SJ的四类响应模型,定义响应类型A、B、C、D。
  • �� 提取隐藏状态在回答最后一词的向量,利用线性方向进行因子分析。
  • �� 设计跨域迁移实验,评估不同层次的迁移效果,采用AUC指标衡量迁移成功率。
  • �� 采用null控制和外推测试,确保迁移效果的稳健性。
  • �� 通过层次分析,区分中后层的迁移表现,验证SJ与OC的语义偏差。
  • �� 利用不同任务(数学推理、事实回忆)和模型参数规模,进行多维验证。

实验设计

使用GSM8K、MATHSTYLE、Movies QA、MMLU和TruthfulQA等数据集,测试四个指令调优模型(最高14B参数)。设计高置信度冲突样本,评估OC与SJ的迁移能力。采用AUC指标,比较不同层次、不同任务中的迁移效果。通过控制变量(回答长度、概率、null方向)验证迁移的稳健性。还进行了跨域迁移和未拟合目标域的外推测试,确保结果的普适性。

结果分析

SJ方向(Wmeta)在所有模型和任务中表现出强大的迁移能力,AUC值普遍超过0.5,跨域迁移效果显著。而OC方向(Wtruth)在所有测试中表现平平,甚至出现反转,AUC值低于0.5。中后层分析显示,SJ信号在深层逐渐增强,迁移效果持续稳健,验证了其作为认知偏差的代表性。多项控制实验确认迁移效果不受回答长度或置信度的影响,说明SJ信号具有较强的语义稳定性。

应用场景

该研究为模型内部认知机制的理解提供了新工具,有助于提升模型的可信性和解释性。可应用于模型调试、偏差检测、自动校准等场景,特别是在安全敏感任务中,识别模型的自我判断偏差,增强模型的可靠性。未来还可结合多模态信息,设计更复杂的自我评估体系,推动可信AI的发展。

局限与展望

研究主要基于指令调优模型,未覆盖微调或未调优模型的表现,限制其普适性。线性方向假设可能忽略复杂非线性关系,未来需考虑非线性方法。样本偏差和任务选择可能影响迁移效果的普适性,需扩大数据规模和多样性验证。

通俗解读 非专业人士也能看懂

想象你在一个工厂里工作,工厂里有很多不同的机器,每台机器都能做不同的事情。有些机器能判断自己做得对不对,有些机器只是盲目地做事。科学家们想知道,这些机器内部是怎么判断自己做得对的。有一种方法是看机器的“内部信号”,就像是机器的灯光或声音,告诉你它觉得自己做得好不好。研究发现,这些“灯光”中,有一种信号(叫SJ)在不同工厂(任务)之间都能保持一致,说明它反映了机器的“自我感觉”。而另一种信号(叫OC)虽然代表真正的正确答案,但在不同工厂之间却不稳定,有时候还会反转。这个发现帮助我们理解,机器的“自我感觉”比“真正的正确”更容易在不同环境中保持一致,但这并不意味着它一定是真正的正确。

简单解释 像给14岁少年讲一样

想象你在学校里参加考试,你答题后老师会问你:‘你觉得你答得对吗?’你可能会觉得自己答得很好,也可能觉得不太确定。其实,老师还会给你一个客观的评分,告诉你答案到底对不对。科学家们也在研究类似的事情,他们用超级聪明的电脑(叫大模型)来回答问题。可是,这些电脑有时候会自己判断答案对不对(自我判断),也有时候会被外部标准(客观正确性)评判。研究发现,这些电脑的“自我判断”信号在不同任务和环境中都很稳定,就像是它们的“直觉”;而“客观正确性”的信号则不那么稳定,有时候还会反转。就像你觉得自己答得好,但其实错了。这个发现告诉我们,要理解这些电脑是不是真的“懂”了答案,还需要看它们的“直觉”信号,而不能只看表面上的正确答案。

术语表

Objective Correctness (OC) (客观正确性)

指答案是否符合外部标准或事实的正确性,通常由外部数据或答案关键判断。In this paper, OC是由外部任务答案的标准定义。

用来衡量模型输出是否符合真实事实或任务要求。

Self-Judgement (SJ) (自我判断)

模型对自己答案的内部评估,判断其是否正确,是一种第二阶认知。In this paper, SJ是模型基于内部激活向量做出的自我评估。

用来反映模型的内部认知偏差和自我感知。

迁移能力 (Transferability)

指模型内部表示或方向在不同任务或域之间的泛化能力。In this paper,指线性方向在跨任务、跨域中的迁移表现。

评估模型表示的普适性和稳健性。

因子分析 (Factor Analysis)

一种统计方法,用于分解多变量数据中的潜在因子。本文用以区分OC与SJ的线性方向。

分析隐藏状态向量中的不同语义偏好。

AUC (Area Under Curve) (曲线下面积)

衡量分类模型性能的指标,值在0到1之间,越接近1越好。本文用以评估迁移方向的排序效果。

用于比较不同迁移方向的效果优劣。

开放问题 这项研究留下的未解疑问

  • 1 如何设计更复杂的非线性方向以捕获OC与SJ的关系?目前线性模型可能忽略了深层次的非线性结构。
  • 2 模型在未调优或微调状态下的迁移表现如何?现有研究主要集中在指令调优模型。
  • 3 多模态信息(如视觉、声音)对OC与SJ信号的影响尚未充分探索,未来可结合多模态数据提升解释能力。

应用场景

近期应用

模型偏差检测

利用迁移中的SJ信号识别模型内部的认知偏差,提升模型在安全敏感场景中的可靠性。

模型调试与校准

通过分析不同层次的迁移表现,优化模型结构和训练策略,增强其自我判断的稳健性。

远期愿景

可信AI系统构建

结合多模态、多任务验证机制,建立具有自我校正能力的可信AI,广泛应用于医疗、法律等关键领域。

原文摘要

Hidden-state readouts can predict whether language-model outputs are correct, but objective correctness (OC) usually agrees with the model's own self-judgement (SJ), leaving the decoded signal semantically ambiguous. We construct conflict cases in which OC and SJ predict opposite readout orderings. On high-confidence disagreements, conventional correctness-labelled contrasts often rank incorrect/self-endorsed responses above correct/self-rejected responses, following SJ rather than OC. We estimate factorial SJ- and OC-associated directions and evaluate their polarity across mathematical reasoning and factual recall. Across four instruction-tuned models up to 14B parameters, the SJ-associated direction transfers above chance in both cross-domain directions for every model, whereas the OC-associated direction has a below-chance point estimate for the expected OC ordering in every corresponding condition. This transfer asymmetry develops across middle-to-late layers, persists under answer-likelihood, sequence-length, and null-direction controls, and extends to MMLU and binary TruthfulQA without target-domain direction fitting. Across the studied models and diagnostic subsets, the most reliably transferable component preserves SJ-associated polarity. Transferability alone therefore does not establish objective-correctness semantics.

cs.CL cs.LG