Epistemic Stance Flexibility Probing: Measuring Prompt-Conditioned Register Shift in Large Language Models

TL;DR

ESFP基准测试测量大语言模型在不同提示下的认知立场灵活性。

cs.CL 🔴 高级 2026-07-14 32 次浏览
Binwen Liu Yilin Ren
语言模型 认知立场 基准测试 灵活性 人工智能

核心发现

方法论

ESFP基准测试通过对比外部归因和自我归因提示,评估模型在四个维度上的反应:词汇自我归因、角色框架响应、句子层次立场内容密度和跨条件立场一致性。

关键结果

  • 八个前沿模型中,27B开源模型与最强专有系统相匹敌,显示认知灵活性与模型能力大致正交。
  • 立场内容密度提供最强信号,而表面词汇标记如“我认为”变化显著但不改变表达立场。
  • 提供项目级别的自举置信区间和权重敏感性分析。

研究意义

ESFP基准测试为模型在不同归因条件下适应其认知立场的倾向提供了测量,而非一般能力测量。高分不应被解释为普遍更好。

技术贡献

提出了一个新的行为基准测试,能够在保持内容不变的情况下,通过改变框架来评估模型的行为。

新颖性

首次提出通过提示条件变化来测量语言模型的认知立场灵活性。

局限性

  • 模型在一致性方面表现不佳,可能是噪声而非反一致性。
  • 仅限于英语词汇,可能影响非英语模型的评估。

未来方向

未来可以扩展到多语言环境,并增加人类金标准标签以提高评估的准确性。

AI 总览摘要

在现代人工智能的背景下,语言模型被要求在不同的提示条件下表现出不同的认知立场。然而,现有的基准测试并未直接评估这种能力。

ESFP基准测试通过对比外部归因和自我归因提示,评估模型在四个维度上的反应:词汇自我归因、角色框架响应、句子层次立场内容密度和跨条件立场一致性。研究发现,认知灵活性与模型能力大致正交,27B开源模型与最强专有系统相匹敌。

该研究为模型在不同归因条件下适应其认知立场的倾向提供了测量,而非一般能力测量。未来的工作可以扩展到多语言环境,并增加人类金标准标签以提高评估的准确性。

深度分析

研究背景

语言模型在对话中需要根据提示条件表现出不同的认知立场。现有的基准测试主要关注准确性、指令遵循和安全性,但未直接评估这种能力。

核心问题

核心问题是模型是否能够在不同提示条件下表现出一致且合理的认知立场变化。

核心创新

ESFP基准测试通过对比外部归因和自我归因提示,评估模型在四个维度上的反应,首次实现了对认知立场灵活性的测量。

方法详解

  • �� 词汇自我归因:分析模型在不同提示下使用的词汇。
  • �� 角色框架响应:评估模型对角色框架变化的响应。
  • �� 句子层次立场内容密度:通过LLM评审小组评估句子层次的立场内容。
  • �� 跨条件立场一致性:使用Fleiss’ κ评估立场一致性。

实验设计

实验评估了八个前沿模型,使用520个独立提示,涵盖六个认知类别和五个措辞模板。

结果分析

27B开源模型与最强专有系统相匹敌,立场内容密度提供最强信号。

应用场景

可用于评估对话代理在不同提示条件下的适应能力。

局限与展望

仅限于英语词汇,可能影响非英语模型的评估。

通俗解读 非专业人士也能看懂

想象一个智能助手,它在不同情况下需要表现出不同的态度。当你问它专家的看法时,它应该给出中立的答案;当你问它自己的看法时,它应该表达自己的观点。ESFP基准测试就像是一个测量工具,帮助我们了解这些助手是否能够在不同的提示下灵活地调整自己的态度。

简单解释 像给14岁少年讲一样

想象你在玩一个角色扮演游戏,你的角色有时需要给出自己的意见,有时需要报告别人的观点。ESFP就像是一个游戏规则,帮助我们看看这些角色是否能在不同的任务中表现得合适。就像你在游戏中需要在不同的任务中切换角色一样,ESFP测试模型在不同提示下的表现。

术语表

ESFP (认知立场灵活性探测)

一种基准测试,用于评估语言模型在不同提示条件下的认知立场变化。

用于测量模型在外部归因和自我归因提示下的反应。

词汇自我归因

分析模型在不同提示下使用的词汇,评估其自我归因的倾向。

用于评估模型在不同提示下的词汇变化。

句子层次立场内容密度

通过评审小组评估句子层次的立场内容,衡量模型的立场表达。

用于评估模型在不同提示下的立场内容变化。

跨条件立场一致性

使用Fleiss’ κ评估模型在不同提示条件下的立场一致性。

用于确保模型在不同提示下的立场变化是连贯的。

Fleiss’ κ

一种统计方法,用于评估多个评审者之间的一致性。

用于评估模型在不同提示条件下的立场一致性。

开放问题 这项研究留下的未解疑问

  • 1 如何在多语言环境中评估认知立场灵活性?
  • 2 如何提高评估的准确性,特别是在非英语模型中?

应用场景

近期应用

对话代理评估

用于评估对话代理在不同提示条件下的适应能力,帮助开发更智能的对话系统。

远期愿景

多语言模型评估

扩展到多语言环境,帮助评估不同语言模型的认知立场灵活性。

原文摘要

A language model may be asked either what experts believe about a contested claim or what it believes about the claim itself. A trustworthy conversational agent should distinguish these two requests and respond in different epistemic registers: neutral attribution in the first case and stance expression in the second. Whether such a shift occurs-and whether it occurs coherently-is not directly assessed by existing benchmarks for accuracy, instruction following, or safety. We introduce ESFP, a behavioral benchmark that treats the contrast between externally attributed and self-attributed prompts as the fundamental unit of measurement. ESFP consists of 104 carefully controlled items spanning six epistemic categories and five phrasing templates, and evaluates model responses along four complementary dimensions: lexical self-attribution, representation-level responsiveness to role framing, sentence-level stance content density assessed by an LLM judge panel, and cross-condition stance consistency. Evaluating eight frontier models from five vendors, we find that epistemic flexibility is largely orthogonal to general model capability: a 27B open-weight model matches the strongest proprietary systems, the flagship model of one family underperforms its lightweight counterpart, and reasoning-optimized models do not consistently exhibit higher flexibility. Stance content density provides the strongest signal, while surface-level lexical markers such as 'I think' can change substantially without corresponding changes in expressed stance. We provide item-level bootstrap confidence intervals, weight-sensitivity analyses, and an explicit discussion of the interpretation limits of the composite score. ESFP measures a model's propensity to adapt its epistemic stance under changing attribution conditions, rather than a general competence measure.

cs.CL