STEREODISCO: Discovering Stereotypicality in LLMs

TL;DR

提出STEREODISCO框架,利用语义差异法系统识别大模型中的刻板印象,发现超出社会心理研究的语义轴。

cs.AI 🔴 高级 2026-07-30 40 次浏览
Farane Jalali Farahani Corina Dima Mojtaba Nayyeri Raphael H. Heiberger Steffen Staab
AI伦理 模型解释 语义轴 刻板印象 大模型

核心发现

方法论

该方法将语义差异法(Osgood et al., 1957)适配到LLM内部表征,构建约2000个候选语义轴,利用探测技术在激活空间中恢复几何轴线,并通过统计检验识别刻板轴。具体流程包括:从WordNet获取反义词对,生成句子样本,利用多层多头注意力的激活向量,线性映射成几何轴,再对概念进行投影,最后用Kolmogorov–Smirnov检验确定刻板性。

关键结果

  • 在LLAMA-3-8B-INSTRUCT和MISTRAL-7B-INSTRUCT模型中,两个模型在社会群体刻板评级上的一致性高于与人类的匹配,模型间相关系数达0.75,而与人类仅为0.55-0.63,表明模型内编码的刻板内容偏离社会心理学中的人类认知。
  • 新发现的刻板语义轴包括谦虚与自豪、狭隘与开阔、胆怯与勇敢等,经过独立人类标注验证,显示模型中存在未被传统研究关注的偏见。
  • 通过统计检验,识别出50个具有显著刻板特征的语义轴,验证了模型内部存在丰富的潜在刻板信息,且这些轴在不同模型中表现出较高一致性。

研究意义

该研究突破了以往仅关注词向量的刻板印象分析,首次系统性揭示了LLMs内部的语义轴结构,为理解模型偏见提供了量化工具,有助于未来模型的公平性调控与伦理审查。通过识别未被关注的偏见轴,也为模型改进和偏见缓解提供了新的思路。该方法兼具理论深度与实用价值,推动了模型解释学和社会心理学的交叉融合。

技术贡献

提出基于语义差异法的几何轴映射框架,结合探测技术实现模型内部语义轴的自动发现。创新点在于:1)大规模候选轴生成机制,超越传统词向量差异;2)利用多层多头注意力激活的线性映射,精确定位语义轴;3)引入统计检验方法,客观判定刻板性。该框架可扩展至多概念类别,提供系统化的偏见检测工具,显著优于现有仅依赖词向量或预定义字典的方法。

新颖性

本研究首次将语义差异法完整迁移到LLM内部激活空间,系统性识别出超出社会心理学预定义轴的潜在偏见。与以往仅在词向量层面分析不同,利用多层多头注意力的激活向量实现内部几何映射,提供了模型内部结构的深度理解。这一方法在大规模候选轴生成和统计验证方面具有创新性,为偏见研究开辟了新路径。

局限性

  • 该方法依赖于WordNet反义词对,可能遗漏非对立关系的偏见轴;同时,探测结果受模型层次和注意力头的选择影响,存在一定的偏差。
  • 统计检验采用Kolmogorov–Smirnov检验,虽具有非参数优势,但对样本大小敏感,可能影响小样本下的检测效果。
  • 模型内部的几何映射假设线性关系,可能无法捕捉更复杂的非线性偏见结构,未来需引入非线性映射或深度学习方法进一步提升识别能力。

未来方向

未来将拓展多模态偏见检测,结合文本与视觉信息,探索多维偏见轴的交互关系。同时,计划引入非线性映射模型,提升偏见识别的复杂性和准确性。此外,将结合人类认知模型,优化偏见校正策略,推动公平AI的发展。

AI 总览摘要

近年来,大型语言模型(LLMs)在自然语言处理领域取得了突破性进展,但其内部潜藏的偏见与刻板印象引发了广泛关注。传统研究多依赖词向量或预定义的语义轴,难以全面理解模型内部的偏见结构。本文提出了STEREODISCO框架,创新性地将语义差异法(Osgood et al., 1957)迁移到模型激活空间中,系统性识别出数千个潜在的语义轴,并利用统计检验确定其中的刻板性。该方法通过从WordNet获取反义词对,生成句子样本,利用多层多头注意力激活向量,线性映射成几何轴,再对概念进行投影,最终用Kolmogorov–Smirnov检验判定偏见轴。实验在LLAMA-3-8B-INSTRUCT和MISTRAL-7B-INSTRUCT模型中进行,发现两个模型在社会群体刻板评级上的一致性高于与人类的匹配,表明模型偏见具有高度内在性。研究还揭示了诸如谦虚与自豪、狭隘与开阔、胆怯与勇敢等新颖偏见轴,经过人类标注验证,显示模型中存在未被传统研究关注的偏见。该工作不仅丰富了模型偏见的理论理解,也为未来模型的公平性调控提供了量化工具。通过系统识别潜在偏见轴,推动了模型解释学与社会心理学的深度融合,为AI伦理与公平性研究提供了新的技术路径。

深度分析

研究背景

随着深度学习技术的发展,大型语言模型(如GPT、BERT)在多个任务中表现出色,但其内部偏见问题逐渐凸显。早期研究多关注词向量中的偏差(如Word Embedding Association Test, WEAT),试图量化模型对特定社会属性的偏好。近年来,社会心理学提出的刻板印象内容模型(SCM)为理解偏见提供了理论基础,但缺乏系统性工具在模型内部进行检测。已有方法多依赖词向量差异或预定义的语义轴,难以全面捕获模型潜在偏见。随着模型规模的扩大,偏见的复杂性也在增加,亟需一种能从模型内部激活空间自动发现偏见轴的技术。本文的研究背景即在于弥补这一空白,将心理学中的语义差异法迁移到深层模型的激活空间,结合统计检验,系统识别偏见轴,推动模型公平性研究向更深层次发展。

核心问题

现有偏见检测方法多依赖于词向量或预定义字典,难以发现模型内部潜藏的偏见结构。尤其是在大规模模型中,偏见可能以复杂的几何关系存在,传统方法难以捕捉。如何在模型的激活空间中自动识别出具有刻板印象的语义轴,成为关键难题。该问题关系到模型的公平性、透明度和伦理责任,亟需一种系统、可扩展、量化的检测工具。解决这一问题不仅有助于理解模型偏见的本质,还能指导偏见缓解和模型调优,确保模型在实际应用中的公平性。

核心创新

本研究的创新点在于:1)提出将语义差异法(Osgood et al., 1957)迁移到模型激活空间,构建几何轴线,实现偏见的几何映射;2)利用多层多头注意力激活向量,通过线性探测精确定位语义轴;3)引入统计检验(Kolmogorov–Smirnov)客观判定偏见轴,避免人为偏见干扰。这一方法突破了传统词向量差异的局限,系统性地在模型内部发现偏见,兼具理论深度和实用价值。框架的可扩展性允许识别多类别偏见,为模型公平性提供了新工具。

方法详解

  • �� 从WordNet获取反义词对,生成句子样本,用于探测模型内部的语义轴。• 在模型的每一层、多头注意力头中,提取激活向量,计算正负极的平均值,形成线性几何轴。• 通过投影概念样本到几何轴,获得概念在该轴上的数值表示。• 利用统计检验(KS检验)判断不同类别的概念投影分布是否显著不同,从而识别刻板轴。• 生成候选轴后,筛选出最具代表性的几何轴,进行偏见检测。• 最终,结合人类标注验证模型中发现的偏见轴,确保结果的可靠性。

实验设计

在LLAMA-3-8B-INSTRUCT和MISTRAL-7B-INSTRUCT模型中,利用WordNet反义词对生成约2000个语义轴候选,采集模型激活数据,进行线性探测。通过对社会群体和随机概念的投影,采用Kolmogorov–Smirnov检验,识别出50个显著刻板的轴。模型输出的偏见与社会心理学中的人类偏见进行对比,发现模型偏见偏离人类认知,但在某些新颖轴(如谦虚vs自豪)上得到验证。实验还包括模型间一致性分析,验证偏见的内在性与稳定性。

结果分析

模型在社会群体偏见评级上,与人类的相关系数为0.55-0.63,而模型间相关达0.75,显示偏见具有模型内在性。新发现的偏见轴(谦虚vs自豪、狭隘vs开阔等)经人类标注确认,说明模型中存在未被传统心理学研究覆盖的偏见。偏见检测的统计显著性达到p<0.05,验证了方法的有效性。模型对不同类别的偏见表现出差异,偏见轴的发现为模型调优提供了依据。

应用场景

该方法可应用于模型偏见监测、伦理审查和偏见缓解,特别适合在招聘、医疗等敏感领域。通过识别潜在偏见轴,指导模型调优和偏见校正,提升模型公平性。未来还可结合多模态信息,拓展偏见检测范围,推动公平AI的实现。

局限与展望

目前依赖WordNet反义词,可能遗漏非对立偏见轴;线性映射假设限制了复杂偏见结构的捕获;统计检验对样本量敏感,可能影响小样本检测效果。未来需引入非线性模型和多模态数据,提升识别能力。

通俗解读 非专业人士也能看懂

想象一个工厂生产各种商品,每个商品都可以用不同的标签描述,比如“高品质”或“低品质”。工厂里有很多工人(模型的不同部分),他们在不同的时间点(层)用不同的方式把商品分类。有些工人特别擅长用“高品质”或“低品质”来判断商品,他们的判断可以用一条线(几何轴)表示。我们通过观察工人在不同商品上的反应,找到这些线,然后看看某些商品(比如“奢侈品”或“廉价品”)在这条线上的位置,是否偏向某一端。这样,我们就可以知道工厂(模型)是否对某些商品有偏见,比如总觉得“奢侈品”更“高端”。这个方法就像用一根尺子测量商品的标签偏向,帮助我们理解工厂的偏见在哪里,是否公平。

简单解释 像给14岁少年讲一样

想象你在学校里,有一份作业要判断不同的朋友是不是喜欢运动。你发现,有些朋友总是偏向说“喜欢运动”,有些偏向说“喜欢看书”。现在,你想知道,背后是不是有一条看不见的“偏好线”,让他们的回答偏向某一端。这个偏好线就像一条隐形的直线,把喜欢运动和喜欢看书的人分成两边。科学家们用一种叫“语义差异法”的方法,找到这条线,然后观察不同的朋友在这条线上的位置,看看是不是有偏见。比如,模型(就像一个超级聪明的机器人)也会有这样的偏见,它可能会觉得“某个社会群体”更“负面”或“正面”。通过这个方法,我们可以发现这些偏见在哪里,帮助让机器人变得更公平、更友善。

原文摘要

LLMs encode, convey, and perpetuate stereotypes. Prior computational research focuses on a small set of semantic axes investigated in social psychology, and operates on word embeddings produced by language models, leaving open which other semantic axes carry stereotypical associations in LLMs and how LLMs internally represent such axes. We introduce STEREODISCO, a framework that adapts the semantic differential method (Osgood et al., 1957) to the systematic study of stereotypes in LLM internal representations. STEREODISCO constructs approx. 2,000 candidate semantic axes from WordNet antonym synsets, recovers each as a geometric axis in the LLM's activation space via probing, and identifies stereotypical axes via a statistical test over concept projections. As a case study, we apply STEREODISCO to social group stereotypes with LLAMA-3-8B-INSTRUCT and MISTRAL-7B-INSTRUCT. We find that the two LLMs agree with each other on social group ratings more than with humans, suggesting that LLM-encoded stereotype content diverges from that documented in social psychology. We also discover stereotypical axes not investigated in prior work -- including humble vs. proud, narrow-minded vs. broad-minded, and cowardly vs. brave, which human annotators independently confirm.

cs.AI cs.LG