From Pretraining Data to Language Models to Downstream Tasks: Tracking the Trails of Political Biases Leading to Unfair NLP Models

TL;DR

政治罗盘探测与受控续训显示:偏见从语料经RoBERTa传至仇恨言论和虚假信息任务。

cs.CL 🔴 高级 2023-05-15 29 次浏览
Shangbin Feng Chan Young Park Yuhan Liu Yulia Tsvetkov
政治偏见 语言模型 公平性 仇恨言论检测 虚假信息检测

核心发现

方法论

论文提出两步框架:首先用Political Compass Test的62条陈述测量模型在社会价值(自由—保守)和经济价值(左—右)上的立场;编码器用掩码填充,比较正、负立场词概率,解码器则生成回答并用基于BART、在MultiNLI上训练的Lewis等(2019)立场检测器分类。其次,对RoBERTa和GPT-2在POLITICS新闻及Reddit党派语料上继续预训练,再微调下游任务。

关键结果

  • 14个模型均显示政治倾向,分布覆盖政治罗盘四象限;社会轴平均绝对分数为2.97,经济轴为0.87,说明社会议题偏差更强。BERT系列通常比GPT系列更社会保守。
  • 党派语料确实改变模型立场:RoBERTa在REDDIT-LEFT上社会分数由2.97降至−3.03。社会媒体使社会轴平均变化1.60,新闻使经济轴平均变化0.90。
  • 总体性能差异有限但群体差异明显。原始RoBERTa在HATE-IDENTITY上BACC/F1为88.74/81.15;REDDIT-RIGHT降至88.34/80.19,并在MISINFORMATION上降至86.01/85.05。

研究意义

研究把通常分开讨论的语料偏见、模型偏见与应用公平性连接成可检验的因果链。它表明,即使预训练材料来自相对正规、经过仇恨内容过滤的新闻和论坛,政治极化仍会进入模型,并在高风险分类器中对身份群体或媒体来源产生不均衡影响。对研究者而言,平均准确率不足以代表公平;对产业而言,模型审计必须追踪数据来源、意识形态位置及类别级错误。

技术贡献

核心技术贡献是把政治科学中的二维意识形态坐标转化为LM探测协议:对62条陈述进行词概率聚合或生成式立场判定,并以−10到10的社会、经济分数表示结果。论文进一步建立受控继续预训练实验,只改变党派语料,保持初始检查点、微调数据和超参数一致,从而隔离语料影响;同时按仇恨目标身份和虚假信息来源分解性能。

新颖性

相较于仅研究政治人物观点、静态刻板联想或标注者偏差的工作,本研究首次系统追踪“自然媒体偏见→LM意识形态→社会任务不公平”的完整路径。创新不在提出新的预训练架构,而在政治罗盘测量、党派语料控制实验与下游类别级公平分析的组合。

局限性

  • 实验主要覆盖英语、RoBERTa/GPT-2及有限新闻和Reddit语料,不能直接推断其他语言、文化或模型。
  • 政治罗盘、词典阈值0.3及立场分类器都是代理测量;生成回答和社会分数未必等同于稳定、可解释的内部价值。
  • 仇恨和虚假信息数据的身份类别、媒体来源有限,公平指标也主要是类别性能而非因果伤害。

未来方向

未来应扩展多语言、多文化和更多任务,比较数据重加权、去偏预训练、来源平衡、价值条件化和模型编辑等方法;还需建立纵向数据审计、群体级校准与因果公平指标,并测试RLHF、规模、训练时间及提示策略如何改变政治偏见。

AI 总览摘要

大型语言模型并非只学习事实,也会吸收新闻、论坛、书籍和百科中的立场。Feng等人关注一个常被忽略的问题:政治极化如何从预训练语料进入模型,再影响仇恨言论和虚假信息检测。既有偏见研究常使用合成模板或预设刻板联想,难以刻画真实政治讨论的复杂性。

研究以Political Compass Test为核心,将62条政治陈述映射到社会和经济两个坐标。编码器通过mask filling比较支持与反对词概率;生成模型则回答陈述,再由MultiNLI训练的BART立场检测器判断。作者在POLITICS新闻和Reddit党派语料上继续预训练RoBERTa、GPT-2,并在Yoder等人的HATE-IDENTITY、HATE-DEMOGRAPHIC及Wang的PolitiFact数据上微调。

结果显示,14个模型都具有可测政治倾向,社会轴平均绝对分数2.97,经济轴为0.87;BERT通常比GPT更社会保守。RoBERTa在REDDIT-LEFT上社会分数从2.97变为−3.03。总体指标变化不大,却掩盖了类别差异:原始RoBERTa的HATE-IDENTITY BACC/F1为88.74/81.15,而REDDIT-RIGHT为88.34/80.19;其虚假信息BACC/F1从88.80/88.37降至86.01/85.05。论文因此主张,模型评估应从平均性能转向数据来源、意识形态和社会群体的全链路审计。

深度分析

研究背景

数字媒体扩大了政治参与,也放大了气候、枪支、堕胎、税收和身份议题的极化。BERT、RoBERTa、GPT-2等模型分别从BookCorpus、CommonCrawl、WebText等来源学习语言。Blodgett等人、Sap等人揭示了表示和标注偏见,但过去较少实证追踪自然媒体立场如何影响下游公平。

核心问题

问题是定义并测量LM的政治位置,同时判断这种位置是否改变高风险任务对不同群体的行为。难点在于政治立场不是单一左—右轴,社会议题和经济议题可能分离;且平均准确率可能掩盖对不同身份或媒体来源的系统性差异。

核心创新

  • ��用Political Compass Test的二维坐标替代单一左—右标签。•用掩码词概率和生成式立场检测统一评估编码器、解码器。•构造LEFT/CENTER/RIGHT×NEWS/REDDIT六类语料,并进行受控继续预训练。•把仇恨数据按身份、虚假信息按媒体来源拆分,直接观察偏见传播。

方法详解

  • ��模型测量:对62条陈述生成提示;编码器返回前10个token,比较支持与反对词汇聚合概率,差值超过0.3映射为STRONG AGREE/DISAGREE等;生成模型用10个随机种子回答,并由BART-MultiNLI立场检测器评分。•语料实验:使用POLITICS和PushShift Reddit语料,过滤潜在仇恨内容,继续预训练RoBERTa/GPT-2。•任务实验:在Yoder数据和PolitiFact上微调RoBERTa变体,报告BACC、F1及类别级结果;110条人工评估中立场检测准确率0.97,Fleiss κ为0.85。

实验设计

研究评估BERT、RoBERTa、distilBERT、ALBERT、BART、GPT-2、GPT-3、GPT-J、LLaMA、ChatGPT和GPT-4等14个模型。下游使用HATE-IDENTITY 159,872条、HATE-DEMOGRAPHIC 276,872条和MISINFORMATION 29,556条样本。比较原始RoBERTa与NEWS/REDDIT、LEFT/RIGHT四种继续预训练版本,并加入特朗普任期前后和数据规模、epoch实验。

结果分析

模型立场与语料方向一致,但初始偏见较难改变。社会媒体对社会轴影响更大,平均变化1.60;新闻对经济轴影响更大,平均变化0.90。后特朗普语料使多数模型远离中心。下游整体上左倾版本略优于右倾版本;类别表中,NEWS-LEFT对Black、Muslim等组达到约89.9%,而REDDIT-RIGHT对Men仅83.69%,显示平均分掩盖了群体差异。

应用场景

新闻平台可在部署仇恨或虚假信息过滤器前测量政治罗盘位置,并报告身份群体、媒体来源的分项指标。模型供应商可保存预训练来源清单,进行版本间偏见回归测试;监管和审计机构可把BACC/F1之外的类别差异纳入高风险系统验收。

局限与展望

政治罗盘不是意识形态真值,词典和立场检测器可能引入二次偏差。研究只覆盖英语、有限语料和两个任务,无法证明所有现实伤害的因果机制。继续预训练规模、epoch增大并未把模型推向±10极端,但仍需测试RLHF、提示、模型规模及去偏方法;未来应加入多语言、真实部署反馈和因果公平评估。

通俗解读 非专业人士也能看懂

把语言模型想成一名读过巨大图书馆的实习记者。图书馆里有报纸、论坛、书和百科;如果某类书特别多,记者就可能形成某种看法,即使没有人直接教他站哪一边。研究者先让这名记者回答62道关于社会和经济的选择题,再把回答画在一张二维地图上。

接着,他们只给记者阅读偏左、偏右或中间的新闻和Reddit内容,再重新测试。如果观点位置移动,就说明阅读材料留下了痕迹。结果是,左边材料通常让模型更偏左,右边材料让模型更偏右;Reddit对社会问题影响更大,新闻对经济问题影响更大。

最后,让这些记者去判断仇恨言论和假新闻。总成绩看起来相近,但面对不同身份群体或不同媒体时,表现会明显变化。就像同一个保安对不同学校社团使用了不同标准。因此,不能只看总分,还要检查他对谁更容易误判,以及这种差异是否来自训练时读过的材料。

简单解释 像给14岁少年讲一样

想象你训练了一个超级会读文章的游戏NPC。它读过新闻、论坛和书,所以它不只是学会拼句子,也可能偷偷学到“哪些观点比较正常”。研究者给它62道政治选择题,把答案放进一张有两个方向的地图:一个方向是社会问题,另一个是经济问题。

然后研究者做了一个很公平的实验:同一个NPC继续读左倾新闻、右倾新闻或不同类型的Reddit,其他设置全部不变。结果,读左边内容通常会向左移动,读右边内容会向右移动。特别是,RoBERTa读完左倾Reddit后,社会分数从2.97变成−3.03;说明训练材料真的会留下痕迹。

接下来,NPC去做两种重要任务:判断一句话是不是仇恨言论,以及判断一条新闻是不是假信息。神奇的是,总成绩差别不算巨大,但它对不同群体和媒体的判断会变。就像游戏里的防作弊系统总体很准,却特别容易误伤某个玩家群体。

所以论文的提醒很简单:AI的总分高,不代表它对所有人都公平。开发者要检查它读过什么、有什么倾向,还要分别测试它面对不同群体时的错误。否则,模型可能在表面上表现优秀,实际上把社会争议悄悄带进自动化决定里!

术语表

Political Compass Test(政治罗盘测试)

用62条政治陈述估计社会价值和经济价值两个方向的立场。论文把模型回答映射到−10至10的二维坐标。

用于测量14个预训练LM及继续预训练版本的政治倾向。

Mask Filling(掩码填充)

编码器根据上下文预测被遮住的词。论文比较支持和反对词汇的聚合概率,再映射为四级同意程度。

用于BERT、RoBERTa等编码器模型。

Stance Detection(立场检测)

判断文本支持、反对或不明确回应某个陈述的任务。论文使用基于BART、在MultiNLI上训练的检测器。

用于解释GPT类模型生成的政治回答。

Continued Pretraining(继续预训练)

在已有模型检查点上继续使用新语料训练,而不是从零开始。它使作者能近似隔离党派语料的影响。

RoBERTa和GPT-2分别在新闻、Reddit及左中右语料上训练。

Balanced Accuracy(平衡准确率)

分别计算各类别召回率后取平均,适合类别不均衡数据。它是论文报告的主要总体性能指标之一。

用于HATE-IDENTITY、HATE-DEMOGRAPHIC和MISINFORMATION。

政治偏见传播

训练语料中的立场进入模型表示,并在下游预测中对群体或来源产生差异。它描述的是一条数据到应用的传播链。

论文的核心分析框架。

开放问题 这项研究留下的未解疑问

  • 1 Political Compass分数与模型内部表示、真实用户伤害之间的因果关系仍不清楚,需要可解释性分析和部署环境中的纵向审计。
  • 2 现有结果集中于英语美国语境;多语言社会的党派结构、媒体生态和身份类别是否产生相同传播规律,仍待验证。

应用场景

近期应用

模型上线前偏见审计

平台可用62条陈述和类别级测试集检查候选模型,再按身份群体、媒体来源报告BACC、F1及误报差异。前提是准备代表性数据,并固定提示、随机种子和评估版本。

预训练数据登记

模型供应商可记录新闻、论坛和过滤规则,比较不同数据版本的政治坐标与下游变化。若某类来源造成明显群体差异,可进行重采样、来源平衡或人工复核。

远期愿景

可审计的公平模型供应链

长期可建立从数据来源、训练检查点到任务预测的标准化审计链,结合多语言测试、因果公平指标和持续监测,使高风险内容审核系统具备可追溯的偏见控制能力。

原文摘要

Language models (LMs) are pretrained on diverse data sources, including news, discussion forums, books, and online encyclopedias. A significant portion of this data includes opinions and perspectives which, on one hand, celebrate democracy and diversity of ideas, and on the other hand are inherently socially biased. Our work develops new methods to (1) measure political biases in LMs trained on such corpora, along social and economic axes, and (2) measure the fairness of downstream NLP models trained on top of politically biased LMs. We focus on hate speech and misinformation detection, aiming to empirically quantify the effects of political (social, economic) biases in pretraining data on the fairness of high-stakes social-oriented tasks. Our findings reveal that pretrained LMs do have political leanings that reinforce the polarization present in pretraining corpora, propagating social biases into hate speech predictions and misinformation detectors. We discuss the implications of our findings for NLP research and propose future directions to mitigate unfairness.

cs.CL