The Fairness Collapse Phenomenon: Bias Amplification in Language Models Trained on Synthetic Data

TL;DR

以Qwen2.5-0.5B递归训练显示:公平性恶化先于困惑度崩溃。

cs.CL 🟡 进阶级 2026-08-05 17 次浏览
Irina Proskurina Antoine Gourru Julien Velcin
模型坍塌 公平性崩溃 合成数据 性别偏见 Bias in Bios

核心发现

方法论

论文使用Bias in Bios的27,752篇职业传记,训练Qwen2.5-0.5B,并比较人类数据、迭代再生成和递归污染三种制度。合成文本采用seeded generation或K=3的few-shot prompting,评估MTLD、Sinkhorn-2 Wasserstein距离、困惑度、MMLU、EO GAP、NLL-GAP、CrowS-Pairs与SoFA。

关键结果

  • 递归seeded训练中,EO GAP由第0轮的13.18升至第5轮19.38,同时PPL由16.07降至10.55;也就是说,训练分布上的预测似乎更好,但性别公平性已明显恶化。
  • MMLU从42.14逐步降至32.08,显示一般能力随后退化;few-shot条件下SoFA偏见由0.509升至约0.714,CrowS-Pairs刻板偏好也随迭代上升。
  • 低温seeded生成更依赖输入种子;T=0.6和0.9最接近人类续写,T=1.2出现更大语义漂移。职业级EO轨迹显示护士、教授、软件工程师等关联被定向强化。

研究意义

研究指出,合成数据污染的早期危险不一定表现为传统模型坍塌。困惑度下降、表面词汇多样性相对稳定,可能掩盖职业—性别关联的累积放大。该发现影响继续预训练、开放网页语料、自动标注和招聘筛选系统,提示公平性应成为数据谱系监控和发布前测试的持续指标。

技术贡献

论文提出并实证刻画“fairness collapse”这一早期失效模式,将递归自训练机制与群体条件公平性联系起来。其技术框架同时分离参数累积效应与数据再生成效应:iterative regime每轮回到Mθ0,recursive regime从Mθt继续训练。EO GAP与signed conditional NLL-GAP共同测量决策差异和概率差异,并以外部CrowS-Pairs、SoFA验证。

新颖性

既有model collapse研究主要追踪分布尾部丢失、困惑度和任务性能;偏见研究则通常考察静态模型。本文把两者置于同一受控反馈实验中,提出偏见可在一般语言指标明显崩溃前持续放大的“公平性崩溃”概念,形成新的风险诊断视角。

局限性

  • 实验仅使用Qwen2.5-0.5B、Bias in Bios和性别—职业任务,结论能否推广到更大模型、多语言、其他身份属性及开放网页分布仍未确定。
  • 训练数据经过职业均衡,且合成文本由固定T=0.9、30-token种子等设置产生;真实语料的混合比例、过滤器和提示策略可能改变偏见轨迹。
  • 论文主要展示相关性,尚未建立偏见放大的完整因果理论,也缺少系统的人类质量评估和去偏干预对照。

未来方向

后续应扩大模型、语言和身份维度,系统改变人类/合成数据比例、温度及过滤策略;建立可预测EO GAP漂移的理论模型,并测试数据溯源、水印、去偏采样、反事实训练和representation editing能否阻断反馈回路。

AI 总览摘要

生成式模型正在制造越来越多的网页文本,这些文本又可能被下一代模型当作训练材料。传统model collapse研究关注词汇、语义多样性下降和困惑度恶化,但一个更隐蔽的问题是:模型会不会先学得更“顺”,却同时变得更不公平?Proskurina、Gourru与Velcin将这种现象称为fairness collapse。

研究者以Bias in Bios职业传记为受控环境,平衡选取27,752篇、约200万token,并使用Qwen2.5-0.5B生成和继续预训练合成传记。他们比较seeded generation、K=3 few-shot generation、迭代再生成与递归污染,并用Sinkhorn-2 Wasserstein距离和MTLD分析文本分布,再用EO GAP、NLL-GAP、MMLU、CrowS-Pairs和SoFA评估公平性及能力。

最醒目的结果是指标错位:递归seeded训练五轮后,EO GAP从13.18升至19.38,PPL却从16.07降至10.55;MMLU才从42.14降至32.08。换言之,偏见可能在模型坍塌被察觉前静默增长。研究因此建议把公平性监控、数据来源追踪和合成文本审计纳入持续预训练流程,同时承认当前证据局限于小模型、单一数据集和性别职业偏见。

深度分析

研究背景

Shumailov等人的model collapse指出,递归使用模型输出会丢失低概率事件;Dohmatob等人从分布尾部和缩放行为解释该过程。另一方面,Bolukbasi、Zhao和Nadeem等研究已证明语言模型会复制职业性别刻板印象。过去两条研究线较少交汇:模型性能如何退化已较清楚,合成数据是否进一步放大社会偏见却缺乏受控证据。

核心问题

核心问题是:当模型输出反复进入训练集时,性别—职业关联会被削弱、保持,还是自我强化?难点在于公平性变化可能与困惑度、词汇多样性和下游准确率不同步;若只观察传统collapse指标,部署者可能错过偏见已扩大的早期阶段。

核心创新

  • ��提出fairness collapse作为独立早期失效模式。
  • ��用iterative regime固定初始化Mθ0,隔离合成数据分布变化;用recursive regime从Mθt继续训练,模拟参数记忆反馈。
  • ��把EO GAP、NLL-GAP与CrowS-Pairs、SoFA结合,覆盖分类、似然和刻板印象。
  • ��用种子长度5—50、温度0.3—1.2、MTLD和Wasserstein距离描绘生成分布。

方法详解

  • ��数据:Bias in Bios原约30万传记,筛为28职业均衡子集27,752篇;xi含文本、职业yi和性别ai。
  • ��生成:seeded generation取前k个token接续;few-shot每职业提供K=3篇人类样本。
  • ��训练:人类基线、迭代再生成、递归污染;每轮重生成并训练。
  • ��表示评估:Qwen3-Embedding-0.6B计算Sinkhorn-2 Wasserstein;ΔW=W2(model,seed)-W2(human,seed)。
  • ��公平评估:EO GAP为各职业TPR差平方的平均;同时报告NLL-GAP、MMLU、CrowS-Pairs和SoFA。

实验设计

所有训练使用Qwen2.5-0.5B和一致超参数。生成分析测试T=0.3、0.6、0.9、1.2及5—50 token种子;主实验采用30 token、T=0.9。测试集保持人类传记,比较多轮递归结果,并设置seeded与few-shot两类反馈;论文还提供人类-only训练结果及外部公平基准。

结果分析

seeded递归中EO GAP 13.18→19.38,而PPL 16.07→10.55;NLL-GAP绝对值由约0.093增至0.106,CrowS-Pairs刻板偏好从57.81%达到约55.63%并伴随波动,MMLU 42.14→32.08。few-shot的MMLU降至24.63,SoFA约0.509→0.714。护士、教授等职业出现方向性EO漂移,且MTLD变化较小。

应用场景

继续预训练团队可把EO GAP、NLL-GAP和SoFA作为每轮数据刷新后的闸门指标,而非只看PPL。网页抓取、自动摘要、合成标注、招聘排序和简历筛选系统应保留数据来源,分离人类与模型文本,并在上线前用Bias in Bios、CrowS-Pairs等测试职业和性别差异。

局限与展望

研究规模和范围有限:只有一个0.5B模型、一个英语职业数据集及二元性别标签;真实网络中的合成比例、来源混杂和质量过滤更复杂。生成温度、种子和提示也会影响分布。未来需进行跨模型、跨语言和多属性复现,加入反事实训练、去偏采样、representation editing及因果分析,检验哪些干预真正阻断反馈。

通俗解读 非专业人士也能看懂

把模型想成一家餐馆,最初厨师手里有顾客真正喜欢的各种菜谱。厨师后来开始参考自己做出的菜,再把这些“仿制菜谱”当成新食谱。由于厨师常重复最熟悉的味道,少见的口味会慢慢消失,原本对“某类人适合某种职业”的偏见也可能被反复复制。

这家餐馆的销量报告甚至会变好:因为菜单越来越符合自己熟悉的模式,预测顾客下一道菜更容易。但菜单其实变窄了,而且对不同顾客越来越不公平。论文发现,模型的“考试分数”和语言流畅度还没有明显崩坏时,性别与职业的错误联系已经增强。

所以不能只问模型说话是否顺、考试是否高分,还要检查它是否给不同群体同样机会。合成内容不是天然有害,但若没有真人材料、来源记录和公平检查,模型就可能像只听自己回声的厨师,越练越自信,也越偏。

简单解释 像给14岁少年讲一样

想象你在玩一个会自己刷新的游戏。第一关的地图由真人玩家画出来,里面既有热门路线,也有少见但重要的小路。后来你让游戏AI自己画地图,再用AI地图训练下一代AI。下一代又画地图、继续训练——听起来很高效,对吧?

麻烦是,AI通常会重复它最常见、最熟悉的路线。小路会逐渐消失,某些“男生适合工程师、女生适合护士”的刻板印象却可能被一遍遍复制。地图看起来仍然很完整,甚至AI走熟路的成绩更高,但游戏对不同角色已经不公平了!

论文用Bias in Bios职业传记和Qwen2.5-0.5B做实验。递归训练五轮后,公平性差距从13.18升到19.38,可是困惑度从16.07降到10.55,说明普通指标还在报喜。MMLU后来才从42.14降到32.08。

这就像考试分数暂时不错,却偷偷只给一类同学好机会。以后训练AI,不能只看它会不会答题,还要检查不同群体是否被平等对待,并保留哪些文字来自真人、哪些来自机器的记录!

术语表

Fairness collapse(公平性崩溃)

指递归使用合成文本时,社会偏见逐代增强,且早于明显的语言性能坍塌。它是本文提出的核心概念。

用于概括职业—性别偏见在多轮训练中的自我强化。

Model collapse(模型坍塌)

模型反复学习自身输出后,逐渐偏离原始数据分布并丢失低概率事件。常由困惑度和任务性能变化观察。

本文将其与公平性退化区分。

EO GAP(机会均等差距)

比较不同群体在真实标签正确时的TPR差异;本文按职业对差异平方取平均。数值越低越公平。

主要公平性指标。

NLL-GAP(负对数似然差距)

比较模型对不同性别传记的平均负对数似然差异,反映概率分配不对称。

检测职业内部的性别条件似然偏差。

Seeded generation(种子生成)

把人类传记前k个token作为提示,由模型生成后续文本。k在5—50间变化。

用于控制合成内容比例。

MTLD

一种较不受文本长度影响的词汇多样性指标,通过类型—词例比的稳定性估计丰富度。

评估合成传记表层多样性。

开放问题 这项研究留下的未解疑问

  • 1 尚不清楚fairness collapse是否在更大模型、多语言及种族、年龄、残障等属性上同样出现;需要跨数据集和真实网页混合比例实验。
  • 2 偏见放大的因果机制仍未完全分解,需区分提示、解码、数据选择与参数继承,并测试哪些过滤和去偏方法能长期稳定。

应用场景

近期应用

继续预训练审计

模型团队可在每次合成数据刷新后测量PPL之外的EO GAP、NLL-GAP、CrowS-Pairs和SoFA;若公平性恶化即暂停迭代,并保存文本来源和生成配置。

招聘模型闸门测试

招聘、简历排序和职业推荐系统可用Bias in Bios的职业配对测试,比较性别条件似然与TPR,避免在语言流畅度提升时忽略分配性伤害。

远期愿景

可追溯的合成数据生态

未来数据平台应结合来源标记、水印、人类数据配额和持续公平监控,使训练语料能按代际回溯,并在偏见反馈形成前自动阻断。

原文摘要

Generative models trained on artificially generated data have been shown to exhibit model collapse, resulting in significant performance degradation. As synthetic content increasingly contaminates the training corpora of language models, this raises critical concerns about the use of open data in continued pretraining. Although previous work has demonstrated model collapse in language models, it remains unclear whether exposure to synthetic data amplifies or attenuates the social biases already present in pretrained models. Because language models are known to reproduce and amplify demographic stereotypes, recursive training on self-generated data may create a self-reinforcing feedback loop in which biased associations become progressively stronger across generations. We call this hypothesized phenomenon fairness collapse. In this work, we construct controlled training regimes in which models are repeatedly trained on synthetic data using the Bias in Bios dataset. Across experiments, we observe a consistent and concerning pattern: fairness degradation emerges before substantial degradation is reflected by standard language-modeling metrics. This result highlights a critical risk associated with synthetic data contamination in language model training: bias can increase silently before strong indicators of model collapse become apparent.

cs.CL