Bias Analysis of L2 Speaking Assessment Systems Using Concept Activation Vectors

TL;DR

CAV与TopK SAE审计显示:概念可恢复性不等于对评分的实际影响。

cs.AI 🔴 高级 2026-08-07 19 次浏览
Arya Labroo Mengjie Qian Kate Knill
自动口语评测 公平性 CAV 稀疏自编码器 Transformer

核心发现

方法论

论文将自动口语评分器拆为表示层与回归输出层,在BERT文本评分器和Whisper多模态评分器上学习Concept Activation Vector(CAV)。CAV由带L2正则、类别平衡的线性铰链损失分类器获得,用平衡准确率衡量概念可恢复性;再以概念方向与评分梯度的余弦距离Bgr衡量概念影响。作者还使用TopK Sparse Autoencoder(SAE)在稀疏潜空间学习CAV,并通过线性解码器映射回原激活空间。

关键结果

  • 概念恢复高度依赖层与架构。BULATS上Whisper的2048维dense.in能恢复所有概念,而BERT两层及Whisper的64维act.out中超过半数L1概念退化。BERT的A2熟练度CAV准确率为88.1%和87.4%,但荷兰语L1的影响随深度由Bgr=0.91降至0.52。
  • 评分影响并不等于编码。BERT对熟练度更敏感,A2的Bgr由Layer 1的0.81降至Layer 2的0.46;Whisper各人口与L1概念接近无影响基线1,熟练度最低约0.83。性别在BERT Layer 2仅有轻微反向敏感性Bgr=1.11。
  • TopK SAE使概念更易线性恢复:实验中退化概念不再存在;但映射回激活空间后敏感性普遍向1衰减,尤其是BERT 20维Layer 2。荷兰语在该层的Bgr由0.52变为约0.92,说明SAE提升可分性,却可能削弱影响估计。

研究意义

研究提醒高风险口语评分不能把“模型能否识别某属性”直接当作“模型是否因该属性打分”。这一界分对L1、年龄和性别等潜在不公平因素尤其关键。结果还表明,审计结论取决于模型模态、内部层和探针表示,而非只取决于概念本身,为教育测评、移民考试和就业认证提供了更细粒度的公平性证据框架。

技术贡献

论文把回归版TCAV系统地扩展到Transformer口语评分器,并同时报告线性可恢复性与梯度影响。其关键工程设计是:在冻结评分器激活上训练TopK SAE,以m>d的稀疏潜变量学习CAV,再用WD dz映射回激活空间,保持与原始CAV相同的Bgr评估。该设计揭示探针表示会改变敏感性测量,而不是简单提高审计精度。

新颖性

相较于在手工特征评分器上发现注入偏差的既有工作,本文首次将CAV偏差分析扩展到BERT文本与Whisper语音文本评分器,并比较原始激活与SAE潜空间。最重要的新意不是提出单一公平分数,而是实验证明“可恢复性”和“影响力”是架构依赖、可分离的两个问题。

局限性

  • BULATS的L1、年龄和性别元数据并不完全均衡,概念与熟练度的真实相关性会影响Bgr解释;因此低敏感性不能自动证明不存在群体差异。
  • SAE只在冻结模型激活上训练,映射方向受重构子空间限制;论文也未建立统计因果检验,因此CAV相关性不能等同于现实决策中的因果偏差。
  • Speak & Improve缺少人口统计元数据,性别需由ECAPA-TDNN推断,限制了跨语料库结论的范围。

未来方向

后续应在更多考试、语言背景和真实群体交叉属性上复现实验,结合反事实样本、群体校准和因果干预验证偏差。还可比较不同SAE宽度、TopK稀疏度及非线性探针,研究如何在提高概念可分性的同时保留真实梯度影响,并形成可供考试机构使用的分层审计协议。

AI 总览摘要

自动口语评分已进入移民、就业认证和教育测评,但一个高准确率系统仍可能利用考生的第一语言、年龄或性别等无关线索。传统总体指标只能说明预测准不准,无法说明模型究竟依据什么评分。剑桥大学团队因此研究BERT文本评分器与Whisper语音文本评分器,尝试打开Transformer内部表示的黑箱。

核心工具是Concept Activation Vector(CAV):它把“荷兰语母语者”或“达到B2”等概念表示成激活空间中的方向。线性分类准确率回答概念是否被编码,概念方向与评分梯度的Bgr则回答它是否影响分数。作者进一步使用TopK Sparse Autoencoder,在更稀疏的潜空间中学习概念方向,再映射回原空间。BULATS结果显示,Whisper的2048维dense.in可恢复所有概念,而其他层对大量L1概念无法稳定分离;这说明概念恢复取决于表示层,而非概念本身。

影响分析同样呈现架构差异。BERT对A2熟练度的Bgr从Layer 1的0.81降至Layer 2的0.46,对荷兰语L1从0.91降至0.52;Whisper的人口与L1概念总体接近无影响基线1。SAE消除了退化CAV,却常把Bgr推回1,BERT 20维层最明显。研究的实际信息是:能解码某属性,不代表评分器使用了它;因此公平审计必须同时检查可恢复性和影响力。

深度分析

研究背景

BERT、wav2vec 2.0和Whisper推动了自动口语评测发展。既有TCAV用线性方向解释神经网络,Wei等人又将其用于回归式口语评分和注入L1偏差检测。但Transformer表示往往分布式、纠缠并存在superposition,单一线性方向可能混合多个因素。

核心问题

评分器应依据流利度、语法和内容,而不应因L1、年龄或性别改变分数。难点在于概念可能存在于内部表示却不参与输出,也可能因数据群体与熟练度相关而产生表面关联;单看分类探针或总体RMSE都无法区分这些情况。

核心创新

论文有三项创新:一是将回归CAV扩展至BERT和Whisper评分器;二是跨模态、跨层比较概念恢复与评分影响;三是引入TopK SAE。SAE通过高维稀疏编码寻找更可分的特征,但作者进一步检验映射后的梯度敏感性,发现可分性提升并不保证偏差影响测量更忠实。

方法详解

  • �� 将评分器写为ŷ=Fy(Fh(x)),在指定层取得激活h。
  • �� 对二元概念标签训练带L2正则和类别平衡的线性分类器,最小化铰链损失,得到CAV d。
  • �� 以平衡准确率判断概念可恢复;低于60%为弱可用,任一类别准确率低于10%则视为退化。
  • �� 将方向按平均激活范数缩放,并计算其与梯度∇hFy的余弦距离Bgr;Bgr=1表示近似无敏感,低于或高于1分别表示正向或负向影响。
  • �� 使用TopK SAE:z=TopK(ReLU(WEh+bE)),重构为ĥ=WDz+bD;在z空间学CAV,再用WD dz归一化映射回h空间。
  • �� 以重构误差、稀疏度、死亡特征率和解码器相干性选择SAE。

实验设计

主数据集为BULATS Part 1,含1657训练、188开发和465评估说话者,分数为0—6;辅助数据为Speak & Improve 2025,含3068、438和300人。BERT分析600维Layer 1和20维Layer 2;Whisper分析2048维dense.in和64维act.out。概念包括A2/B1/B2、性别、年龄及多种L1。模型性能用RMSE、PCC及误差在0.5/1.0内的比例衡量,并比较标准CAV与多种TopK SAE。

结果分析

BULATS上BERT和Whisper的PCC分别为0.756/0.786,RMSE为0.817/0.781。Whisper dense.in恢复全部概念;BERT层和Whisper act.out对过半L1概念退化。BERT的A2敏感性为0.81→0.46,荷兰语为0.91→0.52;Whisper人口与L1概念接近1。SAE使概念均可恢复,但往往削弱Bgr,尤其是20维BERT层。

应用场景

考试机构可在部署前逐层检查L1、性别、年龄与熟练度概念,区分“可解码”与“影响分数”。开发者可将Bgr、群体分数差和外部公平指标联合使用,定位应重训、重采样、校准或删除的组件。教育和移民认证场景尤其需要这种可审计证据链。

局限与展望

研究主要依赖BULATS,部分L1类别样本很少,且数据中的概念—分数相关会混淆公平解释。Speak & Improve缺少完整人口元数据,性别由ECAPA-TDNN推断。SAE是冻结模型后的表示工具,映射方向受重构质量限制;CAV和梯度仍是相关性分析,不能单独证明因果偏差。未来应加入反事实编辑、群体交叉性、更多语言和统计显著性检验。

通俗解读 非专业人士也能看懂

把评分器想成一位给口语考试打分的老师。老师听到回答后,会在脑中整理许多线索:表达是否流畅、语法是否正确、内容是否清楚,也可能无意间注意到口音、母语或年龄。研究者先画出一条“线索方向”:如果沿着这条线移动,样本就更像某个群体,例如荷兰语母语者,这就是CAV。

但“老师能认出你来自哪里”不等于“老师因此给你加分或扣分”。所以研究者又观察分数对这条方向有多敏感:如果方向和提高分数的方向一致,可能影响评分;如果接近直角,说明虽然老师看见了线索,却没有用它打分。

研究还用SAE把复杂记忆整理成更稀疏、更清楚的抽屉。这样更容易找到线索,但整理过程也可能丢掉部分原来的联系。结果正是如此:SAE让线索更容易被找出,却常使测得的评分影响变弱。公平检查因此不能只问“模型知道什么”,还必须问“模型用什么来决定分数”。

简单解释 像给14岁少年讲一样

想象学校里有个机器人老师,负责给英语口语考试打分。它应该看你说得顺不顺、句子对不对、答案有没有内容,而不是因为你来自哪个国家、年龄多大就偷偷改变分数。问题是,机器人脑子里的信息不像课本答案,而像一大团互相缠绕的耳机线。

研究者给机器人做了两种检查。第一种像找藏宝图:拿一组荷兰语母语者和一组非荷兰语母语者,看机器人脑中的数字能不能画出一条分界线。这就是CAV。第二种更关键:把这条线轻轻推一下,看最终分数会不会跟着动。能找到线索,只说明机器人知道它;分数跟着动,才说明它可能真的用了它。

他们还用SAE像整理游戏背包一样,把混乱信息拆成许多稀疏小格子。整理后,很多属性更容易被找出来,可是它们对分数的影响反而常常变小。BERT对熟练度很敏感,A2概念的指标从0.81变到0.46;Whisper对人口和母语线索通常接近“没有影响”的1。

所以结论很像考试复核:不能因为老师认出了你的校服,就说老师按校服打分。必须同时检查他能不能识别线索,以及分数是否真的随线索改变。这种双重检查能让口语评分更可信。

术语表

Concept Activation Vector(概念激活向量)

表示某个人类可理解概念在模型激活空间中的方向。它由线性分类器分离有概念和无概念样本得到。

论文用它表示L1、性别、年龄和熟练度。

TCAV(概念激活向量测试)

一种用CAV并结合梯度评估概念是否影响预测的方法。原始工作主要面向分类任务。

本文将其改造为口语评分回归分析。

Bgr敏感性

概念方向与评分梯度之间的平均余弦距离。数值接近1表示近似不敏感,偏离1表示可能影响分数。

用于区分概念被编码和概念影响评分。

TopK SAE

把激活编码为更高维但只有K个最大单元保留的稀疏表示。线性解码器再重构原激活。

论文用它在稀疏空间学习CAV。

概念可恢复性

从模型内部表示中用线性分类器识别概念的能力,通常用平衡准确率衡量。它不等于概念对输出的影响。

是本文公平审计的第一步。

Whisper-Fuse

同时处理音频和文本的评分架构。音频经log-mel谱编码,解码器通过交叉注意力融合声学与词汇信息。

作为多模态对照评分器。

开放问题 这项研究留下的未解疑问

  • 1 CAV与Bgr仍主要揭示相关结构,无法证明模型在现实决策中因某属性而偏置。需要反事实语音编辑、干预实验和因果估计。
  • 2 不同SAE宽度、稀疏度与解码器质量如何共同影响敏感性尚不清楚,尤其是低维输出层的方向失真机制仍待理论解释。
  • 3 多语言交叉属性、口音强度与社会经济背景可能同时出现,现有单一二元概念分析无法充分覆盖真实考生群体。

应用场景

近期应用

考试模型上线前审计

考试机构可在BERT或Whisper的多层激活上训练L1、性别和年龄CAV,同时报告平衡准确率与Bgr。若无关概念既可恢复又明显偏离1,应进一步做数据重平衡、校准或模型干预。

评分器开发诊断

模型开发团队可比较文本层、融合层和输出层,定位偏差信号首次出现的位置。结合BULATS式分数差与人类评分,可判断问题来自ASR、编码器、融合模块还是回归头。

远期愿景

可审计的高风险语言评测

未来可建立统一审计标准,将CAV、梯度、群体校准、反事实测试和人工复核纳入移民及就业认证流程。主要障碍是跨语言元数据、隐私保护和因果验证成本。

原文摘要

Automatic speaking assessment systems are increasingly deployed in high-stakes settings to mark second language (L2) learners' speaking tests, making it critical to show that their scores depend on speaking proficiency rather than irrelevant speaker attributes such as first language (L1) or age. Transformer-based foundation models have improved the accuracy of these L2 speaking graders, but their black-box representations make fairness and interpretability analysis more difficult. Building on prior work that used Concept Activation Vectors (CAVs) to detect bias towards unwanted attributes (`concepts') in feature-based graders, we extend CAV-based analysis to two neural speaking assessment systems: a text-based BERT grader and a speech-and-text multimodal grader based on Whisper. CAVs represent human-interpretable concepts as directions in a model's activation space, allowing us to distinguish between whether a concept is encoded in a model's internal representations and whether it influences the predicted score, the latter quantified using a gradient-based sensitivity metric. Since CAVs rely on linear separability, which is less likely in complex neural embedding spaces, we also investigate whether sparse autoencoders (SAEs) provide cleaner concept directions by learning CAVs in a sparse latent space and mapping them back to activation space. Our analysis shows that concept recoverability depends strongly on the representation and architecture being probed, rather than on the concept alone. Sensitivity to concepts is also architecture-dependent. SAEs make concepts more linearly recoverable, but attenuate the original activation-space sensitivity, especially in low-dimensional layers. These findings highlight the need to distinguish concept recoverability from concept influence when auditing bias in speaking assessment systems.

cs.AI