Algorithmic Fragility and Persona Bias in LLM-Generated Autistic Communication

TL;DR

研究揭示LLM在自闭症交流生成中的算法脆弱性和角色偏见,使用多代理定性分析框架。

cs.CL 🔴 高级 2026-05-26 3 次浏览
Naba Rizvi Mohammed Rizvi Harper Strickland Saleha Ahmedi Nedjma Ousidhoum
自闭症 大语言模型 角色偏见 算法脆弱性 安全对齐

核心发现

方法论

研究采用双角色重写范式,要求十个大语言模型在自闭症和神经典型角色下重写自闭症对话。通过多代理定性分析框架,分析14,840对重写文本,揭示角色特定的生成崩溃。

关键结果

  • 自闭症角色重写在词汇形式和情感上显著不同于神经典型重写,尽管语义相似性相等。
  • 大多数模型在跨角色生成中几乎产生相同输出,显示角色特定的生成崩溃。
  • 与自闭症人类标注者的比较显示,社区内部知识导致与LLM分类的系统性标签反转。

研究意义

研究揭示当前对齐训练导致角色特定的生成崩溃,仅通过定性分析可见,确认了提示工程无法解决的深层表示差距。这对自闭症交流的真实再现具有重要意义。

技术贡献

研究提出多代理定性分析框架,揭示LLM在自闭症交流生成中的系统性输出抹除、刻板幻觉和任务逃避元评论等失败模式。

新颖性

首次通过双角色重写范式揭示LLM在自闭症交流生成中的角色特定崩溃,提供了新的分析视角。

局限性

  • 模型在自闭症角色下生成的输出在词汇和情感上偏离源文本,显示角色特定的偏见。
  • 大多数模型在跨角色生成中输出几乎相同,未能捕捉角色差异。

未来方向

未来研究可探索改进对齐策略以减少角色特定的生成崩溃,并开发更具包容性的模型。

AI 总览摘要

研究揭示大语言模型在生成自闭症交流时的算法脆弱性和角色偏见。通过双角色重写范式,研究人员要求十个大语言模型在自闭症和神经典型角色下重写自闭症对话。结果显示,自闭症角色重写在词汇形式和情感上显著不同于神经典型重写,尽管语义相似性相等。

研究引入了多代理定性分析框架,分析了14,840对重写文本,揭示了系统性输出抹除、刻板幻觉和任务逃避元评论等失败模式。与自闭症人类标注者的比较显示,社区内部知识导致与LLM分类的系统性标签反转。

研究表明,当前对齐训练导致角色特定的生成崩溃,仅通过定性分析可见,确认了提示工程无法解决的深层表示差距。这对自闭症交流的真实再现具有重要意义,未来研究可探索改进对齐策略以减少角色特定的生成崩溃,并开发更具包容性的模型。

深度分析

研究背景

近年来,大语言模型(LLM)在自然语言处理领域取得了显著进展。然而,这些模型在生成自闭症交流时可能存在算法脆弱性和角色偏见。以往研究多关注模型在生成神经典型交流时的表现,而忽视了自闭症交流的独特性。

核心问题

研究的核心问题是LLM在生成自闭症交流时的角色特定崩溃。当前的对齐训练可能导致模型在自闭症角色下生成偏离源文本的输出,未能真实再现自闭症交流。

核心创新

研究的核心创新在于提出双角色重写范式,首次揭示LLM在自闭症交流生成中的角色特定崩溃。通过多代理定性分析框架,系统分析了模型在不同角色下的生成表现。

方法详解

  • �� 使用双角色重写范式,要求模型在自闭症和神经典型角色下重写对话。
  • �� 引入多代理定性分析框架,分析14,840对重写文本。
  • �� 比较模型输出与自闭症人类标注者的标签,揭示角色特定的生成崩溃。

实验设计

实验设计包括使用十个大语言模型,分别在自闭症和神经典型角色下重写自闭症对话。通过多代理定性分析框架,分析14,840对重写文本,揭示角色特定的生成崩溃。

结果分析

实验结果显示,自闭症角色重写在词汇形式和情感上显著不同于神经典型重写,尽管语义相似性相等。大多数模型在跨角色生成中几乎产生相同输出,显示角色特定的生成崩溃。

应用场景

研究结果可用于改进大语言模型在自闭症交流生成中的表现,开发更具包容性的模型,以真实再现自闭症交流。

局限与展望

研究的局限在于模型在自闭症角色下生成的输出在词汇和情感上偏离源文本,显示角色特定的偏见。未来研究可探索改进对齐策略以减少角色特定的生成崩溃。

通俗解读 非专业人士也能看懂

想象一个工厂,工人们负责将原材料加工成产品。大语言模型就像工厂里的机器,负责将输入的文本转换成输出。在这个过程中,机器可能会因为设置问题而无法正确加工某些特殊材料,比如自闭症交流。研究发现,当机器处理自闭症交流时,常常会出现偏差,生成的产品与原材料不符。这就像工厂的机器在加工特殊材料时出现故障,导致产品不合格。为了改善这种情况,研究人员建议调整机器的设置,使其能够更好地处理这些特殊材料。

简单解释 像给14岁少年讲一样

想象你在玩一个角色扮演游戏,你可以选择扮演不同的角色,比如勇士或法师。每个角色都有不同的技能和任务。在这个研究中,科学家们让电脑程序扮演不同的角色,比如自闭症角色和普通角色。结果发现,当程序扮演自闭症角色时,它们常常搞砸,生成的内容不太对劲,就像游戏角色用错了技能。科学家们想找出问题所在,并改进程序,让它们在扮演自闭症角色时表现得更好。

术语表

大语言模型 (LLM)

一种使用大量数据训练的人工智能模型,能够生成和理解自然语言。

研究中使用了十个大语言模型来重写自闭症对话。

角色偏见

模型在生成不同角色的文本时表现出的偏差,导致输出不一致。

研究揭示了LLM在自闭症角色下的生成偏差。

算法脆弱性

模型在处理特定任务时容易出错或产生偏差的特性。

研究发现LLM在自闭症交流生成中存在算法脆弱性。

多代理定性分析框架

一种分析方法,使用多个模型独立分析数据,以揭示潜在模式和偏差。

研究使用该框架分析了14,840对重写文本。

自闭症交流

自闭症个体之间的交流方式,通常具有独特的词汇和情感特征。

研究要求模型重写自闭症交流文本。

开放问题 这项研究留下的未解疑问

  • 1 如何改进对齐策略以减少角色特定的生成崩溃,仍需进一步研究。
  • 2 当前模型在自闭症角色下生成的输出偏差问题尚未完全解决。

应用场景

近期应用

自闭症交流生成

改进大语言模型在自闭症交流生成中的表现,开发更具包容性的模型。

远期愿景

包容性AI

开发能够真实再现多样化交流风格的AI,促进社会包容。

原文摘要

Safety alignment reduces explicitly harmful outputs but inadvertently encodes a sanitized, neuronormative representation of marginalized communication. We investigate this encoding using a dual-persona rewrite paradigm, prompting ten large language models (LLMs) to rewrite naturally occurring autistic discourse from either an autistic or neurotypical persona. We uncover autistic-persona rewrites diverge significantly more in lexical form and affective register than neurotypical rewrites, despite equivalent semantic similarity. Furthermore, most models collapse cross-persona generations into near-identical outputs. To uncover the mechanisms behind this generative breakdown, we introduce a multi-agent qualitative analysis framework. Our results reveal systemic output erasure, stereotyped hallucination, and task-evasive meta-commentary are pervasive failure modes for this task that cluster by alignment strategy rather than parameter scale. Finally, our targeted comparison with autistic human annotators demonstrates that community-insider knowledge produces systematic label reversals relative to LLM classifications. Our findings indicate that current alignment training causes persona-specific generative breakdown visible only through qualitative analysis, confirming a deep representational gap that prompt engineering cannot resolve.

cs.CL cs.AI