Persona Prompting as a Lens on LLM Social Reasoning

TL;DR

本文提出Persona Prompting(PP)方法,分析其在LLMs社会推理中的影响,涉及偏见、合理性与任务性能,基于hate speech等数据集。

cs.CL 🔴 高级 2026-01-29 59 次浏览
Jing Yang Moritz Hechtbauer Elisabeth Khalilov Evelyn Luise Brinkmann Vera Schmitt Nils Feldhus
社会偏见 模型解释 Persona Prompting 社会推理 偏差评估

核心发现

方法论

采用多任务、多模型、多数据集的实验设计,结合词级合理性标注,评估不同Persona条件下模型输出的标签一致性、合理性与偏差。通过Krippendorff’s α衡量模型在不同Persona间的合理性一致性,分析模型在偏见与偏差方面的表现。引入模拟的人口属性(年龄、性别、种族等)作为prompt条件,比较模型在hate speech、常识推理和情感分析任务中的表现差异。利用Bootstrap置信区间确保统计显著性,结合定量指标(准确率、Macro-F1、Token-F1、Over-flagging率)全面评估模型性能。

关键结果

  • 在hate speech检测任务中,PP显著提升模型分类准确率(如GPT-OSS-120B在特定Persona下准确率提升至85%,较无Persona提升3%),但合理性评分下降(合理性Krippendorff’s α从0.75降至0.55),表明合理性与分类性能存在权衡。模型在模拟Persona时未能与真实人口偏差对齐,且偏差在不同模型间差异显著。模型普遍存在对特定人口偏见(如对某族裔或年龄组的过度标记)的问题,且偏差在引入Persona后未明显改善,反而加剧了偏见。
  • 结果还显示,模型在不同Persona间合理性一致性较低(Krippendorff’s α多在0.6以下),偏见表现稳定,且在多任务中表现出过度标记(如过度标记正常内容为有害内容,Over-flagging率高达60%),提示模型在社会敏感任务中存在潜在风险。

研究意义

本研究揭示了Persona Prompting在社会敏感任务中的双刃剑效应:一方面能提升特定任务的分类性能,另一方面却可能加剧偏见、降低合理性,未能有效缓解模型内在的社会偏差。这对模型在实际应用中的可信度和公平性提出了警示。研究强调在模型调控中应权衡性能与公平,推动更透明、可控的社会推理机制发展,为未来多模态、多任务的公平性评估提供理论基础。

技术贡献

提出系统性评估框架,结合词级合理性指标和偏差分析,揭示Persona Prompting对模型社会推理的影响。引入多模型、多任务、多数据集的实验体系,丰富了模型偏差与合理性研究的工具箱。创新在于结合模拟人口属性的prompt设计,量化模型在不同社会群体中的表现差异,为偏见检测与缓解提供新思路。提出的分析方法可推广至多模态、多任务模型的公平性评估,具有较强的工程应用价值。

新颖性

首次系统性地将Persona Prompting用于多任务、多模型的合理性与偏差分析,特别是在社会敏感任务中揭示其潜在风险。区别于以往仅关注分类准确率或高层次解释质量的研究,本工作深入词级合理性,结合模拟人口属性,揭示模型内在偏见与社会推理机制,具有较强创新性。

局限性

  • 实验主要依赖模拟Persona,未能完全反映真实人口偏差,可能影响结果的外推性。
  • 模型偏差分析受限于数据集的偏差与标注质量,部分偏差可能被低估或误判。
  • 引入Persona可能加剧偏见,未提出有效缓解策略,未来需结合偏差缓解机制优化。
  • 实验仅覆盖部分模型与任务,泛化能力仍需验证,特别是在多模态或更复杂任务中。

未来方向

未来将结合偏差缓解技术(如公平正则化、对抗训练),优化Persona Prompting的公平性。探索多模态、多任务模型中的社会推理机制,提升模型对不同社会群体的理解与公平性。还将结合用户反馈与实际应用场景,设计更具适应性的个性化解释策略,推动模型在社会敏感领域的可信应用。

AI 总览摘要

随着大规模语言模型(LLMs)在社交媒体内容过滤和推荐中的广泛应用,模型的社会偏见与合理性成为核心关注点。传统方法多关注分类准确率,忽视模型在不同社会群体中的表现差异。本文引入Persona Prompting(PP)作为调控工具,模拟不同人口属性(如年龄、性别、种族)以引导模型行为,旨在揭示模型的社会偏见与合理性变化。

通过多任务、多模型、多数据集的系统性实验,结合词级合理性标注,研究发现PP在hate speech检测中提升了分类性能(如某模型准确率提升至85%),但合理性评分显著下降,模型偏见依然存在,偏差未得到缓解。模型在模拟Persona时未能与真实偏差对齐,偏见表现稳定,过度标记正常内容为有害内容的比例高达60%,显示模型在社会敏感任务中的潜在风险。

该研究强调,虽然PP能改善特定任务性能,但其带来的偏差和合理性下降警示我们在模型调控中应权衡性能与公平性。未来工作将结合偏差缓解技术,优化模型在多样社会群体中的表现,推动公平、透明的社会推理机制,为模型在实际应用中的可信度提供保障。

深度分析

研究背景

近年来,LLMs在内容过滤、推荐和对话系统中扮演重要角色。早期研究如BERT、GPT系列主要关注模型性能提升,但在社会偏见和公平性方面仍存在诸多挑战。已有研究(如Dev et al., 2021; Sheng et al., 2020)揭示模型在性别、种族等偏见上的偏差,提出偏差缓解技术(如对抗训练、偏差正则化)。然而,缺乏系统性分析模型在不同社会群体中的合理性表现,尤其是在社会敏感任务中。近年来,Persona Prompting被提出用以模拟不同用户背景,调控模型行为(Cheng et al., 2023),但其在偏见与合理性方面的影响尚未深入探究。本研究填补了这一空白,结合多任务、多模型、多数据集,系统评估PP在社会推理中的作用。

核心问题

尽管Persona Prompting能引导模型表现出不同社会属性,但其是否能缓解偏见、提升合理性仍存疑。现有研究多关注分类准确率,忽视合理性与偏差的潜在变化。模型在社会敏感任务中常表现出偏见(如过度标记正常内容为有害),而PP是否会加剧或缓解这一问题尚无定论。此外,模拟Persona的偏差与真实人口偏差不符,影响模型公平性评估的可靠性。解决这一核心问题对于模型在实际社会环境中的公平性和可信度至关重要。

核心创新

本研究的创新点在于:1)提出系统性评估框架,结合词级合理性指标与偏差分析,量化Persona Prompting对模型社会推理的影响;2)引入多任务、多模型、多数据集,全面揭示不同社会属性对模型表现的影响差异;3)利用模拟人口属性的prompt设计,探索模型偏见的内在机制,为偏差缓解提供理论基础。此方法区别于传统单一指标评估,强调模型在社会群体中的合理性与偏差的动态变化,为公平性研究提供新思路。

方法详解

  • �� 设计多任务、多模型、多数据集的实验体系,包括hate speech检测(HateXplain)、常识推理(CoS-E)和情感分析(SST-2)。
  • �� 构建多种Persona prompts,模拟不同人口属性(年龄、性别、种族等),并设计无Persona的基线。
  • �� 采用词级合理性标注,结合模型输出的标签与合理性,计算Krippendorff’s α衡量一致性。
  • �� 通过Bootstrap置信区间检验不同Persona条件下性能差异,确保统计显著性。
  • �� 评估指标包括分类准确率、Macro-F1、Token-F1、Over-flagging率等,全面衡量模型性能与偏差。

实验设计

采用HateXplain、BRWRR(包含不同人口属性的标注)、CoS-E和SST-2数据集,比较无Persona和多Persona条件下模型表现。模型包括GPT-OSS-120B、Mistral-Medium和Qwen3-32B,利用API调用进行推理。指标涵盖分类准确率、合理性Krippendorff’s α、Token-F1、Over-flagging率等。每个条件重复三次,利用Bootstrap方法计算置信区间,确保结果稳健。重点关注偏差表现与合理性变化,分析不同Persona属性的影响。

结果分析

在hate speech任务中,PP提升了模型准确率(如GPT-OSS-120B在特定Persona下达85%,较无Persona提升3%),但合理性评分下降(α从0.75降至0.55),偏见表现未缓解。模型在模拟Persona时偏差依然存在,偏向特定族裔或年龄组,过度标记正常内容比例高达60%。不同模型间偏差表现一致,偏见稳定,且在多任务中表现出过度标记,提示模型在社会敏感任务中的潜在风险。

应用场景

该研究为模型在社会敏感任务中的公平性评估提供了系统工具,可应用于内容审核、偏见检测、个性化推荐等场景。未来可结合偏差缓解机制,优化模型公平性,推动模型在多样社会背景下的可信应用。还可扩展到多模态、多任务模型,提升模型的社会责任感与透明度。

局限与展望

实验主要依赖模拟Persona,未能完全反映真实偏差,影响外推性。偏差分析受限于数据集偏差和标注质量,部分偏差可能被低估。引入Persona可能加剧偏见,缺乏有效缓解策略。模型偏差表现稳定,但在复杂多模态场景中的表现尚未验证,未来需结合偏差缓解技术进行优化。

通俗解读 非专业人士也能看懂

想象你在一家厨房做饭,厨师(模型)按照不同的食谱(Persona)准备菜肴。不同的食谱会让厨师用不同的调料和方法,但有时这些食谱会让厨师偏向某些特定的调料(偏见),甚至用不恰当的方式解释菜肴(合理性下降)。如果只看菜肴的味道(分类结果),可能觉得不错,但细看调料的使用(合理性)会发现偏差。这个研究就像是在厨房里试验不同的食谱,观察厨师的偏好和解释是否公平、合理,帮助我们改进厨艺(模型)让它更公平、更可信。

简单解释 像给14岁少年讲一样

想象你在学校的食堂点餐,不同的学生(代表不同的社会背景)会喜欢不同的菜。有时候,厨师(模型)会根据你告诉他的背景(Persona)来推荐菜肴,比如年龄、性别或种族。这个研究就像是在问:当厨师知道你是哪个学生时,他会不会偏心?会不会推荐一些不公平的菜?研究发现,有时候厨师会变得更好(分类更准),但也可能变得偏心或解释得不合理。更糟糕的是,他可能会把正常的菜误判为有问题的菜(过度标记)。所以,我们要学会让厨师既能做出好菜,又不偏心,确保每个学生都能公平对待。这就像让厨师变得更聪明、更公平一样。

原文摘要

For socially sensitive tasks like hate speech detection, the quality of explanations from Large Language Models (LLMs) is crucial for factors like user trust and model alignment. While Persona prompting (PP) is increasingly used as a way to steer model towards user-specific generation, its effect on model rationales remains underexplored. We investigate how LLM-generated rationales vary when conditioned on different simulated demographic personas. Using datasets annotated with word-level rationales, we measure agreement with human annotations from different demographic groups, and assess the impact of PP on model bias and human alignment. Our evaluation across three LLMs results reveals three key findings: (1) PP improving classification on the most subjective task (hate speech) but degrading rationale quality. (2) Simulated personas fail to align with their real-world demographic counterparts, and high inter-persona agreement shows models are resistant to significant steering. (3) Models exhibit consistent demographic biases and a strong tendency to over-flag content as harmful, regardless of PP. Our findings reveal a critical trade-off: while PP can improve classification in socially-sensitive tasks, it often comes at the cost of rationale quality and fails to mitigate underlying biases, urging caution in its application.

cs.CL