A Multi-Agent Framework for Mitigating Dialect Biases in Privacy Policy Question-Answering Systems

TL;DR

多智能体框架将方言问题标准化并由隐私专家复核,使GPT-4o-mini在PrivacyQA上由0.394升至0.601。

cs.CL 🟡 进阶级 2025-06-03 27 次浏览
Đorđe Klisura Astrid R Bernaga Torres Anna Karen Gárate-Escamilla Rajesh Roshan Biswal Ke Yang Hilal Pataci Anthony Rios
隐私政策问答 方言偏差 大语言模型 多智能体协作 公平性

核心发现

方法论

框架由Dialect Agent与Privacy Policy Agent组成。前者依据方言的语音、语法、词汇和文化信息,将问题转换为标准美式英语(SAE),并保留原始意图;后者结合政策片段生成答案及理由。Dialect Agent随后审查答案,若发现语义遗漏,触发最多两轮的Privacy Agent修订。该方法仅依赖提示,不需重训练或方言微调。

关键结果

  • 在PrivacyQA上,GPT-4o-mini零样本平均F1由0.394提升至多智能体零样本0.587,少样本由0.565提升至0.598;最大方言差距由0.093降至0.019。
  • 在PolicyQA上,GPT-4o-mini零样本平均分由0.352升至0.452,少样本由0.449升至0.471;Llama 3.1少样本最大差距由0.080降至0.028。
  • 公平性改善具有模型无关性:PrivacyQA中最小AVG Diff为0.005,PolicyQA中为0.006;加入方言信息后,PrivacyQA初始平均F1由0.5210升至0.5772。

研究意义

论文把方言公平性引入隐私政策这一高风险、强领域任务。隐私政策本已因冗长和法律化语言难以理解,而非主流英语使用者还可能因提问形式被系统误判。研究显示,无需收集敏感群体数据或重新训练模型,仅通过结构化角色协作即可提高准确率并缩小差距,为公平、可部署的隐私辅助工具提供了实证路径。

技术贡献

技术上,论文提出“方言解释—领域回答—方言复核—定向修订”的闭环提示架构。它将Multi-VALUE生成的方言扰动与隐私领域知识分工结合,并以AVG Diff和Max Diff同时衡量总体与最坏不公平。相较直接翻译或单次提示,该机制显式验证方言意图,支持GPT-4o-mini、Llama 3.1和DeepSeek-R1,形成无需参数更新的跨模型适配方案。

新颖性

以往Multi-VALUE、DADA和TADA主要评估通用NLP方言鲁棒性;隐私QA研究则较少处理语言公平。本文首次系统研究多方言隐私政策问答,并将方言专家角色嵌入领域QA闭环。核心新意不是训练新模型,而是把社会语言学知识转化为可复用的提示协议。

局限性

  • 方言由Multi-VALUE的189条规则合成,未必覆盖真实说话者的地区、年龄和身份差异;因此实验公平性不能完全等同于现实公平性。
  • 系统依赖模型正确理解方言描述;Dialect Agent若误译原意,后续Privacy Agent可能在错误问题上产生看似合理的政策答案。
  • 论文给出的摘要实验信息未完整呈现所有方言、成本和统计显著性分析。

未来方向

未来应使用真实用户、多地区和多身份语料验证迁移效果,比较人工翻译与自动翻译误差;还需测试更多隐私类别、模型和语言,优化循环次数与推理成本,并加入可解释的证据引用、人工复核及安全拒答机制。

AI 总览摘要

隐私政策决定人们如何理解数据收集、共享和删除权利,但法律化文本和长篇结构已经制造了明显门槛。问题在于,系统对标准美式英语(SAE)往往更可靠,对非标准英语方言却可能答错;在隐私场景中,这种差异会让本已更容易遭受监控和数据滥用的群体进一步失去保护工具。

Klisura等人提出一个无需训练的多智能体框架。Dialect Agent先利用指定方言的语言与文化信息,把问题转换为SAE;Privacy Policy Agent再依据政策片段生成简洁答案和理由;Dialect Agent最后检查答案是否真正对应原意,必要时要求最多两轮修订。这相当于让语言专家和隐私专家共同校对,而不是让单一模型一次猜测。

在PrivacyQA和PolicyQA上,框架显著提高GPT-4o-mini表现:PrivacyQA零样本平均分由0.394升至0.587,少样本由0.565升至0.598;PolicyQA零样本由0.352升至0.452,少样本由0.449升至0.471。PrivacyQA最大方言差距降至0.019,PolicyQA中Llama 3.1的最大差距由0.080降至0.028。研究仍受合成方言、提示误译、推理成本和未充分报告的显著性限制,但说明结构化协作可能成为无需微调的公平性工程工具。

深度分析

研究背景

隐私NLP已从OPP-115实践分类、PolicyIE语义解析和PI-Extract实体识别发展到问答。PrivacyQA将任务设为答案句选择,PolicyQA则要求抽取精确答案片段。与此同时,Multi-VALUE用189条规则生成50种英语方言压力测试。已有研究证明AAVE、Chicano English等方言会降低模型性能,但隐私政策QA中的方言差距尚未被系统解决。

核心问题

给定方言问题qd与政策片段p,模型f输出答案,并以指标Φ评估。论文关注方言间性能差距Δ=max|Φdi(f)-Φdj(f)|,目标是在维持平均准确率的同时最小化Δ。难点在于方言表达可能改变句法和词汇,却不能改变法律意图;直接标准化还可能抹去语境或产生错误翻译。

核心创新

  • ��角色分工:Dialect Agent负责意图保真,Privacy Policy Agent负责政策证据。
  • ��闭环复核:方言代理审查答案,发现误解后触发最多两次定向修订。
  • ��免训练适配:仅通过方言描述和提示工作,不需要方言标注数据、参数更新或专门微调。
  • ��公平评估:同时报告平均F1、AVG Diff和Max Diff,区分总体能力与最坏群体风险。

方法详解

  • ��输入:方言问题、对应政策片段及方言信息。
  • ��标准化:Dialect Agent使用“专家语言学家”提示,将问题转为SAE,要求保留意图与文化细节。
  • ��回答:Privacy Agent使用“隐私政策专家”提示,仅依据政策片段生成答案和理由。
  • ��复核:Dialect Agent比较原方言问题、政策片段和答案,判断是否遗漏方言含义。
  • ��修订:若不通过,Privacy Agent依据反馈重写;最多循环2次。
  • ��少样本:每个代理加入8个涵盖方言、问题类型和政策情境的示例。

实验设计

数据集为PrivacyQA(35份移动应用政策、1,750个问题、3,500多个专家标注答案)和PolicyQA(115份网站政策、25,017个问答对)。方言由Multi-VALUE生成,重点报告RAAVE、Jamaican、Aboriginal、Welsh和SWE。基线包括GPT-4o-mini、Llama 3.1 8B和DeepSeek-R1-Distill-Qwen-14B,均测试零样本、少样本及多智能体设置。PrivacyQA使用分类F1,PolicyQA使用token-level F1。

结果分析

GPT-4o-mini多智能体少样本在PrivacyQA达到0.598,超过普通少样本0.565;PolicyQA达到0.471,超过0.449。PrivacyQA最佳AVG Diff为0.005、Max Diff为0.019;PolicyQA最佳AVG Diff为0.006。Llama 3.1在PolicyQA的Max Diff从0.080降至0.028。加入方言信息使PrivacyQA初始分数从0.5210升至0.5772。

应用场景

可将框架部署在政府、平台和企业的隐私助手中,让用户用RAAVE、Jamaican或地方英语询问数据共享、保存、安全、访问和删除。前提是系统能获得政策片段、可靠的方言描述和可审计的证据输出。它也可迁移到服务条款、医疗同意书及公共福利问答。

局限与展望

实验主要依赖Multi-VALUE合成方言,可能低估真实口语中的身份、代码转换和语境复杂性。多轮调用增加延迟、费用和错误传播风险;Dialect Agent也可能把合法方言表达错误标准化。未来需要真实多方言用户研究、人工公平审计、更多模型和语言,以及证据约束、成本控制和不确定性校准。

通俗解读 非专业人士也能看懂

把系统想成一个帮助居民读隐私合同的服务台。第一位工作人员熟悉不同社区的说话方式:无论用户用哪种英语提问,他都先确认“你真正想问的是什么”,再用大家容易读懂的说法写下来。第二位工作人员专门研究合同,只能从合同原文找答案,不能凭空补充。

接着第一位工作人员再次检查答案:它有没有听错用户?有没有回答合同里真正的内容?如果有问题,就把具体问题退回给第二位工作人员修改,最多来回两次。这样做不像把所有用户都要求重新学习一套标准说法,而是让服务台主动适应用户。

实验表明,这种分工让GPT-4o-mini在PrivacyQA的平均表现从0.394升到0.587,在PolicyQA从0.352升到0.452;不同说话方式之间的差距也明显缩小。不过,测试中的方言主要是规则生成的,真实社区的表达可能更丰富,因此上线前仍需要真人检验。

简单解释 像给14岁少年讲一样

想象你在玩一款规则超多的网络游戏:游戏说明书又长又难懂,而且你用家乡口音问问题时,机器人更容易答错。隐私政策就像这本说明书,告诉你平台会不会收集、保存或分享你的资料。

这篇论文安排了两个“队友”。Dialect Agent像语言翻译高手,先听懂不同英语方言的问题,再写成标准美式英语;Privacy Policy Agent像规则专家,只根据政策原文回答。然后翻译高手再检查:规则专家真的听懂了吗?如果没听懂,就让他重新回答,最多返工两次。

作者用PrivacyQA和PolicyQA测试三个模型。GPT-4o-mini在PrivacyQA零样本表现从0.394升到0.587,在PolicyQA从0.352升到0.452。也就是说,系统不只是让机器人更聪明,还让不同说话方式的玩家更接近公平待遇!

但它还不是魔法:测试方言主要由规则生成,可能和真人说话不完全一样;两个队友反复讨论也会花更多时间和费用。下一步要请真实用户测试,并确保机器人能展示政策证据,而不是自信地胡说。

术语表

Dialect Agent(方言代理)

负责识别方言表达并转写为SAE,同时检查答案是否保留原始意图。它是语言与文化语境的中介。

框架的第一步和最终复核步骤。

Privacy Policy Agent(隐私政策代理)

依据给定政策片段回答隐私问题的领域角色。其提示要求答案简洁、准确且不超出文本证据。

生成初始答案并根据反馈修订。

Multi-VALUE(多方言扰动框架)

用189条语言学规则把SAE转换为50种英语方言形式的规则系统。它用于压力测试而非模型训练。

生成PrivacyQA和PolicyQA的方言问题。

PrivacyQA(隐私问答数据集)

移动应用隐私政策的句子级答案选择数据集,包含1,750个问题和3,500多个专家标注答案。

使用分类F1评估答案是否正确。

PolicyQA(政策问答数据集)

网站隐私政策问答数据集,含25,017个问答对和115份政策。任务强调精确答案片段抽取。

使用token-level F1评估重叠程度。

Max Diff(最大差距)

任意两个方言之间性能指标的最大绝对差值。数值越低,表示最坏方言不公平越小。

论文用它衡量跨方言公平性。

开放问题 这项研究留下的未解疑问

  • 1 合成方言能否代表真实社区?Multi-VALUE保留了规则化语义,却可能缺少身份、语境和代码转换信息,需要真实用户语料与人工评审。
  • 2 多智能体循环的额外成本是多少?论文未充分报告延迟、API费用、错误传播和统计显著性,部署前需系统测量。

应用场景

近期应用

多方言隐私助手

平台可把用户问题、相关政策片段和方言标签送入两个代理,输出带证据的简明答案。适合解释数据共享、保存、删除和用户控制权,但必须配置隐私文本检索与人工升级通道。

政策可及性审计

企业可用Multi-VALUE生成压力测试问题,比较SAE、RAAVE、Jamaican等方言的F1和Max Diff,定位回答不公平的条款类别,再由语言专家与隐私专家复核。

远期愿景

公平的公共信息基础设施

未来可把方言感知问答扩展至服务条款、医疗同意书和政府福利政策。若结合真实社区参与、证据引用和安全审计,系统有望降低法律信息门槛,但仍需治理数据偏见与责任归属。

原文摘要

Privacy policies inform users about data collection and usage, yet their complexity limits accessibility for diverse populations. Existing Privacy Policy Question Answering (QA) systems exhibit performance disparities across English dialects, disadvantaging speakers of non-standard varieties. We propose a novel multi-agent framework inspired by human-centered design principles to mitigate dialectal biases. Our approach integrates a Dialect Agent, which translates queries into Standard American English (SAE) while preserving dialectal intent, and a Privacy Policy Agent, which refines predictions using domain expertise. Unlike prior approaches, our method does not require retraining or dialect-specific fine-tuning, making it broadly applicable across models and domains. Evaluated on PrivacyQA and PolicyQA, our framework improves GPT-4o-mini's zero-shot accuracy from 0.394 to 0.601 on PrivacyQA and from 0.352 to 0.464 on PolicyQA, surpassing or matching few-shot baselines without additional training data. These results highlight the effectiveness of structured agent collaboration in mitigating dialect biases and underscore the importance of designing NLP systems that account for linguistic diversity to ensure equitable access to privacy information.

cs.CL