Creating Multilingual Mental Health Dialogue Datasets: Limits of Persona-Based Localization via Nationality and Language

TL;DR

通过修改国籍和语言参数生成多语言心理健康对话数据集,发现临床一致性问题。

cs.CL 🔴 高级 2026-06-18 6 次浏览
Yunkai Xu Saeed Abdullah
心理健康 多语言 大语言模型 数据集 临床一致性

核心发现

方法论

研究通过修改临床角色的国籍和语言参数来生成多语言心理健康对话数据集。使用不同的大语言模型评估生成数据集的抑郁程度,比较与英语基线的表现。

关键结果

  • 结果显示,英语模型表现最佳,准确率达98.21%,而在孟加拉语中下降至63.33%。
  • 不同模型在非英语文本中评估抑郁程度时表现不一致,尤其是较小的模型。
  • 语言和国籍的简单替换未能保持临床信号的一致性。

研究意义

研究揭示了基于英语的角色在多语言环境中的系统性限制,强调了生成文化响应数据以确保全球心理健康系统公平的重要性。

技术贡献

研究展示了基于角色的多语言数据生成方法的局限性,并提出了需要进行语言特定的评估以保持跨语言一致性。

新颖性

首次系统评估了通过简单的国籍和语言参数替换生成的多语言心理健康数据集的临床一致性。

局限性

  • 简单的国籍和语言替换未能保持临床信号的一致性,导致跨语言的表现差异。
  • 小型模型在非英语环境中表现不佳,准确率波动较大。

未来方向

未来研究应关注文化响应数据生成,开发更复杂的角色模型以提高跨语言的临床一致性。

AI 总览摘要

全球心理健康挑战需要高质量的数据集来训练和评估AI系统。然而,现有的数据集主要集中在英语环境中,导致其他语言的代表性不足。本文通过修改角色的国籍和语言参数来生成多语言心理健康对话数据集,评估不同大语言模型在这些数据集上的表现。结果显示,简单的参数替换未能保持临床信号的一致性,尤其是在较小的模型中表现出明显的跨语言差异。研究强调了生成文化响应数据以确保全球心理健康系统公平的重要性,并提出了未来需要进行语言特定的评估以保持跨语言一致性。

深度分析

研究背景

全球心理健康问题日益严峻,尤其是在医疗资源匮乏的地区。AI和大语言模型被视为潜在的解决方案,但高质量的训练和评估数据集仍然稀缺,尤其是在非英语环境中。

核心问题

现有的心理健康数据集主要集中在英语环境中,导致其他语言的代表性不足,影响了AI系统在多语言环境中的表现。

核心创新

通过修改角色的国籍和语言参数生成多语言心理健康对话数据集,评估不同大语言模型在这些数据集上的表现。

方法详解

  • �� 修改角色的国籍和语言参数以生成多语言数据集
  • �� 使用不同的大语言模型评估生成数据集的抑郁程度
  • �� 比较与英语基线的表现

实验设计

实验使用了不同的大语言模型,包括ChatGPT-4o-mini和DeepSeek-V3.2,评估生成的多语言数据集的抑郁程度。实验结果显示,英语模型表现最佳,而在其他语言中表现不一致。

结果分析

结果显示,英语模型表现最佳,准确率达98.21%,而在孟加拉语中下降至63.33%。不同模型在非英语文本中评估抑郁程度时表现不一致,尤其是较小的模型。

应用场景

研究结果可用于开发更复杂的角色模型,以提高跨语言的临床一致性,促进全球心理健康系统的公平性。

局限与展望

简单的国籍和语言替换未能保持临床信号的一致性,导致跨语言的表现差异。小型模型在非英语环境中表现不佳,准确率波动较大。

通俗解读 非专业人士也能看懂

想象你在不同国家旅行,试图用当地语言交流。虽然你知道一些基本短语,但你发现自己无法准确表达复杂的情感或症状。这就像研究中所发现的问题:简单的语言和国籍替换无法保持临床信号的一致性。不同语言的文化背景和表达方式影响了AI模型的表现,导致在评估心理健康时出现误差。就像在旅行中,你需要深入了解当地文化和语言才能有效交流,AI系统也需要更复杂的角色模型来提高跨语言的临床一致性。

简单解释 像给14岁少年讲一样

想象一下,你在玩一个游戏,角色可以在不同国家旅行。每个国家都有自己的语言和文化,你需要用当地语言与角色交流。但有时简单的翻译无法准确表达角色的情感或症状。这就是研究中发现的问题:简单的语言和国籍替换无法保持临床信号的一致性。不同语言的文化背景和表达方式影响了AI模型的表现,导致在评估心理健康时出现误差。就像在游戏中,你需要深入了解当地文化和语言才能有效交流,AI系统也需要更复杂的角色模型来提高跨语言的临床一致性。

术语表

大语言模型 (Large Language Model)

一种AI模型,能够处理和生成自然语言文本。

用于评估生成的多语言心理健康数据集的抑郁程度。

角色 (Persona)

一种虚构的、基于数据的角色,用于模拟用户行为。

用于生成多语言心理健康对话数据集。

临床一致性 (Clinical Consistency)

指在不同语言和文化背景下保持相同的临床信号。

评估生成的多语言数据集的临床一致性。

抑郁程度 (Depression Severity)

衡量个体抑郁症状的严重程度。

使用大语言模型评估生成数据集的抑郁程度。

文化响应数据 (Culturally Responsive Data)

能够反映不同文化背景的真实数据。

强调生成文化响应数据以确保全球心理健康系统公平的重要性。

开放问题 这项研究留下的未解疑问

  • 1 简单的语言和国籍替换未能保持临床信号的一致性,未来需要开发更复杂的角色模型。
  • 2 不同语言的文化背景和表达方式影响了AI模型的表现,未来需要进行语言特定的评估。

应用场景

近期应用

多语言心理健康评估

开发更复杂的角色模型,以提高跨语言的临床一致性。

远期愿景

全球心理健康系统公平性

生成文化响应数据以确保全球心理健康系统的公平性。

原文摘要

AI and large language models (LLMs) have emerged as promising tools to address global mental health challenges. Despite the global nature of these challenges, there remains a critical shortage of high-quality datasets for training and evaluating such systems. To mitigate this gap, researchers increasingly generate synthetic clinical personas to simulate user data and test digital mental health support systems. However, most validated personas rely on English-centric contexts. This paper investigates whether similar persona-based methods can be used to generate multilingual mental health datasets. We modified nationality and language parameters in personas to generate clinical dialogues in Mandarin, Bengali, and Hindi. We then examined how different LLMs perform when evaluating the depression severity of these generated multilingual datasets against the baseline in English. Our findings indicate that just adding nationality and language parameters in personas might not be adequate, as it can introduce clinical inconsistency across languages. LLM judge models often exhibit inaccuracies in assessing depression severity in non-English texts, with performance varying across different models. This exposes the systemic limitations of applying English-centric personas to multilingual contexts. Ultimately, our work highlights the urgent need for culturally responsive data generation to ensure equitable mental health systems globally.

cs.CL cs.AI cs.HC