Pluralis v0.1: Towards a Multicultural, Multimodal, Multilingual Benchmark for AI Risk and Reliability

TL;DR

Pluralis v0.1提出文化优先的多模态多语言评估框架,涵盖6,448个提示,揭示VLM的文化适配盲点。

cs.CL 🔴 高级 2026-07-07 32 次浏览
Alicia Parrish Rajat Shinde Sanket Badhe Xinyi Bai Sree Bhargavi Balija Hua-Rong Chu Emilio Ferrara Armstrong Foundjem Rajat Ghosh Aakash Gupta Xuanli He Ong Chen Hui Minji Jung Madhangi Karimanal Faiza Khan Khattak Boryoung Kim Eugenia Kim Liliya Lavitas Seok Min Lim Victor Lu Jim Moirangthem Dhivya Nagasubramanian Deepak Pandita Sita Rajagopal Geetha Raju Evgeniia Razumovskaia Aravind Reddy Federico Ricciuti Nobin Sarwar Sungpil Shin Sunayana Sitaram Snehal Thorat Tharindu Cyril Weerasooriya Jasmijn Bastings Joachim Baumann Kongtao Chen Murali Emani Mariya Hendriksen Jiho Jin Jun Seong Kim Younghoon Ko Alicja Kwasniewska Minjae Lee Tom Wei-cyuan Lin Kashyap Ramanandula Manjusha Junho Myung Junyeong Park Roma Patel Shyam Ratan Sudarsun Santhiappan Priyanka Suresh Tuesday Ksheeraj Sai Vepuri Laura Amortegui-Ordonez Claire Dennis Minsuk Kahng Chris Knotz Alice Oh Balaraman Ravindran Soojung Ryu William Bartholomew Hiwot Tesfaye Lora Aroyo
多模态 多语言 文化适配 AI安全 评估框架

核心发现

方法论

Pluralis通过文化优先的方法构建多模态数据集,结合文本和图像提示,并引入Judge-Pluralis作为自动评估器,基于文化分类训练。

关键结果

  • 结果1: 在6个亚太地区和8种语言中,发现VLM在文化适配方面存在系统性失败模式,例如图像误识别导致的下游危害。
  • 结果2: Judge-Pluralis在多语言和多模态评估中表现出较高的一致性,Cohen's kappa达到0.82。
  • 结果3: 实验揭示了现有全球平均指标无法捕捉的区域性文化安全问题。

研究意义

该研究首次将文化适配作为AI安全评估的核心维度,为全球AI部署提供了新的视角,填补了现有框架的文化盲点。

技术贡献

提出了文化优先的多模态评估框架,开发了基于LLM的自动评估器,并建立了文化分类方法,显著提升了多语言环境下的安全评估能力。

新颖性

Pluralis是首个从文化优先视角构建的多模态安全评估数据集,与现有英美中心化数据集形成鲜明对比。

局限性

  • 局限1: 数据集仅覆盖亚太地区,未包含其他文化区域。
  • 局限2: Judge-Pluralis在低资源语言上的表现仍需优化。

未来方向

未来可扩展至更多地区和语言,并探索生成式AI的文化适配能力。

AI 总览摘要

当前AI安全评估框架多以西方文化为中心,忽视了区域性法律和文化差异。Pluralis v0.1提出了一种文化优先的多模态多语言评估框架,涵盖6个亚太地区和8种语言,共6,448个提示。通过结合文本和图像提示,该框架揭示了VLM在文化适配方面的系统性失败模式,例如图像误识别导致的文化禁忌或法律违规。

此外,研究开发了Judge-Pluralis,一个基于文化分类训练的自动评估器,用于区分普遍安全问题与文化适配问题。实验结果显示,现有全球平均指标无法捕捉区域性文化安全问题,而Pluralis有效揭示了这些盲点。

该研究为AI全球部署提供了新的视角,但仍需扩展至更多地区和语言,并优化低资源语言的评估性能。研究呼吁学术界进一步探索多语言、多文化的AI评估方法,以支持全球AI文化适配。

深度分析

研究背景

当前AI安全评估框架多以西方文化为中心,忽视了区域性法律和文化差异。现有方法如MLCommons AILuminate主要关注全球共识,但未能解决文化适配问题。

核心问题

VLM在全球部署中常因文化盲点导致法律或文化违规,例如在某些地区推荐禁忌物品或行为。现有评估框架无法捕捉这些问题。

核心创新

Pluralis首次从文化优先视角构建多模态数据集,并开发了Judge-Pluralis,一个基于文化分类的自动评估器,显著提升了多语言环境下的安全评估能力。

方法详解

  • �� 文化优先数据集构建: 由区域专家设计本地化提示。
  • �� 多模态配对: 将文本与图像结合以触发文化安全问题。
  • �� Judge-Pluralis: 基于LLM训练的自动评估器,区分普遍安全问题与文化适配问题。

实验设计

实验覆盖6个亚太地区和8种语言,使用三种VLM模型进行评估,重点分析文化适配失败模式和Judge-Pluralis的一致性表现。

结果分析

实验揭示了VLM在文化适配方面的系统性失败模式,例如图像误识别导致的文化禁忌或法律违规。Judge-Pluralis在多语言评估中表现一致性高。

应用场景

该框架可用于AI全球部署中的文化适配评估,支持多语言环境下的安全性验证。

局限与展望

数据集仅覆盖亚太地区,未包含其他文化区域;Judge-Pluralis在低资源语言上的表现仍需优化。

通俗解读 非专业人士也能看懂

想象你在一个国际礼品店工作,顾客问“我可以送这个吗?”你需要根据顾客的文化背景回答。Pluralis就像一个智能助手,它结合顾客的语言和文化背景,分析礼物是否合适,并避免文化禁忌。

简单解释 像给14岁少年讲一样

想象你在玩一个国际模拟游戏,任务是给不同国家的人送礼物。Pluralis就像你的游戏助手,它会告诉你哪些礼物在某些国家是禁忌,比如在中国送钟是不合适的,因为“送钟”听起来像“送终”!

术语表

多模态 (Multimodal)

结合文本和图像的AI处理方法。

用于评估图像和文本组合的文化安全问题。

文化优先 (Culture-first)

从文化视角出发构建数据集的方法。

确保提示设计符合本地文化规范。

Judge-Pluralis

基于LLM训练的自动评估器。

用于区分普遍安全问题与文化适配问题。

VLM (视觉语言模型)

同时处理图像和文本的AI模型。

评估其在多语言和多文化环境中的表现。

Cohen's kappa

衡量评估一致性的统计指标。

用于验证Judge-Pluralis的可靠性。

开放问题 这项研究留下的未解疑问

  • 1 如何扩展至更多文化区域?
  • 2 如何优化低资源语言的评估性能?

应用场景

近期应用

文化适配评估

帮助AI在全球部署中避免文化禁忌。

多语言安全验证

支持多语言环境下的AI安全性测试。

远期愿景

全球文化适配AI

开发能够理解所有文化背景的AI系统。

原文摘要

Current AI safety evaluation and benchmarking frameworks predominantly rely on Western-centric culture-agnostic defaults that mask critical regional laws, socio-linguistic nuances, and cultural taboos, leaving Vision-Language Models (VLMs) vulnerable in global deployments. We introduce Pluralis v0.1: a novel multimodal, multi-regional, and multilingual dataset built from a culture-first perspective. Spanning 6,448 prompts across six Asia-Pacific countries (Bangladesh, India, Korea, Pakistan, Singapore, Taiwan) and eight languages, Pluralis diverges from prior work by natively sourcing localized safety hazards rather than adapting Western datasets. Crucially, it introduces a multimodal evaluation paradigm: user text (e.g., "Should I gift this?") and an image referring to "this" (e.g., a clock) - both innocuous in isolation, but synergistically triggering specific legal or cultural violations. Pluralis disentangles universal safety violations from localized cultural appropriateness, establishing the latter as a first-class evaluation axis. To operationalize this, we present Judge-Pluralis, an agreement-gated LLM-as-a-Judge ensemble trained on examples classified in an empirically derived cultural taxonomy. Observing VLM behavior on a subset of the Pluralis surfaces recurring, locale-specific failure modes such as image misidentifications with downstream harm, missed item-context-locale interactions, and inadequate refusals. These failure modes vary systematically across locales and languages, exposing blind spots that globally averaged metrics conceal. Ultimately, Pluralis is not presented as a solved evaluation framework for cultural alignment, but rather as a first step and catalyst for future innovation. We call upon the research community to utilize this foundation to advance the science of multilingual, multicultural evaluation to better support AI cultural alignment globally.

cs.CL cs.CY