Pluralis v0.1: Towards a Multicultural, Multimodal, Multilingual Benchmark for AI Risk and Reliability

TL;DR

Pluralis v0.1 introduces a culture-first multimodal evaluation framework with 6,448 prompts, exposing VLM blind spots in cultural alignment.

cs.CL 🔴 Advanced 2026-07-07 34 views
Alicia Parrish Rajat Shinde Sanket Badhe Xinyi Bai Sree Bhargavi Balija Hua-Rong Chu Emilio Ferrara Armstrong Foundjem Rajat Ghosh Aakash Gupta Xuanli He Ong Chen Hui Minji Jung Madhangi Karimanal Faiza Khan Khattak Boryoung Kim Eugenia Kim Liliya Lavitas Seok Min Lim Victor Lu Jim Moirangthem Dhivya Nagasubramanian Deepak Pandita Sita Rajagopal Geetha Raju Evgeniia Razumovskaia Aravind Reddy Federico Ricciuti Nobin Sarwar Sungpil Shin Sunayana Sitaram Snehal Thorat Tharindu Cyril Weerasooriya Jasmijn Bastings Joachim Baumann Kongtao Chen Murali Emani Mariya Hendriksen Jiho Jin Jun Seong Kim Younghoon Ko Alicja Kwasniewska Minjae Lee Tom Wei-cyuan Lin Kashyap Ramanandula Manjusha Junho Myung Junyeong Park Roma Patel Shyam Ratan Sudarsun Santhiappan Priyanka Suresh Tuesday Ksheeraj Sai Vepuri Laura Amortegui-Ordonez Claire Dennis Minsuk Kahng Chris Knotz Alice Oh Balaraman Ravindran Soojung Ryu William Bartholomew Hiwot Tesfaye Lora Aroyo
multimodal multilingual cultural alignment AI safety evaluation framework

Key Findings

Methodology

Pluralis builds a culture-first multimodal dataset combining text and images, introducing Judge-Pluralis, an LLM-based evaluator trained on cultural taxonomy.

Key Results

  • Result 1: Across six Asia-Pacific regions and eight languages, VLMs exhibit systematic failures in cultural alignment, such as image misidentifications causing downstream harm.
  • Result 2: Judge-Pluralis achieves high consistency in multilingual evaluations, with Cohen's kappa reaching 0.82.
  • Result 3: Experiments reveal regional cultural safety issues that global metrics fail to capture.

Significance

This study pioneers cultural alignment as a core dimension of AI safety evaluation, addressing blind spots in global AI deployments.

Technical Contribution

Introduces a culture-first multimodal evaluation framework, develops an LLM-based evaluator, and establishes cultural taxonomy, enhancing safety assessment in multilingual environments.

Novelty

Pluralis is the first safety-oriented multimodal dataset built entirely from a culture-first perspective, contrasting with existing Anglosphere-centric datasets.

Limitations

  • Limitation 1: Dataset covers only Asia-Pacific regions, excluding other cultural areas.
  • Limitation 2: Judge-Pluralis performance in low-resource languages needs improvement.

Future Work

Future directions include expanding to more regions and languages and exploring cultural alignment in generative AI.

AI Executive Summary

Current AI safety frameworks are predominantly Western-centric, overlooking regional laws and cultural nuances. Pluralis v0.1 proposes a culture-first multimodal evaluation framework, spanning six Asia-Pacific regions and eight languages with 6,448 prompts. By combining text and image inputs, the framework identifies systematic failures in VLMs' cultural alignment, such as image misidentifications leading to legal or cultural violations.

The study introduces Judge-Pluralis, an LLM-based evaluator trained on cultural taxonomy, which distinguishes universal safety issues from cultural appropriateness. Experimental results show that existing global metrics fail to capture regional cultural safety concerns, while Pluralis effectively exposes these blind spots.

This research provides a new perspective for global AI deployment but requires expansion to more regions and languages and optimization for low-resource language evaluations. The authors urge the community to further explore multilingual and multicultural AI evaluation methods to support global AI cultural alignment.

Deep Analysis

Background

Current AI safety frameworks focus on universal harms, often neglecting regional cultural nuances. Existing methods like MLCommons AILuminate prioritize global consensus but fail to address cultural alignment.

Core Problem

VLMs deployed globally often overlook cultural nuances, leading to legal or cultural violations, such as recommending prohibited items or actions in specific regions. Current frameworks cannot address these issues.

Innovation

Pluralis pioneers a culture-first multimodal dataset and develops Judge-Pluralis, an LLM-based evaluator trained on cultural taxonomy, significantly improving safety assessment in multilingual environments.

Methodology

  • �� Culture-first dataset creation: prompts designed by regional experts.
  • �� Multimodal pairing: combining text and images to trigger cultural safety issues.
  • �� Judge-Pluralis: LLM-based evaluator trained to distinguish universal safety from cultural appropriateness.

Experiments

Experiments span six Asia-Pacific regions and eight languages, using three VLM models to analyze cultural alignment failures and Judge-Pluralis consistency.

Results

Experiments reveal systematic failures in VLMs' cultural alignment, such as image misidentifications causing downstream harm. Judge-Pluralis demonstrates high consistency in multilingual evaluations.

Applications

The framework can be used for cultural alignment evaluation in global AI deployments, supporting safety validation in multilingual environments.

Limitations & Outlook

Dataset covers only Asia-Pacific regions; Judge-Pluralis performance in low-resource languages needs optimization.

Plain Language Accessible to non-experts

Imagine you're working at an international gift shop, and customers ask, 'Can I gift this?' Pluralis acts like a smart assistant, analyzing the cultural background and language to ensure the gift is appropriate and avoids cultural taboos.

ELI14 Explained like you're 14

Imagine you're playing an international simulation game where your task is to gift items to people from different countries. Pluralis is like your game assistant, telling you what gifts are taboo in certain cultures — like gifting a clock in China, which sounds like 'attending a funeral'! Cool, right?

Glossary

Multimodal

AI methods combining text and images.

Used to evaluate cultural safety issues in text-image pairs.

Culture-first

Dataset creation method prioritizing cultural perspectives.

Ensures prompts align with local cultural norms.

Judge-Pluralis

LLM-based evaluator trained on cultural taxonomy.

Distinguishes universal safety from cultural appropriateness.

VLM (Vision-Language Model)

AI models processing both images and text.

Evaluated for performance in multilingual and multicultural settings.

Cohen's kappa

Statistical measure of evaluation consistency.

Used to validate Judge-Pluralis reliability.

Open Questions Unanswered questions from this research

  • 1 How to expand to more cultural regions?
  • 2 How to optimize evaluations for low-resource languages?

Applications

Immediate Applications

Cultural alignment evaluation

Helps AI avoid cultural taboos in global deployments.

Multilingual safety validation

Supports AI safety testing in multilingual environments.

Long-term Vision

Global cultural alignment AI

Develop AI systems capable of understanding all cultural contexts.

Abstract

Current AI safety evaluation and benchmarking frameworks predominantly rely on Western-centric culture-agnostic defaults that mask critical regional laws, socio-linguistic nuances, and cultural taboos, leaving Vision-Language Models (VLMs) vulnerable in global deployments. We introduce Pluralis v0.1: a novel multimodal, multi-regional, and multilingual dataset built from a culture-first perspective. Spanning 6,448 prompts across six Asia-Pacific countries (Bangladesh, India, Korea, Pakistan, Singapore, Taiwan) and eight languages, Pluralis diverges from prior work by natively sourcing localized safety hazards rather than adapting Western datasets. Crucially, it introduces a multimodal evaluation paradigm: user text (e.g., "Should I gift this?") and an image referring to "this" (e.g., a clock) - both innocuous in isolation, but synergistically triggering specific legal or cultural violations. Pluralis disentangles universal safety violations from localized cultural appropriateness, establishing the latter as a first-class evaluation axis. To operationalize this, we present Judge-Pluralis, an agreement-gated LLM-as-a-Judge ensemble trained on examples classified in an empirically derived cultural taxonomy. Observing VLM behavior on a subset of the Pluralis surfaces recurring, locale-specific failure modes such as image misidentifications with downstream harm, missed item-context-locale interactions, and inadequate refusals. These failure modes vary systematically across locales and languages, exposing blind spots that globally averaged metrics conceal. Ultimately, Pluralis is not presented as a solved evaluation framework for cultural alignment, but rather as a first step and catalyst for future innovation. We call upon the research community to utilize this foundation to advance the science of multilingual, multicultural evaluation to better support AI cultural alignment globally.

cs.CL cs.CY