QuranicMMLU: A Cognitively-Aware Benchmark for Evaluating Generative AI Solutions on Quranic Linguistic Knowledge

TL;DR

QuranicMMLU基准评估生成式AI在古兰经语言知识上的表现,平均多选准确率84%。

cs.CL 🔴 高级 2026-09-19 29 次浏览
Rawan El Ghali Umm Kulsoom Anas Madkoor Dima Faris Alsaudi Roaa Abdelmagid Roaa Ibrahim Raghad Mousa Hamza Aljaji Abdullah Khanafer Abdallah Alkanani Salah Feras Alali Rawan Khaled Mohamed Ehsaneddin Asgari
生成式AI 古兰经 语言学 认知评估 自然语言处理

核心发现

方法论

研究构建了一个五大支柱的古兰经语言学分类法,涵盖音韵学、形态学、句法学、语义学和语用学。每个分支生成问题,并根据Bloom认知水平进行分层,使用LLM进行独立回答和评分,最后由人工审核。

关键结果

  • 在多选题中,伊斯兰专业模型表现最佳,平均准确率为96.4%,而开放式问题的平均质量得分为60%。
  • 多选题的准确率平均为84%,而开放式问题的得分仅为60%,显示出多选题可能掩盖了模型的缺陷。
  • 多选和开放式问题的排名高度一致(Kendall's τ=0.73),但多选题可能隐藏了在开放式问题中暴露的失败。

研究意义

QuranicMMLU提供了一个严格的语言学基础框架,用于评估古兰经领域的阿拉伯语NLP能力。它填补了现有基准未能涵盖的语言能力多样性和认知需求层次的评估空白。

技术贡献

该研究提出了一个新的五支柱分类法,结合了多种问题格式和多评审协议,系统地评估了认知水平和经文困惑度维度的知识。

新颖性

这是第一个将古兰经语言学复杂性分层评估的基准,提供了比现有伊斯兰和古兰经QA资源更细致的语言能力评估。

局限性

  • 开放式问题的评分完全依赖于LLM,可能引入模型偏见。
  • 没有评估闭源商业模型,因为无法访问其API。

未来方向

未来工作包括扩展叶子覆盖范围,增加开放式答案的人类评分,以及评估更多伊斯兰专业化系统。

AI 总览摘要

QuranicMMLU是一个新的基准,用于评估生成式AI在古兰经阿拉伯语上的表现。现有的基准主要集中在一般问答和语义检索,而没有深入探讨具体的语言能力或按认知需求和经文难度进行分层。

该研究构建了一个五大支柱的古兰经分类法,涵盖音韵学、形态学、句法学、语义学和语用学。每个分支生成问题,并根据Bloom认知水平和经文困惑度进行分层,然后由LLM独立回答和评分,最后由人工审核。

结果显示,伊斯兰专业模型在多选题中表现最佳,平均准确率为96.4%,而开放式问题的平均质量得分为60%。这表明多选题可能掩盖了模型的缺陷。QuranicMMLU为评估古兰经领域的阿拉伯语NLP能力提供了一个严格的语言学基础框架。

深度分析

研究背景

古兰经是近二十亿穆斯林的主要宗教和文化文本,理解其语言和内容需要的不仅仅是阅读。随着大型语言模型在伊斯兰话题上的应用增加,准确、细致地评估它们对古兰经阿拉伯语的理解能力变得至关重要。

核心问题

现有的伊斯兰和古兰经问答资源主要评估事实和推理能力,但没有针对古兰经理解所需的语言能力多样性进行评估。

核心创新

QuranicMMLU通过构建一个五大支柱的古兰经分类法,涵盖音韵学、形态学、句法学、语义学和语用学,提供了一个细致的语言能力评估框架。

方法详解

  • �� 构建五大支柱的古兰经分类法
  • �� 根据Bloom认知水平和经文困惑度生成问题
  • �� 使用LLM独立回答和评分
  • �� 进行人工审核和裁定

实验设计

研究使用了980个人工审核的问题,涵盖五大支柱的语言能力。每个问题以开放式和多选形式发布,并在12个系统上进行了基准测试。

结果分析

伊斯兰专业模型在多选题中表现最佳,平均准确率为96.4%,而开放式问题的平均质量得分为60%。多选题的准确率平均为84%,显示出多选题可能掩盖了模型的缺陷。

应用场景

QuranicMMLU为评估古兰经领域的阿拉伯语NLP能力提供了一个严格的语言学基础框架,适用于研究人员和开发人员。

局限与展望

开放式问题的评分完全依赖于LLM,可能引入模型偏见。没有评估闭源商业模型,因为无法访问其API。

通俗解读 非专业人士也能看懂

想象你在学习一门新语言,而这门语言有着复杂的语法和词汇规则。QuranicMMLU就像一个详细的学习指南,帮助你理解这些复杂的规则。它不仅仅是一个简单的问答工具,而是一个全面的评估系统,帮助你在不同的语言层次上测试自己的理解能力。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,这个游戏有很多关卡,每一关都有不同的挑战。QuranicMMLU就像是这个游戏的攻略,帮助你一步步通过每个关卡。它不仅仅是给你答案,而是教你如何理解和解决问题。是不是很酷?

术语表

Phonology (音韵学)

研究语言声音系统的学科,涉及发音和音位。

用于评估古兰经中的发音规则。

Morphology (形态学)

研究词形变化和构词规则的学科。

用于分析古兰经中的词根和词形变化。

Syntax (句法学)

研究句子结构和语法规则的学科。

用于解析古兰经中的句子结构。

Semantics (语义学)

研究词汇和句子的意义和解释的学科。

用于理解古兰经中的词义和句义。

Pragmatics (语用学)

研究语言使用和语境意义的学科。

用于分析古兰经中的语境和交际功能。

开放问题 这项研究留下的未解疑问

  • 1 如何更好地评估开放式问题的答案质量,尤其是在没有人工参与的情况下。
  • 2 如何扩展基准以涵盖更多的语言现象和认知层次。

应用场景

近期应用

语言能力评估

研究人员可以使用QuranicMMLU来评估生成式AI在古兰经语言知识上的表现。

远期愿景

教育工具

QuranicMMLU可以发展成为一个教育工具,帮助学习者更好地理解古兰经语言。

原文摘要

We introduce QuranicMMLU, a benchmark for evaluating generative AI on Quranic Arabic across multiple dimensions of linguistic complexity. Existing Quranic benchmarks center on general question answering and semantic retrieval, without probing specific linguistic competencies or stratifying by cognitive demand and verse difficulty. We construct a five-pillar Quranic taxonomy spanning Phonology, Morphology, Syntax, Semantics, and Pragmatics, with 31 leaves covering phenomena from tajwīd and root-and-pattern morphology to occasions of revelation and inter-surah coherence. For each leaf we generate questions stratified by Bloom's cognitive level and verse perplexity, then have LLM as a judge to independently answer and score every item and route the annotations to manual review. The resulting dataset comprises 980 human-reviewed questions, each issued in both open-ended and multiple-choice form. We benchmark 12 systems on these items and find that the Islamic-specialized model leads, yet every system scores higher on multiple-choice accuracy (average 84%) than open-ended answer quality (average 60%): the two rankings agree closely (Kendall's τ=0.73), but multiple-choice scoring hides failures that surface only once answer choices are removed. QuranicMMLU thus offers a rigorous, linguistically grounded framework for evaluating Arabic NLP in the Quranic domain.

cs.CL