GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models
GSM-Plus-BN通过扰动的孟加拉语数学推理数据集评估LLM,GPT-OSS-20B在标准提示下达96.08%准确率。
核心发现
方法论
研究提出了GSM-Plus-BN,一个基于英语GSM-Plus的孟加拉语数学推理数据集,包含1,000个种子问题和8,000个扰动变体。评估了六种开源LLM,包括Qwen3-32B、Llama-3.1-8B、Llama-3.3-70B等,使用标准提示和链式思维提示进行测试。
关键结果
- GPT-OSS-20B在标准提示下对种子问题的准确率为96.08%,表现最佳。
- Llama-3.3-70B和GPT-OSS-120B在多种扰动类型下表现出更高的鲁棒性。
- 链式思维提示显著提升了大多数模型的推理能力,但与英语基准相比,所有模型在孟加拉语中的表现仍有显著差距。
研究意义
该研究填补了孟加拉语数学推理领域的空白,提供了首个系统性评估LLM在低资源语言下数学推理能力的基准。通过分析模型在不同扰动类型下的表现,揭示了模型在低资源语言环境中的鲁棒性和理解能力的不足。
技术贡献
技术贡献包括引入了GSM-Plus-BN数据集,涵盖八种扰动类型;首次系统性评估了六种LLM在孟加拉语数学推理中的表现;分析了链式思维提示对推理能力的提升效果。
新颖性
这是首个基于扰动的孟加拉语数学推理基准,填补了低资源语言数学推理研究的空白。与现有的英语基准相比,GSM-Plus-BN提供了跨语言评估的可能性。
局限性
- 模型在孟加拉语中的表现显著低于英语,表明现有LLM在低资源语言中的适应性有限。
- 数据集的扰动类型虽然多样,但未涵盖更复杂的数学问题。
- 实验仅限于六种开源模型,未涉及闭源模型如GPT-4。
未来方向
未来可以扩展数据集以涵盖更多复杂问题,探索针对低资源语言的专用预训练方法,并研究如何进一步优化链式思维提示的效果。
AI 总览摘要
数学推理是评估大语言模型(LLM)认知能力的重要领域,但现有研究主要集中在英语等高资源语言上,忽视了孟加拉语等低资源语言。GSM-Plus-BN是首个基于扰动的孟加拉语数学推理数据集,包含1,000个种子问题和8,000个扰动变体,旨在评估LLM在低资源语言环境下的鲁棒性和推理能力。
研究评估了六种开源LLM,包括Qwen3-32B、Llama-3.3-70B和GPT-OSS-20B,采用标准提示和链式思维提示两种策略。结果显示,GPT-OSS-20B在标准提示下对种子问题的准确率达到96.08%,而Llama-3.3-70B和GPT-OSS-120B在多种扰动类型下表现更为鲁棒。链式思维提示显著提升了大多数模型的推理能力,但与英语基准相比,所有模型在孟加拉语中的表现仍有显著差距。
该研究不仅填补了孟加拉语数学推理领域的空白,还为未来的低资源语言研究提供了重要的基准和方向。未来的工作可以包括扩展数据集、优化提示策略以及开发更适合低资源语言的模型。
深度分析
研究背景
数学推理是LLM评估的重要领域,现有研究多集中于英语。GSM8K等数据集推动了英语数学推理的研究,但低资源语言如孟加拉语的研究严重不足。孟加拉语是全球第七大语言,拥有超过3亿使用者,但在NLP领域资源匮乏,尤其是复杂推理任务。
核心问题
现有LLM在低资源语言中的数学推理能力缺乏系统性评估,尤其是在面对扰动输入时。孟加拉语数学推理的研究不仅稀缺,而且缺乏与英语基准的可比性。
核心创新
GSM-Plus-BN是首个基于扰动的孟加拉语数学推理数据集,涵盖八种扰动类型,包括数值替换、算术变体、问题重述等。研究还首次系统性评估了六种开源LLM在孟加拉语数学推理中的表现。
方法详解
- �� 数据集构建:从GSM-Plus中提取1,000个种子问题,生成8,000个扰动变体。
- �� 模型选择:评估Qwen3-32B、Llama-3.1-8B、Llama-3.3-70B等六种模型。
- �� 提示策略:采用标准提示和链式思维提示两种方法。
- �� 性能评估:分析模型在不同扰动类型下的表现,比较与英语基准的差距。
实验设计
实验使用GSM-Plus-BN数据集,包含9,000个问题样本。评估了六种LLM在标准提示和链式思维提示下的表现。实验还分析了模型在不同扰动类型下的鲁棒性。
结果分析
GPT-OSS-20B在标准提示下对种子问题的准确率为96.08%。Llama-3.3-70B和GPT-OSS-120B在多种扰动类型下表现更为鲁棒。链式思维提示显著提升了推理能力,但与英语基准相比仍有差距。
应用场景
GSM-Plus-BN可用于评估LLM在低资源语言中的推理能力,为教育、翻译和AI应用开发提供支持。
局限与展望
模型在孟加拉语中的表现显著低于英语,数据集未涵盖更复杂的数学问题,实验范围仅限于六种开源模型。
通俗解读 非专业人士也能看懂
想象一个人试图用不同的方式描述同一个问题,比如用不同的语言或改变问题的措辞。GSM-Plus-BN就像一个测试,看看AI是否能理解这些变化并正确回答问题。这种测试帮助我们评估AI是否真的理解问题,而不仅仅是记住了答案。
简单解释 像给14岁少年讲一样
想象你在学校里做数学题,但老师把题目改了,比如换了数字或者用不同的语言写题目。GSM-Plus-BN就是这样一个测试,看看AI能不能像你一样灵活地理解和解答这些变化后的题目!
术语表
GSM-Plus-BN
一个孟加拉语数学推理数据集,包含扰动问题,用于评估LLM的鲁棒性。
论文中用于测试模型在低资源语言中的表现。
链式思维提示
一种提示策略,鼓励模型逐步推理以提高准确性。
用于提升模型的数学推理能力。
扰动类型
对问题进行修改的方式,如数值替换、问题重述等。
用于评估模型对输入变化的鲁棒性。
低资源语言
在NLP研究中资源匮乏的语言,如孟加拉语。
研究的目标语言。
鲁棒性
模型在面对输入变化时保持性能的能力。
评估模型是否真正理解问题。
开放问题 这项研究留下的未解疑问
- 1 如何提高LLM在低资源语言中的数学推理能力?
- 2 如何设计更复杂的扰动类型以更全面地评估模型?
应用场景
近期应用
教育评估
用于开发适合孟加拉语的智能教育工具,帮助学生学习数学。
多语言AI
提升AI在多语言环境下的表现,特别是低资源语言。
远期愿景
全球化AI系统
开发适用于所有语言的通用AI推理系统,消除语言障碍。
原文摘要
The evaluation of mathematical reasoning in large language models (LLMs) has predominantly focused on high-resource languages like English. This has created a significant barrier to the equitable development and deployment of AI in linguistically diverse regions such as Bangladesh, where over 230 million people speak Bengali. Despite this global significance, there has been minimal prior work on mathematical reasoning in Bengali and no existing research that systematically benchmarks a perturbated Bengali mathematical dataset, leaving a critical void in assessing model robustness and true comprehension beyond pattern recognition. This study addresses this gap by introducing GSM-Plus-BN, a novel perturbated Bengali mathematical dataset derived from the English GSM-Plus benchmark and verified by human translators. We evaluate six open-source LLMs Qwen3-32B, Llama-3.1-8B-Instant, Llama-3.3-70B-Versatile, Llama-4-Scout-17B-16E-Instruct, GPT-OSS-120B, and GPT-OSS-20B using a benchmark of 9,000 evaluation samples comprising 1,000 seed questions and 8,000 perturbed variants under both Standard Prompting and Chain-of-Thought (CoT) Prompting. Experimental results show that GPT-OSS-20B achieves the highest seed question accuracy of 96.08% under Standard Prompting, while larger models such as Llama-3.3-70B and GPT-OSS-120B demonstrate superior robustness across perturbation types. Furthermore, CoT prompting substantially improves reasoning for most models compared to Standard Prompting, yet a notable performance gap persists across all models relative to their English benchmarks, underscoring the inherent difficulty of perturbed Bengali text. This research makes a foundational contribution by providing GSM-PLUS-BN as a new resource and baseline for future Bengali mathematical reasoning research.