BenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali
BenHalluEval框架评估Bengali语言模型幻觉,BenHalluScore从7.72%到55.42%。
核心发现
方法论
BenHalluEval框架通过双轨协议评估Bengali语言模型幻觉,涵盖生成问答、Bangla-English混合问答、摘要和推理四个任务。使用GPT-5.4生成12,000个幻觉候选,并评估七个LLM。
关键结果
- 在QA任务中,GPT-4.1 mini的BenHalluScore为15.56%,表现最佳,而Mistral-nemo-12B表现最差,得分为53.84%。
- 在Bangla-English混合问答中,Qwen2.5-32B的表现显著提高,BenHalluScore为24.00%。
- TigerLLM-9B在Bengali特定任务中表现优于多语言模型,BenHalluScore为28.28%。
研究意义
BenHalluEval是首个专为Bengali设计的幻觉检测基准,填补了低资源语言领域的空白。它揭示了单轨和仅提示评估方法在低资源语言环境中的不足。
技术贡献
提出了BenHalluScore作为双轨校准指标,平衡错误率,避免统一响应偏差。该框架为低资源语言的幻觉检测提供了新的评估标准。
新颖性
BenHalluEval首次为Bengali语言提供了专门的幻觉检测基准,涵盖了本地Bengali和Bangla-English混合输入。
局限性
- 某些模型在幻觉检测中表现出系统性偏差,影响准确性。
- 低资源语言的幻觉评估仍然面临数据不足的问题。
未来方向
未来研究可探索更多低资源语言的幻觉检测,并改进模型在Bangla-English混合输入上的表现。
AI 总览摘要
BenHalluEval是首个专为Bengali语言设计的幻觉检测框架,填补了低资源语言领域的空白。该框架通过双轨协议评估语言模型在生成问答、Bangla-English混合问答、摘要和推理任务中的幻觉表现。使用GPT-5.4生成12,000个幻觉候选,并评估七个不同类别的LLM。实验结果显示,GPT-4.1 mini在QA任务中表现最佳,而Mistral-nemo-12B表现最差。BenHalluScore作为双轨校准指标,揭示了模型在幻觉检测中的系统性偏差。该研究强调了单轨和仅提示评估方法在低资源语言环境中的不足,并为未来的研究提供了方向。
BenHalluEval框架的技术贡献在于提出了BenHalluScore作为双轨校准指标,平衡错误率,避免统一响应偏差。该框架为低资源语言的幻觉检测提供了新的评估标准,具有重要的学术和工业意义。未来研究可探索更多低资源语言的幻觉检测,并改进模型在Bangla-English混合输入上的表现。
尽管BenHalluEval在幻觉检测方面取得了显著进展,但仍面临某些模型在幻觉检测中表现出系统性偏差的问题。此外,低资源语言的幻觉评估仍然面临数据不足的问题。未来研究可通过扩展数据集和改进模型来解决这些问题。
深度分析
研究背景
幻觉评估在不同语言中已有探索,但Bengali作为世界第六大语言,仍未有系统评估。现有的Bengali模型和多语言基准未能解决幻觉检测问题。
核心问题
Bengali语言模型生成的输出可能与已知事实相矛盾,导致幻觉现象。缺乏全面的幻觉基准,无法可靠评估LLM的可信度。
核心创新
BenHalluEval框架首次为Bengali语言提供专门的幻觉检测基准,涵盖本地Bengali和Bangla-English混合输入,采用双轨协议进行评估。
方法详解
- �� 使用GPT-5.4生成幻觉候选
- �� 评估七个LLM在四个任务上的表现
- �� 提出BenHalluScore作为双轨校准指标
- �� 验证三名Bengali注释者的标注一致性
实验设计
使用TyDiQA-GoldP、BanglaCHQ-Summ和SOMADHAN数据集,评估九个LLM在不同任务上的幻觉检测能力。实验设置包括双轨协议和链式思维提示。
结果分析
GPT-4.1 mini在QA任务中表现最佳,BenHalluScore为15.56%。Qwen2.5-32B在Bangla-English混合问答中表现显著提高,BenHalluScore为24.00%。
应用场景
BenHalluEval为低资源语言的幻觉检测提供了新的评估标准,适用于学术研究和工业应用。
局限与展望
某些模型在幻觉检测中表现出系统性偏差,影响准确性。低资源语言的幻觉评估仍然面临数据不足的问题。
通俗解读 非专业人士也能看懂
想象你在一个图书馆里,有些书籍的信息是错误的。BenHalluEval就像一个图书管理员,负责检查这些书籍是否包含幻觉信息。它通过四个任务来评估这些书籍:问答、混合问答、摘要和推理。每个任务都有特定的检查方法,确保信息的准确性。就像图书管理员要确保每本书的信息都是正确的,BenHalluEval也要确保语言模型生成的信息没有幻觉。
简单解释 像给14岁少年讲一样
想象你在玩一个游戏,游戏里的角色会告诉你一些信息,但有时候这些信息是错的。BenHalluEval就像一个游戏管理员,负责检查这些信息是否正确。它通过四个任务来评估这些信息:问答、混合问答、摘要和推理。每个任务都有特定的检查方法,确保信息的准确性。就像游戏管理员要确保每个角色的信息都是正确的,BenHalluEval也要确保语言模型生成的信息没有幻觉。
术语表
幻觉 (Hallucination)
模型生成的输出与已知事实相矛盾或与提供的上下文冲突。
在BenHalluEval中用于检测模型生成的幻觉信息。
双轨协议 (Dual-track protocol)
独立测量模型在真实实例上的误报率和在幻觉候选上的检测率。
用于评估模型在不同任务上的幻觉检测能力。
BenHalluScore
一种双轨校准指标,平衡错误率,避免统一响应偏差。
用于评估模型在幻觉检测中的表现。
链式思维提示 (Chain-of-thought prompting)
一种提示策略,通过引导模型进行多步推理来改善幻觉检测。
在BenHalluEval中用于评估模型的幻觉检测能力。
TyDiQA-GoldP
一个包含问题、段落和答案的Bengali数据集。
用于评估模型在问答任务上的幻觉检测能力。
开放问题 这项研究留下的未解疑问
- 1 如何改进模型在Bangla-English混合输入上的幻觉检测能力?
- 2 如何扩展数据集以提高低资源语言的幻觉检测准确性?
应用场景
近期应用
学术研究
BenHalluEval为低资源语言的幻觉检测提供了新的评估标准,适用于学术研究。
远期愿景
工业应用
该框架可用于改进低资源语言的语言模型,提升工业应用中的信息准确性。
原文摘要
Despite Bengali being the sixth most spoken language in the world, no prior work has systematically evaluated hallucination in large language models (LLMs) for Bengali. We introduce BenHalluEval, a fine-grained hallucination evaluation framework for Bengali covering four tasks: Generative Question Answering (GQA), Bangla-English Code-Mixed QA, Summarization, and Reasoning. We construct 12,000 hallucinated candidates using GPT-5.4 across twelve task-specific hallucination types, drawn from three existing Bengali datasets, and evaluate seven LLMs spanning reasoning-oriented, multilingual, and Bengali-centric categories under a dual-track protocol that independently measures false-positive rate on ground-truth instances (Track A) and hallucination detection rate on hallucinated candidates (Track B). To jointly penalise both failure modes and prevent inflated scores from uniform response bias, we propose BenHalluScore, a dual-track calibration metric that ranges from 7.72% to 55.42% across models and tasks, revealing substantial variation in hallucination calibration. Chain-of-thought prompting, applied as a mitigation strategy, shifts response distributions without consistently improving hallucination discrimination. BenHalluEval establishes the first dedicated hallucination benchmark for Bengali and highlights the inadequacy of single-track and prompting-only evaluation approaches for low-resource language settings. The dataset and code are available at https://anonymous.4open.science/r/BanglaHalluEval-EB77.