Bi'an: A Bilingual Benchmark and Model for Hallucination Detection in Retrieval-Augmented Generation

TL;DR

Bi'an框架结合双语基准和轻量级模型,有效检测RAG中的幻觉内容。

cs.CL 🔴 高级 2025-02-26 53 次浏览
Zhouyu Jiang Mengshu Sun Zhiqiang Zhang Lei Liang
AI 自然语言处理 模型评估 多语种 幻觉检测

核心发现

方法论

本研究提出Bi'an框架,构建了包含中英双语、多任务、多领域的基准数据集Bi'anBench,涵盖问答、摘要、数据转文本、机器翻译等场景。利用GPT-4o作为合成模型,通过问答扰动和反事实生成,生成22,992个高质量测试样本。模型训练采用分层采样、集成式样本构建、监督微调(SFT)结合直接偏好优化(DPO),基于7B和14B参数的Qwen2.5架构进行微调。模型在多任务、多场景下表现优异,尤其在检测幻觉方面超越参数规模更大的基线模型。

关键结果

  • 14B参数的Bi'an模型在Bi'anBench上平均准确率达88.2%,超越五倍参数规模的基线模型Qwen2.5-72B-Instruct,接近GPT-4o的性能。在中英双语场景中,Bi'an-qwen-14B表现优异,特别在问答和摘要任务中,准确率分别达84.5%和69.6%。在幻觉检测的反事实QA子集,模型达到了93.3%的准确率,显示出强大的泛化能力。
  • 实验还验证了训练策略的有效性,微调阶段的性能提升明显,特别是SFT阶段带来的增益超过DPO阶段。模型在不同任务和场景中的表现差异揭示了模型规模和训练数据的重要性。
  • 在参数知识冲突分析中,发现较小模型在某些反事实场景优于大模型,提示参数知识丰富可能干扰幻觉检测。整体而言,Bi'an模型在保持较低计算成本的同时,达到了较高的检测准确率,展现出良好的应用潜力。

研究意义

本研究填补了RAG幻觉检测缺乏多语种、多场景基准的空白,为模型评估提供了系统性工具。通过构建轻量级模型,显著降低了部署门槛,推动了可信AI的发展。该框架不仅提升了模型对幻觉的识别能力,也为未来多模态、多任务的检测提供了基础,有助于增强大规模语言模型的实用性和可靠性。

技术贡献

提出多任务多场景的双语基准数据集Bi'anBench,结合合成和反事实数据生成管线,创新性地采用集成式样本构建和两阶段训练(SFT+DPO),实现对轻量模型的高效微调。模型在参数规模远小于SOTA闭源模型的情况下,达到接近其性能的水平,展示了微调策略的有效性。该方法提供了可扩展的幻觉检测解决方案,为模型的可信性和可解释性提供技术支撑。

新颖性

首次在多语种、多任务、多场景下系统性构建RAG幻觉检测基准,结合合成扰动和反事实生成,提出基于轻量模型的微调策略。不同于传统仅依赖大模型的检测方法,本研究强调模型微调的可扩展性和实用性,突破了闭源模型依赖的限制,推动了低成本高效的幻觉检测技术发展。

局限性

  • 模型在长文本处理和复杂推理任务中仍表现不足,尤其在数值计算和长上下文理解方面存在差距。部分反事实样本生成依赖GPT-4o,计算成本较高,限制了大规模应用。
  • 数据集虽覆盖多语种和多任务,但在创造性写作等主观任务上尚未覆盖,未来需扩展评估范围以应对更多实际场景。
  • 模型对知识冲突敏感,较大模型的丰富参数知识可能干扰幻觉检测,需进一步优化模型结构和训练策略。

未来方向

未来将探索多模态数据融合,提升模型在复杂场景中的表现。加强对知识冲突的理解与缓解策略,优化模型结构以提升长文本和推理能力。此外,将扩展数据集覆盖更多主观和创造性任务,推动模型在实际应用中的可信性和鲁棒性。

AI 总览摘要

随着大规模语言模型(LLMs)在各类应用中的广泛部署,幻觉问题逐渐成为制约其可靠性的重要瓶颈。现有的检测方法多依赖大模型,成本高昂且缺乏系统性评估工具。为此,本文提出Bi'an框架,结合双语、多任务、多场景的基准数据集Bi'anBench,系统性评估不同模型在RAG幻觉检测中的表现。

通过创新性地利用GPT-4o进行合成和反事实数据生成,构建了22,992个高质量测试样本,覆盖问答、摘要、数据转文本和机器翻译等场景。模型训练采用分层采样、集成样本构建、微调(SFT)结合直接偏好优化(DPO),基于7B和14B参数的Qwen2.5架构,显著提升了检测性能。在多任务、多场景评估中,14B模型的平均准确率达到88.2%,优于参数规模更大的基线模型,接近GPT-4o的性能。

实验还验证了训练策略的有效性,模型在反事实QA子集中的准确率达93.3%,展现出强大的泛化能力。研究发现,较小模型在某些反事实场景优于大模型,提示参数知识丰富可能干扰幻觉检测。该研究不仅提供了系统性评估工具,也为低成本、高效的模型部署提供了技术路径,推动了可信AI的发展。未来,将继续优化模型结构,扩展多模态和主观任务的检测能力,提升模型在实际场景中的应用价值。

深度分析

研究背景

近年来,LLMs在自然语言理解和生成方面取得巨大突破,但幻觉问题严重制约其应用。早期工作如GPT-3、BERT推动了模型能力提升,但幻觉仍是难以根除的难题。现有研究多关注模型微调和知识蒸馏,缺乏系统性、多语种、多场景的评估工具。HaluBench、RAGTruth等数据集虽提供基础,但在多任务、多领域、多语种方面仍不足。随着RAG技术的兴起,结合外部知识源的生成模型逐渐成为热点,但幻觉检测的系统性评价和模型优化仍待突破。

核心问题

当前幻觉检测多依赖大模型,成本高昂,难以推广。缺乏统一、多场景、多语种的基准数据集,导致模型在实际复杂场景中的表现难以评估。且,现有方法多忽视知识冲突和反事实场景,限制了检测的全面性和鲁棒性。如何构建高质量、多任务、多场景的基准,设计轻量级模型进行高效检测,成为亟待解决的问题。

核心创新

本研究的创新点包括:1)构建多语种、多任务、多场景的Bi'anBench,覆盖问答、摘要、数据转文本、机器翻译;2)采用GPT-4o进行合成扰动和反事实生成,丰富测试样本;3)提出集成式样本构建和两阶段训练(SFT+DPO),提升模型微调效率和性能;4)基于轻量模型(7B、14B)实现高性能检测,降低部署成本。这些创新突破了传统大模型依赖,提供了可扩展、低成本的解决方案。

方法详解

  • �� 构建Bi'anBench:采集中英多任务、多场景数据,利用问答、摘要、数据转文本、机器翻译任务,确保多样性和覆盖面。
  • �� 合成扰动:用GPT-4o对原始数据进行语义一致但事实不符的修改,生成扰动样本,模拟幻觉情况。
  • �� 反事实生成:开发反事实QA生成管线,合成具有支持证据或反证的问答对,丰富反事实样本库。
  • �� 样本构建:采用分层采样,从源数据中抽取训练集,结合集成模型(GPT-4o、Qwen2.5、Mini)生成判定结果,筛选正确和偏好样本。
  • �� 模型微调:通过SFT结合DPO,利用LoRA技术在7B和14B模型上进行训练,优化检测能力。
  • �� 训练流程:先进行监督微调,再结合偏好学习,确保模型在多任务场景下的泛化能力。

实验设计

在Bi'anBench的中英子集上,比较GPT-4o、Qwen2.5、Llama等模型的检测准确率。采用准确率作为评价指标,进行三次平均。重点关注模型参数规模与性能关系,验证训练策略的有效性。还设计了消融实验,分析不同训练阶段的贡献。通过反事实子集,评估模型对知识冲突的敏感性。实验结果显示,14B模型在多任务场景中表现优异,检测准确率达88.2%,优于大规模基线模型,验证了训练策略的有效性。

结果分析

模型在多任务、多场景下均表现出色,尤其在问答和摘要任务中,准确率超过80%。在反事实QA子集,模型达93.3%的准确率,显示出强泛化能力。训练策略的微调显著提升检测性能,验证了集成样本构建和两阶段训练的有效性。模型参数规模与性能呈正相关,但在知识冲突场景中,小模型表现优于大模型,提示知识干扰问题。

应用场景

该框架适用于企业级内容生成监控、问答系统的可靠性评估、知识库内容审核等场景。低成本的轻量模型便于部署在边缘设备或实时系统中,提升内容可信度。未来可结合多模态信息,拓展到图像、视频等多模态内容的幻觉检测,推动可信AI的落地。

局限与展望

模型在长文本和复杂推理任务中仍存在不足,尤其在数值和逻辑推理方面。部分反事实样本生成依赖高成本模型,限制大规模应用。数据集尚未覆盖创造性写作等主观任务,未来需扩展。知识冲突问题仍待优化,模型对知识丰富的场景敏感,影响检测效果。

通俗解读 非专业人士也能看懂

想象你在一家工厂里,工厂的任务是生产高质量的产品。这里的“产品”就是模型的输出,而“幻觉”就像工厂偶尔会出现的错误产品,比如颜色错了或尺寸不对。为了确保工厂出品的质量,工厂需要一套检测系统。传统上,这个检测系统很大很贵,像一台超级机器人,成本高,难以普及。现在,研究人员设计了一个新系统,像一个聪明的小助手,既能用中文也能用英文工作,能在不同的生产线上检测出错误产品。这个助手通过学习大量的样品,学会了识别哪些产品是“假货”。他们还用模拟的错误样品训练这个助手,让它更聪明。最终,这个小助手可以快速、准确地检测出错误,比以前的昂贵机器人更便宜、更灵活。这就像用一台小而强的机器,保证每个出厂的产品都符合标准,帮助工厂节省成本,提高效率。

简单解释 像给14岁少年讲一样

想象你在学校里,老师给你一份作业,要你判断一篇文章是不是有错误。以前,老师会用一个很大的机器人帮你检查,但这个机器人很贵,而且不容易每次都用。现在,科学家们发明了一个聪明的小助手,它可以用中文和英文工作,学习了很多不同类型的文章。这个小助手通过模拟错误的例子,学会了怎么找出文章里的谎话或不对的地方。它还用一种特别的方法,反复练习,变得越来越厉害。结果,这个小助手在检测文章中的错误方面表现得非常好,甚至比一些更大的机器人还要快还要准。这样,老师和学生都可以用它来保证作业的质量,节省时间,也让学习变得更有趣。这就像你有一个超级聪明的朋友,帮你快速找出文章里的问题,让你更容易学到正确的知识。

原文摘要

Retrieval-Augmented Generation (RAG) effectively reduces hallucinations in Large Language Models (LLMs) but can still produce inconsistent or unsupported content. Although LLM-as-a-Judge is widely used for RAG hallucination detection due to its implementation simplicity, it faces two main challenges: the absence of comprehensive evaluation benchmarks and the lack of domain-optimized judge models. To bridge these gaps, we introduce \textbf{Bi'an}, a novel framework featuring a bilingual benchmark dataset and lightweight judge models. The dataset supports rigorous evaluation across multiple RAG scenarios, while the judge models are fine-tuned from compact open-source LLMs. Extensive experimental evaluations on Bi'anBench show our 14B model outperforms baseline models with over five times larger parameter scales and rivals state-of-the-art closed-source LLMs. We will release our data and models soon at https://github.com/OpenSPG/KAG.

cs.CL