LFQA-HP-1M: A Large-Scale Human Preference Dataset for Long-Form Question Answering

TL;DR

提出LFQA-HP-1M数据集,基于九项评分指标评估长文问答质量,模型表现与人类偏好相当。

cs.CL 🔴 高级 2026-02-27 43 次浏览
Rafid Ishrak Jahan Fahmid Shahriar Iqbal Sagnik Ray Choudhury
长文问答 人类偏好 评估指标 大规模数据集 模型鲁棒性

核心发现

方法论

本文构建了1.3百万对人类偏好标注的长文问答数据集LFQA-HP-1M,整合多源数据并采用问答过滤策略。提出九项细粒度评分指标,结合逻辑回归模型和SOTA大模型(如GPT-4)进行偏好预测。系统分析模型的传递性、一致性和对抗鲁棒性,验证线性模型在可解释性和性能上的优势。

关键结果

  • LFQA-HP-1M涵盖300K个独立问题,偏好判定准确率达68%,模型表现与GPT-4(69%)相近。九项评分指标中,连贯性和完整性为偏好最强指标,相关性和语法为负向指标。线性模型在偏好预测中表现优异,验证了指标的解释性。
  • 模型在偏好一致性和偏见检测方面表现良好,传递性检验显示模型偏好具有一定的逻辑一致性,但存在长度和位置偏差。对抗性扰动实验表明模型对语义保持的微调敏感性较低,鲁棒性有待提升。
  • 该数据集和评估框架为长文问答的透明、可解释和可靠评价提供了基础,有助于推动自动化偏好判断和模型优化,解决现有指标缺乏细粒度和透明度的问题。

研究意义

本研究填补了长文问答偏好数据的空白,提供了规模最大、标注细粒度的公开数据集,推动了偏好导向的自动评估方法发展。其基于九项评分的框架增强了评估的透明度和可解释性,为未来模型优化和偏好对齐提供了理论基础。对行业而言,有助于提升问答系统的用户满意度和可信度,推动人机交互的智能化升级。

技术贡献

本文提出了结合九项细粒度评分指标的偏好预测模型,验证了线性模型在可解释性和性能上的竞争优势。创新在于系统分析偏好模型的传递性和偏见,提出了基于对抗扰动的鲁棒性评估方法。此外,构建了规模最大的人类偏好长文问答数据集LFQA-HP-1M,为自动化偏好判断提供了丰富资源。

新颖性

首次大规模公开长文问答偏好数据集,结合九项评分指标实现透明评估。不同于传统的单一指标或黑箱模型,提出基于多维评分的可解释偏好预测框架,增强了评估的透明度和鲁棒性。该方法在模型偏好判定中展现出优越的性能和解释能力,具有较强创新性。

局限性

  • 模型在极端偏好或复杂语义扰动下表现仍有限,偏好一致性受限于评分指标的全面性。
  • 对抗扰动实验未覆盖所有潜在攻击场景,鲁棒性仍需提升。
  • 数据集偏向英文和特定领域,跨语言和多领域适应性有待验证。

未来方向

未来将扩展多语言、多领域偏好数据,提升模型的泛化能力。探索更丰富的偏好指标和鲁棒性增强技术,结合人类反馈优化模型偏好对齐。还将研究偏好模型的动态适应能力,以应对不断变化的用户需求和语境变化。

AI 总览摘要

长文问答(LFQA)作为人工智能中的一项核心任务,旨在生成详尽、结构合理的多句回答,满足复杂问题的解答需求。然而,现有评估指标如ROUGE、BLEU等在反映人类偏好方面表现不足,限制了模型的优化与应用。为解决这一问题,本文提出LFQA-HP-1M数据集,汇集了来自多源的1.3百万对人类偏好标注,涵盖300K个独立问题,构建了规模最大且标注细粒度的偏好数据资源。通过九项评分指标(如完整性、连贯性、事实性等),实现了对长文回答的多维度、透明化评估。实验显示,基于这些指标的线性模型在偏好预测中与GPT-4等先进模型表现相当,验证了指标的解释性和有效性。同时,系统分析模型的偏见和鲁棒性,发现其对长度、位置偏差敏感,但对语义扰动具有一定鲁棒性。这一框架不仅提升了长文问答的自动化偏好评估的透明度,也为未来模型偏好对齐和优化提供了理论基础。未来工作将扩展多语言、多领域数据,增强模型的泛化能力和鲁棒性,推动人机交互的智能化发展。整体而言,本研究为长文问答的评估提供了新思路和丰富资源,有望引领行业向更可靠、更可解释的方向迈进。

深度分析

研究背景

长文问答(LFQA)近年来成为自然语言处理的重要研究方向,旨在生成详细、逻辑连贯的多句回答,满足复杂问题的解答需求。早期工作如SQuAD、NarrativeQA、ELI5等提供了基础数据集,但多依赖参考答案,难以反映多样化偏好。近年来,随着大规模预训练模型的发展,LFQA的生成质量显著提升,但评估仍面临挑战,尤其是偏好偏差和指标缺乏透明性。现有指标如ROUGE、BERTScore等在反映人类偏好方面表现有限,模型偏好判定多依赖黑箱模型,缺乏可解释性。部分研究如Rosset等提出偏好一致性原则,但缺乏规模化数据支持。本文在此背景下,构建了规模最大、细粒度的偏好数据集,结合多维评分指标,推动了评估方法的革新。

核心问题

当前长文问答评估主要依赖参考文本或单一指标,难以全面反映人类偏好。模型偏好判定存在偏见(如长度、位置偏差)且缺乏透明度,限制了模型优化和偏好对齐的有效性。缺少大规模、细粒度、公开的偏好数据集,导致评估结果不够可靠,难以指导模型改进。此外,模型鲁棒性不足,容易受到微调或对抗扰动影响,影响实际应用中的稳定性和可信度。

核心创新

本文的核心创新在于:1)构建规模最大、标注细粒度的LFQA偏好数据集LFQA-HP-1M,涵盖多源、多领域;2)提出九项评分指标(如完整性、连贯性、事实性),实现多维度、透明化评估;3)验证线性模型在偏好预测中的竞争优势,增强模型可解释性;4)系统分析模型偏见和鲁棒性,提出对抗扰动评估方法,提升模型稳定性。这些创新突破了传统单一指标和黑箱模型的局限,为偏好导向的自动评估提供了新思路。

方法详解

  • �� 数据采集:整合SHP-2、LFQA Eval、Chatbot Arena等多源偏好数据,筛选长文问答。• LFQA定义:制定严格的长文问答定义,排除非长文问题。• 过滤策略:采用问答提示和模型筛选,确保数据质量。• 指标设计:提出九项评分指标,结合LLM(如G-EVAL、Veriscore)自动评估。• 模型训练:用逻辑回归模型结合指标预测偏好,验证指标有效性。• 鲁棒性分析:测试模型传递性、偏见和对抗扰动,评估稳定性。

实验设计

  • �� 数据集:LFQA-HP-1M,包含300K问题对。• 评估指标:偏好准确率68%,与GPT-4(69%)相近。• 模型:线性逻辑回归、GPT-4、Gemini-2.5等。• 设计:随机抽样偏好样本,验证指标预测能力。• 其他:偏好一致性检验、偏见检测、对抗扰动测试。

结果分析

  • �� 线性模型在偏好预测中达68%准确率,表现接近GPT-4。• 九项指标中,连贯性和完整性为偏好最强指标,相关性和语法为负向指标。• 模型偏好具有一定传递性,但存在长度和位置偏差。• 对抗扰动实验显示模型对微调保持一定鲁棒性,但仍存在提升空间。

应用场景

  • �� 立即应用:自动化长文问答评价,提升模型偏好对齐效率。• 长远愿景:实现可解释、透明的偏好评估体系,推动个性化问答系统和人机交互的智能化发展。

局限与展望

  • �� 当前偏好模型对极端偏好和复杂语义扰动敏感,鲁棒性不足。• 数据集偏向英文和特定领域,跨语言适应性有限。• 评估指标仍需丰富,未来需结合用户反馈持续优化。

通俗解读 非专业人士也能看懂

想象你在一家厨房做饭,厨师需要判断哪份菜更好吃。传统方法可能只看颜色或味道的描述,但这不能完全反映大家的喜好。现在,厨师用了一套评分标准,比如菜的完整度、味道是否浓郁、摆盘是否漂亮、是否符合健康要求等。每一道菜都根据这些标准打分,然后用一个简单的公式,结合这些分数,判断哪份菜更受大家喜欢。这就像我们用九个不同的尺子量一份长文问答,最后用一个透明的公式告诉我们哪份回答更符合人类偏好。这种方法比单纯看答案是否正确更公平、更直观,也能帮助厨师不断改进菜肴,满足不同人的口味。

简单解释 像给14岁少年讲一样

你知道吗?当你在网上问问题,别人给你答案,有些答案比其他的更受欢迎。科学家们也在研究,怎么让电脑判断哪个答案更好。以前的方法就像只看答案是不是拼写正确,或者是不是用了一些关键词,但这些都不能完全反映人们的喜好。现在,研究人员设计了一套“评分尺子”,比如答案是不是完整、是不是有逻辑、是不是很有趣、是不是很准确。他们用这些尺子给每个答案打分,然后用一个简单的公式,告诉电脑哪个答案更符合人类的偏好。这样,电脑就能更聪明地判断答案的好坏,也能帮人们找到更满意的回答。这就像你用多个标准来评价一份作业,最后得出一个公平的结论。

原文摘要

Long-form question answering (LFQA) demands nuanced evaluation of multi-sentence explanatory responses, yet existing metrics often fail to reflect human judgment. We present LFQA-HP-1M, a large-scale dataset comprising 1.3M human pairwise preference annotations for LFQA. We propose nine rubrics for answer quality evaluation, and show that simple linear models based on these features perform comparably to state-of-the-art LLM evaluators. We further examine transitivity consistency, positional bias, and verbosity biases in LLM evaluators and demonstrate their vulnerability to adversarial perturbations. Overall, this work provides one of the largest public LFQA preference datasets and a rubric-driven framework for transparent and reliable evaluation.

cs.CL cs.AI cs.IR