Large Language Models are not Fair Evaluators

TL;DR

通过校准框架解决大语言模型评估中的位置偏差,提升与人工一致性达14.3%。

cs.CL 🔴 高级 2023-05-29 37 次浏览
Peiyi Wang Lei Li Liang Chen Zefan Cai Dawei Zhu Binghuai Lin Yunbo Cao Qi Liu Tianyu Liu Zhifang Sui
大语言模型 评估偏差 校准框架 人工智能 公平性

核心发现

方法论

提出三种校准策略:多证据校准(MEC)生成多次评价证据;平衡位置校准(BPC)通过交换位置平均分数;人类参与校准(HITLC)基于位置多样性熵(BPDE)选择需人工干预的样本。

关键结果

  • Vicuna-13B在80个问题中胜率从ChatGPT评估的2.5%提升至82.5%,展示位置偏差显著影响。
  • MEC和BPC策略使GPT-4与人工一致性提升9.8%,ChatGPT提升14.3%。
  • HITLC在仅需20%人工干预情况下,将ChatGPT与人工一致性提升至71.3%,成本降低39%。

研究意义

研究揭示了当前使用LLM作为评估者的显著局限性,提出的校准框架显著改善评估公平性,为未来自动化评估方法的开发提供了重要方向。

技术贡献

首次系统揭示LLM评估中的位置偏差问题,提出结合多证据、位置平衡与人工干预的综合校准框架,显著提升评估可靠性。

新颖性

首次提出基于BPDE的人工干预策略,结合多证据与位置平衡校准,创新性解决LLM评估偏差问题。

局限性

  • 校准框架需额外计算资源,尤其是多证据采样。
  • BPDE阈值选择对结果敏感,需进一步优化。
  • 实验仅限于Vicuna Benchmark,需扩展到更多任务。

未来方向

未来可研究更高效的校准方法,探索跨任务通用性,并优化BPDE参数以减少人工干预需求。

AI 总览摘要

当前大语言模型(LLM)如GPT-4被广泛用于生成文本的质量评估,但研究发现其评估结果存在显著位置偏差。例如,仅通过交换候选响应的顺序即可显著改变评估结果,导致不公平性。论文揭示了这一问题的严重性,Vicuna-13B在ChatGPT评估下的胜率从2.5%到82.5%波动,表明LLM对位置极为敏感。

为解决这一问题,作者提出了一个三部分校准框架:多证据校准(MEC)通过生成多次评价证据稳定结果;平衡位置校准(BPC)通过交换位置平均分数消除偏差;人类参与校准(HITLC)基于位置多样性熵(BPDE)选择需人工干预的样本。实验表明,这些方法显著提升了GPT-4与ChatGPT的评估公平性,与人工一致性分别提升9.8%和14.3%。

尽管校准框架需要额外计算资源,尤其是多证据采样,但其在减少人工干预成本方面表现出色。未来研究可进一步优化BPDE参数,探索更高效的校准方法,并验证框架在更多任务中的通用性。研究为开发更公平的自动化评估方法奠定了基础。

深度分析

研究背景

随着大语言模型(LLM)的快速发展,其在文本生成任务中的表现令人瞩目。然而,如何评估这些模型生成的文本质量仍是一个挑战。传统的n-gram指标如BLEU和ROUGE已被证明不足以全面评估生成质量,而基于模型的评估方法如BERTScore也存在局限性。近年来,LLM本身被用作评估者,但其可靠性尚未得到充分验证。

核心问题

研究发现,LLM作为评估者存在显著位置偏差问题。例如,仅通过交换候选响应的顺序即可显著改变评估结果。这种偏差可能导致评估结果不公平,甚至被恶意利用,使得较差的模型看起来优于更强的模型。

核心创新

提出的校准框架包括三部分:1)多证据校准(MEC),通过生成多次评价证据稳定结果;2)平衡位置校准(BPC),通过交换位置平均分数消除偏差;3)人类参与校准(HITLC),基于位置多样性熵(BPDE)选择需人工干预的样本。

方法详解

  • �� 多证据校准:生成多次评价证据并取平均分数。
  • �� 平衡位置校准:交换候选响应位置并计算平均分数。
  • �� 人类参与校准:基于BPDE选择需人工干预的样本,结合人工和模型评估结果。

实验设计

实验使用Vicuna Benchmark的80个问题,涵盖9类任务。评估GPT-4和ChatGPT作为评估者的表现,比较不同校准策略的效果。主要指标包括与人工一致性和冲突率。

结果分析

MEC和BPC策略使GPT-4与人工一致性提升9.8%,ChatGPT提升14.3%。HITLC在仅需20%人工干预情况下,将ChatGPT一致性提升至71.3%,成本降低39%。

应用场景

校准框架可用于改进LLM在对话系统、内容生成和教育领域的评估公平性,尤其是在需要高可靠性评估的场景。

局限与展望

校准框架需额外计算资源,尤其是多证据采样。BPDE阈值选择对结果敏感,需进一步优化。实验仅限于Vicuna Benchmark,需扩展到更多任务。

通俗解读 非专业人士也能看懂

想象你在评比两位厨师的菜品,菜品的摆盘顺序却影响了你的判断。这就像GPT-4评估文本时对位置的偏好。研究提出了三种方法来解决这个问题:第一,要求厨师多次展示菜品(多证据校准);第二,交换菜品的摆盘顺序并平均分数(位置平衡校准);第三,邀请美食专家在有争议时提供意见(人工参与校准)。这些方法让评比结果更公平。

简单解释 像给14岁少年讲一样

想象你和朋友比赛写作文,老师评分时却总是偏爱第一个交的作业!这就是GPT-4评估时的位置偏差。研究提出了三招解决:1)让老师多次打分取平均;2)交换作业顺序再评分;3)请另一个老师帮忙评判争议。这些方法让评分更公平,也更接近真实水平!

术语表

多证据校准 (Multiple Evidence Calibration)

通过生成多次评价证据稳定评估结果。

用于减少单次评估的不稳定性。

平衡位置校准 (Balanced Position Calibration)

通过交换候选响应位置并平均分数消除位置偏差。

解决LLM对位置敏感的问题。

位置多样性熵 (Balanced Position Diversity Entropy)

衡量评估结果多样性的指标,用于选择需人工干预的样本。

用于HITLC策略中。

Vicuna Benchmark

一个包含80个问题的评估基准,涵盖9类任务。

用于评估LLM的表现。

冲突率 (Conflict Rate)

评估结果因位置变化而冲突的比例。

用于量化位置偏差的影响。

开放问题 这项研究留下的未解疑问

  • 1 BPDE参数选择对结果的影响机制尚不清楚。
  • 2 校准框架在更复杂任务中的通用性需进一步验证。

应用场景

近期应用

对话系统优化

改进聊天机器人评估的公平性,提升用户体验。

教育评估工具

用于自动化评分系统,确保评分结果更可靠。

远期愿景

通用评估框架

开发跨领域通用的公平评估方法,推动AI评估标准化。

原文摘要

In this paper, we uncover a systematic bias in the evaluation paradigm of adopting large language models~(LLMs), e.g., GPT-4, as a referee to score and compare the quality of responses generated by candidate models. We find that the quality ranking of candidate responses can be easily hacked by simply altering their order of appearance in the context. This manipulation allows us to skew the evaluation result, making one model appear considerably superior to the other, e.g., Vicuna-13B could beat ChatGPT on 66 over 80 tested queries with ChatGPT as an evaluator. To address this issue, we propose a calibration framework with three simple yet effective strategies: 1) Multiple Evidence Calibration, which requires the evaluator model to generate multiple evaluation evidence before assigning ratings; 2) Balanced Position Calibration, which aggregates results across various orders to determine the final score; 3) Human-in-the-Loop Calibration, which introduces a balanced position diversity entropy to measure the difficulty of each example and seeks human assistance when needed. We also manually annotate the "win/tie/lose" outcomes of responses from ChatGPT and Vicuna-13B in the Vicuna Benchmark's question prompt, and extensive experiments demonstrate that our approach successfully mitigates evaluation bias, resulting in closer alignment with human judgments. We release our code and human annotation at \url{https://github.com/i-Eval/FairEval} to facilitate future research.

cs.CL cs.AI cs.IR