The FACTS Leaderboard: A Comprehensive Benchmark for Large Language Model Factuality

TL;DR

FACTS排行榜评估大语言模型的事实准确性,使用四个子排行榜,平均得分为68.8。

cs.CL 🔴 高级 2025-12-12 2 次浏览
Aileen Cheng Alon Jacovi Amir Globerson Ben Golan Charles Kwong Chris Alberti Connie Tao Eyal Ben-David Gaurav Singh Tomar Lukas Haas Yonatan Bitton Adam Bloniarz Aijun Bai Andrew Wang Anfal Siddiqui Arturo Bajuelos Castillo Aviel Atias Chang Liu Corey Fry Daniel Balle Deepanway Ghosal Doron Kukliansky Dror Marcus Elena Gribovskaya Eran Ofek Honglei Zhuang Itay Laish Jan Ackermann Lily Wang Meg Risdal Megan Barnes Michael Fink Mohamed Amin Moran Ambar Natan Potikha Nikita Gupta Nitzan Katz Noam Velan Ofir Roval Ori Ram Polina Zablotskaia Prathamesh Bang Priyanka Agrawal Rakesh Ghiya Sanjay Ganapathy Simon Baumgartner Sofia Erell Sushant Prakash Thibault Sellam Vikram Rao Xuanhui Wang Yaroslav Akulov Yulong Yang Zhen Yang Zhixin Lai Zhongru Wu Anca Dragan Avinatan Hassidim Fernando Pereira Slav Petrov Srinivasan Venkatachary Tulsee Doshi Yossi Matias Sasha Goldshtein Dipanjan Das
事实性 大语言模型 多模态 参数化 信息检索

核心发现

方法论

FACTS排行榜通过四个子排行榜评估模型的事实性:多模态、参数化、搜索和文档基础。每个子排行榜使用自动评分模型,最终得分是四个子排行榜的平均值。

关键结果

  • Gemini 3 Pro在FACTS排行榜中得分最高,达到68.8,特别是在搜索场景中表现优异,得分83.8。
  • GPT 5在多模态和参数化任务中表现相对较弱,得分分别为44.1和55.8。
  • Claude 4.5在文档基础任务中表现较好,但整体得分仅为51.3。

研究意义

该研究为评估大语言模型的事实准确性提供了全面的基准,填补了当前评估工具的空白,特别是在多模态和信息检索场景中。对学术界和工业界都有重要影响。

技术贡献

提出了一种新的评估框架,结合多种评估场景,提供了更全面的事实性评估。与现有方法相比,FACTS排行榜在评估范围和深度上都有显著提升。

新颖性

首次将多模态、参数化、搜索和文档基础结合在一个评估框架中,提供了一个全面的事实性评估工具。

局限性

  • 模型在多模态任务中的表现不稳定,可能受到图像质量和问题复杂度的影响。
  • 参数化任务中,模型对罕见事实的记忆能力有限。

未来方向

未来可以扩展到更多的评估场景,如视频理解和实时信息检索,进一步提高评估的全面性和准确性。

AI 总览摘要

大语言模型在生成事实性文本方面仍面临挑战。FACTS排行榜通过四个子排行榜评估模型的事实性:多模态、参数化、搜索和文档基础。每个子排行榜使用自动评分模型,最终得分是四个子排行榜的平均值。实验结果显示,Gemini 3 Pro在搜索场景中表现优异,而GPT 5在多模态和参数化任务中表现相对较弱。该研究为评估大语言模型的事实准确性提供了全面的基准,填补了当前评估工具的空白,对学术界和工业界都有重要影响。未来可以扩展到更多的评估场景,如视频理解和实时信息检索,进一步提高评估的全面性和准确性。

深度分析

研究背景

近年来,大语言模型在自然语言处理领域取得了显著进展。然而,生成的文本中常常包含事实性错误,这对其在实际应用中的可靠性提出了挑战。现有的评估方法通常只关注某一特定方面,缺乏全面的事实性评估工具。

核心问题

大语言模型生成的文本常常缺乏事实性,尤其是在多模态和信息检索场景中。这不仅影响模型的实际应用,还对用户信任度造成影响。

核心创新

FACTS排行榜通过结合多模态、参数化、搜索和文档基础四个子排行榜,提供了一个全面的事实性评估框架。每个子排行榜针对不同的事实性维度,使用自动评分模型进行评估。

方法详解

  • �� 多模态:评估模型对图像问题的回答准确性。
  • �� 参数化:评估模型对封闭式问题的内部知识。
  • �� 搜索:评估模型在信息检索场景中的表现。
  • �� 文档基础:评估长文本回答的文档依赖性。

实验设计

实验使用了多个大语言模型,包括Gemini 3 Pro和GPT 5。评估数据集包括公共和私有部分,以防止过拟合。每个子排行榜的得分通过自动评分模型计算,最终得分是四个子排行榜的平均值。

结果分析

Gemini 3 Pro在FACTS排行榜中得分最高,特别是在搜索场景中表现优异。GPT 5在多模态和参数化任务中表现相对较弱。Claude 4.5在文档基础任务中表现较好,但整体得分较低。

应用场景

该评估框架可用于评估大语言模型在多种场景下的事实性表现,帮助开发者识别模型的优缺点,指导模型改进。

局限与展望

模型在多模态任务中的表现不稳定,可能受到图像质量和问题复杂度的影响。参数化任务中,模型对罕见事实的记忆能力有限。

通俗解读 非专业人士也能看懂

想象你在一个图书馆,那里有很多书和图片。你需要回答一些关于这些书和图片的问题。FACTS排行榜就像一个图书馆管理员,帮助你判断答案是否正确。它会检查你是否正确地使用了书中的信息,是否没有误解图片中的内容。这样,你就能更好地理解图书馆中的知识。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,游戏中你需要回答一些关于世界的有趣问题。FACTS排行榜就像一个游戏裁判,它会检查你的答案是否正确。如果你回答对了,它会给你加分;如果错了,它会告诉你哪里出错了。这样,你就能更好地了解世界,也能在游戏中得高分!

术语表

FACTS排行榜

一个用于评估大语言模型事实性的在线排行榜。

用于综合评估模型在多种场景下的事实性表现。

多模态

结合多种信息源(如文本和图像)进行分析和判断。

评估模型对图像问题的回答准确性。

参数化

利用模型内部知识回答问题,而不依赖外部信息。

评估模型对封闭式问题的内部知识。

信息检索

通过搜索工具获取和使用信息。

评估模型在信息检索场景中的表现。

文档基础

基于提供的文档生成长文本回答。

评估长文本回答的文档依赖性。

开放问题 这项研究留下的未解疑问

  • 1 如何提高模型在多模态任务中的稳定性,尤其是在处理复杂图像时。
  • 2 如何增强模型对罕见事实的记忆能力,尤其是在参数化任务中。

应用场景

近期应用

模型评估

开发者可以使用FACTS排行榜评估模型的事实性表现,识别优缺点,指导改进。

远期愿景

智能助手

未来,智能助手可以利用这种评估框架提高回答准确性,为用户提供更可靠的信息服务。

原文摘要

We introduce The FACTS Leaderboard, an online leaderboard suite and associated set of benchmarks that comprehensively evaluates the ability of language models to generate factually accurate text across diverse scenarios. The suite provides a holistic measure of factuality by aggregating the performance of models on four distinct sub-leaderboards: (1) FACTS Multimodal, which measures the factuality of responses to image-based questions; (2) FACTS Parametric, which assesses models' world knowledge by answering closed-book factoid questions from internal parameters; (3) FACTS Search, which evaluates factuality in information-seeking scenarios, where the model must use a search API; and (4) FACTS Grounding (v2), which evaluates whether long-form responses are grounded in provided documents, featuring significantly improved judge models. Each sub-leaderboard employs automated judge models to score model responses, and the final suite score is an average of the four components, designed to provide a robust and balanced assessment of a model's overall factuality. The FACTS Leaderboard Suite will be actively maintained, containing both public and private splits to allow for external participation while guarding its integrity. It can be found at https://www.kaggle.com/benchmarks/google/facts .

cs.CL cs.AI