Thucy: An LLM-based Multi-Agent System for Claim Verification across Relational Databases

TL;DR

Thucy系统利用多智能体架构实现跨数据库事实验证,准确率达94.3%。

cs.DB 🔴 高级 2025-12-03 42 次浏览
Michael Theologitis Dan Suciu
多智能体系统 关系数据库 事实验证 可解释性 大规模语言模型

核心发现

方法论

Thucy采用基于大规模语言模型(LLM)的多智能体架构,包括数据专家、模式专家和SQL专家,通过MCP协议实现对多数据库的自主探索与推理。系统在无先验知识的情况下,自动发现、分析关系数据库,生成支持验证的SQL语句,确保验证过程的可追溯性。核心算法结合GPT-4等强大模型,利用多轮交互优化SQL生成,结合特定工具实现数据库操作,最终由验证器整合多轮推理,输出验证结论与证据。系统在TabFact数据集上实现94.3%的准确率,超越先前最优的88.7%。

关键结果

  • Thucy在TabFact数据集上的验证准确率达到94.3%,比之前的最优模型高出5.6个百分点,显著提升跨数据库验证能力。
  • 系统能自动发现多关系数据库中的相关表和数据,生成精确SQL查询,支持复杂多表、多数据库的验证任务。
  • 通过提供具体SQL证据,增强验证过程的透明性和可解释性,便于专家审查和二次分析。

研究意义

本研究突破了现有单表、小规模数据库的限制,实现跨数据库、跨表的自动事实验证,极大提升了信息验证的自动化和透明度。该技术在舆情监测、政策评估、公共数据核查等场景具有广泛应用潜力,为构建可信信息生态提供技术支撑,也推动了多智能体系统在实际数据分析中的创新应用。

技术贡献

提出基于MCP协议的多智能体架构,结合GPT-4等模型实现无监督环境下的数据库探索与推理。引入多轮交互优化SQL生成,确保验证的准确性和可追溯性。系统设计实现了完全环境无依赖的自主发现能力,超越传统单一数据库或静态验证模型,显著提升验证范围和效率。

新颖性

首次实现跨数据库、跨表的全自动事实验证系统,结合多智能体架构和大模型的推理能力,提供完整的验证流程和证据链,填补了结构化数据验证的技术空白。

局限性

  • 系统对数据库的依赖性较强,需数据库结构合理且数据质量较高,面对噪声或不完整数据时表现可能下降。
  • 多数据库环境下的复杂查询可能导致推理时间较长,实时性仍需优化。
  • 目前主要在TabFact数据集上验证,实际应用中需适应多样化的行业场景和数据库结构。

未来方向

未来将扩展系统支持非关系型数据库,提升多源异构数据的融合能力。同时,结合强化学习优化SQL生成策略,增强系统的适应性和效率。还计划引入用户交互机制,增强验证过程的可控性和可解释性,推动系统在实际场景中的落地应用。

AI 总览摘要

在信息爆炸的时代,真假难辨成为一大难题。尽管结构化数据丰富,但现有自动验证系统多局限于单一、小规模数据库,难以应对复杂、多源环境。本文提出Thucy系统,基于大规模语言模型(如GPT-4)构建多智能体架构,突破了单表验证的限制,实现跨数据库、跨表的自动事实验证。系统由数据专家、模式专家和SQL专家组成,通过MCP协议实现无缝连接与协作,自动探索未知数据库,生成支持验证的SQL查询,确保验证过程的透明性和可追溯性。实验在TabFact数据集上取得94.3%的准确率,优于之前的88.7%,验证了其强大能力。Thucy的创新在于其完全环境无依赖的自主探索能力和多轮交互优化SQL的机制,为结构化数据验证提供了新范式。该技术不仅提升了验证效率,也增强了验证的可信度,为公共数据核查、政策评估等场景提供了技术支撑。未来,系统将扩展支持异构数据源,结合强化学习优化推理流程,推动其在实际应用中的广泛落地。整体而言,Thucy代表了多智能体与大模型结合的结构化数据验证新方向,具有重要的学术价值和应用前景。

深度分析

研究背景

随着大数据和结构化信息的快速增长,自动化事实验证成为数据科学和信息安全的重要研究方向。早期方法多依赖规则或模板匹配,效果有限。近年来,深度学习和大模型(如GPT系列)推动了自然语言理解和生成能力的突破,但在结构化数据验证方面仍受限于单一数据库或静态环境。现有工作如BINDER、DATER、CoTable等,虽实现部分跨表或跨数据库验证,但多缺乏全自动化、环境无依赖的能力。随着多源异构数据的普及,需求日益增长,促使研究转向多智能体系统,结合大模型的推理能力,提升跨环境验证的能力。本文的Thucy系统正是在此背景下提出,旨在实现完全自主、透明、跨数据库的事实验证,满足实际应用的复杂需求。

核心问题

现有结构化数据验证系统多局限于单一数据库或小规模数据集,难以应对多源、多表环境中的复杂验证任务。传统方法依赖人工预定义规则或静态SQL,缺乏环境无依赖的自动探索能力,限制了其扩展性和适应性。在实际应用中,数据环境复杂多变,验证需求多样,单一模型难以满足跨数据库、跨表的验证需求。如何实现一个自主发现、推理、验证的系统,确保验证的透明性和可追溯性,成为亟待解决的问题。

核心创新

本研究的核心创新在于:1)提出基于MCP协议的多智能体架构,支持环境无依赖的数据库探索;2)设计多轮交互机制,优化SQL生成,提升验证准确率;3)实现跨数据库、跨表的全自动验证流程,提供详细SQL证据链;4)在TabFact上实现94.3%的验证准确率,显著优于现有模型。系统结合大模型推理能力与工具驱动的数据库操作,突破传统单一模型限制,为结构化数据验证开辟新路径。

方法详解

  • �� 采用GPT-4作为核心推理引擎,结合MCP协议实现多数据库连接。
  • �� 设计三类专家:数据专家负责快速扫描数据库,模式专家解析结构,SQL专家生成和优化SQL。
  • �� 通过工具集管理不同数据库的连接和操作,支持多源数据的无缝调用。
  • �� Verifier协调专家,逐步探索数据、理解结构、生成SQL,反复验证直至得出结论。
  • �� 多轮交互中,SQL专家根据上下文不断调整查询,确保结果的准确性。
  • �� 最终,Verifer输出验证结论和详细SQL证据,确保过程透明、可重现。

实验设计

在TabFact数据集上,系统以真实的关系数据库(如PostgreSQL)加载官方数据,进行验证任务。采用准确率作为主要指标,比较不同模型和变体。通过消融实验验证多轮交互、工具集设计的效果。参数调优包括模型温度、交互轮次等,确保验证的稳定性和效率。结果显示,Thucy在复杂验证任务中优于现有模型,验证准确率达94.3%,显著提升跨数据库验证能力。

结果分析

系统在TabFact数据集上实现94.3%的验证准确率,比之前最优模型高出5.6个百分点。能自动发现多数据库中的相关表,生成精确SQL,支持复杂多表、多源验证。提供详细SQL证据链,增强验证透明性。多轮交互优化显著提升SQL生成质量,减少错误。实验还验证了系统在不同数据库环境下的适应性和扩展性,展现了强大的实用潜力。

应用场景

Thucy适用于公共数据核查、政策评估、舆情监测等场景,用户只需提供结构化数据,系统即可自动验证声明。对政府、媒体、研究机构等具有重要价值,能大幅提升验证效率和可信度。未来可结合自动数据采集和多源融合技术,扩展到非关系型数据库和实时数据流,推动智能验证在实际行业中的应用。

局限与展望

系统依赖数据库结构合理、数据质量高,面对噪声或不完整数据时表现受限。多数据库环境中,复杂查询可能导致推理时间较长,实时性不足。目前主要在TabFact验证,实际场景中需适应多样化数据源和行业需求。未来需优化推理效率,增强对异构数据的支持,并提升系统的鲁棒性和扩展性。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,手边有很多不同的食材和工具。每次你想做一道菜,都需要先找到所有食材,了解它们的特性,然后用合适的工具把它们组合起来。Thucy就像这个厨房助手,它可以自己探索所有的食材(数据库),理解它们的性质(结构),然后用正确的厨具(SQL)做出菜肴(验证结果)。它还能告诉你用的哪些食材和工具,确保你知道每一步怎么做,最后帮你确认菜是不是符合你的要求。这种自动化探索和验证的方法,让厨房变得更高效、更可靠,也让你更放心吃到的菜是真的符合标准。

简单解释 像给14岁少年讲一样

想象你在学校里参加一个比赛,老师说某个学生去年得了多少奖,大家都想知道真假。可是,要确认这个消息,你得去问很多老师、查很多资料,还得理解每份资料的内容。Thucy就像一个超级聪明的助手,它可以自己跑去找所有的资料,理解每份资料的内容,然后用一个特别的“翻译器”把问题变成数据库能理解的语言(SQL),再去查证。它会告诉你答案是不是对的,还会把用到的查询语句告诉你,让你知道它是怎么得出结论的。这样一来,你不用自己翻查所有资料,就能快速、准确地知道消息的真假,还能理解它是怎么验证的,既省时又可靠。

术语表

Multi-Agent System (多智能体系统)

由多个专门的智能体组成,各自负责不同任务,通过协作完成复杂任务。本文中,系统包括数据专家、模式专家和SQL专家。

用以实现跨数据库的自主探索和推理。

MCP协议 (Model Context Protocol)

一种标准协议,用于不同AI工具和模型之间的连接,简化多源数据访问和操作流程。本文利用其实现数据库工具的无缝集成。

支持Thucy中多数据库的工具管理。

SQL专家 (SQL Expert)

负责将自然语言问题转化为SQL查询,并执行以获得验证证据。确保每个查询都能追溯到数据源。

实现自动化、多轮交互的核心组件。

TabFact数据集

用于结构化数据事实验证的标准基准数据集,包含大量已标注的事实验证任务。

评估Thucy在结构化数据验证中的性能。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步扩展Thucy支持非关系型数据库和实时数据流,仍需解决多源异构数据融合与推理效率问题。
  • 2 在复杂行业场景中,如何保证验证的鲁棒性和准确性,仍是未来研究重点。

应用场景

近期应用

公共数据核查

政府和媒体可以利用Thucy自动验证政策声明、新闻报道的真实性,提升信息可信度。

政策评估

通过自动分析多源统计数据,帮助决策者快速评估政策效果,减少人为偏差。

远期愿景

智能信息验证平台

未来将构建全自动、多源、多行业的验证平台,实现实时、全自动的事实核查,推动可信信息生态。

原文摘要

In today's age, it is becoming increasingly difficult to decipher truth from lies. Every day, politicians, media outlets, and public figures make conflicting claims -- often about topics that can, in principle, be verified against structured data. For instance, statements about crime rates, economic growth or healthcare can all be verified against official public records and structured datasets. Building a system that can automatically do that would have sounded like science fiction just a few years ago. Yet, with the extraordinary progress in LLMs and agentic AI, this is now within reach. Still, there remains a striking gap between what is technically possible and what is being demonstrated by recent work. Most existing verification systems operate only on small, single-table databases -- typically a few hundred rows -- that conveniently fit within an LLM's context window. In this paper we report our progress on Thucy, the first cross-database, cross-table multi-agent claim verification system that also provides concrete evidence for each verification verdict. Thucy remains completely agnostic to the underlying data sources before deployment and must therefore autonomously discover, inspect, and reason over all available relational databases to verify claims. Importantly, Thucy also reports the exact SQL queries that support its verdict (whether the claim is accurate or not) offering full transparency to expert users familiar with SQL. When evaluated on the TabFact dataset -- the standard benchmark for fact verification over structured data -- Thucy surpasses the previous state of the art by 5.6 percentage points in accuracy (94.3% vs. 88.7%).

cs.DB cs.AI