A Cost-Aware Agentic Architecture for NL-to-SQL over Nested Enterprise Schemas, with a New Benchmark

TL;DR

提出了一种成本感知的单代生成架构,在DevRev基准上达到91.7%的正确率。

cs.AI 🔴 高级 2026-09-04 12 次浏览
Yoga Sri Varshan Varadharajan Ajay Yadav Ritesh Goru Prateek Chaudhury Constantine Caramanis Prateek Jain Divyateja Pasupuleti Sunil Kumar Pandey
自然语言处理 SQL生成 企业架构 嵌套模式 基准测试

核心发现

方法论

该研究提出了一种成本感知的单代生成架构,专为处理企业级嵌套模式设计。架构包括模式选择、元数据检索和错误修复组件,利用LLM驱动的迭代模式发现和结构化错误模型来优化SQL生成。

关键结果

  • 在DevRev基准上,系统实现了91.7%的答案正确率,比次优基线高出54.6个百分点。
  • 在Spider 2.0 Snowflake公共数据集上,系统在单代操作点上与领先系统竞争。
  • 通过动态错误分类和历史感知反馈,显著提高了生成的SQL的准确性。

研究意义

该研究通过引入DevRev NL2SQL基准和一种新架构,显著提高了自然语言到SQL的转换能力,特别是在处理复杂的企业级嵌套模式时。这一进步不仅在学术界具有重要意义,还为实际应用提供了新的可能性。

技术贡献

技术贡献包括引入了一种新的错误分类和修复机制,以及一种动态学习的备忘单框架。这些创新使得系统能够在单代生成中保持高效和准确。

新颖性

这是首次针对企业级嵌套模式提出的NL2SQL架构,能够处理复杂的多层嵌套和多态链接关系,与现有方法相比具有显著的创新性。

局限性

  • 在处理极其复杂的嵌套模式时,系统可能仍会遇到性能瓶颈。
  • 需要进一步优化以减少计算成本。

未来方向

未来工作包括扩展架构以支持更多的数据库类型,以及进一步优化错误修复机制以提高系统的鲁棒性和效率。

AI 总览摘要

自然语言到SQL的转换系统在学术基准上取得了快速进展,但在实际应用中仍面临挑战,尤其是处理企业级嵌套模式时。现有基准未能充分测量这些复杂结构,因此本研究引入了DevRev NL2SQL基准,包含900个经过执行验证的查询,并引入了语义深度评分(SDS)来评估分析推理深度。

为应对这些挑战,研究者提出了一种成本感知的单代生成架构,专为满足企业级嵌套模式的需求而设计。该架构包括模式选择、元数据检索和错误修复组件,利用LLM驱动的迭代模式发现和结构化错误模型来优化SQL生成。

在DevRev基准上,该系统实现了91.7%的答案正确率,比次优基线高出54.6个百分点;在Spider 2.0 Snowflake公共数据集上,该系统在单代操作点上与领先系统竞争。研究表明,这种新架构在处理复杂企业级数据时具有显著优势,并为未来的研究和应用提供了新的方向。

深度分析

研究背景

自然语言到SQL的转换技术近年来取得了显著进展,尤其是在Spider 1.0和2.0等学术基准上。然而,实际企业数据通常具有图状、半结构化和深度嵌套的特征,这些特征在现有基准中未被充分测量。

核心问题

现有的NL2SQL系统在处理企业级嵌套模式时面临挑战。这些模式通常包含多层嵌套和多态链接关系,需要复杂的推理和SQL生成能力。

核心创新

本研究的核心创新在于引入了一种新的架构,能够处理企业级嵌套模式的复杂性。该架构通过LLM驱动的迭代模式发现和结构化错误模型,显著提高了SQL生成的准确性和效率。

方法详解

  • �� 利用LLM进行迭代模式发现,选择合适的数据库表。
  • �� 通过工具调用检索每个表的压缩模式。
  • �� 使用结构化错误分类和修复机制,优化SQL生成过程。
  • �� 动态学习框架积累可转移的SQL规则。

实验设计

实验使用了DevRev NL2SQL基准和Spider 2.0 Snowflake公共数据集。系统在900个查询上实现了91.7%的答案正确率,并在单代操作点上与领先系统竞争。

结果分析

系统在DevRev基准上实现了91.7%的答案正确率,比次优基线高出54.6个百分点。在Spider 2.0 Snowflake数据集上,系统在单代操作点上表现出色。

应用场景

该系统可直接应用于需要处理复杂企业级数据的场景,如财务分析和客户关系管理,显著提高了数据查询的效率和准确性。

局限与展望

尽管系统在处理嵌套模式上表现出色,但在极其复杂的嵌套结构下仍可能遇到性能瓶颈。此外,系统的计算成本仍需进一步优化。

通俗解读 非专业人士也能看懂

想象一个复杂的企业数据库就像一个多层次的图书馆,每本书都有自己的章节和子章节。传统的SQL查询就像是寻找特定书籍中的某个段落,而我们的系统则像是一个智能图书管理员,能够快速找到所需的信息,即使这些信息隐藏在多个层次的书架中。通过这种方式,系统能够高效地处理复杂的查询请求。

简单解释 像给14岁少年讲一样

想象你在一个巨大的迷宫里找东西。普通的SQL查询就像是拿着一张简单的地图,可能找不到所有的秘密通道。而我们的系统就像是一个超级智能的导航助手,能帮你找到所有隐藏的路径,快速到达目的地!这就像在游戏里有个无敌的攻略助手,帮你轻松通关!

术语表

NL2SQL (自然语言到SQL)

将自然语言转换为SQL查询的技术,旨在简化数据库查询过程。

用于生成SQL查询以从复杂的企业数据库中提取信息。

SDS (语义深度评分)

一种用于评估SQL查询分析推理深度的评分标准。

用于衡量生成的SQL查询的复杂性和准确性。

ARRAY[STRUCT] (数组结构)

一种数据库字段类型,允许存储多层次嵌套的数据。

在处理企业级嵌套模式时,常见于数据库模式中。

LATERAL FLATTEN (横向展开)

一种SQL操作,用于展开嵌套的数组结构。

用于处理复杂的嵌套数据结构。

Polymorphic Link (多态链接)

一种数据库关系,允许链接到多种实体类型。

在处理复杂的企业级数据模式时,常用于链接不同的实体。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化系统以处理更复杂的嵌套模式。
  • 2 在计算成本和性能之间找到最佳平衡点。

应用场景

近期应用

企业数据分析

系统可用于企业数据分析,提高查询效率和准确性,尤其是在处理复杂数据结构时。

远期愿景

智能数据库管理

系统有潜力成为智能数据库管理工具,自动化处理复杂查询,提高企业数据管理效率。

原文摘要

Natural-language-to-SQL systems have ad- vanced rapidly on academic benchmarks, yet production enterprise schemas exhibit graph- like, semi-structured, deeply nested structure that current benchmarks do not measure. We make two complementary contributions. First, we introduce the DevRev NL2SQL bench- mark: 900 execution-verified queries with nested-type and link-graph structure, accom- panied by the Semantic Depth Score (SDS), a schema-agnostic rubric for analytical reasoning depth. Second, we present a cost-aware single- generation agentic architecture whose schema- selection, metadata-retrieval, and error-repair components are designed for the requirements this regime imposes. On the DevRev NL2SQL benchmark the system attains 91.7% answer correctness, a margin of 54.6 percentage points over the next-best baseline; on the Spider 2.0 Snowflake public dataset, it is competitive with leading systems at a single-generation operating point.

cs.AI