Test-Time Verification for Text-to-SQL via Outcome Reward Models

TL;DR

GradeSQL框架通过ORM提升Text-to-SQL的可靠性,在BIRD上提升4.33%。

cs.CL 🔴 高级 2026-06-30 7 次浏览
Mattia Tritto Giuseppe Farano Dario Di Palma Gaetano Rossiello Fedelucio Narducci Dharmashankar Subramanian Tommaso Di Noia
Text-to-SQL ORM 验证 大语言模型 数据集

核心发现

方法论

本文提出了GradeSQL框架,利用Outcome Reward Models (ORMs)进行测试时验证。通过自动候选生成和基于执行的标注进行训练,无需人工标注。ORM被集成到验证驱动的Best-of-N流程中,并在BIRD和Spider基准上进行评估。

关键结果

  • 在BIRD数据集上,ORM选择方法比基于执行的Best-of-N和多数投票方法提高了4.33%。
  • 在Spider数据集上,ORM选择方法提高了2.10%,在复杂查询中表现更优。
  • ORM在候选集规模扩大时表现更优,尤其在复杂查询中。

研究意义

研究展示了ORM在结构化查询生成中的应用潜力,提供了一种简单、有效且可扩展的替代方案,解决了现有启发式选择策略的局限性。

技术贡献

技术贡献包括提出了一种无需人工标注的自动化数据生成和标注流程,以及通过ORM进行语义评分,超越了传统的执行成功率和输出频率。

新颖性

这是首次将ORM应用于结构化查询生成,提供了一种新的验证机制,超越了现有的启发式方法。

局限性

  • 在复杂查询中,虽然ORM表现优异,但在简单查询中提升有限。
  • 需要额外的训练阶段,增加了计算成本。
  • 适用于特定的LLM架构,通用性有限。

未来方向

未来工作包括探索ORM在其他结构化任务中的应用,以及优化训练过程以减少计算成本。

AI 总览摘要

在结构化推理任务中,如Text-to-SQL,提升大语言模型的可靠性是一个核心挑战。现有的测试时推理策略,如Best-of-N采样和多数投票,依赖于启发式信号,难以在候选输出之间提供语义上的区分。本文研究了Outcome Reward Models (ORMs)作为学习的语义评分函数,用于Text-to-SQL的测试时验证。我们引入了GradeSQL,一个通过自动候选生成和基于执行的标注进行任务特定ORM训练的可扩展框架,允许验证器训练无需人工标注。我们将ORM集成到验证驱动的Best-of-N流程中,并在BIRD和Spider基准上评估我们的方法。ORM选择方法在BIRD上提升了4.33%,在Spider上提升了2.10%。结果表明,ORM验证提供了一种简单、有效且可扩展的替代方案,超越了启发式测试时选择策略。代码、数据集和模型均已公开。

深度分析

研究背景

Text-to-SQL任务旨在将自然语言问题翻译为可执行的SQL查询,提供对结构化数据库的直观访问。虽然大语言模型在这一领域取得了显著进展,但在复杂查询上仍然表现有限。

核心问题

现有的测试时推理策略依赖于启发式信号,如执行成功或输出频率,无法在候选输出之间提供语义上的区分。

核心创新

提出了GradeSQL框架,通过自动候选生成和基于执行的标注进行任务特定ORM训练,允许验证器训练无需人工标注。

方法详解

  • �� 自动候选生成:根据自然语言问题和数据库模式生成多样化的候选SQL查询。
  • �� 数据标注:通过执行等价性标注候选查询的正确性。
  • �� 监督微调:使用标注数据微调验证器LLM。

实验设计

在BIRD和Spider基准上进行评估,使用多个开源LLM家族。结果显示ORM选择方法在执行准确性上优于启发式基线。

结果分析

ORM选择方法在BIRD上提升了4.33%,在Spider上提升了2.10%。在复杂查询中表现更优。

应用场景

适用于需要高语义准确性的结构化查询生成任务,如数据库查询优化。

局限与展望

需要额外的训练阶段,增加了计算成本。适用于特定的LLM架构,通用性有限。

通俗解读 非专业人士也能看懂

想象你在一个图书馆寻找一本书。你有很多书名候选,但不知道哪本是你真正需要的。ORM就像一个聪明的图书管理员,它根据你的需求和书的内容来推荐最合适的书,而不是仅仅根据书的封面或书名出现的频率来选择。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,需要选择正确的路径才能赢。你有很多选择,但不知道哪个是对的。ORM就像一个聪明的向导,它能根据你的目标和路径的特点来推荐最合适的路线,而不是仅仅根据路径的外观或名字来选择。是不是很酷?

术语表

Outcome Reward Models (ORMs)

一种学习的语义评分函数,用于测试时验证。

用于Text-to-SQL的测试时验证。

Best-of-N

一种测试时推理策略,通过生成多个候选并选择最佳输出。

用于候选输出选择。

Majority Voting

一种测试时推理策略,通过输出频率选择最佳输出。

用于候选输出选择。

GradeSQL

一个通过自动候选生成和基于执行的标注进行任务特定ORM训练的框架。

用于ORM训练。

BIRD

一个用于评估Text-to-SQL任务的基准数据集。

用于评估ORM选择方法。

开放问题 这项研究留下的未解疑问

  • 1 如何在其他结构化任务中应用ORM?
  • 2 如何优化训练过程以减少计算成本?

应用场景

近期应用

数据库查询优化

通过ORM选择方法提高查询的语义准确性。

远期愿景

智能数据分析

通过ORM提高复杂数据分析任务的准确性和效率。

原文摘要

Improving the reliability of large language models (LLMs) at inference time is a central challenge in structured reasoning tasks such as Text-to-SQL. Common test-time inference strategies, including Best-of-N sampling and Majority Voting, rely on heuristic signals such as execution success or output frequency, which provide limited semantic discrimination across candidate outputs. In this work, we study Outcome Reward Models (ORMs) as learned semantic scoring functions for test-time verification in Text-to-SQL. While ORMs have been previously explored for test-time scaling and alignment, their application to structured query generation remains underexplored. We introduce GradeSQL, a scalable framework for training task-specific ORMs via automated candidate generation and execution-based labeling, enabling verifier training without manual annotation. We integrate ORMs into a verification-driven Best-of-N pipeline and evaluate our approach on the BIRD and Spider benchmarks across multiple open-source LLM families. ORM-based selection consistently outperforms execution-based Best-of-N and Majority Voting, with gains of up to +4.33% on BIRD and +2.10% on Spider. We further show that ORMs scale effectively with larger candidate sets and yield stronger improvements on complex queries. Overall, our results demonstrate that ORM-based verification provides a simple, effective, and scalable alternative to heuristic test-time selection strategies for Text-to-SQL. Code datasets and models are publicly available.

cs.CL cs.AI cs.DB