AutoPyVerifier: Learning Compact Executable Verifiers for Large Language Model Outputs

TL;DR

AutoPyVerifier通过DAG搜索自动学习紧凑的Python验证器集,提升目标任务F1达55点。

cs.CL 🔴 高级 2026-04-25 46 次浏览
Pouya Pezeshkpour Estevam Hruschka
验证 大模型 自动化 程序合成 优化搜索

核心发现

方法论

该方法利用大型语言模型(LLM)生成候选验证器,构建有向无环图(DAG)进行逐步扩展。核心包括:用LLM合成验证器集、构建DAG表示搜索空间、通过任务相关指标(如F1)评分节点、结合探索与复杂度惩罚进行节点选择、利用LLM critic和modifier优化验证器。最终选出紧凑且高效的验证器集,逼近目标指标。该流程实现自动化验证逻辑学习,兼顾可控性与覆盖性。

关键结果

  • 在数学推理、编码、函数调用和指令跟随任务中,AutoPyVerifier提升目标F1值最高达55.0点,验证器集仅含1-6个函数,表现优于初始LLM生成的验证器集。多模型、多任务中,验证器具备良好迁移性,显著改善模型输出的正确性。
  • 在不同模型(如GPT-5.4、Gemini-3.1 Pro)和数据集(ID与OOD)上,验证器集均能有效提升预测准确率,OOD场景下最高提升达54.4点,表明验证逻辑具有一定的泛化能力。
  • 通过引入验证器作为外部工具,模型在推理过程中调用验证器,整体性能提升最高达17.0点,验证器不仅用于评估,也能作为反馈机制改善模型行为。

研究意义

该研究突破了验证器设计的自动化瓶颈,将验证逻辑从手工工程转向数据驱动学习,增强了验证的可控性、可解释性和覆盖能力。其方法可广泛应用于LLM的训练、推理和自我反思,为AI系统的可靠性提供新路径,推动验证技术从规则手工设计向智能学习转变,有望改善AI决策的透明度和安全性。

技术贡献

提出基于DAG的验证器搜索框架,结合LLM合成、搜索优化和结构化验证逻辑,显著提升验证器的表达能力和效率。引入任务相关指标、多目标搜索策略和验证器类别分析,丰富了验证器学习的理论基础。实现自动化验证逻辑的高效迁移和工具化,为未来自适应验证体系提供技术支撑。

新颖性

首次将DAG搜索机制应用于验证器集的自动学习,结合LLM合成与搜索优化,显著提升验证器的紧凑性和泛化能力。不同于传统手工设计或单一模型验证,该方法实现验证逻辑的自动诱导与结构化改进,开创了验证器自动学习的新方向。

局限性

  • 当前方法依赖大量LLM调用,计算成本较高,尤其在大规模任务中可能限制实用性。
  • 验证器类别和逻辑仍受限于预定义的类别,可能无法捕捉所有复杂验证需求。
  • 验证器的迁移能力虽强,但在极端或复杂场景下仍存在性能下降的风险。

未来方向

未来将探索多模态验证器学习,结合知识图谱和推理模型增强验证逻辑的表达能力。同时,优化搜索策略以降低计算成本,扩展验证器类别,提升验证逻辑的深度和广度。此外,将验证器集融入端到端训练流程,实现验证逻辑的自适应调整与持续学习。

AI 总览摘要

随着大规模语言模型(LLMs)在复杂任务中的表现不断提升,验证机制成为确保输出质量和系统可靠性的关键环节。传统验证方法或依赖于人工设计规则,或使用难以控制的LLM判别器,存在覆盖不足或不可靠的问题。为解决这一瓶颈,本文提出AutoPyVerifier,一种基于DAG搜索的自动验证器学习框架。该方法利用LLM生成候选验证器集,构建有向无环图(DAG)进行逐步扩展,通过评分指标(如F1)引导搜索,最终获得紧凑、结构化且高效的验证器集。这些验证器不仅能逼近目标任务的评价指标,还具备良好的迁移性和实用性。在多个基准任务(数学推理、编码、指令遵循)中,AutoPyVerifier实现了最高55点的F1提升,验证器集规模仅为1-6个函数,表现优于初始生成的验证器。实验还显示,验证器的类别逐步从表面特征转向结构和语义层面,验证逻辑更具深度。引入验证器作为外部工具后,模型推理性能提升最高达17点,验证了验证器在实际应用中的潜力。该研究推动了验证逻辑从手工规则向自动学习的转变,为未来构建更可靠、可解释的AI系统提供了新路径。未来工作将聚焦多模态验证、成本优化和验证逻辑的持续学习,期待其在AI安全和可信性方面发挥更大作用。

深度分析

研究背景

近年来,随着GPT、PaLM等大模型的崛起,AI在数学推理、代码生成等领域取得突破。然而,模型输出的可靠性仍受验证机制制约。传统验证多依赖手工规则或单一判别模型,难以兼顾覆盖性与可控性。近年来,研究者尝试引入LLM判别器,但其不稳定性和难以解释的问题突出。程序化验证器(如Python函数)具有可解释性和可执行性,但设计成本高,覆盖有限。如何自动学习高效、结构化的验证逻辑,成为当前研究热点。

核心问题

核心问题在于如何自动构建一组验证器,使其联合满足目标指标(如正确率、有效性),同时保持验证器集的紧凑性和可解释性。现有方法多依赖人工设计或有限的规则集,难以应对复杂任务的多样性和变化。手工验证器难以扩展,自动判别模型虽灵活但不稳定,二者难以兼得。如何在保证可控性和覆盖性的基础上,实现验证逻辑的自动化学习,成为亟待解决的难题。

核心创新

本研究提出基于DAG的验证器搜索框架,结合LLM生成、结构化搜索和多目标优化。创新点包括:

  • �� 利用LLM合成多样验证器候选集,覆盖不同验证逻辑;
  • �� 构建有向无环图(DAG)表示搜索空间,有效追踪验证器演化过程;
  • �� 引入基于任务指标(如F1)和复杂度惩罚的评分机制,平衡验证效果与验证器规模;
  • �� 结合探索策略(如UCB)引导搜索,避免陷入局部最优;
  • �� 通过验证器类别分析,逐步从表面特征转向结构和语义验证逻辑。这些创新使验证器学习更高效、更具泛化能力。

方法详解

  • �� 初始验证器合成:用LLM基于任务描述生成多组验证器集,涵盖结构、格式、内容等方面;
  • �� DAG构建:每个验证器集作为节点,边表示验证器变换(添加、修改、删除);
  • �� 节点评分:结合任务指标(如F1)、探索值(UCB)、验证器规模惩罚和可行性,计算节点价值;
  • �� 节点选择:选择最高评分节点进行扩展;
  • �� 生成子节点:利用LLM critic分析当前验证器,识别漏洞,指导修改(添加、替换、删除验证器);
  • �� 迭代搜索:重复评分、选择、扩展,直到满足停止条件;
  • �� 最终验证器集:从所有探索节点中选择最优(高任务指标、规模小)作为输出。

实验设计

在数学推理(AIME)、编码(LiveCodeBench)、多步推理(ComplexFuncBench)和指令遵循(IFBench)等任务上,采用GPT-4.1作为验证器生成和优化的基础模型。通过在ID和OOD数据集上评估,指标为F1。设置搜索步数为20,验证器生成上限为3个子集,调优超参数(α、β、γ)以最大化验证指标。对比初始验证器集和搜索后验证器集的性能,分析迁移能力和类别变化,验证验证器的泛化和实用性。

结果分析

搜索显著提升验证器性能,最高达55点F1,验证器规模仅1-6个函数,优于初始生成版本。验证器在不同模型间迁移效果良好,OOD场景下提升达54.4点。验证器类别逐步从内容检测转向结构和语义验证,验证逻辑更具深度。引入验证器作为工具后,模型性能提升最高17点,验证了验证器在实际推理中的有效性。这些结果表明,自动学习验证器不仅提升了模型的正确性,也增强了验证的可解释性和迁移性。

应用场景

该方法适用于自动化验证、模型调优、推理增强等场景。可作为模型训练中的奖励信号、推理过程中的过滤器或修正工具,提升模型输出的可靠性和解释性。未来,结合多模态信息和知识图谱,将验证逻辑融入端到端训练流程,推动可信AI的发展。

局限与展望

当前方法依赖大量LLM调用,计算成本较高,难以在大规模应用中普及。验证器类别有限,难以覆盖所有复杂验证需求。验证逻辑迁移性虽强,但在极端或特殊场景下仍可能失效。未来需优化搜索效率,扩展验证类别,增强验证逻辑的深度和广度。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,验证器就像厨师检查食材是否新鲜、调料是否合适。传统方法是每次都自己写规则,比如“如果盐多了就重新调味”,但这样很麻烦也不灵活。现在,有个智能厨师(AutoPyVerifier)可以根据你提供的食谱,自动学习哪些检查最重要,比如“菜色是否均匀”、“味道是否正宗”。它会用一种像地图(DAG)的方法,逐步试验不同的检查组合,找到最有效的几条规则。这样,你只需要告诉它目标(比如菜要好吃),它就能自动学会一套简洁又可靠的验证方法。最终,这些验证规则可以帮你快速判断菜是否合格,也可以作为提醒,避免出错。这个过程就像让厨房变得更智能、更省事,做饭也更有保障。

简单解释 像给14岁少年讲一样

想象你在学校里写作文,老师会检查你的内容是不是有错别字、逻辑是否清楚。以前,老师自己写很多规则,比如“每段都要有主题句”,但每次都得手工写,太麻烦了。现在,有个聪明的机器人(AutoPyVerifier),它可以根据你以前写的作文,自己学习哪些检查最重要,比如“有没有拼写错误”、“句子是否通顺”。它会用一种像拼图一样的方法,把不同的检查拼在一起,试试哪些组合最能帮你写得更好。最后,它会告诉你哪些地方需要改,帮你写出更棒的作文。这样,你不用每次都自己想检查点,机器人帮你自动学习,作文质量自然就提高了。这就像有个超级帮手,让写作变得更简单、更靠谱。

原文摘要

Verification is becoming central to both reinforcement-learning-based training and inference-time control of large language models (LLMs). Yet current verifiers face a fundamental trade-off: LLM-based verifiers are expressive but hard to control and prone to error, while deterministic executable verifiers are reliable and interpretable but often limited in capability. We study the following question: given a development set of LLM outputs and labels for a target objective, such as correctness, can we automatically induce a minimal set of Python verifiers whose joint satisfaction closely matches that objective? We propose AutoPyVerifier, a framework that uses an LLM to synthesize candidate verifier functions and then refines them through search over a directed acyclic graph (DAG). By navigating the DAG, AutoPyVerifier systematically explores the space of deterministic executable verifiers and selects a compact verifier set whose joint satisfaction best approximates the target objective. Across mathematical reasoning, coding, function calling, and instruction-following benchmarks for several state-of-the-art LLMs, AutoPyVerifier improves target-objective prediction by up to 55.0 F1 points over the initial LLM-generated verifier sets. Additional analyses show that the most useful verification targets vary by benchmark and model, and that the DAG-based search shifts the learned verifier sets toward more structural and semantically grounded checks. We further show that exposing the discovered verifier set to an LLM as an external tool improves downstream accuracy by up to 17.0 points. We release our code

cs.CL cs.LG cs.PL