Rethinking Table Pruning in TableQA: From Sequential Revisions to Gold Trajectory-Supervised Parallel Search

TL;DR

提出TabTrim,将表格剪枝从序贯修正转为金轨迹监督的并行搜索,显著提升TableQA性能。

cs.CL 🔴 高级 2026-01-07 43 次浏览
Yu Guo Shenghao Ye Shuangwu Chen Zijian Wen Tao Zhang Qirui Bai Dong Jin Yunpeng Hou Huasen He Jian Yang Xiaobin Tan
表格问答 剪枝算法 深度学习 SQL执行 多轨迹搜索

核心发现

方法论

本文提出TabTrim框架,利用金SQL查询的中间子表轨迹作为监督信号,训练剪枝器和验证器,实现逐步剪枝的轨迹对齐。训练阶段包括监督微调和偏好优化,验证器通过损失感知评分衡量子表质量。在推理中,采用并行搜索策略,生成多个候选轨迹,通过验证器筛选出最优子表。该方法结合SQL分解、轨迹构建、偏好学习和多轨迹搜索,显著提升表格推理的准确率。核心算法包括金轨迹构建、偏好优化(DPO)和beam搜索,确保剪枝的鲁棒性与多样性。

关键结果

  • 在WikiTQ数据集上,TabTrim-8B模型达到73.5%的平均准确率,比最强基线(Table-Critic 70.3%)提升3.2%。在WikiTQ中达79.4%,在TableBench中61.2%。在多任务场景中表现优异,尤其在复杂推理任务中优势明显。
  • 在不同难度层级中,TabTrim-8B在极难问题上表现尤为突出,准确率比基线提升超过10%。多轨迹搜索显著减少了早期剪枝错误,提升了关键答案数据的保留率。
  • 消融实验显示,偏好优化和多轨迹搜索是性能提升的关键,去除偏好优化后,准确率下降约4%。模型训练中引入偏好学习和轨迹监督,增强了剪枝的语义准确性。

研究意义

该研究突破了传统表格剪枝的局限,解决单一轨迹易陷入局部最优的问题,为复杂表格推理提供了更鲁棒的解决方案。其创新的多轨迹并行搜索机制,有望推动自动化表格理解与推理技术在问答、数据分析等领域的广泛应用,提升大规模知识库的智能检索能力。该方法兼容现有SQL和深度学习模型,为未来多模态、多任务的表格处理奠定基础。

技术贡献

提出基于金SQL轨迹的监督机制,结合偏好优化和多轨迹beam搜索,显著改善剪枝的鲁棒性和多样性。引入损失感知验证器,动态评估子表质量,确保答案关键数据的完整保留。实现从序贯修正到并行探索的转变,提升了剪枝的效率与效果,为表格推理提供了新的技术范式。

新颖性

首次将金轨迹作为监督信号,系统性地将表格剪枝从单一序贯修正转变为多轨迹并行搜索。不同于传统基于错误反馈或概率判断的方法,本文利用SQL分解生成可靠的中间轨迹,结合偏好学习优化剪枝路径,开创了表格剪枝的新思路。多轨迹搜索机制有效避免了局部最优,提升了模型的整体表现。

局限性

  • 依赖金SQL数据集中的轨迹信息,训练数据的依赖性较强,泛化到未标注轨迹的场景可能受限。
  • 多轨迹搜索带来较高的计算成本,尤其在大规模表格和复杂查询中,推理时间较长。
  • 验证器的性能高度依赖训练样本的质量,偏差可能影响最终剪枝效果。

未来方向

未来将探索无监督或弱监督的轨迹生成方法,降低对标注数据的依赖。同时,优化搜索策略以提升效率,结合多模态信息增强剪枝的语义理解能力,推动大规模表格推理的实时应用。还计划将该框架扩展到多任务、多模态场景,实现更广泛的智能表格理解与推理。

AI 总览摘要

在大规模表格问答(TableQA)任务中,表格剪枝作为关键技术,旨在提取简洁且信息完整的子表以提升推理效率。然而,传统剪枝方法多依赖序贯修正,容易受到不可靠的批评信号影响,导致答案关键数据的丢失。本文提出TabTrim框架,通过利用金SQL查询的中间子表轨迹作为监督信号,将剪枝过程从单一序贯修正转变为多轨迹的并行搜索。该方法包括轨迹构建、偏好优化和多轨迹beam搜索,显著改善剪枝的鲁棒性和多样性。在训练阶段,模型学习如何生成符合金轨迹的子表,并通过偏好学习强化对正确轨迹的偏好。在推理时,模型同时探索多个候选轨迹,筛选出最优子表。大量实验证明,TabTrim在WikiTQ、TableBench等多个数据集上均优于现有最优方法,平均准确率提升3.2%,在复杂推理任务中表现尤为突出。该研究不仅突破了传统剪枝的局限,也为未来自动化表格理解提供了新思路,具有重要的学术与应用价值。未来,结合多模态信息和优化搜索策略,将进一步推动该技术在智能问答、数据分析等领域的广泛应用。

深度分析

研究背景

表格问答(TableQA)近年来随着大规模预训练模型的发展,成为自然语言处理的重要研究方向。早期工作如TaBERT、TAPEX等,侧重于表格结构理解和语义匹配,但在处理大规模或复杂表格时,推理效率和准确性仍受限。表格剪枝技术旨在通过筛选冗余信息,提取关键子表,减少模型负担。现有方法多采用基于程序的逐步修正(如SQL分解)或多步推理(如Chain-of-Thought),但都存在剪枝不鲁棒、信息丢失和错误传播的问题。近年来,利用大语言模型(LLMs)进行剪枝评价的研究逐渐兴起,试图通过模型的自我批评改善剪枝质量。然而,现有方法多依赖单一轨迹,易陷入局部最优,难以应对复杂场景。本文在此基础上提出创新框架,结合SQL轨迹构建、多轨迹搜索和偏好学习,推动表格推理技术向更鲁棒、更高效的方向发展。

核心问题

传统表格剪枝方法多依赖逐步修正机制,受限于不可靠的批评信号,难以确保答案关键数据的完整性。序贯修正容易受到早期错误的影响,导致最终子表信息缺失,影响推理准确性。此外,单一轨迹的搜索策略难以跳出局部最优,限制了剪枝的效果。面对复杂查询和大规模表格,这些问题尤为突出,严重制约了TableQA的应用效果。如何设计一种既能保证信息完整,又能高效探索多种剪枝路径的方法,成为亟需解决的核心难题。

核心创新

本文提出TabTrim框架,核心创新包括:1)利用金SQL查询的中间子表轨迹作为可靠的监督信号,确保每一步剪枝都符合正确的推理路径;2)引入偏好优化(DPO),强化模型偏向于正确轨迹,减少语义错误;3)采用多轨迹并行搜索(beam search),同时探索多个候选路径,避免陷入局部最优。这一机制显著提升剪枝的鲁棒性和多样性,确保答案关键数据的完整保留。相比传统单轨迹修正,方法更具探索性和容错性,为复杂场景下的表格推理提供了新思路。

方法详解

  • �� 构建金SQL轨迹:通过SQL分解,将金SQL逐步执行,生成对应的中间子表轨迹,作为监督信号。
  • �� 训练剪枝器:利用轨迹数据,进行监督微调(LSFT)和偏好优化(DPO),使模型学会沿着正确轨迹剪枝,同时能从错误轨迹中恢复。
  • �� 训练验证器:学习评估子表质量的损失感知评分,确保剪枝过程中保留答案关键数据。
  • �� 推理阶段:采用beam search,生成多个候选子表轨迹,利用验证器筛选出最优路径,最终输出最佳子表。
  • �� 关键机制:结合SQL分解、轨迹构建、偏好学习、多轨迹搜索,形成完整的端到端剪枝优化流程。

实验设计

采用WikiTQ、TableBench和TabFact等公开数据集,比较多种基线,包括程序基础、LLM基础和批评机制。模型训练采用80K样本,调优参数包括beam宽度、最大深度等。评估指标为准确率和子表信息完整性。通过消融实验验证偏好优化和多轨迹搜索的贡献,分析不同难度层级的表现差异,确保方法在复杂场景中的鲁棒性。

结果分析

TabTrim-8B在WikiTQ达到73.5%的平均准确率,优于最强基线(70.3%)3.2个百分点。在复杂问题中,提升尤为明显,极难类别准确率提升超10%。多轨迹搜索显著降低早期剪枝错误,提升答案关键数据的保留率。消融实验显示,偏好优化和多轨迹机制是性能提升的关键因素,整体验证了方法的有效性和鲁棒性。

应用场景

该技术适用于自动化表格问答、数据分析和知识库检索等场景。通过提升剪枝鲁棒性和推理效率,可应用于企业智能问答系统、自动报告生成和大规模数据检索。未来结合多模态信息,将实现更复杂的跨模态表格理解与推理,推动行业智能化升级。

局限与展望

当前方法依赖SQL轨迹的构建,训练数据的依赖性较强,泛化能力有限。多轨迹搜索带来较高计算成本,推理时间较长,难以实时应用。验证器性能受训练样本质量影响,可能引入偏差。未来需优化搜索效率,减少计算资源消耗,并扩展到无标注或少标注场景。

通俗解读 非专业人士也能看懂

想象你在整理一个大厨房的食材。每次做菜都需要从一堆杂乱的食材中挑出关键的材料,比如蔬菜、肉类和调料。传统方法就像逐步试错,先挑一些材料,然后发现少了重要的调料,再重新挑选。这样既耗时又容易漏掉关键的东西。现在,有了新方法,就像你事先知道哪些材料是必须的,然后同时准备多个食材组合,最后挑出最合适的那一份。这样不仅省时,还能确保做出的菜味道正宗。这就像论文中的多轨迹搜索,提前规划好多个方案,最后选出最优的那一个,保证菜肴(答案)既美味又完整。

简单解释 像给14岁少年讲一样

嘿,你知道做菜的时候,有时候会试错,先放点盐,结果发现还不够咸,又得重新调料。传统的做法就像这样,一次次试,可能会漏掉一些重要的调料,最后做出来的菜不够完美。现在,想象你有个神奇的厨师助手,它提前告诉你哪些调料一定要用,还帮你准备多个不同的调料组合,然后你只需试试哪个最好。这样一来,不仅省时间,还能做出超级好吃的菜!这就像论文里的新方法,用多个方案同时试,最后挑出最棒的那一个,确保答案既完整又准确。是不是很酷?

原文摘要

Table Question Answering (TableQA) benefits significantly from table pruning, which extracts compact sub-tables by eliminating redundant cells to streamline downstream reasoning. However, existing pruning methods typically rely on sequential revisions driven by unreliable critique signals, often failing to detect the loss of answer-critical data. To address this limitation, we propose TabTrim, a novel table pruning framework which transforms table pruning from sequential revisions to gold trajectory-supervised parallel search. TabTrim derives a gold pruning trajectory using the intermediate sub-tables in the execution process of gold SQL queries, and trains a pruner and a verifier to make the step-wise pruning result align with the gold pruning trajectory. During inference, TabTrim performs parallel search to explore multiple candidate pruning trajectories and identify the optimal sub-table. Extensive experiments demonstrate that TabTrim achieves state-of-the-art performance across diverse tabular reasoning tasks: TabTrim-8B reaches 73.5% average accuracy, outperforming the strongest baseline by 3.2%, including 79.4% on WikiTQ and 61.2% on TableBench.

cs.CL