Long SKILL Compliance as Logical Reasoning: Closure-Grounded Detection with Scaling-Guided On-Policy Distillation

TL;DR

提出SkillCDG,通过两层图模型提升长SKILL合规检测,F1提升12.8%,节省64.3%令牌。

cs.AI 🔴 高级 2026-08-08 42 次浏览
Shuaitao Zhao Feng Ni Lichao Ma Jiaye Lin Fei Han Yang Wei Lu Pan
自然语言处理 合规检测 图结构 模型缩放 知识蒸馏

核心发现

方法论

本研究提出SkillCDG框架,将企业长SKILL政策转化为两层约束依赖图:上层索引场景路由,下层捕获原子约束依赖关系。在推理阶段,先进行两级检索,再通过依赖闭包补全完整规则子图,结合LLM进行合规判断。采用图结构明确逻辑依赖关系,支持源追溯,减少冗余信息。通过对三企业数据集和两个公开基准的评估,验证了该方法在检测F1提升至12.8%、令牌节省64.3%的同时,模型规模与策略复杂度呈现出一致的缩放规律。引入复杂度指标(规则密度、依赖耦合)量化策略难度,结合模型缩放趋势,提出基于策略复杂度的自适应样本选择和On-Policy蒸馏策略,有效提升小模型性能。

关键结果

  • 在三企业数据集上,SkillCDG在检测F1上比基线最高提升12.8个百分点,且令牌消耗最大降低64.3%,显著优于RawSkill和LightRAG方法。
  • 模型规模从Qwen3.5-4B到27B,检测正确率呈现饱和趋势,策略复杂度指标(依赖耦合)能有效预测实例难度和模型性能提升空间。
  • 基于策略复杂度的样本优先级排序,结合蒸馏策略,显著提升小模型在长政策合规检测中的表现,验证了缩放规律的实用性。

研究意义

本研究突破了长企业政策合规检测的瓶颈,将图结构引入逻辑推理,提升检测准确性和效率,为企业自动审计、法规遵从提供了技术支撑。通过模型缩放规律的发现,推动了模型能力的渐进式提升,降低了大模型部署成本,具有重要的理论和应用价值。该方法可广泛应用于金融、保险、供应链等行业的合规审查,推动智能审计的自动化和智能化发展。

技术贡献

提出基于两层约束依赖图的长SKILL合规检测框架,结合图遍历和依赖闭包实现逻辑完整性。引入策略复杂度指标,量化策略难度,结合模型缩放规律,设计自适应样本选择和蒸馏策略。实现模型规模与策略复杂度的联合建模,突破传统单一模型性能提升的局限,为模型压缩和知识蒸馏提供新思路。

新颖性

首次将企业长政策转化为两层图结构,明确逻辑依赖关系,结合模型缩放规律实现性能预测和优化。区别于传统语义图或规则匹配,强调逻辑完整性和依赖闭包,提升检测的逻辑严密性。提出基于策略复杂度的模型缩放规律,为模型选择和样本优先级提供理论基础,具有创新性。

局限性

  • 当前方法依赖预定义的政策结构,面对极端复杂或模糊政策时可能表现不足,且对政策的格式和标注要求较高。
  • 模型缩放规律在特定数据集和模型族中验证,泛化到其他行业或不同模型架构仍需验证。
  • 推理过程中的图遍历和闭包计算存在一定的计算成本,可能影响大规模部署的实时性。

未来方向

未来将探索自监督的策略复杂度估计方法,降低对人工标注的依赖;同时结合多模态信息丰富策略依赖图,提升复杂场景下的合规检测能力。还将研究模型压缩与蒸馏的动态调度策略,实现更高效的模型部署和维护,推动企业智能审计的普及。

AI 总览摘要

随着企业业务场景日益复杂,企业政策文件逐渐变长,传统的合规检测方法面临效率低、准确率不足的挑战。现有模型在处理长文本时,难以兼顾逻辑完整性与推理效率,导致误判和漏检频发。为应对这一难题,本文提出SkillCDG框架,利用两层图结构对长SKILL政策进行建模,将复杂的业务规则转化为明确的依赖关系图。上层索引策略场景,下层捕获原子约束,结合图遍历和闭包技术,有效支持合规判断和源头追溯。实验在多企业数据集和公开基准上验证,SkillCDG在检测F1提升12.8个百分点的同时,显著减少令牌消耗,达到了高效、准确的双重目标。研究还揭示模型规模与策略复杂度的缩放规律,提出基于策略复杂度的样本优先级和蒸馏策略,显著提升小模型性能。这一创新方法为企业自动审计提供了理论基础和实践工具,有望推动法规遵从自动化的广泛应用。

深度分析

研究背景

企业长政策文件在合规审查中的重要性不断提升,传统基于规则或关键词匹配的方法难以应对长文本中的复杂逻辑关系。近年来,图结构和逻辑推理方法逐渐成为研究热点,代表工作包括知识图谱构建、语义关系抽取等。尽管如此,长文本中的依赖关系复杂,如何高效准确地提取和利用这些关系,仍是行业难题。现有方法如RAG和语义图虽能改善信息访问,但在逻辑完整性和推理效率方面仍有不足。企业政策的多样性和复杂性要求新型结构化建模技术,特别是在保证逻辑严密的同时,兼顾推理速度和模型规模的平衡。

核心问题

长SKILL政策的合规检测面临多重挑战:一是政策文本庞大,信息分散,导致检索成本高;二是政策规则之间存在复杂的逻辑依赖,单纯检索难以保证完整性;三是现有模型在处理长文本时,推理效率低、准确率不足,限制了实际应用。如何在保证逻辑完整性的基础上,提高检测效率和模型适应性,成为行业亟需解决的问题。这不仅关系到企业合规的自动化水平,也影响到法规遵从的效率和准确性。

核心创新

本研究的核心创新在于提出两层约束依赖图(CDG)模型,将长政策文本转化为结构化的逻辑图,明确规则间的依赖关系。上层索引场景,支持快速定位相关政策;下层捕获原子规则及其依赖,支持逻辑闭包。结合图遍历和闭包机制,有效保证逻辑完整性。引入策略复杂度指标,量化政策难度,结合模型缩放规律,设计自适应样本筛选和蒸馏策略,提升小模型性能。这一方法区别于传统的语义匹配或知识图谱,强调逻辑严密和推理可追溯,具有理论创新和工程实用价值。

方法详解

  • �� 构建长SKILL政策的两层约束依赖图(CDG),上层索引策略场景,下层存储原子规则及其依赖关系。
  • �� 离线阶段:将长文本拆分成语义块,提取原子规则,构建局部子图,融合成完整规则图,定义require关系。
  • �� 在线阶段:
  • 通过关键词检索快速定位相关场景和规则。
  • 从种子规则出发,遍历require边,生成完整依赖闭包。
  • 利用LLM对闭包进行合规判断,源跨度提供证据支持。
  • �� 通过策略复杂度指标(规则密度、依赖耦合)量化策略难度,结合模型缩放规律,设计样本优先级和蒸馏策略,优化模型性能。

实验设计

采用三家企业的订单履约、售后和商户支持等数据集,以及公开的CompliBench和Long变体,评估检测准确率和F1。比较RawSkill、LightRAG和SkillCDG在不同模型(Qwen3.5、DeepSeek-V4、GPT-5)上的表现。重点分析模型规模与策略复杂度的关系,验证缩放规律的有效性。实验设置包括不同模型参数、不同策略复杂度阈值,采用交叉验证和置信区间估计,确保结果的稳健性。

结果分析

SkillCDG在三企业数据集上,F1最高提升12.8个百分点,令牌消耗最大降低64.3%,优于对比方法。模型规模从4B到27B,检测正确率表现出饱和趋势,策略复杂度指标能有效预测实例难度。基于复杂度的样本优先级排序,结合蒸馏策略,显著提升小模型性能,验证了模型缩放和策略复杂度的关系,为实际部署提供理论指导。

应用场景

该方法适用于企业自动审计、法规遵从、合同合规检测等场景,依赖企业政策文本的结构化表示和逻辑依赖关系。可实现自动化合规检测、风险识别和源头追溯,降低人工成本,提高审查效率。未来还可结合多模态信息,扩展到更复杂的场景,实现全流程自动化合规管理。

局限与展望

当前模型对政策格式和标注依赖较强,面对模糊或极端复杂政策时表现不足。图遍历和闭包计算存在一定成本,可能影响大规模实时应用。模型缩放规律在特定数据集验证,泛化到其他行业仍需验证。未来需优化图结构构建和推理效率,增强模型的鲁棒性和泛化能力。

通俗解读 非专业人士也能看懂

想象你在管理一个复杂的工厂,工厂里有许多工序和规则,每个工序都依赖前面的步骤。要确保整个生产流程顺利,必须知道每个步骤的前置条件和依赖关系。传统方法就像只看每个工序的说明书,容易遗漏关键步骤或误判。本文提出的方法像是用一张详细的流程图,把每个工序和它的依赖关系都画出来。这样一来,工厂管理者可以快速找到问题所在,确保每个环节都符合规定。通过这种结构化的方式,不仅提高了效率,还能更准确地检测出潜在的违规行为。就像在厨房做菜,知道每个调料的用量和顺序,才能做出美味佳肴。这个方法让企业的政策变得像一份清晰的操作手册,自动检测是否遵守了所有规则。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的拼图游戏,每个拼图块都代表一个规则或条件。要拼出完整的图案,你需要知道每个拼图块的前置条件,比如哪个拼图必须先放,哪个可以后放。有时候,拼图太多,容易搞错顺序或者漏掉重要的部分。这个研究就像是设计了一张超级聪明的拼图指南,把所有拼图块的关系都画出来,告诉你哪个必须先放,哪个可以后放。这样一来,你就可以用这张图快速找到拼图的正确顺序,确保拼出来的图案没有漏洞。它还会告诉你哪些拼图最难拼,帮你优先处理那些关键部分。最终,这个方法让拼图变得更简单、更快,也更容易拼出完美的图案。就像在游戏中找到最强的策略一样,帮助企业自动检测政策是否被正确遵守,避免出错。

原文摘要

The increasing complexity of enterprise business scenarios has promoted the widespread adoption of long SKILL documents in agent systems, posing new challenges for compliance detection: large models incur substantial inference costs, while small models may fail to maintain detection accuracy. To address this gap, we propose SkillCDG, a graph-based framework for long SKILL compliance detection. SkillCDG represents complex business policies as a two-layer constraint dependency graph, where the upper layer indexes SKILL descriptions for scenario routing and the lower layer captures dependencies among atomic constraints within each SKILL. During inference, two-level retrieval followed by dependency closure supports compliance judgment and source traceability. We comprehensively evaluate the framework on three enterprise datasets and two controlled public benchmark variants. Experimental results demonstrate that SkillCDG outperforms baseline methods by up to 12.8 percentage points in detection F1 score, while reducing token consumption by a maximum 64.3\%. Moreover, we further investigate the inherent relationships among policy-graph complexity, model scale, and detection performance. Comparative experiments conducted on four checkpoints from a single model family validate a concise and effective scaling trend: end-to-end detection correctness exhibits a complexity-differentiated scaling pattern, and the complexity metric derived from the constraint dependency graph can effectively quantify instance difficulty and the performance improvement potential of models. Leveraging this insightful scaling trend, we conduct adaptive training sample selection and adopt on-policy distillation to efficiently enhance the compliance detection capability of small-scale models.

cs.AI