BiNSGPS: Geometry Problem Solving via Bidirectional Neuro-Symbolic Interaction

TL;DR

BiNSGPS以双向神经符号反馈,在Geometry3K和PGPS9K达90.5%与90.1%。

cs.AI 🔴 高级 2026-06-03 21 次浏览
Qi Wang Peijie Wang Fei Yin Cheng-Lin Liu
几何推理 神经符号 多模态大模型 符号求解器 工具调用

核心发现

方法论

BiNSGPS由多模态表示对齐、Symbolic Solver和MLLM Adviser组成。系统先用PGDPNet解析图形、用MLLM解析文本,形成表示集L;求解器依据定理库R进行超图扩展。若出现矛盾,Adviser修正或删除L中的错误;若推理停滞,则生成辅助假设H,并重新交给求解器验证。

关键结果

  • 在Geometry3K(3,001题)Completion模式达到90.5%,明显高于GPT-5.2的77.9%;在PGPS9K(9,022题)达到90.1%。Choice模式准确率为95.2%,较下一最佳方法在两个数据集分别高10.7和10.9个百分点。
  • 系统在准确性之外保持较强的数学可信度,论文报告其逐步逻辑一致性达到96%。Symbolic Solver通过超图节点、定理超边及父节点指针保存可追溯证明链,减少MLLM表面合理但错误的推导。
  • 双向反馈针对两类失败:冲突触发表示纠错,死锁触发辅助假设生成。PGDPNet的元素和位置关系识别率超过99%,为MLLM提供视觉锚点;但论文未给出完整模块消融表或各反馈模式的独立增益。

研究意义

该工作回应了几何AI长期存在的两难:纯符号系统严谨但脆弱、规则覆盖有限,纯神经系统灵活却容易产生幻觉。BiNSGPS把求解器从被动后端变成主动诊断器,使错误能够回流到感知与形式化阶段。其价值不仅在于提升竞赛题准确率,也在于展示一种可验证的多模态智能体范式:大模型负责理解、策略和补充直觉,符号系统负责约束、验证与证明。

技术贡献

核心工程贡献是将传统单向“神经解析→符号推理”改造成agentic tool-calling闭环。求解器把几何事实表示为超图节点,把定理表示为超边,并在冲突或无新结论时输出诊断。Adviser在纠错模式中只能修改或删除已有表示,在假设模式中生成带Rationale-Conclusion顺序的H;最终通过最小解图回溯,再由MLLM生成可读证明。

新颖性

与AlphaGeometry、AlphaGeometry2、AutoGPS和GeoDRL等主要单向协作方法相比,BiNSGPS的基本创新不是增加一个更大的模型,而是让符号求解器“反向发言”。反馈被明确分为表示纠错与辅助假设两种机制,分别处理感知错误和规则库不完备,从而形成可迭代、自校正的神经符号交互。

局限性

  • 系统仍依赖PGDPNet、MLLM解析质量和预定义定理库;复杂、模糊或超出训练分布的图形可能导致锚点错误或反复反馈。
  • 论文给出总体准确率和96%一致性,但提供的正文信息缺少完整消融、迭代次数、运行成本及失败案例统计,难以精确判断每个组件的边际贡献。
  • 达到最大迭代次数后采用MLLM数值回退,虽有结构化视觉输入,却可能牺牲符号可验证性。

未来方向

后续可系统研究反馈轮数、假设质量和规则库规模的关系,发布更完整的消融与成本评测;还可扩展到三维几何、开放式证明和更复杂的辅助作图。重要方向包括学习可验证的定理发现、对假设进行概率排序,以及用形式化证明检查器替代部分回退流程。

AI 总览摘要

几何题是检验人工智能能否同时理解图像、语言和严格逻辑的典型任务。传统符号方法依赖精确形式化,初始解析一错便可能整体崩溃;纯神经模型虽灵活,却常生成貌似合理的错误证明。AlphaGeometry、AutoGPS等神经符号系统改善了这一矛盾,但多数仍是单向流水线,求解器无法向前端反馈。

BiNSGPS提出双向神经符号交互。系统首先用PGDPNet提取点、线、圆及位置关系,再由MLLM Adviser整合文本与图形信息,生成表示集L。Symbolic Solver把事实建成超图,以定理库R扩展推理链:若发现冲突,要求Adviser纠正或删除错误表示;若陷入死锁,则要求其提出辅助假设H。求解成功后,系统回溯最小解图,并将形式证明翻译成人类可读文本。

在Geometry3K和PGPS9K上,Completion准确率分别为90.5%和90.1%;Choice模式达到95.2%,较次优方法分别高10.7和10.9个百分点,Geometry3K上超过GPT-5.2的77.9%。逐步逻辑一致性为96%。不过,结果仍依赖PGDPNet和规则库,正文未提供完整消融与成本分析。总体而言,BiNSGPS的重要意义在于把大模型的直觉置于符号验证之下,同时允许验证器反向修复感知错误,展示了更可靠的多模态推理架构。

深度分析

研究背景

几何推理经历了专用神经网络、符号系统和神经符号混合三个阶段。PGPSNet、LANS和G-LLaVA强调视觉直觉;InterGPS、E-GPS强调形式规则;AlphaGeometry与AlphaGeometry2结合语言模型和符号引擎。问题在于,前者会幻觉,后者怕解析错误且受规则覆盖限制,已有混合系统多为单向传递。

核心问题

给定图形D与文本T,系统必须识别结构、对齐约束、选择定理并生成正确答案与证明。难点包括图形感知误差、文本指代不清、隐含几何事实缺失,以及定理库无法覆盖新构型。单向架构中,任何早期错误都可能被后续推理放大,死锁也没有有效的神经反馈通道。

核心创新

  • ��双向反馈:Symbolic Solver输出冲突诊断或死锁状态。•表示纠错:MLLM仅修改或删除L中的可疑事实,并以PGDPNet识别的基本元素B和位置关系P为锚点。•辅助假设:死锁时生成形式化H,扩充L。•可验证输出:求解器回溯最小证明图,MLLM只负责语言化。与单向神经符号方法相比,系统形成闭环自校正。

方法详解

  • ��输入:图形D和文本T。•标准化:必要时调用小型模型为图中点添加唯一字母,得到D′。•双源抽取:PGDPNet提取点、线、圆及PointLiesOn等关系;MLLM以few-shot方式解析文字。•整合:形成统一表示集L,并优先相信高精度视觉事实。•求解:完成隐含事实后,以超图节点和定理超边迭代扩展;每个结论保存父节点与规则。•反馈:冲突时纠错,死锁时生成H。•输出:回溯最小路径并生成自然语言证明;超限则采用Analyze-Answer-Proof回退。

实验设计

实验使用Geometry3K(3,001个图文题对)和PGPS9K(9,022个题对),每题含四个选项。评测包括Choice模式和独立求数值的Completion模式,并加入人工评估的Step-wise Logical Coherence。比较对象覆盖神经方法、符号方法、MLLM及神经符号系统;正文明确报告GPT-5.2和PGDPNet相关结果,但未完整列出所有消融细节。

结果分析

BiNSGPS在Choice模式达到95.2%,在Geometry3K和PGPS9K上分别领先次优方法10.7和10.9个百分点。Completion模式准确率为90.5%和90.1%,Geometry3K上高于GPT-5.2的77.9%。PGDPNet基本元素与位置关系识别率超过99%,逐步逻辑一致性达到96%。这些结果支持“专用感知+符号验证+MLLM反馈”的组合。

应用场景

可用于几何教育辅导、竞赛题自动批改、可解释数学问答和教材证明生成。实际部署需要可靠的图形解析器、覆盖目标课程的定理库,以及对MLLM生成假设进行符号验证。其工具调用结构也可迁移到物理图示、工程草图和科学图表推理。

局限与展望

方法假设PGDPNet能够稳定识别图形基本事实,且定理库包含大部分常用规则;对模糊图、复杂辅助线和分布外问题仍可能失败。反馈循环会增加推理延迟与调用成本,最大迭代后的MLLM回退不保证严格证明。论文摘要和正文节选缺少完整消融、硬件、平均轮数及统计显著性,未来应补充可复现实验。

通俗解读 非专业人士也能看懂

把BiNSGPS想成一个解几何题的团队。第一位成员像眼睛,负责从图中认出点、线和圆;第二位成员像经验丰富的老师,把题目文字翻译成明确的事实;第三位成员像严谨的检查员,按照规则一步步验证答案。

普通团队是单向接力:前面看错了,后面只能继续错。BiNSGPS不同,检查员发现两句话互相矛盾时,会把错误退回给前面的成员,让他修改;如果所有已知规则都用完了却还没答案,检查员会请老师补充一个可能有用的新条件。新条件也必须再次检查,不能直接当真。

例如,图中某条线被误认为切线,检查员会发现它实际上穿过圆两次,于是要求删除这个判断。若题目是梯形,老师可能补充“中位线等于两底边平均值”。这样,系统既利用机器的观察和联想,又保留严格核对,最后只把真正用到的步骤整理成清楚证明。

简单解释 像给14岁少年讲一样

想象你在玩一个几何解谜游戏。你有三个队友:一个负责看地图,一个负责理解任务说明,一个负责像裁判一样检查每一步是否符合规则。看地图的队友使用PGDPNet,能很准确地认出点、线和圆;理解说明的队友是MLLM Adviser;裁判就是Symbolic Solver。

普通AI像“只许往前传话”的队伍:如果第一步把切线看错,后面即使算得很认真,也会得到错误答案。BiNSGPS允许裁判把错误直接退回去:“这里两条线互相矛盾,请重新检查!”如果规则书里没有下一步,裁判还会说:“请提出一个可能的新条件,但我会先验证它。”

它把每一步推理连接起来,像游戏中的任务树。找到答案后,只保留真正需要的路线,再把机器语言改写成普通人能读懂的证明。实验中,它在Geometry3K上完成题准确率90.5%,在PGPS9K上为90.1%,步骤逻辑一致性达96%。很酷吧?不过它仍可能看错特别复杂的图,也会花更多时间反复检查。

术语表

Bidirectional Neuro-Symbolic Interaction(双向神经符号交互)

让神经模型与符号求解器相互传递信息,而非只有神经模型向求解器输出。求解器可反馈冲突或死锁。

BiNSGPS的核心闭环机制。

MLLM Adviser(多模态大模型顾问)

同时处理图像和文本、负责策略、纠错及假设生成的语言模型组件。

它协调解析工具与Symbolic Solver。

Symbolic Solver(符号求解器)

依据形式事实和定理规则进行可验证演绎的程序。论文使用超图表达推理过程。

负责发现矛盾、死锁并验证答案。

PGDPNet

用于几何图形元素与位置关系识别的专用解析网络。论文报告其识别率超过99%。

为MLLM提供高精度视觉锚点。

Hypergraph Expansion(超图扩展)

把事实作为节点、定理作为连接多个前提并产生结论的超边。新结论不断加入图中。

Symbolic Solver的主要推理方式。

Auxiliary Hypothesis(辅助假设)

在规则库无法继续推理时提出的补充几何事实。它必须经过符号求解器检查。

用于打破deductive deadlock。

开放问题 这项研究留下的未解疑问

  • 1 尚不清楚双向反馈相较单向系统的独立增益,因为节选未提供完整消融、平均迭代轮数和失败类型统计。
  • 2 规则库之外生成的辅助假设如何保证完备性、低幻觉率与可证明性,仍需要形式化验证和大规模开放题测试。
  • 3 PGDPNet对模糊、遮挡或三维图形的鲁棒性,以及系统在不同语言和教育体系中的迁移能力尚未充分评估。

应用场景

近期应用

智能几何辅导

教育平台可用BiNSGPS读取题干和图形,逐步给出可验证提示,而不是只返回答案。部署需准备课程定理库、PGDPNet解析器和可视化证明界面,适合家庭学习与教师备课。

竞赛题自动批改

系统可在Choice和Completion两种模式下检查答案及推理链,利用Symbolic Solver定位矛盾步骤。学校或题库平台可据此生成错误诊断,但应保留人工复核机制。

远期愿景

可验证科学推理代理

将双向反馈扩展到物理、工程和三维空间推理,使大模型提出假设、专用程序验证结论。主要障碍是跨领域规则库、计算成本和统一形式语言。

原文摘要

Geometry problem solving poses distinct challenges in artificial intelligence. Existing approaches typically fall into two paradigms: symbolic methods, which exhibit limited adaptability, and neural methods, which are prone to hallucinations. Recent neuro-symbolic hybrids predominantly rely on a unidirectional pipeline where neural outputs are fed into solvers without feedback, making system brittle to early-stage errors. To break this unidirectional bottleneck, we propose BiNSGPS, a framework that establishes Bidirectional Neuro-Symbolic Interaction (BiNS) between a MLLM Adviser and a Symbolic Solver. MLLM Adviser actively incorporates feedback from the symbolic solver to dynamically rectify inconsistent formal representations or propose auxiliary hypotheses, resolving symbolic conflicts and facilitating complex deductions.

cs.AI