Algorithmic Blindness in Large Language Models: A Calibration Study of Performance Prediction

TL;DR

本研究评估8个前沿大模型在因果发现算法性能预测中的校准能力,发现普遍存在算法盲视。

cs.CL 🔴 高级 2026-02-25 56 次浏览
Sohan Venkatesh Ashish Mahendran Kurapath Tejas Melkote
人工智能 大模型 因果推断 模型校准 算法性能

核心发现

方法论

采用因果发现作为评估平台,利用13个公开数据集和4种算法(如PC、FCI、LiNGAM、NOTEARS),通过100次重复实验获得真实性能指标。用8个前沿大模型(如Claude、GPT-5)生成算法性能范围预测,评估其校准度(覆盖率)。采用标准指标(精确率、召回率、F1、SHD)衡量模型预测的准确性,结合不同提示策略确保结果稳健。通过比较预测区间与真实值的覆盖情况,检测模型的校准能力。

关键结果

  • 所有模型平均校准覆盖率仅为15.9%,远低于随机猜测的36.5%,表现极差。Claude模型虽表现较好(39.4%),但仍远低于理想水平。大模型在不同算法和指标上均表现不佳,7个模型低于随机基线,说明绝大多数模型未能提供有用的性能预测。
  • 模型预测区间宽度远大于真实置信区间(平均宽度为4.34对比synthetic数据的9.83),但仍未覆盖真实值,显示严重校准偏差。不同数据集(基准与合成)之间的性能差异显著,模型更依赖记忆而非结构化推理。
  • 在synthetic数据上,模型表现随网络规模增加而退化(覆盖率从20.3%降至6.2%),表明模型难以泛化到未见过的复杂结构。模型间一致性低,表明缺乏基于算法和图结构的合理推断能力。

研究意义

本研究揭示了大模型在算法性能预测中的根本局限性,即所谓的‘算法盲视’。这表明当前大模型在结构化推理任务中的能力远未达到实用水平,提醒行业在依赖大模型进行算法选择和性能评估时应保持谨慎。研究强调了模型对算法理解的深层次缺失,促使未来在模型校准和结构推理方面进行突破,推动自动化算法选择的科学发展。

技术贡献

本文首次系统性评估了多模型在因果发现算法性能预测中的校准能力,结合标准化指标和真实数据,揭示模型普遍存在校准偏差。提出了‘算法盲视’的概念,强调模型在从结构特征中推断性能方面的根本不足。研究采用多样数据集和算法,验证模型在复杂结构下的泛化能力,提供了量化的性能偏差指标,为未来模型校准和结构推理提供理论基础。

新颖性

本研究首次将大模型性能预测的校准问题系统化,利用因果发现作为测试平台,结合多数据、多算法、多指标,揭示模型在结构化推理中的普遍缺陷。提出‘算法盲视’概念,区别于传统的知识缺失或推理能力不足,强调模型在结构化性能预估中的根本局限。这为大模型在自动算法选择中的应用提供了重要警示。

局限性

  • 评估仅限于因果发现领域的四个算法,其他领域的表现可能不同,模型在不同任务中的泛化能力尚未验证。
  • 实验依赖于特定数据集和指标,未来需扩展到更多任务和指标以验证普适性。
  • 模型的训练和微调策略可能影响结果,未来应探索不同提示和训练方法对校准能力的影响。

未来方向

未来应结合知识增强、推理引擎和结构化推断技术,提升模型的性能预测和校准能力。探索多模态和交互式提示策略,增强模型对复杂结构的理解。推动模型在多任务、多领域中的泛化能力,最终实现更可靠的自动算法选择和性能评估体系。

AI 总览摘要

当前大规模语言模型(LLMs)在知识广度方面表现卓越,但其在推理计算过程中的能力仍存严重缺陷。本研究以因果发现算法性能预测为测试平台,系统评估了8个前沿模型在13个公开数据集和4种算法上的表现。通过100次重复实验获得真实性能指标,比较模型预测区间的校准情况,发现绝大多数模型的覆盖率远低于随机猜测,平均仅为15.9%。模型预测的区间宽度远大于真实置信区间,显示出严重的校准偏差,且在复杂结构(如大规模网络)上表现更差,表明模型难以进行结构化推理。特别是,7个模型的表现甚至低于随机基线,唯一的Claude模型略优(39.4%),但仍不足以作为可靠的性能预测工具。这揭示了所谓的‘算法盲视’——模型在从问题结构中推断算法性能方面的根本缺陷。模型的预测偏差主要源于对基准统计的记忆,而非真正的结构化推理。这一发现对自动算法选择和性能评估提出了警示,强调了模型在结构理解和校准方面的巨大改进空间。未来应结合知识增强和推理机制,推动模型在复杂任务中的泛化能力,逐步实现可信赖的自动化算法推荐体系。

深度分析

研究背景

人工智能领域中,算法性能预测一直是自动化系统的核心难题。早期方法依赖于元学习和贝叶斯优化(如Auto-WEKA、Auto-sklearn),旨在根据特定任务特征选择最优算法。近年来,随着大模型的发展,研究者尝试利用其强大的知识存储能力进行算法推荐(如排名和排序任务),但多项校准研究显示模型在概率输出上的偏差(如Overconfidence问题)。因果发现作为结构化推理的典范,提供了标准化的性能指标(如精确率、召回率、F1、SHD)和丰富的基准数据集(bnlearn、Sachs等),成为检验模型推理能力的理想平台。尽管如此,关于大模型在结构推理中的理解能力仍缺乏系统性验证,特别是在性能预测和校准方面的研究尚属空白。

核心问题

核心问题在于,尽管大模型在知识表达方面表现出色,但其在结构化推理任务中的性能预测能力严重不足。具体表现为模型生成的性能区间宽泛,且未能有效覆盖真实值,导致在算法选择时缺乏可靠的校准。这一问题阻碍了模型在自动化算法推荐中的实际应用,尤其是在复杂网络结构和未见过的任务场景中。模型的预测偏差源于其对训练数据中统计信息的过度依赖,而非真正理解算法的结构和行为。这种‘算法盲视’限制了大模型在结构推理中的潜力,亟需系统性评估和改进。

核心创新

本研究的创新点在于:首先,提出将因果发现作为性能预测的测试平台,结合多数据、多算法、多指标,全面评估模型的校准能力。其次,定义并量化‘算法盲视’这一新概念,揭示模型在结构推理中的根本缺陷。再次,采用真实的多次重复实验获得基准性能,为模型校准提供客观参考。最后,通过synthetic数据验证模型在结构复杂度增加时的泛化能力退化,强调记忆而非推理的局限性。这些创新为理解大模型在结构推理中的能力提供了新的视角。

方法详解

  • �� 采集13个bnlearn基准数据集和4个合成数据集,构建多样化的结构场景。• 对每个数据集和算法(PC、FCI、LiNGAM、NOTEARS)重复100次,计算性能指标(精确率、召回率、F1、SHD),得到真实性能的统计基准。• 设计3种不同提示策略,向8个前沿大模型(如Claude、GPT-5)提问,生成算法性能范围预测。• 采用平均覆盖率作为校准指标,衡量模型预测区间是否包含真实平均值。• 引入随机和启发式基线,比较模型表现。• 通过synthetic数据分析模型在不同网络规模下的泛化能力,检测记忆偏差。

实验设计

实验包括在13个公开数据集和4个synthetic数据集上,评估8个大模型的性能预测能力。每个模型对每个算法和指标生成3个提示版本的预测区间,计算覆盖率。对比随机和启发式基线,验证模型的校准偏差。分析模型在不同数据类型和网络规模下的表现差异,特别关注synthetic数据的泛化能力。通过多模型交叉一致性和范围宽度分析,揭示模型是否依赖记忆或真正理解结构推理。

结果分析

所有模型平均校准覆盖率仅为15.9%,远低于随机猜测的36.5%,表现极差。Claude模型虽表现较好(39.4%),但仍远低于理想水平。大模型在不同算法和指标上均表现不佳,7个模型低于随机基线,说明绝大多数模型未能提供有用的性能预测。模型预测区间宽度远大于真实置信区间,显示出严重的校准偏差。synthetic数据上,模型表现随网络规模增加而退化,覆盖率从20.3%降至6.2%。模型间一致性低,表明缺乏基于算法和图结构的合理推断能力。这些结果表明,当前大模型在结构化推理中的能力严重不足,难以作为可靠的性能预测工具。

应用场景

本研究结果对自动化算法选择、结构推理和模型校准具有重要指导意义。未来可结合知识增强、推理引擎和多模态提示策略,提升模型在复杂场景中的性能预测能力。行业中,自动化系统可借助改进的模型实现更可靠的算法调度和故障诊断,推动智能系统的自主决策能力。长远来看,建立基于结构推理的性能评估体系,将极大促进人工智能在科学研究、工程优化等领域的应用。

局限与展望

本研究仅评估了因果发现领域的四个算法,其他结构化推理任务可能表现不同。模型在复杂网络和未见数据上的泛化能力仍有限,未来需探索多任务、多领域的验证。实验依赖特定数据集和指标,可能存在偏差。模型训练和提示策略的不同也会影响结果,未来应系统性优化提示设计和训练方法。

通俗解读 非专业人士也能看懂

想象一个工厂每天都在生产不同的产品。工厂的工人(模型)需要根据产品的设计图(问题结构)判断生产效率(算法性能)。一些工人只记住了常见产品的生产时间(记忆),而没有真正理解设计图的细节(推理)。当遇到新颖或复杂的设计图时,他们的判断变得非常不准确,甚至比随机猜测还差。这就像大模型在预测算法表现时,依赖于记忆而非理解,导致预测范围宽泛但不可靠。这个问题就叫‘算法盲视’,意味着模型没有真正理解设计图背后的原理,只是在模仿过去的经验。未来,要让工厂的工人真正懂得设计图的逻辑,就需要他们学习更多原理,而不是死记硬背。这样,工厂才能更高效、更智能地应对各种新产品的生产挑战。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你的朋友(模型)试图猜出某个复杂迷宫的最佳路线。这个朋友平时只记住了以前遇到的迷宫路径(记忆),但没有真正理解迷宫的结构。当遇到新迷宫时,他的猜测就变得很糟糕,甚至比随便走走还差。这就像大模型在预测算法表现时,只是依赖以前看到的统计信息,没有真正理解算法背后的原理。研究发现,这些模型的预测范围非常宽,很多时候都不能包含真实的表现结果,说明它们根本没有真正理解问题,只是在模仿过去的经验。就像那个猜迷宫的朋友,他需要学习迷宫的基本结构和逻辑,才能更好地找到出路。未来,我们希望模型能像聪明的探险家一样,真正理解迷宫的设计,而不是死记硬背过去的路径。这样,它们才能在面对新迷宫时,做出更准确的预测和决策。

原文摘要

Large language models (LLMs) demonstrate remarkable breadth of knowledge, yet their ability to reason about computational processes remains poorly understood. Closing this gap matters for practitioners who rely on LLMs to guide algorithm selection and deployment. We address this limitation using causal discovery as a testbed and evaluate eight frontier LLMs against ground truth derived from algorithm executions. We find systematic, near-total failure across models. The predicted ranges are far wider than true confidence intervals yet still fail to contain the true algorithmic mean in most cases. Most models perform worse than random guessing. The best model's marginal improvement points to benchmark memorization rather than principled reasoning. We term this failure algorithmic blindness and argue it reflects a fundamental gap between declarative knowledge about algorithms and calibrated procedural prediction.

cs.CL