V4FinBench: Benchmarking Tabular Foundation Models, LLMs, and Standard Methods on Corporate Bankruptcy Prediction

TL;DR

V4FinBench通过TabPFN和Llama-3-8B模型在公司破产预测上表现优异。

cs.LG 🔴 高级 2026-05-12 8 次浏览
Marcin Kostrzewa Sebastian Tomczak Roman Furman Anna Poberezhna Michał Furgała Julia Farganus Oleksii Furman Maciej Zięba
金融预测 机器学习 数据集 TabPFN Llama-3-8B

核心发现

方法论

V4FinBench利用Visegrád集团的公司数据,结合TabPFN和Llama-3-8B模型进行公司破产预测。数据集包含超过一百万条公司年记录,涵盖131个特征和六个预测时段。通过不平衡感知微调,TabPFN在F1-score和ROC-AUC上超越了梯度提升方法。

关键结果

  • TabPFN在长时间预测中,F1-score和ROC-AUC均超过梯度提升方法,尤其在两年及以上的预测中表现突出。
  • Llama-3-8B在所有时段的ROC-AUC上均落后于梯度提升,F1-score在较长时段差距更大。
  • 在美国破产数据集上的外部评估显示,V4FinBench微调的TabPFN比原版TabPFN表现更佳。

研究意义

该研究为公司破产预测提供了一个大规模、公开的基准数据集,填补了现有小规模数据集的空白。通过对比TabPFN和Llama-3-8B模型,研究展示了在不平衡数据下的模型表现,为金融预测领域提供了新的视角。

技术贡献

V4FinBench为金融预测提供了一个大规模的公共数据集,并通过不平衡感知微调展示了TabPFN在长时间预测中的优势。该研究还验证了模型在不同数据集上的迁移能力。

新颖性

V4FinBench首次提供了一个大规模的公司破产预测数据集,结合了多时段预测和不平衡数据处理,展示了TabPFN在长时段预测中的潜力。

局限性

  • 数据集仅限于中欧四国,可能不适用于其他地区。
  • 破产标签基于财务困境标准,而非法律破产。
  • 模型在极端不平衡数据下的表现仍需进一步验证。

未来方向

未来研究可扩展至其他地区的数据集,并探索更多的模型微调策略,以提高在不同经济背景下的模型适用性。

AI 总览摘要

公司破产预测是金融领域的重要任务,然而现有的公开数据集规模较小,限制了模型的评估和应用。为此,研究者们推出了V4FinBench,一个包含超过一百万条公司年记录的数据集,涵盖了中欧四国的公司数据。该数据集支持多时段预测,并提供了不平衡数据下的模型评估基准。

研究中,TabPFN通过不平衡感知微调,在长时间预测中表现优异,超越了传统的梯度提升方法。而Llama-3-8B在所有时段的ROC-AUC上均落后于梯度提升,显示了在结构化数据上的局限性。通过在美国破产数据集上的外部评估,研究验证了V4FinBench微调的TabPFN的迁移能力。

尽管V4FinBench为公司破产预测提供了一个重要的基准,但其局限性在于地理范围的限制和标签定义的局限。未来的研究可以扩展至其他地区的数据集,并探索更多的模型微调策略,以提高模型的适用性和准确性。

深度分析

研究背景

公司破产预测在金融领域具有重要意义,然而现有的公开数据集规模较小,限制了模型的评估和应用。常用的数据集如UCI波兰公司破产数据集和台湾破产预测数据集,规模仅为几千到几万条记录,难以支持大规模模型的训练和评估。

核心问题

现有的公司破产预测数据集规模较小,难以支持大规模模型的训练和评估。此外,多时段预测和数据不平衡问题也增加了预测的难度。

核心创新

V4FinBench提供了一个大规模的公司破产预测数据集,支持多时段预测,并通过不平衡感知微调展示了TabPFN在长时间预测中的优势。该数据集填补了现有小规模数据集的空白。

方法详解

  • �� 数据集来源于Visegrád集团的公司数据,包含超过一百万条公司年记录。
  • �� 使用TabPFN和Llama-3-8B模型进行预测,分别通过不平衡感知微调和QLoRA微调。
  • �� 实验采用五折交叉验证,评估指标包括F1-score和ROC-AUC。

实验设计

实验使用V4FinBench数据集,包含六个预测时段。基线模型包括梯度提升、逻辑回归等。TabPFN通过不平衡感知微调,Llama-3-8B通过QLoRA微调。评估指标为F1-score和ROC-AUC。

结果分析

TabPFN在长时间预测中,F1-score和ROC-AUC均超过梯度提升方法,尤其在两年及以上的预测中表现突出。Llama-3-8B在所有时段的ROC-AUC上均落后于梯度提升,F1-score在较长时段差距更大。

应用场景

V4FinBench可用于评估和开发新的公司破产预测模型,特别是在不平衡数据和多时段预测的场景下。其大规模和多样性使其适用于金融机构和研究人员。

局限与展望

V4FinBench的地理范围仅限于中欧四国,可能不适用于其他地区。此外,破产标签基于财务困境标准,而非法律破产。模型在极端不平衡数据下的表现仍需进一步验证。

通俗解读 非专业人士也能看懂

想象你在一个大商场里,商场里有很多商店,每个商店都有自己的财务状况。V4FinBench就像是一个大数据库,记录了这些商店的财务信息。研究人员使用这个数据库来预测哪些商店可能会破产。就像你在商场里走动,观察每家商店的顾客数量、商品库存和销售情况,研究人员通过分析这些数据来判断商店的经营状况。TabPFN和Llama-3-8B就像是两个聪明的助手,它们帮助研究人员更快、更准确地做出预测。

简单解释 像给14岁少年讲一样

想象一下你在玩一个模拟经营游戏,你需要管理一个虚拟城市里的公司。每家公司都有自己的财务数据,比如收入、支出和利润。V4FinBench就像是游戏里的一个超级工具,帮你收集和分析这些数据。研究人员用这个工具来预测哪些公司可能会破产,就像你在游戏里需要决定哪些公司需要更多的关注和支持。TabPFN和Llama-3-8B就像是游戏里的两个超级助手,它们帮助你更快地做出决策,确保你的城市经济健康发展。

术语表

TabPFN (表格基础模型)

一种用于表格数据预测的模型,能够在上下文中进行学习。

用于公司破产预测的模型之一,通过不平衡感知微调提高性能。

Llama-3-8B (大型语言模型)

一种大型语言模型,通过QLoRA微调进行公司破产预测。

在实验中与TabPFN进行对比,评估其在结构化数据上的表现。

ROC-AUC (受试者工作特征曲线下面积)

一种评估分类模型性能的指标,数值越高表示模型性能越好。

用于评估TabPFN和Llama-3-8B模型在破产预测中的表现。

F1-score (F1评分)

一种综合考虑精确率和召回率的分类性能指标。

在实验中用于评估模型在不平衡数据下的表现。

QLoRA (量化低秩适配器)

一种用于微调大型语言模型的方法,降低计算成本。

用于微调Llama-3-8B模型,以适应公司破产预测任务。

开放问题 这项研究留下的未解疑问

  • 1 如何在其他地区应用V4FinBench的数据集和模型?
  • 2 在极端不平衡数据下,如何进一步提高模型的预测性能?
  • 3 如何结合法律破产信息以提高标签定义的准确性?

应用场景

近期应用

金融机构风险评估

金融机构可以使用V4FinBench数据集和模型来评估公司破产风险,优化信贷决策。

远期愿景

全球金融预测标准

V4FinBench可作为全球金融预测的标准,推动跨国界的金融风险评估。

原文摘要

Corporate bankruptcy prediction is a high-stakes financial task characterized by severe class imbalance and multi-horizon forecasting demands. Public datasets supporting it remain scarce and small: widely used free benchmarks contain between 6,000 and 80,000 company-year observations, while larger resources are behind subscription paywalls. To address this gap, we introduce V4FinBench, a benchmark of over one million company-year records from the Visegràd Group (V4) economies (2006-2021), with 131 financial and non-financial features, six prediction horizons, and a composite distress criterion jointly capturing solvency, profitability, and liquidity deterioration. V4FinBench is designed to support the evaluation of tabular and foundation-model methods under realistic class imbalance, with positive rates between 0.19% and 0.36%. We provide reference evaluations of standard tabular baselines, finetuned TabPFN, and QLoRA-finetuned Llama-3-8B. With imbalance-aware finetuning, TabPFN matches or exceeds gradient boosting at longer time horizons on both $F_1$-score and ROC-AUC. In contrast, Llama-3-8B trails gradient boosting on ROC-AUC at every horizon and is generally weaker on $F_1$-score, with the gap widening sharply beyond the immediate horizon. In an external evaluation on the American Bankruptcy Dataset, the V4FinBench-finetuned TabPFN checkpoint improves over vanilla TabPFN, suggesting that adaptation captures transferable financial-distress structure rather than only V4-specific patterns. V4FinBench is publicly released to support further evaluation and development of prediction methods on realistic financial data.

cs.LG