StakeBench: Evaluating Language Understanding Grounded in Market Commitment

TL;DR

StakeBench框架通过市场承诺评估语言理解,包含560,876条评论和四个诊断任务。

cs.CL 🔴 高级 2026-05-26 5 次浏览
Yunhua Pei Jingyu Hu Yiwei Shi Hongnan Ma Weiru Liu John Cartlidge
金融NLP 市场承诺 语言理解 大语言模型 预测市场

核心发现

方法论

StakeBench通过链接Polymarket和Manifold平台的评论与市场记录,提出四个任务:市场承诺检测、揭示面识别、未来行动预测和集体赔率投射。监督信号来源于可观察的市场行为,而非人类注释。

关键结果

  • 结果1:15个LLM在揭示面识别任务上的定向准确率为0.506到0.599,显示出对市场承诺信号的部分恢复能力。
  • 结果2:大多数模型在未来行动预测任务中仅能识别一到两个行动标签,显示出结构性失败。
  • 结果3:在集体赔率投射任务中,无模型能持续优于基线,显示出模型规模与性能不相关。

研究意义

StakeBench通过市场承诺信号替代感知标签,提供了金融NLP的新评估框架,挑战了现有模型在市场语言理解中的能力,揭示了模型在识别市场承诺和预测市场行为方面的局限性。

技术贡献

StakeBench通过无注释的市场记录提供监督信号,提出了四个新的诊断任务,并定义了三种承诺感知指标,挑战了现有模型在市场语言理解中的能力。

新颖性

StakeBench是首个将语言与验证的金融位置、交易行为和市场赔率信号相结合的评估框架,替代了传统的感知标签。

局限性

  • 局限1:模型在未来行动预测任务中表现不佳,显示出对行为变化的过度预测。
  • 局限2:在集体赔率投射任务中,模型未能超越基线,显示出对集体信号的不足。

未来方向

未来研究可探索如何改进模型在市场承诺信号识别和行为预测方面的能力,特别是在集体信号识别和预测市场行为方面。

AI 总览摘要

StakeBench框架通过市场承诺评估语言理解,挑战了现有金融NLP模型的能力。现有的金融NLP基准通常依赖于外部观察者提供的标签,测量语言的感知,而非市场中的实际承诺。StakeBench通过链接Polymarket和Manifold平台的评论与市场记录,提出了四个新的诊断任务:市场承诺检测、揭示面识别、未来行动预测和集体赔率投射。实验结果显示,模型在揭示面识别任务上部分恢复了市场承诺信号,但在未来行动预测和集体赔率投射任务上表现不佳,显示出结构性失败。StakeBench的引入为金融NLP提供了新的评估框架,揭示了现有模型在市场语言理解中的局限性,并为未来研究提供了方向。

深度分析

研究背景

金融NLP领域近年来发展迅速,现有基准通常依赖于外部观察者提供的标签,测量语言的感知,而非市场中的实际承诺。StakeBench通过市场承诺信号替代感知标签,提供了新的评估框架。

核心问题

现有金融NLP基准未能充分捕捉市场语言中的承诺信号,导致模型在市场行为预测中的局限性。StakeBench通过市场承诺信号替代感知标签,提供了新的评估框架。

核心创新

StakeBench通过无注释的市场记录提供监督信号,提出了四个新的诊断任务,并定义了三种承诺感知指标,挑战了现有模型在市场语言理解中的能力。

方法详解

  • �� StakeBench链接Polymarket和Manifold平台的评论与市场记录。
  • �� 提出四个任务:市场承诺检测、揭示面识别、未来行动预测和集体赔率投射。
  • �� 定义三种承诺感知指标,替代传统的感知标签。

实验设计

实验涉及15个大语言模型,涵盖18个主题和平台设置。使用Polymarket和Manifold平台的数据,评估模型在四个任务上的表现。

结果分析

模型在揭示面识别任务上部分恢复了市场承诺信号,但在未来行动预测和集体赔率投射任务上表现不佳,显示出结构性失败。

应用场景

StakeBench可用于评估金融NLP模型在市场语言理解中的能力,为模型改进提供指导。

局限与展望

模型在未来行动预测任务中表现不佳,显示出对行为变化的过度预测。在集体赔率投射任务中,模型未能超越基线,显示出对集体信号的不足。

通俗解读 非专业人士也能看懂

想象一个市场就像一个大型的拍卖会,参与者在这里不仅仅是买卖商品,还在通过语言表达他们的意图和承诺。StakeBench就像一个观察者,它不仅关注参与者说了什么,还关注他们在拍卖会上做了什么。通过这种方式,StakeBench能够更好地理解参与者的真实意图,而不仅仅是他们的表面言辞。

简单解释 像给14岁少年讲一样

想象你在一个游戏中,玩家们不仅要说出他们的策略,还要根据他们的行动来判断他们的真实意图。StakeBench就像是游戏中的一个裁判,它不仅听玩家说了什么,还观察他们做了什么。这样,它能更准确地判断玩家的策略,而不仅仅是他们的表面言辞。

术语表

StakeBench (市场承诺评估框架)

StakeBench是一个通过市场承诺信号评估语言理解的框架,替代了传统的感知标签。

用于评估金融NLP模型在市场语言理解中的能力。

Polymarket (多市场平台)

Polymarket是一个真实货币市场,提供货币承诺信号。

StakeBench使用Polymarket的数据进行评估。

Manifold (虚拟市场平台)

Manifold是一个虚拟市场,提供更密集的位置覆盖和直接解决元数据。

StakeBench使用Manifold的数据进行评估。

Market Commitment (市场承诺)

市场承诺是指参与者在市场中通过语言和行为表达的真实意图。

StakeBench通过市场承诺信号评估语言理解。

Directed Accuracy (定向准确率)

定向准确率是评估模型在揭示面识别任务上恢复市场承诺信号的能力。

用于评估模型在StakeBench任务上的表现。

开放问题 这项研究留下的未解疑问

  • 1 如何改进模型在市场承诺信号识别和行为预测方面的能力,特别是在集体信号识别和预测市场行为方面。

应用场景

近期应用

金融市场分析

StakeBench可用于评估金融NLP模型在市场语言理解中的能力,为模型改进提供指导。

远期愿景

市场行为预测

StakeBench可用于改进市场行为预测模型,提升金融市场分析的准确性和可靠性。

原文摘要

Existing financial NLP benchmarks often rely on labels supplied by outside observers, measuring how language is perceived rather than what speakers have committed to in the market. We introduce StakeBench, an evaluation framework for language understanding grounded in market commitment. StakeBench links 560,876 comments from 2,261 resolved markets to verified position, action, and market-odds records across Polymarket and Manifold. Supervision is derived from observable market behavior. Position sides, post-comment trading actions, and market-odds trajectories replace human annotation. Four diagnostic tasks test whether models detect market commitment, identify the revealed side, anticipate future action, and perform collective odds projection. Three commitment-aware metrics measure alignment with revealed preferences rather than perceived sentiment. Validity audits and explicit interpretation boundaries help distinguish observable commitment signals from latent belief and causal market-odds impact. Across 15 LLMs and 18 topics and platform settings, models partially recover position-side signals, with Directed Accuracy from 0.506 to 0.599, but show structural failures on later tasks. Ten of the fifteen models collapse to one or two action labels in future action anticipation, and no model consistently improves on the naive odds-direction baseline in collective odds projection. Model scale is not correlated with performance, finance-domain tuning does not improve revealed-side identification, and platform incentives strongly shape higher-order results. StakeBench is packaged with evaluation code and dataset under CC-BY 4.0.

cs.CL cs.AI q-fin.GN