The Token Games: Evaluating Language Model Reasoning with Puzzle Duels

TL;DR

Token Games通过模型自创谜题来评估语言模型的推理能力,节省成本。

cs.AI 🔴 高级 2026-02-20 22 次浏览
Simon Henniger Gabriel Poesia
语言模型 推理评估 编程谜题 Elo评分 创造力测试

核心发现

方法论

Token Games (TTG) 是一种评估框架,模型通过创建编程谜题互相挑战。每个谜题由返回布尔值的函数表示,模型需要找到使函数返回True的输入。通过对决结果计算Elo评分,比较模型能力。

关键结果

  • 结果1:TTG对10个前沿模型进行评估,与现有基准排名高度一致,如Humanity's Last Exam,相关性高达0.87。
  • 结果2:创建高质量谜题仍是当前模型的挑战,表现出模型的创造力和任务创建能力。
  • 结果3:TTG运行成本低于200美元,无需人工参与谜题创建。

研究意义

TTG提供了一种新颖的推理评估方法,避免了现有基准的饱和问题。它不仅评估模型的推理能力,还测试其创造力和任务创建能力,对学术界和工业界都有重要影响。

技术贡献

TTG通过模型自创谜题进行评估,避免了数据污染问题,提供了新的理论保证和工程可能性。与传统基准相比,它能动态适应模型能力的提升。

新颖性

TTG首次采用模型自创谜题的方式进行推理评估,与现有基准不同,它不依赖人工设计的问题。

局限性

  • 局限1:模型可能会过于自信,提出自己无法解决的谜题,导致失败。
  • 局限2:当前模型在创造高质量谜题方面仍有困难,影响评估准确性。

未来方向

未来工作可以探索如何提高模型的谜题创造能力,并扩展TTG以评估其他能力,如情感理解和语言生成。

AI 总览摘要

随着语言模型能力的提升,评估其推理能力变得越来越困难。现有基准依赖人工设计的难题,成本高且易饱和。Token Games (TTG) 提供了一种创新的解决方案,通过模型自创谜题进行评估。模型在对决中轮流扮演提问者和解答者角色,创建和解决编程谜题。实验表明,TTG的排名与现有基准高度一致,且成本低于200美元。TTG不仅评估推理能力,还测试创造力和任务创建能力,对学术界和工业界都有重要影响。尽管如此,模型在创造高质量谜题方面仍面临挑战,未来工作将探索如何进一步提高模型能力。

深度分析

研究背景

随着GPT-3和PaLM等模型的出现,语言模型的推理能力显著提高。早期的基准如GSM8K和MATH已逐渐饱和,最近的基准如GPQA和HLE依赖专家设计的难题,成本高昂。

核心问题

评估语言模型的推理能力是一个核心问题。现有基准依赖人工设计的问题,难以衡量模型的真实能力,且容易受到数据污染影响。

核心创新

TTG的创新在于模型自创谜题进行评估。它避免了数据污染问题,能够动态适应模型能力的提升,同时测试模型的创造力。

方法详解

  • �� 模型轮流扮演提问者和解答者角色
  • �� 提问者创建编程谜题并提供解决方案
  • �� 解答者尝试解决谜题
  • �� 通过对决结果计算Elo评分

实验设计

实验在10个前沿模型上进行,每对模型进行10轮对决。使用Elo评分系统评估模型表现,与现有基准如HLE和ARC-AGI进行比较。

结果分析

TTG的排名与现有基准高度一致,相关性高达0.87。模型在创造高质量谜题方面仍面临挑战,表现出创造力和任务创建能力。

应用场景

TTG可用于评估模型的推理能力和创造力,适用于学术研究和工业应用。它提供了一种低成本的评估方法,避免了人工设计问题的高昂成本。

局限与展望

模型可能会过于自信,提出自己无法解决的谜题。当前模型在创造高质量谜题方面仍有困难,影响评估准确性。未来工作将探索如何提高模型能力。

通俗解读 非专业人士也能看懂

想象你在玩一个智力游戏,你和朋友轮流出题和解题。每个题目都是一个小程序,你需要找到输入让程序返回正确答案。这个游戏不仅考验你的解题能力,还考验你的创造力,因为你需要设计出让朋友无法解决的题目。Token Games就是这样一个游戏,只不过是由语言模型来玩。它帮助我们评估模型的推理能力和创造力,而不需要人工设计题目。

简单解释 像给14岁少年讲一样

想象你和朋友在玩一个智力游戏,你们轮流出题和解题。每个题目都是一个小程序,你需要找到输入让程序返回正确答案。这个游戏不仅考验你的解题能力,还考验你的创造力,因为你需要设计出让朋友无法解决的题目。Token Games就是这样一个游戏,只不过是由语言模型来玩。它帮助我们评估模型的推理能力和创造力,而不需要人工设计题目。

术语表

Token Games (TTG)

一种评估语言模型推理能力的框架,模型通过自创编程谜题进行对决。

用于评估模型的推理能力和创造力。

编程谜题

一个由返回布尔值的函数表示的问题,模型需要找到使函数返回True的输入。

用于评估模型的解题能力。

Elo评分

一种用于比较模型能力的评分系统,基于对决结果计算。

用于评估模型的相对能力。

创造力测试

评估模型在创造新问题方面的能力,避免重复训练数据中的问题。

用于评估模型的创造力和任务创建能力。

数据污染

训练数据中包含评估问题的情况,影响评估准确性。

TTG通过模型自创谜题避免数据污染问题。

开放问题 这项研究留下的未解疑问

  • 1 如何提高模型的谜题创造能力,仍需进一步研究。
  • 2 模型在创造高质量谜题方面仍有困难,影响评估准确性。

应用场景

近期应用

推理能力评估

TTG可用于评估模型的推理能力,适用于学术研究和工业应用。

创造力测试

通过模型自创谜题评估其创造力,适用于任务创建能力的研究。

远期愿景

动态评估框架

TTG提供了一种能够动态适应模型能力提升的评估框架,未来可扩展至其他能力评估。

原文摘要

Evaluating the reasoning capabilities of Large Language Models is increasingly challenging as models improve. Human curation of hard questions is highly expensive, especially in recent benchmarks using PhD-level domain knowledge to challenge the most capable models. Even then, there is always a concern about whether these questions test genuine reasoning or if similar problems have been seen during training. Here, we take inspiration from 16th-century mathematical duels to design The Token Games (TTG): an evaluation framework where models challenge each other by creating their own puzzles. We leverage the format of Programming Puzzles - given a function that returns a boolean, find inputs that make it return True - to flexibly represent problems and enable verifying solutions. Using results from pairwise duels, we then compute Elo ratings, allowing us to compare models relative to each other. We evaluate 10 frontier models on TTG, and closely match the ranking from existing benchmarks such as Humanity's Last Exam, spending less than $200 USD and without involving any human effort in creating puzzles. We also find that creating good puzzles is still a highly challenging task for current models. Overall, our work suggests new paradigms for evaluating reasoning that avoid saturation by design, and that allow testing models for other skills like creativity and task creation alongside problem solving.

cs.AI