← 最新论文
💻 computer science

Evaluating Language Models' Evaluations of Games

本文引入了一种形式化方法和数据集以评估人工智能系统对棋类游戏的评估能力,结果显示,尽管推理模型比非推理模型更符合人类判断,但随着其趋近博弈论最优解,其与人类数据的拟合度减弱,且表现出不可预测的资源消耗。

原作者: Katherine M. Collins, Cedegao E. Zhang, Graham Todd, Lance Ying, Mauricio Barba da Costa, Ryan Liu, Prafull Sharma, Adrian Weller, Ionatan Kuperwajs, Lionel Wong, Joshua B. Tenenbaum, Thomas L. Griffi
发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Katherine M. Collins, Cedegao E. Zhang, Graham Todd, Lance Ying, Mauricio Barba da Costa, Ryan Liu, Prafull Sharma, Adrian Weller, Ionatan Kuperwajs, Lionel Wong, Joshua B. Tenenbaum, Thomas L. Griffiths

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正身处一场派对,每个人都在试图解开一个巨大而复杂的拼图。通常,当我们测试人工智能(AI)时,我们会问 AI:“你能解开这个拼图吗?”然后观察它找到答案的速度或准确度。

但这篇论文提出了一个不同、更微妙的问题:"AI 能否审视这个拼图,并告诉我们它是否值得被解开?”

研究人员希望看看 AI 模型能否像游戏评论家或裁判那样行动,而不仅仅是一个玩家。他们通过向 AI 提供 121 款全新的棋盘游戏(这些游戏 AI 从未见过),并就每款游戏提出两个具体问题来测试这一点:

  1. “公平性”问题: 如果两个人完美地玩这款游戏,谁会赢?游戏是平衡的,还是某位玩家从一开始就注定失败?
  2. “趣味性”问题: 人们真的会享受玩这款游戏吗?

以下是他们发现的成果,分解为简单的概念:

1. “聪明”与“人类”

研究人员比较了三种类型的“思考者”:

  • 即时猜测者: 标准 AI 模型,它们只是立即抛出答案。
  • 深度思考者: 较新的 AI 模型,它们在回答前会花时间“思考”(使用思维链)。
  • 人类: 真实的人类,他们查看游戏规则并给出直觉感受。

结果: “即时猜测者”在这方面表现糟糕。它们听起来很自信,但往往完全错误,主要是因为它们基于训练数据中看到的模式进行猜测,而不是真正分析新规则。

“深度思考者”要好得多。它们实际上查看了规则,在“脑海”中模拟了游戏,并给出了更接近人类观点的答案。然而,它们并不完美。

2. “金发姑娘”问题(太聪明反而不好)

这是最惊人的发现。研究人员发现,AI 的“聪明”程度与它同意人类观点的程度之间,存在一种奇怪的非线性关系。

  • 太笨: AI 随机猜测,与人类意见相左。
  • 刚刚好: AI 深入思考,与人类意见一致。
  • 太完美: 随着 AI 在计算数学上完美结果方面变得极其擅长(就像超级计算机国际象棋引擎),它开始再次与人类意见相左。

类比: 想象一场“石头、剪刀、布”的游戏。

  • 人类会想:“我要出石头,因为我觉得运气好。”
  • “刚刚好”的 AI 会想:“人类经常出石头,所以我应该出布。”
  • “太完美”的 AI 会想:“从统计学上讲,最优策略是出布,所以我会出布。”

该论文发现,当 AI 变得过于痴迷于追求数学上的完美时,它就不再理解人类实际上会做什么或感受什么。它变得过于理性,从而失去了“人情味”。

3. “趣味性”因素难以衡量

当 AI 被问及“公平性”(数学问题)时,结果是一致的。但当被问及“趣味性”时,结果则五花八门。

类比: 要求 AI 判断“公平性”,就像要求它用尺子测量桌子的长度。那里有一个明确的答案。要求它判断“趣味性”,就像要求它测量一首歌的“快乐程度”。这是主观且混乱的。

该论文发现,不同的 AI 模型对于什么让游戏变得有趣有着截然不同的看法。有些认为短游戏有趣;另一些则认为长而策略性的游戏有趣。由于“趣味性”难以定义,AI 模型表现出不一致性,有时甚至最先进的模型之间都无法达成一致,更不用说与人类达成一致了。

4. “能量饮料”问题

最后,研究人员观察了 AI 在回答这些问题时使用了多少“脑力”(计算资源)。

类比: 想象你被要求判断一个新食谱是否好。

  • 有时你只是扫一眼配料表(低努力)。
  • 有时你会阅读整个食谱,想象味道,并检查烹饪时间(高努力)。

该论文发现,AI 模型非常不可预测。有时它们仅用极少的努力来判断一款复杂的游戏,而有时却用巨大的努力来判断一款简单的游戏。它们似乎没有很好的“何时停止思考”的意识。它们不知道如何做到“资源理性”——即不知道何时该节省精力。

总结

这篇论文表明,为了让 AI 成为人类真正的伙伴,它需要做的不仅仅是解决问题。它还需要能够评估问题。

  • 标准 AI 就像计算器:擅长数学,但不擅长理解“氛围”。
  • 推理 AI 更好:它能通过规则进行思考,更接近人类的观点。
  • 陷阱: 如果 AI 变得过于专注于追求数学上的完美,它就不再听起来像人类。而在涉及“趣味性”等主观事物时,即使是最聪明的 AI 也难以就什么让游戏变得有趣达成一致。

作者得出结论,我们需要教会 AI 的不仅仅是如何解决问题,还有如何决定什么值得解决,以及如何高效地使用其脑力,避免过度思考或思考不足。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →