← 最新论文
🤖 AI

Hallucinations on the Board: Tool-Augmented Evaluation of LLM Chess Commentary

本文介绍了 ACT-Eval,这是一个工具增强型评估框架,它将国际象棋解说分解为原子级断言,以评估事实正确性和策略覆盖范围,并揭示了虽然工具集成减少了大语言模型中的幻觉现象,但在商业模型和开源权重模型中,专家级策略解释方面仍存在显著差距。

原作者: S. Ashwin Hebbar, Peiyao Sheng, Sewoong Oh, Pramod Viswanath

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: S. Ashwin Hebbar, Peiyao Sheng, Sewoong Oh, Pramod Viswanath

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何玩国际象棋。你手头有两个强大的工具。首先,你有一个“超级引擎”,这台机器每秒可以计算数百万步棋,并且知道任何局面下的数学完美走法。它就像一个能瞬间解开谜题的天才数学家,但它只用冰冷、硬核的数字进行交流。其次,你有一个“说书人”,这是一个大语言模型(LLM)。这个机器人极其擅长以人类能理解的方式进行写作、说话和解释。它可以讲述一场战斗的惊险故事,但它有时会编造事实,因为它并不能真正“看到”棋盘,它只是在猜测哪些词语通常会凑在一起。

核心问题是,科学家们在问:我们能否将这两者结合起来?我们能否让“说书人”利用“超级引擎”的大脑,来撰写一段既令人兴奋又百分之百真实的解说?问题在于,“说书人”经常会产生“幻觉”——它会自信地描述那些并不存在的棋子位置,或者发明非法的走法。直到现在,我们一直很难捕捉到这些谎言。如果你让一个机器人去给另一个机器人的故事打分,评分者可能会被华丽的辞藻所迷惑,从而完全忽略了事实错误。这就像是让一个不懂国际象棋规则的学生去给一篇关于国际象棋比赛的故事打分;即使学生描述了一个骑士像鸟一样飞翔,评分者也可能因为文笔优美而给出一个“A”。

这篇题为《棋盘上的幻觉》(Hallucinations on the Board)的论文介绍了一种测试这类 AI 说书人的新方法,称为 ACT-Eval。研究人员构建了一个系统,充当一名带着清单的严格裁判。该系统不仅仅是阅读故事并给出分数,而是将解说拆解成一个个微小的、独立的实事——例如“皇后在 E4 格”或“这一步威胁到了将死”。然后,它将每个微小的实事发送给“超级引擎”,以验证这些内容在棋盘上是否真实。如果故事说某个棋子正在攻击某个格子,系统就会检查棋盘,看它是否真的如此。如果故事遗漏了人类专家会发现的关键战略思想,系统也会将其标记出来。

研究结果带来了一丝警醒。研究人员发现,即使是那些最聪明的 AI 模型,在没有“超级引擎”帮助的情况下,其事实错误率高得令人惊讶。例如,一个顶尖的模型在约 22% 的陈述中出现了事实错误,而较小的模型出错率则超过了 40%。它们会自信地声称某个棋子在某个位置,而实际上它并不在那里,或者描述一个并不存在的威胁。然而,当研究人员允许这些模型在写作前使用“超级引擎”工具来核实事实时,错误率显著下降。模型在陈述事实方面变得更加准确。

但这里有一个陷阱。虽然这些工具帮助模型停止了对“事实”的谎言,但它们并不一定能让模型更好地理解游戏的“故事”。即使有了这些工具,AI 模型也经常会错过人类特级大师会注意到的深层、巧妙的战略思想。它们可以告诉你棋子的位置是正确的,但在以一种完整的方式解释为什么这一步棋很精彩方面,却显得力不从心。论文指出,虽然我们可以通过修复 AI 核实事实的能力,但要教会它真正理解招法背后的“为什么”,仍然是一个非常艰巨的挑战。研究结论认为,我们需要这些借助工具的检查器来信任 AI 所说的话,但我们目前还不应该期望它们能取代人类专家。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →