Explaining Puzzle Solutions in Natural Language: An Exploratory Study on 6x6 Sudoku
这项探索性研究评估了五个大语言模型在 6x6 数独谜题上的表现,发现尽管其中一个模型显示出有限的解题能力,但没有任何一个模型能够提供反映策略性推理或直觉性问题解决的解释,从而凸显了有效的人机协同决策所面临的重大障碍。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一支由非常聪明、博览群书的机器人组成的团队。你请它们解决一个名为数独的逻辑谜题(具体是较小的 6×6 版本),更重要的是,用通俗易懂的英语教你它们是如何解决的。
这篇论文就像是为其中五台机器人颁发的一份成绩单,主要检查两点:
- 它们是否得出了正确答案?
- 它们能否以一种人类真正能理解的方式解释其思考过程?
以下是研究人员发现的内容,并运用了一些日常类比进行说明。
设置:"数独测试”
研究人员创建了近 2,300 个这样的 6×6 谜题。可以将这些谜题视为大脑的健身房。它们并非世界上最难的谜题(如 9×9 版本),但足够棘手,以至于你不能仅靠猜测;你必须运用逻辑和规则来推断数字的位置。
他们想看看大型语言模型(LLMs)——即聊天机器人背后的 AI 大脑——能否扮演一名优秀的导师。一名优秀的导师不会只给你答案钥匙;他们会引导你一步步走,让你理解为什么要采取某一步骤。
结果:“解题者”与“解释者”
1. 开源机器人(“业余时间”)
研究人员测试了四种不同的开源模型(如 Llama、Gemma 和 Mistral)。
- 结果: 这些机器人基本上未能通过测试。在 2,293 个谜题中,它们完全正确解出整个谜题的次数不到 1%。
- 类比: 想象一下让一群人填写填字游戏。这些机器人就像那些随机猜测单词的人。他们可能碰巧猜对几个字母,但无法保持整体的一致性。他们一旦开始书写,就忘记了规则。
2. 明星学生:OpenAI 的"o1-preview"
随后,来自 OpenAI 的一个特定模型 o1-preview 出现了。
- 结果: 该模型在解题方面表现出色。它大约 65% 的时间能完全正确解出整个谜题。在较简单的谜题上,它表现完美(100%)。
- 问题所在: 随着谜题难度增加(“地狱级”水平),其表现开始下降。它开始犯错,就像一个擅长数学作业的学生,但在考试变得非常困难时却感到困惑。
3. 真正的问题:“糟糕的解释者”
这里研究变得有趣起来。研究人员选取了 o1-preview 正确解出的 20 个谜题,并要求它向人类专家解释其步骤。
结果: 解释是一场灾难。
- 理由说明: 只有 5% 的情况下,机器人真正解释了为什么选择某个数字。大多数时候,它只是说“我在这里放了一个 5",而没有说明原因。
- 清晰度: 解释令人困惑,跳跃不定,且用词不当。
- 教育价值: 如果你试图从这个机器人那里学习如何解决数独,你将一无所获。它没有教授任何策略。
类比: 想象一位能做出完美牛排的大厨。你问他们:“你是怎么做到的?”
- 一个好的解释: “我在高温下煎了两分钟,然后降低了温度……"
- o1-preview 的做法: 它把牛排递给你,说:“好了。它很好。给你牛排。”它给了你结果,但拒绝(或无法)分享食谱。这就像一位魔术师完美地表演了一个戏法,但当被问及如何做到时,只是说“我就是这么做的”,然后编造一个与实际情况不符的虚假理由。
主要结论
该论文得出结论:虽然 AI 在完成工作(解决谜题)方面变得越来越好,但在讲述它是如何完成工作的故事方面仍然非常糟糕。
作者认为,为了让 AI 成为人类真正的伙伴——尤其是在医疗或法律等重要领域——它必须能够清晰地展示其工作过程。目前,即使是最聪明的 AI,也像一个在考试中得了"A"却无法向老师解释答案的学生。
下一步是什么?
该论文建议,与其试图让 AI 完全独立地像人类一样“思考”,不如将 AI 与逻辑工具(如专门的数学软件)结合起来。
- 理念: 让逻辑软件执行艰难、严格的数学运算,以确保答案 100% 正确。然后,让 AI 充当翻译,将这些严格、枯燥的数学运算转化为对人类友好、易于理解的故事。
简而言之: AI 能解决谜题,但还无法教你如何解题。它是一位出色的员工,却是一位糟糕的老师。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。