IsoSci: A Benchmark of Isomorphic Cross-Domain Science Problems for Evaluating Reasoning versus Knowledge Retrieval in LLMs
该论文引入了 ISOSCI,这是一个同构跨领域科学问题基准,旨在证明大型语言模型中大多数推理能力的提升实际上是由领域知识检索而非结构化推理能力驱动的,从而挑战了思维链推理能够本质上增强短程科学问题解决能力的假设。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图弄清楚一个学生之所以擅长逻辑,是因为他真的聪明,还是仅仅因为他拥有极好的记忆力。
通常情况下,当我们用科学问题来测试 AI 模型(比如驱动聊天机器人的那些模型)时,我们无法分辨其中的区别。如果一个 AI 解出了一个化学题,它是通过巧妙的推理解决的吗?还是它只是记住了训练数据中的答案?
这篇论文的作者们开发了名为 ISOSCI 的特殊测试,旨在破解这个谜团。以下是他们实现这一目标的简单解释:
“双胞胎”测试(同构对)
研究人员创建了一组“双胞胎”问题。这些双胞胎在结构上是完全相同的(即解决问题所需的步骤),但在内容上却截然不同(即所需的具体事实)。
你可以把它想象成两份不同的食谱:
- 食谱 A(物理): “取 2 杯面粉,加入 1 个鸡蛋,以 350 度进行烘焙。”
- 食谱 B(化学): “取 2 摩尔气体,加入 1 个常数,并计算压力。”
这两份食谱需要完全相同的逻辑:取一个数字,乘以一个常数,然后得出结果。 但食谱 A 需要你知道面粉和鸡蛋,而食谱 B 则需要你知道气体定律。
如果一个 AI 真正具备“推理”能力,它应该能同样出色地解决这两个双胞胎问题,因为其背后的逻辑是一致的。如果它只能解决其中一个,那么它仅仅是在依赖对特定学科的记忆。
重大发现:记忆力 vs. 逻辑
研究人员使用这些双胞胎对测试了几种顶尖的 AI 模型。他们通过开启或关闭一个“推理模式”开关,来观察这是否会有所帮助。
以下是他们的发现,使用了简单的类比:
“手电筒”类比
想象 AI 正在一个黑暗的房间里,试图寻找一个特定的工具来修理机器。
- 推理模式就像是打开一把明亮的手电筒。
- 知识则是放在架子上的那个工具。
研究发现,对于简短的标准科学问题,开启手电筒(推理)并不能帮助 AI 更快地找到工具。 只有当 AI 已经知道工具在哪里(即掌握了特定的科学事实)时,它解决问题的能力才会提升。
事实上,在 AI 解决问题表现变好的情况下,有 91.3% 的情况是因为它记住了特定的事实,而不是因为它变得更擅长逻辑步骤。
“o3-mini” 的惊喜
论文中最有趣的环节之一涉及到一个名为 o3-mini 的特定 AI 模型。
- 在一个名为 GPQA(包含非常困难、深层概念性问题)的著名测试中,o3-mini 表现得像个超级明星,以巨大的优势击败了其他模型。人们认为:“哇,这个模型是一个推理天才!”
- 但当研究人员将 oло-mini 置于他们全新的 ISCI 测试(即双胞胎逻辑测试)中时,它的表现反而比标准模型更差。
教训: “天才”这一标签完全取决于你给 AI 进行什么样的测试。如果测试需要深层的、抽象的思考,推理模型就会脱颖而出;如果测试需要回忆特定事实并将其代入公式,推理模型不仅没有太大帮助,甚至可能成为累赘。
“切换开关”实验
研究人员还测试了可以在不改变模型本身的情况下,通过“拨动开关”来开启或关闭“推理”功能的模型。
- 结果: 拨动开关几乎没有任何区别(提升不到 5%)在处理这些简短的科学问题时。
- 这就像是给一台计算器提供了一个“超级计算”模式,但由于问题太简单,计算器并不需要额外的动力。它只需要知道数字即可。
总结
该论文得出结论,对于简短的、分步式的科学问题:
- 推理并非魔法: 它并不会自动让 AI 在逻辑方面变得更聪明。
- 主要关乎记忆: 当 AI 看起来“推理”得更好时,通常只是因为它成功检索到了某个特定的事实。
- 并非一劳永逸: 一个在某种测试中看起来像推理专家的模型,在另一种测试中可能表现平平,这取决于测试需要的是深层思考还是仅仅是良好的记忆。
作者发布了他们的“双胞胎测试”(ISOSCI),以便他人可以使用它来停止猜测一个 AI 究竟是在进行真正的推理,还是仅仅在进行记忆。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。