In-Context Examples Suppress Scientific Knowledge Recall in LLMs
本文表明,向大型语言模型添加上下文示例会抑制其回忆和应用潜在科学知识的能力,导致它们转而依赖经验模式拟合,即使这些示例是由正确的底层公式生成的。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用简单语言和日常类比对这篇论文的解释。
核心观点:示例会让你遗忘已知知识
想象你是一名天才学生,已经熟记了物理、化学和经济学的定律。你完全知道如何运用正确的公式来解决问题。但随后,老师给你出了一份带有转折的试卷:在解题之前,他们先展示了 10 道类似题目及其答案。
你可能会想:“太棒了!这些示例能帮我更好地记住规则。”
但这篇论文发现事实恰恰相反。 当人工智能(大语言模型)看到这些示例时,它实际上停止使用其记忆中的科学定律,转而开始根据示例中的模式进行猜测。这就像一位大厨,在看了几张菜肴的照片后,忘记了食谱,只是试图通过观察图片来猜测食材。
作者将这种现象称为**“知识置换”**。示例并没有强化知识,反而将其挤到了一边。
人工智能思考的两种方式
这篇论文描述了人工智能解决科学问题时的两种不同“模式”:
“教科书模式”(知识驱动):
- 工作原理: 人工智能看到一个问题(例如,“这个物体冷却得有多快?”),识别出关键词,并从记忆中提取正确的公式(牛顿冷却定律)。它通过数学一步步计算出答案。
- 类比: 这就像一位机械师听到奇怪的引擎噪音,凭借多年的训练确切知道是哪个部件坏了,并使用正确的工具进行修复。
“模式模式”(示例驱动):
- 工作原理: 人工智能忽略了公式。相反,它查看提示中提供的 10 个示例,试图寻找捷径或趋势。它通过说“在示例中,当数字上升时,答案下降了,所以我也这样做”来猜测答案。
- 类比: 这就像一位从未研究过引擎的机械师,查看了 10 张带有损坏部件的汽车照片。他们通过说“在所有这些照片中,轮胎都是瘪的,所以我就猜轮胎是瘪的”来猜测修复方法,而不理解引擎发出噪音的原因。
这一发现: 当你给人工智能提供示例(即使是正确的示例)时,它几乎总是从“教科书模式”切换到“模式模式”。它不再进行真正的科学推理,而是开始进行“模式匹配”。
令人惊讶的结论:有时有帮助,有时有危害
研究人员在五个领域(经济学、化学、物理学、生物学和地球科学)的 60 个不同科学问题上测试了这一点。他们发现,虽然人工智能总是切换到“模式模式”,但最终得分的结果因学科而异。
具体情况如下:
“有害”案例(经济学与化学):
- 发生了什么: 人工智能完美地掌握了公式。当展示示例时,它停止使用这些公式,转而开始猜测模式。
- 结果: 得分显著下降。
- 类比: 想象一位精通乘法表的数学天才。如果你给他们看几个""的示例,他们可能会停止思考"2 乘以 2",转而猜测“也许是 5?”,仅仅因为示例看起来是某种样子。他们答错了,因为他们忘记了自己原本知道的规则。
“有益”案例(地球科学):
- 发生了什么: 人工智能知道公式,但不擅长记住具体数字(如岩石的密度)。它一直猜错数字。当展示示例时,它停止尝试回忆数字,而是直接查看示例中的模式来猜测答案。
- 结果: 得分上升。
- 类比: 想象一位知道食谱公式但总是忘记加多少盐的学生。如果你给他们看 10 张成品菜肴的照片,他们可能会停止尝试回忆盐的用量,而是直接从照片中模仿味道。他们做出了更好的菜,但他们并没有真正学会食谱;他们只是碰巧利用了模式。
“无变化”案例(物理学与生物学):
- 发生了什么: 人工智能切换了模式,但对于这些特定问题,“模式模式”碰巧与“教科书模式”一样有效。
- 结果: 得分保持不变。
- 类比: 这就像开车。你可以使用 GPS 驾驶(教科书模式),或者跟随朋友的汽车驾驶(模式模式)。如果你的朋友开得完美,你会同时到达。但你仍然不再使用 GPS 了。
为什么会发生这种情况?
论文发现,人工智能的“教科书模式”非常脆弱。它依赖于关键词。
- 如果问题说“消费者剩余”,人工智能就会想到“经济学公式”。
- 如果你将词语改为“阿尔法波”(同一概念的一个虚构名称),人工智能就会完全忘记该公式。
然而,“模式模式”并不关心词语。它只看数字。因此,当你给人工智能提供带有数字的示例时,它会立即切换到模式模式,因为这样更容易,即使这些示例与其已知的规则完全一致。
给用户的主要警告
论文最后对任何使用人工智能进行科学研究的人提出了警告:
不要假设给人工智能示例会帮助它利用其知识。
事实上,它可能会产生相反的效果。它可能会让人工智能停止像科学家一样思考,转而像猜测者一样思考。有时,这个猜测者会走运并获得更高的分数,但通常它会因为忘记本应知道的规则而得到更低的分数。
简而言之: 示例并没有教会人工智能任何新东西;它们只是让它忘记了原本已经知道的东西。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。