← 最新论文
🤖 AI

Library Reachability in LSR-Synth: How Anti-Memorization Design Changes the Measurement of Symbolic Discovery

本文通过论证虽然 LSR-Synth 基准测试的反记忆控制是有效的,但目前的任务主要是在衡量固定词汇表内未见表达式的重组,而非语言模型先验知识的独特贡献(除非该词汇表被刻意限制),从而评估了该基准测试区分科学先验知识与常规算子搜索的能力。

原作者: Zhan'ao Yao, Liang Yin, Zhihao Gao, Boxuan Zhang, Xiaoyu Wu, Linjing Li, Rongyan Wang, Tingwei Chen, Youwei Wang, Xiaolin Zhao, Jiahui Shi, Jianjun Liu

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhan'ao Yao, Liang Yin, Zhihao Gao, Boxuan Zhang, Xiaoyu Wu, Linjing Li, Rongyan Wang, Tingwei Chen, Youwei Wang, Xiaolin Zhao, Jiahui Shi, Jianjun Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜题的侦探:一位才华横溢的新晋侦探究竟是在利用其敏锐的直觉破案,还是仅仅在背诵一本他们从名著中记下的解决方案?这就是科学家在使用人工智能(AI)发现新数学定律时面临的核心问题。长期以来,研究人员一直在训练 AI 去观察数据——比如掉落苹果的速度或细菌的生长——并推测解释这些现象的隐藏公式。这个领域被称为“符号回归”(symbolic regression)。问题在于,AI 模型就像是读过几乎所有文献的巨型图书馆。如果你问它们重力的公式,它们可能只是从训练期间读过的教科书中记住了答案,而不是真正通过数据推导出来的。为了解决这个问题,科学家们创建了一个特殊的测试,名为 LSR-Synth。他们通过将已知的规则与奇特的、全新的成分混合在一起,发明了全新的、虚构的科学问题。他们的希望是,由于这些问题是完全原创的,AI 就不能仅仅“记住”答案,而必须真正地去“发现”它。

但转折点在于:即使最终的答案是全新的,AI 用来寻找答案的“工具”可能却是旧的。想象一位厨师试图发明一道新菜。如果厨房里备好了所有能想象到的香料和食材(一个“固定库”),那么这位厨师并不需要成为天才才能做出美妙的佳肴;他只需要混合好现有的正确食材即可。这篇论文提出了一个非常具体、虽然有些枯燥但至关重要的问题:这些新的 AI 测试究竟是在证明 AI 正在使用它的“大脑”(科学知识),还是它仅仅是一个极其擅长混合现有食材的“调配师”?作者们构建了一个“盲盒”厨房,AI 看不到食材的名字或食物的类型,只能看到原始数字。他们将一位聪明的 AI 厨师与一个只会遵循规则、尝试各种标准食材组合的简单机器人进行了对比。

结果给这种热潮泼了一盆冷水。作者发现,在大多数这些“新”科学谜题中,那个拥有标准厨房工具的简单机器人可以像聪明的 AI 厨师一样出色地解决问题。事实上,当他们给 AI 厨师配备一个全能厨房时,它解决的问题并没有比机器人多出多少。只有当厨房被精简,缺少了像“指数”或“三角函数”这类核心食材时,AI 建议新奇食材的能力才会展现出真正的优势。

那么,这意味着什么呢?这并不意味着 AI 是没用的,或者它只是在套用记忆中的方案。这意味着对于目前的这批测试而言,“标准厨房”里的储备过于丰富,以至于 AI 特有的“科学直觉”对于获得高分来说并非严格必要。论文指出,为了真正证明 AI 正在发现新科学而非仅仅是在重新排列旧工具,我们需要设计出那些让标准工具首先失效的测试。在此之前,在这些测试中获得高分,可能只意味着 AI 擅长使用标准的工具箱,而不是它已经开启了某种全新的科学天赋。作者总结道,虽然这些测试能够很好地防止 AI 仅仅是复制旧公式,但它们目前还不足以证明 AI 确实能从自己的思维中创造出真正崭新的东西。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →