← 最新论文
🤖 AI

ALPS: Measuring Valid Creativity in Large Language Models with Mathematical Construction

本文介绍了 ALPS,这是一个通过要求大型语言模型为随机生成的等式法则生成原创且可验证的数学证明或构造,从而严格衡量其有效创造力的创新基准,该研究揭示了当前模型在构造方面存在显著困难,且大多数实例即使是对于先进的自动化证明器而言仍然难以解决。

原作者: Eric Xie, Wenqian Ye, Aidong Zhang

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Eric Xie, Wenqian Ye, Aidong Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代科学领域,人工智能已开始从数据处理者的角色转向发现者的角色。我们正看到机器能够提出新的化学化合物、建议新型材料,甚至构思人类尚未考虑过的数学猜想。这种转变提出了一个深刻的问题:当机器产生一个看起来像是突破性的答案时,我们如何知道它是真正的创造性,还是仅仅对其训练期间记忆内容的巧妙重复?科学中的真正创造力需要两个条件:解法必须是原创的,即以前从未见过;并且必须是有效的,即它确实起作用并解决了当前的问题。难点在于验证这些品质。在许多领域,判断一个新想法是否有效需要人类专家观察结果并做出判断,这是一个缓慢且具有主观性的过程。在数学中,由于答案可以用绝对的确定性进行检查,挑战则有所不同:问题通常非常复杂,以至于计算机无法简单地通过搜索所有可能性来找到答案,而且问题本身往往是机器可能已经研究过的固定集合。

为了解决这一困境,弗吉尼亚大学的研究人员开发了一种测试人工智能的新方法,他们将这一基准测试称为 ALPS。该系统旨在通过向机器展示一种特定类型的数学谜题来衡量“有效的创造力”,这种谜题无法通过记忆或遵循标准程序来解决。这些谜题基于一组物体如何组合在一起的规则。想象一下,有一组物体以及一条关于如何将其中任意两个混合在一起的规则。研究人员生成了一条特定的规则或定律,描述了这些物体必须如何表现。机器的任务是决定其中之一:要么该规则过于严格,以至于迫使所有物体都变得完全相同;要么该规则允许存在一个满足条件的复杂且无限的物体结构。如果机器声称该结构存在,它必须构建出该结构的描述。如果它声称物体必须是相同的,它必须证明不存在其他可能性。这一设置的精妙之处在于,答案可以由计算机以完美的准确度进行检查,无需任何人类查看结果。此外,该系统可以生成无穷无尽的此类谜题,确保机器始终面临从未见过的新问题。

研究人员使用各种强大的自动推理工具(即专门用于解决逻辑问题的特化计算机程序)对该系统进行了测试。他们针对四千多个生成的定律库运行了这些工具。结果非常悬殊。即使在计算能力大幅增加的情况下,这些自动化工具也只能解决极小比例的问题。具体而言,由八种不同配置的最优证明器组成的组合,仅解决了约 2% 的定律。当研究人员将计算预算增加 20 倍时,他们只发现了极少数额外的解法,而且这些解法都不是他们正在寻找的复杂结构;它们仅仅是证明了物体必须是相同的。这表明,解决这些问题的障碍不在于缺乏计算能力,而在于缺乏一种方法来发明每个独特定律所要求的特定定制结构。机器根本不知道如何从零开始构建正确的无限结构。

研究人员随后转向了大语言模型,即驱动当今许多对话式工具的人工智能类型。他们测试了最强大的推理模型,给它们同样的谜题和同样的机会来证明其答案。在机器需要证明所有物体都相同的任务方面,表现最好的模型在约 14% 的案例中取得了成功,但仅限于较简单的问题。在机器需要构建一个全新的无限结构的任务方面,结果更加发人深省:没有任何模型取得成功。当模型尝试构建结构时,它们一致地以两种方式之一失败:要么它们提出的结构过于僵化,导致所有物体坍缩为一个点,从而未能展示出复杂的解法;要么它们提出的结构过于松散,未能遵循其试图满足的定律规则。在每一种情况下,机器都无法平衡遵循规则与创造新颖复杂事物之间的需求。

研究得出结论,尽管这些人工智能系统在遵循指令和检查自身工作方面正在变得更好,但它们仍然在科学发现的核心行为上挣扎:即发明一个符合一系列约束条件的全新结构。研究人员向公众发布了他们的整个系统,包括创建谜题的生成器和检查答案的自动评判器。这使得其他科学家可以在不耗尽新鲜问题的情况下,继续测试和改进这些模型。研究结果表明,人工智能在科学领域的未来路径可能不在于给机器更多的数据或更多的时间,而在于教它们如何在创造与验证的循环中提出并完善自己的想法。在机器能够可靠地构建这些定制化解决方案之前,它们在科学发现中的作用将受到限制,无法跨越从处理信息到生成真正有效的、原创知识之间的鸿沟。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →