Assessing LLMs' mathematical abilities requires understanding the various mechanisms of mathematical creativity
该论文认为,评估大语言模型的数学能力需要超越聚合基准测试,转向一种由截然不同且不可替代的创造性机制构成的细致分类法,并指出虽然目前的模型擅长重组现有知识,但它们可能从根本上缺乏其他形式的数学发明能力,而随着自动化证明生成的进步,这些能力正变得日益重要。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
长期以来,数学一直被视为人类逻辑的终极测试——一个答案非黑即白、真理之路由严密证明铺就的领域。几个世纪以来,这一领域依赖于一种简单的经济模式:人类直觉发现模式或可能性,随后通过艰苦的验证工作来确认其正确性。如今,人工智能已经开始掌握这个等式中的后半部分。现代计算机系统现在能够以远超人类能力的效率和规模生成并检查数学证明,将曾经稀缺的“验证”资源变成了过剩的资源。这种转变迫使我们面对一个更难的问题:如果机器可以如此轻易地证明事物,那么数学真正的价值究竟在哪里?答案不在于证明本身,而在于开启整个过程的那个火花——即数学家发明新想法、新概念或新观察世界方式的那一瞬间。
西尔维尔·甘格洛夫(Silvère Gangloff)最近的一篇论文深入探讨了这种“火花”,探讨人工智能究竟是真的能发明数学思想,还是仅仅在重新排列旧的思想。作者认为,我们一直在问错误的问题。该论文指出,我们不应将“数学创造力”视为一种计算机要么拥有或缺乏的单一技能,而应将其视为一系列截然不同、互不相关的机制。其中一些机制涉及观察数学家的工作方式,并将这些习惯转化为形式化的规则;另一些则涉及从物理世界中发现某种结构(例如热量的流动),并将其重新利用来解决抽象谜题;还有一些是关于通过发明一种全新的工具来攻克某个特定且顽固的问题;以及那种罕见的、高层次的将两个从未有过交集的数学领域联系起来的行为。论文提出,这些不仅仅是同一种东西的不同变体,它们是本质上不同的思维类型,需要不同种类的机制。
这项研究的核心发现是,目前的人工智能系统在某些模式下表现极其出色,但在其他模式下则可能无能为力,无论其性能如何提升。我们现有的系统通过重组现有部件来运作。它们就像精通分类学的图书管理员,能够瞬间找到并缝合它们曾经阅读过的任何两个事实。这使得它们在寻找已知类型问题的特定解法或检查证明是否符合规则方面表现卓越。然而,论文指出,当被要求发明一种全新的对象或一种在训练数据中没有先例的新思维方式时,它们会撞上一堵硬墙。例如,计算机可以搜索数百万个现有的数学结构以找到符合约束条件的结构,但它无法在观察人类计算的过程时,自主决定将这种计算实践本身作为一种新的数学对象来进行研究。这是一种本质上的差异,而非仅仅是速度的问题:机器不仅在发明“原语”(primitives)方面比人类慢,而且在结构上无法做到这一点,因为它缺乏选择“什么值得被发明”的机制。
作者通过回顾数学史上的实际进展来支持这一观点。在一个著名的案例中,数学家艾伦·图灵不仅解决了一个问题,还观察了人类遵循规则书的行为,并决定将这一行为本身作为一种新理论的研究对象。在另一个案例中,物理学家柯尔莫哥洛夫借鉴了处理热量与能量的热力学概念,并将其应用于纯数学,以解决一个关于抽象形状的问题。这些都不是在已知的拼图中寻找缺失的碎片,而是创造拼图本身的行动。论文认为,依赖于在固定动作库中进行搜索的当前人工智能无法复制这一点。它可以找到缺失的碎片(如果碎片的形状已经定义),但它无法想象一个从未存在过的全新形状。
这种区别对于我们如何评判人工智能在科学领域的未来具有深远意义。如果我们继续通过AI能生成多少证明或能解决多少标准测试题来衡量其成功,我们衡量的是错误的目标。我们是在奖励机器完成它擅长的工作,却忽略了真正驱动人类进步的工作。论文警告说,随着证明生成变得廉价且自动化,数学的真正价值将向这些更难的“发明模式”转移:即对新实践进行形式化处理的反思行为、从其他领域引入思想的类比飞跃,以及基于目标的、对全新概念的深度创造。如果我们不改变评估这些系统的方式,我们可能会面临一种局面:产生大量的正确但毫无趣味的结果,而真正的、变革性的理解飞跃却依然遥不可及。
这项研究并非声称人工智能永远无法进行这些创造性行为。它指出,要实现这些行为,底层技术需要发生改变,例如开发出能够通过与世界互动来形成具身理解(grounded understandings)的系统,而非仅仅是预测句子中的下一个词。论文最后总结道,在此之前,我们必须谨慎,不要将“重组旧思想的能力”与“创造新思想的能力”混为一谈。数学发现的未来可能并不取决于我们的计算机计算得有多快,而取决于我们能否制造出能够理解“什么值得被发明”的机器。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。