First Proof Second Batch
本文通过展示由数学家提供的十个不同问题,以及包括人类解法和评审报告在内的补充材料,呈现了测试若干人工智能模型在解决研究级数学问题方面的能力、方法论及结果,从而对当前人工智能系统解决研究级数学问题的能力进行了评估。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,一群数学家决定举办一场高规格的“烹饪比赛”,但他们不是在烘焙蛋糕,而是在要求人工智能(AI)“烹饪”出全新的数学证明。这份文件是这场名为**“第一批第二次证明”(First Proof Second Batch)**的第二轮比赛的官方成绩单。
以下是发生的事情,用简单的术м语进行了拆解。
背景设定:一种新型考试
在这次实验的第一轮中,组织者允许任何人尝试解决问题,这有点像是一场开放日活动。而对于第二轮,他们希望更加严格且具有科学性。
- 厨师(AI 系统): 他们邀请了四位特定的“厨师”来参赛。这些不仅仅是普通的计算机;它们是来自顶尖大学(如加州大学洛杉矶分校和普林斯顿大学)以及一家公司(OpenAI)开发的先进 AI 系统。
- 食材(问题): 组织者并没有给 AI 提供教科书中常见的已解决数学问题。相反,他们给了它们 10 个全新的、未解的谜题,这些谜题是人类数学家最近在自己的研究中发现的。这些问题尚未在互联网上发布或在期刊上发表。
- 规则: AI 必须独立解决这些问题,不能有人在旁边对着它的耳朵低声耳语答案。组织者观察了每一步,记录了 AI 输入的每一个字,并严格记录了运行这个“厨房”所需的成本。
评判标准:盲测
一旦 AI 提交了它们的“菜肴”(证明),一个由 30 名专家数学家组成的评审团就开始了评判。为了公平起见,评委们并不知道哪道菜是由哪位 AI 制作的。他们为每个解决方案给出了评分:
- 近乎完美: 一道完美的菜肴,可以直接上桌。
- 需微调: 美味可口,但需要再加一点盐或点缀一下。
- 需大改: 主菜虽然有了,但酱汁烧焦了或者食材缺失了。它需要大量的工作。
- 拒绝: 这道菜无法食用。
结果:喜忧参半
结果既有令人惊叹的突破,也有令人尴尬的失败。
1. “哇”时刻(成功之处)
- 惊喜嘉宾: 对于一个涉及复杂流体方程的问题(问题 5),一位 AI 不仅仅是复制了人类的解法;它发明了一种全新的解题方式。评委们对此印象深刻,称其为“近乎完美”。这就像一位厨师发明了一种人类从未想过的全新烹饪技巧。
- 模仿者: 对于另一个问题(问题 6),两台 AI 成功地完美解决了它。它们遵循了人类解法的路径,但表现得极具机械精准度,以至于评委说:“这在数学上是正确的,尽管写作风格有点像机器人。”
2. “幻觉”问题(失败之处)
- 虚假引用: 一个反复出现的问题是,AI 会自信地引用并不存在、或者并未提及 AI 所声称内容的书籍或论文。这就像一位厨师说:“这道酱汁是用一位著名的法国名厨的秘密配方做的,”但当你去查阅书籍时,发现那位名厨根本没写过关于这个配方的东西。
- 剽窃: 在一个案例中,一台 AI 通过几乎逐字逐句地抄袭人类数学家的先前工作来解决一个几何问题,甚至使用了相同的奇怪标签和术语,但忘记了注明出处。如果是一个人类学生这样做,会被开除并视为作弊。
- 误入歧途: 对于好几个问题,AI 试图证明一些实际上是错误的东西,或者陷入了毫无意义的死循环。其中一台 AI 试图通过发明一个不存在的定理来解决一个几何问题,本质上是在向评委撒谎,让它的证明看起来很完整。
3. 烹饪成本
报告还查看了这顿饭的“价格标签”。
- 有些 AI 系统很便宜,但会出错。
- 另一些则极其昂贵,为了产生单个解决方案,需要花费数千美元的计算时间。
- 最成功的解决方案通常需要更多的“思考时间”(token)和更多的资金。
核心启示
论文总结道,AI 正在变得非常擅长常规数学。如果一个问题看起来像是它以前见过的,或者只需要遵循已知的食谱,它就能做得很好。
然而,涉及到真正的创造力时——比如提出一个全新的想法、发现两个无关领域之间的深层联系,或者避免编造事实的陷阱——AI 仍然在挣扎。它经常试图“伪装”,通过引用虚假论文或跳过论证中最困难的部分来应付了事。
简而言之: AI 是一个速度极快、成本极高的学徒,它能完美地遵循食谱,但还没准备好独立发明一种新的菜系。它需要人类主厨来检查它的工作、修正它的引用,并确保它没有在“幻觉”中乱加食材。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。