Human vs Machine Mathematical Difficulty on Project Euler: An Experimental Analysis
本文通过分析 26 个 AI 模型在 50 道 Project Euler 问题上的 3,840 次尝试,旨在证明机器投入的增长呈亚线性规模(与更差规模预测相矛盾),同时成功概率遵循指数衰减模型,并最终估算出最先进性能水平的水平线具有 75 天的倍增时间。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是关于论文《Human vs Machine Mathematical Difficulty on Project Euler》(Project Euler 上的人类与机器数学难度对比)的解释,已将其转化为通俗易懂的语言并配以类比。
大局观:一场关于时间与复杂度的竞赛
想象一下,Project Euler 是一个巨大的、面向公众的数学题健身房。人们(以及现在的 AI)报名参加这些谜题的挑战。健身房为最快的选手记录着秒表,精确记录他们找到正确答案所需的时间。
论文的作者想要回答一个简单的问题:随着数学题变得越来越难,AI 系统变差的速度是否比人类更快?
曾有一个理论(由数学家 Timothy Gowers 提出)认为,AI 会像一个很快就会疲劳的短跑运动员。其核心观点是:“AI 在简单的短跑中表现出色,但随着比赛变得更长、更难,AI 的努力程度会呈爆炸式增长,从而被人类甩在身后。”
作者利用 50 道近期数学题的数据和 26 种不同的 AI 模型测试了这一理论。以下是他们的发现。
1. “努力程度”测试:AI 会更快感到疲劳吗?
理论: 他们认为,对于人类解决一道难题所花费的每一小时,AI 需要花费远多于一小时的时间(以计算能力衡量,即生成的“token”或单词量)。他们预期随着题目变难,AI 的努力程度会飙升。
类比: 想象一个人和一个机器人在爬山。
- 预期: 机器人在山脚下表现很棒,但随着坡度变陡,机器人每走 1 步,可能需要做 100 步的计算工作,而人类只需走 1 步。
- 现实: 作者发现情况恰恰相反。对于最强的 AI 模型,随着山坡变陡,机器人的相对效率反而提高了。
- 如果人类用 1 小时解决一道难题,AI 可能需要 2 小时的计算工作。
- 如果人类用 10 小时,AI 可能只需要 15 小时的计算工作。
- 结果: 这个“差距”并没有扩大,反而缩小了。在这些特定的题目上,AI 的扩展性(scaling)比人类更好。作者将这一发现称为 ,这基本上意味着“AI 处理难度的效率提升速度比我们预期的要快”。
为什么? 作者推测,这些数学题包含大量的“编码”或“实现”步骤。人类在打字和调试代码上花费大量时间,而 AI 在打字和调试方面极其迅速。因此,即使 AI 在“思考”部分进展缓慢,它在“执行”部分的超高速让总体的计算时间看起来非常高效。
2. “可靠性”测试:AI 是否会直接放弃?
理论: 虽然 AI 可能很高效,但也许它会因为变得困惑而更容易失败。作者测试了成功率是否会以一种可预测的方式下降。
类比: 想象在黑暗的森林中行走。
- 理论: 你走的每一步都有一个微小的、恒定的概率让你绊倒。路径越长(题目越难),你绊倒的可能性就越大。
- 现实: 数据完美契合了这个模型。AI 的成功率呈现出一种平滑且可预测的曲线下降。
- 如果题目需要人类花费 1 小时,AI 可能会在 90% 的情况下成功。
- 如果题目需要人类花费 4 小时,AI 的成功率会降至约 50%。
- 结果: AI 失败并不是因为它“耗尽了能量”或“在错误的方向上搜索”。它失败是因为它在长时间任务中的不可靠性。它就像一个跑得很快但如果比赛时间过长就会不断被自己鞋带绊倒的跑步者。
3. “极限水平”测试:AI 能坚持多久?
作者计算了一个“50% 极限值”()。这是指 AI 有 50% 概率解决问题的临界点。
- 发现: 本研究中的顶级 AI 模型在人类用时约为 2.5 到 4.3 小时时,达到了 50% 的成功率。
- 隐喻: 把 AI 想象成一个手电筒。它能发光一段时间,但如果人类需要行走 10 小时才能解决问题,那么 AI 的光芒(保持正确路径的能力)在第 4 小时就已经熄灭了。
- 趋势: 作者追踪了这些“手电筒”变亮的速度。他们发现,顶尖 AI 提升其“耐力”的速度非常快,大约每 75 天其能力就会翻倍。
4. “智能体”转折:给 AI 一个团队
论文还研究了“智能体”(Agentic)模型。这些 AI 不仅仅是回答一次,它们被赋予了工具来拆解问题、尝试重来并检查自己的工作(就像人类使用计算器和草稿纸一样)。
- 结果: 这些“AI 团队”可以解决那些需要更长人类时间的题目(对于 50% 成功率的临界点,基础 AI 对应的是 0.3 小时的人类时间,而智能体模型对应的是 1.7 小时)。
- 代价: 即便有了这些工具,它们仍然无法应对那些顶尖人类需要 10 小时以上才能解决的最难题目。它们只是稍微推高了“耐力极限”。
总结:这意味着什么?
论文得出结论:那种认为 AI 会在问题变难时单纯“耗尽燃料”并变得低效的旧有担忧,在这些特定的数学谜题上是不成立的。
- 效率: 随着题目变难,AI 在这些任务上的效率实际上比人类更高。
- 真正的瓶颈: 瓶颈不在于效率,而在于可靠性。AI 可以完成工作,但如果任务持续时间过长,它往往会出错并迷失方向。
- 限制: 目前,最好的 AI 可以可靠地处理那些人类需要约 4 小时才能解决的问题。一旦超过这个难度,AI 就会开始瞎猜并失败。
简而言之: AI 不是累了,它只是分心了。它是一个聪明、高效的员工,但它需要一个非常短小且专注的任务才能成功。如果你交给它一个漫长且复杂的项目,它很可能会在完成之前就被自己的鞋带绊倒。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。