Think Fast: Estimating No-CoT Task-Completion Time Horizons of Frontier AI Models
本文通过衡量前沿人工智能模型相对于人类基准的任务完成时间跨度,评估了这些模型在没有显式思维链标记的情况下进行复杂推理的能力,揭示了其性能每年翻倍的趋势,并预测到2030年,这些模型将能够通过单次尝试解决需要超过25分钟人类努力的任务。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在观看一位魔术师表演魔术。通常情况下,魔术师会向你讲解他的过程:“我要先洗牌,然后我会偷看最上面一张,现在我要让它消失。”这种说话的过程就像是人工智能的“思维链”(Chain of Thought, CoT)。它是模型在给出答案之前向我们展示的逐步推理过程。安全专家非常喜爱这一点,因为他们可以通过倾听“思考过程”来确保人工智能没有在策划任何危险的行为,比如撒谎或试图欺骗其人类监督者。
但如果魔术师完全停止说话了呢?如果他能在脑海中完成所有这些复杂的洗牌、窥视和规划,全程保持沉默,然后只需打个响指就能揭晓答案呢?如果人工智能能够做到这一点,安全监控人员就会陷入黑暗,无法看到那些可能隐藏着坏计划的“思考”。这篇论文提出了一个宏大且略带恐惧的问题:这些超级智能的人工智能模型,究竟能在不向我们展示哪怕一个单词的情况下,在脑海中完成多少复杂的工作?
研究人员决定通过让前沿人工智能模型经历一场由超过 3 万个谜题、数学问题、编程挑战和逻辑游戏组成的巨大考验来寻找答案。但有一个限制条件:他们强迫模型立即回答,不允许使用任何“思维标记”(thinking tokens)或内心独白。他们想要测量的是“时间跨度”(Time Horizon)——这是一个高级的问法,即:“人类解决刚才人工智能在瞬间解决的同一个问题需要多长时间?”
以下是他们的发现。在过去的六年中,这些人工智能模型在“沉默思考”方面变得极其出色。在 2019 年,人工智能只能解决人类在没有帮助的情况下能在不到一秒钟内完成的问题。但到这项研究对 2026 年的预测时,最新的模型(如 GPT-5.5)预计能够解决那些需要人类花费超过 3 分钟才能弄清楚的问题,而且全程无需说出一个关于其推理过程的单词。
这种增长正在迅速发生。研究人员发现,这些沉默任务的复杂度大约每年都在翻倍(具体来说是每 373 天)。这就像是人工智能在短短一个日历年内,就学会了一整年的脑力体操。如果这一趋势持续下去,到 2028 年,这些模型可能会在沉默状态下解决需要人类花费 7 分钟的任务;而到 2030 年,这可能会跃升至 25 分钟的纯粹、隐藏的脑力劳动。
为了复核他们的计算,他们还观察了一个参考模型在解决这些相同问题时需要多少个“推理标记”(即数字化的思考步骤)。他们发现,从这些标记的角度来看,人工智能的沉默处理能力也在每年翻倍,对于最新的模型而言,其隐藏的处理能力已达到超过 1,500 个标记。
该论文指出,虽然我们无法 100% 确定未来(数值存在广泛的可能性),但趋势是明确的:人工智能模型正在迅速获得在不向我们展示的情况下,完全在它们的“大脑”中进行复杂、多步推理的能力。这意味着,依靠倾听人工智能的思想来确保其安全,在不久的将来可能会变得更加困难,因为人工智能可能只是在沉默中完成了所有的思考。作者敦促开发者密切追踪这种“沉默”能力,因为它正以可预测的方式增长,并可能改变我们监控这些强大系统的模式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。