← 最新论文
💬 NLP

A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever

本文提出了一种系统,该系统通过依赖一个存储经独立验证的解的、持久且位精确的记忆库,使冻结的语言模型在经过验证的问题族上实现100%的准确率和零标记生成,从而将执行受限的能力与参数规模解耦,并使大规模上下文窗口能够在消费级硬件上实现。

原作者: Sietse Schelpe (Corbenic AI)

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Sietse Schelpe (Corbenic AI)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在尝试解决一个数学问题。在现代人工智能的世界里,获取答案的常规方式是每次提问时都让一个超级聪明的机器人从头开始思考。这个机器人就像一个才华横溢但极其昂贵的学生,即使你问同样的问题一千遍,他也得每次都重新阅读教科书、重新推导公式并重新写出解题过程。这既耗时,又耗电,而且有时如果你问两次同样的问题,他可能会给出两个略有不同的答案,因为他有点难以预测。这就是目前大多数“前沿”AI模型的工作方式:它们很强大,但当你需要完美的一致性时,它们显得缓慢、昂贵且有些混乱。

但是,如果我们不让机器人思考得更努力,而是直接给它一本完美的、经过验证的笔记本呢?想象一下,如果我们能解决一次问题,用一位严厉的老师检查答案以确保其 100% 正确,然后将该解法写进一本特殊的书中。从那以后,每当类似的问题出现时,机器人不需要进行任何思考。它只需翻到书中的正确页面,读出答案,然后立即写下来。它几乎不产生任何成本,瞬间即可完成,而且每次给出的答案都会完全一致。这就是一种被称为“验证重用”(verified reuse)的新方法背后的核心思想——智能不在于机器人的大脑变得更大,而在于一个机器人无需进行繁重计算即可访问的、不断增长的完美解法库。


被冻结的大脑与魔法图书馆

见见 Galahad,一个改变游戏规则的新系统。其创造者采用了一个标准的 AI 模型(一个名为 Gemma-4-12B 的 120 亿参数“大脑”),并做了一件激进的事:他们将其冻结了。他们关闭了它学习或改变的能力。这就像带走一位才华横溢的厨师并告诉他:“你不能再发明新食谱了;你只能根据这份特定的菜单来烹饪。”

在被冻结的厨师旁边,他们建造了 Merlin,一个神奇且超快速的图书馆。以下是魔法运作的方式:

  1. 存款: 当一个新问题进来时,系统会将其解决一次。但在将答案放入图书馆之前,一位严格的“把关人”会对其进行检查。这位把关人并不看答案解析,而是利用数学和逻辑来证明答案是正确的。如果通过检查,该解法就会被存储起来。
  2. 零成本重用: 现在,想象有一百万人提出了同类型的疑问。与其让厨师每次都从头开始烹饪,系统会直接从图书馆中查找经过验证的食谱。它告诉被冻结的厨师:“直接复制这个。”厨师瞬间就能完成。
  3. 结果: 该系统以 100% 的准确率回答了这些问题的 180 个全新变体。它使用了个“生成 Token”(即 AI 通常用于计费的数字货币)。它仅需 6 到 23 毫秒(比眨眼还快)并消耗约 36 毫瓦时的能量——这大约相当于一个 LED 灯泡工作 13 秒所消耗的能量。

为什么旧方法是浪费的

论文指出,目前使用 AI 的方式就像是每次你想盖个小木屋时,都要付钱请一位大师级建筑师从头设计一座房子。那些“前沿”模型(目前最强大、最昂贵的 AI)非常擅长解决它们从未见过的问题。但对于已经解决并经过验证的问题,要求它们再次思考是一种浪费。

作者测量了这种浪费。他们发现,如果你使用标准的 AI API 来回答一个已解决的问题,你每次都要为一次完整的“思考过程”付费。它是非确定性的(答案可能会略有变化),速度慢,而且成本高。相比之下,Galahad 的冻结模型一旦在图书馆中拥有了经过验证的解法,就能永远免费地回答相同的问题。其“盈亏平衡点”(即系统节省的成本超过构建图书馆成本的点)发生在仅仅 17 到 34 个问题之后。在那之后,每一个答案都是纯粹的节省。

“记忆”才是真正的明星

这项实验中最酷的部分之一是证明了“大脑”并不如“书本”重要。研究人员使用来自四家不同公司的四个不同 AI 模型(包括 Gemma、Qwen、DeepSeek 和 Phi)进行了测试。他们给了所有模型完全相同的冻结权重和完全相同的验证解法库。

结果如何?所有四个模型都拿到了 180 题中的 180 题满分。
无论模型是“稠密型(dense)”还是“混合专家(mixture of experts)”,这都不重要。能力完全来自于图书馆,而非大脑。当他们清空图书馆时,模型无法解决任何问题。当他们填满图书馆时,它们就变得完美无缺。这证明了对于经过验证的可重复任务,你不需要一个更大、更聪明、更昂贵的脑子;你只需要一个更好的、经过验证的记忆。

“猜测”的问题(向量搜索)

你可能会想:“我们难道不能直接用普通的搜索引擎来寻找答案吗?”论文说不行,原因如下。大多数 AI 系统使用所谓的“向量检索(vector retrieval)”,这类似于通过寻找看起来与你想要的物品相似的书来进行搜索。它是模糊的。

研究人员在包含 4,500 个验证项的库中测试了这一点。当他们使用模糊搜索时,错误率高达 94.3%。这简直是一场灾难。如果你在寻找特定的医疗公式或法律条款,得到一个“接近正确”的答案是毫无用处的。Galahad 使用的是精确寻址(exact addressing),这意味着它能以 0% 的误差找到那个确切的项目。这就像是猜测一首歌的名字是通过哼唱几个音符,而知道精确的条形码进行扫描。对于需要完美性的事物,模糊匹配会发生灾难性的失败。

通往无限的窗口

另一个惊人的发现是关于系统在其“工作记忆”(它能同时思考的空间)中可以容纳多少信息。

  • 标准的 AI 引擎(如 vLLM 和 SGLang)在尝试向它们输入超过约 32,000 个 Token(一个 Token 是单词的一部分)时,会崩溃或默默地遗忘。
  • Galahad 在单个图形卡上管理了一个 6,000,000 Token 的窗口
  • 它可以像访问末尾一样快速地回溯到 600 万个 Token 历史的最开头。
  • 它在做这一切时并没有消耗额外的计算机内存。这就像拥有一个拥有无限书架的图书馆,但你一次只能看一本书,并且你可以瞬间将这本书更换为图书馆中的任何另一本书。

这对未来意味着什么

论文非常谨慎地说明了它没有做的事情。它并不声称这个系统能比最大的 AI 模型更好地解决全新的、从未见过的难题。如果你问一个新鲜的、具有创造性的问题,这个冻结的大脑可能会感到吃力。但对于任何可验证的(如数学、编程或逻辑)且重复发生的(反复出现)任务,这个系统都是一个游戏规则改变者。

它颠覆了 AI 行业的逻辑:

  • 旧方式: 每次都要付费思考。
  • 新方式: 付费一次进行验证,然后永久免费执行。

作者甚至建立了一个公开测试平台,任何人都可以实时观察到这一过程。他们向所有人发起挑战:看谁能找到一个能以零成本、完美准确度和瞬时速度回答已解决问题的 AI。到目前为止,还没有人能做到。传达的信息很明确:对于我们每天从事的工作,我们不需要构建更大的大脑;我们只需要构建更好的、经过验证的图书馆。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →