← 最新论文
🤖 AI

Closing the Loop on Latent Reasoning via Test-Time Reconstruction

该论文介绍了 ReLAT,一种自监督测试时训练方法,它通过从中间潜状态重构原始查询来确保任务相关信息的保留,从而提升潜在推理能力,进而显著提高了在数学、知识和代码生成基准测试上的性能。

原作者: Xiaopeng Yuan, Haibo Jin, Ye Yu, Peng Kuang, Lijun Yu, Yushun Dong, Haohan Wang

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaopeng Yuan, Haibo Jin, Ye Yu, Peng Kuang, Lijun Yu, Yushun Dong, Haohan Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在尝试解决一个非常困难的谜题,比如一个复杂的数学问题或一个编程挑战。

问题:“黑盒”捷径

传统上,当人工智能(AI)尝试解决这些问题时,它会大声地对自己进行思考。它会将思考的每一步都用纯英文写下来(就像人类在笔记本上写笔记一样)。这很好,因为你可以阅读这些笔记,并观察 AI 是否分心了或者是否忘记了某个规则。然而,写下所有这些文字需要大量的时间和计算能力(就像是在为一次很长的电话通话付费)。

为了节省时间,研究人员开始让 AI 使用一种“秘密代码”(称为潜空间推理/latent reasoning)进行思考。AI 不再编写完整的句子,而是将它的想法作为不可见的、压缩后的数字保存在大脑内部。这非常快速且高效。

但问题在于: 由于这些想法是不可见的,AI 无法检查自己是否仍处于正确的轨道上。这就像闭着眼睛开车,完全信任自己没有不小心驶入沟渠。如果 AI 在使用“秘密代码”思考时忘记了一个关键的谜题规则,它直到给出错误答案时才会意识到这一点。论文称之为**“开环”(open loop)**——AI 先进行思考,然后给出答案,中间没有任何安全检查。

解决方案:ReLAT(“记忆测试”)

作者提出了一种名为 ReLAT(测试时重建引导的潜空间推理)的新方法。

你可以将 ReLAT 理解为 AI 在回答问题之前给自己进行的一次记忆测试

它是这样运作的,使用一个简单的类比:

  1. 设定: 你给 AI 一个很难的数学题(“问题”)。
  2. 秘密想法: AI 迅速将它的思考压缩成那种不可见的“秘密代码”(“潜空间想法”)。
  3. 记忆测试(循环): 在 AI 被允许给出最终答案之前,它必须尝试仅使用那个秘密代码来重建原始问题
    • 如果 AI 能从其秘密代码中完美地重建问题, 这证明它记住了所有的规则和约束条件。它通过了测试。
    • 如果 AI 未能重建问题(也许它忘了一个数字或一个条件),它就知道自己的“秘密想法”是有缺陷的。
  4. 修复: 如果 AI 未能通过记忆测试,它会利用这次失败来快速调整其内部设置(一个被称为“测试时训练”的过程)以修复其记忆中的漏洞。
  5. 答案: 只有在通过记忆测试后,它才会生成最终答案。

为什么这很重要

论文声称,这种方法将“开环”(盲目驾驶)转变为了**“闭环”**(配备了一个不断检查你位置的 GPS 导航)。

  • 它是自我修正的: AI 不需要人类来检查它的工作。它使用原始问题本身作为“标准答案”来验证自己的思考。
  • 它是高效的: 与旧方法不同(旧方法中 AI 需要写出长篇大论的文本来检查自己,这既慢又贵),ReLAT 使用不可见的、压缩后的数字来进行这种检查。
  • 它行之有效: 作者在困难的数学竞赛(如 AIME)、编程任务和医学问题上测试了该方法。他们发现,与标准的 AI、基于文本的检查以及其他“秘密代码”方法相比,ReLAT 显著提高了准确率。例如,在一场高难度的数学测试中,它将 AI 的得分从 56.7% 提升到了 73.3%。

核心要点

ReLAT 是让快速、不可见的 AI 思考变得更可靠的一种方法。它通过要求 AI 在给出最终解法之前,先从隐藏的想法中“回放”原始问题,从而强迫 AI 证明自己没有跑题。这就像是在出门之前,确保自己没有忘记购物清单,但这一切都是在瞬间完成的,无需写下任何东西。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →