← 最新论文
🤖 AI

Probabilistic Tiny Recursive Model

本文介绍了概率微型递归模型(PTRM),这是一种任务无关的框架,通过在迭代递归过程中注入高斯噪声以实现随机探索,从而增强小模型的推理能力,在复杂谜题任务上相比前沿大语言模型实现了近两倍准确率提升,同时仅需显著更少的参数量且无需重新训练。

原作者: Amin Sghaier, Ali Parviz, Alexia Jolicoeur-Martineau

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Amin Sghaier, Ali Parviz, Alexia Jolicoeur-Martineau

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明、微小的机器人,专为解决像数独或逻辑网格这样的复杂谜题而设计。这个被称为“微小递归模型”(TRM)的机器人效率极高。它不需要巨型人工智能模型(比如你可能在新闻中听说的那些)那样庞大的算力,它仅使用极少量的计算机内存。

然而,这个小机器人有一个缺陷:它对第一次猜测过于自信。一旦它开始思考一个谜题,它就会沿着一条单一的直线路径前进。如果它不小心踏入“死胡同”(一个糟糕的解决方案),它就会一直沿着这条死胡同走下去,直到被困住,无法回头或尝试其他路线。这就像一名徒步者,看到一条路后,即使这条路通向悬崖,也会径直走下去,因为他们没有一种机制来提醒自己:“等等,也许我应该尝试另一条小径。”

新想法:“概率性”机器人

这篇论文的作者引入了一种名为“概率微小递归模型”(PTRM)的升级方案。他们并没有教给机器人任何新知识,甚至没有重新训练它。相反,他们改变了它在测试期间的“思考方式”。

以下是类比:

旧方法(确定性):
想象你正在一个巨大的黑暗迷宫中寻找出口。你派出一名探险者。他向前走,左转,右转,然后继续前进。如果他撞到了墙,他就停下来。如果他陷入循环,他就会永远待在那里。他只有一次找到出口的机会。

新方法(PTRM):
现在,想象你同时派出100名探险者。但这里的诀窍是:每当他们迈出一步时,你就给他们一个微小的、随机的“推力”(就像一阵轻柔的微风推了一把)。

  • 由于这些随机的推力,这 100 名探险者不会都走完全相同的路径。
  • 大多数人可能仍然会像那名单独的探险者一样,陷入相同的死胡同。
  • 但是,其中少数人可能会因为被恰到好处地推了一把,而偶然发现一扇隐藏的门,或者找到一条通往出口的不同路径。

当所有 100 名探险者完成后,你并不只是选择最常见的答案。相反,机器人内置了一个“裁判”(称为Q 头),它会审视所有 100 个答案,并说:“这个看起来最正确。”它选出那个获胜者。

为什么这很重要

这篇论文表明,这种派出多个被“推了一把”的探险者的简单技巧效果惊人:

  1. 它能逃离死胡同:随机的推力使机器人能够跳出“不良盆地”(即死胡同),而原始机器人会永远被困在那里。
  2. 它很便宜:这个机器人非常小(仅有 700 万个参数)。它解决谜题的能力几乎是世界上最大、最昂贵的人工智能模型的两倍,但运行成本却不到后者的 0.0001%
  3. 它能解决难题
    • 极端数独(Sudoku-Extreme)上,该机器人解决谜题的比例从 87.4% 提升至98.75%
    • 在一组名为PPBench的逻辑谜题集合上,其准确率从 62.6% 跃升至91.2%。这几乎是当今最佳单一人工智能模型准确率的两倍,并且击败了由顶尖 7 个人工智能模型组成的整个“团队”的总和。

核心结论

作者发现,机器人实际上知道自己是否走在正确的轨道上(这要归功于其内部的“裁判”),但原始方法从未给它机会去找到正确的轨道,如果它一开始就走错了方向。通过增加一点点随机性,并并行多次运行谜题,他们无需教给机器人任何新知识,就释放了它的全部潜力。

简而言之:不要只派一个人去寻找宝藏;派出一百个人,带一点点混乱,然后让最聪明的那个人选出获胜者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →