← 最新论文
🤖 machine learning

PRISM: Parallel Residual Iterative Sequence Model

PRISM 是一种可并行化的序列模型,它通过解耦非线性并使用两阶段代理架构将迭代细化蒸馏为前馈算子,解决了 Transformer 表达能力与线性效率之间的张力,在实现理论上的 Rank-LL 累积并比显式优化方法高出 174 倍吞吐量的同时,保持了相当的性能。

原作者: Jie Jiang, Ke Cheng, Xin Xu, Mengyang Pang, Tianhao Lu, Jiaheng Li, Yue Liu, Yuan Wang, Jun Zhang, Huan Yu, Zhouchen Lin

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Jie Jiang, Ke Cheng, Xin Xu, Mengyang Pang, Tianhao Lu, Jiaheng Li, Yue Liu, Yuan Wang, Jun Zhang, Huan Yu, Zhouchen Lin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:“速度 vs. 智力”的困境

想象一下,你正试图记住一个非常长的故事(比如一个用户的整个购物历史,或者你正在读的一本书),以便预测接下来的情节。

  • “聪明”的方式 (Transformer): 这就像有一位超级聪明的图书管理员,每当你提问时,他都会把整个故事重新读一遍。因为他看到了全局,所以极其准确,但速度很慢。如果故事变得太长,管理员就会感到应接不暇,寻找答案需要耗费大量时间。
  • “快速”的方式 (线性模型): 这就像一位只记录简短摘要笔记的图书管理员。随着新词汇的到来,他会立即更新这些笔记。他们速度极快,但由于笔记过于简单,往往会错过故事中微妙的细节或复杂的联系。他们虽然“笨”,但效率很高。

长期以来,研究人员认为你必须做出选择:要么变聪明但变慢,要么变快但变笨。

旧有的“聪明”方案:串行瓶颈

一些研究人员试图通过一种“测试时训练”(Test-Time Training, TTT)方法让这些快速的图书管理员变得更聪明。这就像是告诉那位快速的管理员:“在你回答之前,先深入思考一下,检查你的笔记,纠正你的错误,然后再思考一次。”

这让他们变得聪明得多(能够处理复杂的模式),但也破坏了速度。为什么?因为他们必须循序渐进地思考。在完成第 1 步之前,他们无法思考第 2 步。这就像是一个人在试图同时解决一个拼图,必须一个零件一个零件地处理,而周围有一群人在等待。这很准确,但它扼杀了速度优势。

新的解决方案:PRISM

该论文的作者们提出了一个大胆的问题:“我们能否让图书管理员既能进行深度思考(像聪明的那样),又能同时进行(像快速的那样)?”

他们的答案是:可以。他们构建了一个系统,模仿深度思考的过程,但对其进行了重新排列,使其能够并行执行。

PRISM 的工作原理(类比)

想象一下,图书管理员需要更新他的记忆笔记。

  1. “写与忘”的技巧:
    论文意识到,“忘记”旧信息是容易且稳定的(就像让一杯咖啡冷却下来)。你不需要一个超级复杂的脑子来做这件事。然而,“写入”新信息才是魔力所在。PRISM 将这两个任务分开了:它使用一种简单、快速的方法来“忘记”,并将所有的脑力都留给“写入”部分。

  2. “输入锚点”(小抄):
    旧有的“深度思考”方法之所以慢,是因为图书管理员必须查看他们当前的笔记,才能决定下一步要写什么。这产生了一种连锁反应(第 1 步依赖于第 1 步的结果,而第 1 步又依赖于第 1 步的结果……)。
    PRISM 打破了这种链条。与其观察当前的笔记,图书管理员转而观察从输入(刚刚到达的新词汇)中提取出的**“小抄”**。这份小抄会预测笔记在更新后可能呈现的样子。

    • 类比: 与其等到天气变化后再决定穿什么,不如直接看天气预报(输入),然后立即决定你的着装。你不需要等到雨真的落下来才决定。
  3. “并行循环”(专家团队):
    通常,深度思考是在一个循环中进行的:思考、检查、再思考、再检查。这是串行的。
    PRISM 将这个循环展开了。想象一下,不再是一个人循序渐进地思考,而是你拥有一个由 L 个专家组成的团队在同时工作。

    • 专家 1 查看小抄并提出一项修正建议。
    • 专家 2 查看同一个小抄并提出另一种不同的修正建议。
    • 专家 3 也做同样的事情。
      因为他们都在观察小抄(输入)而不是互相等待,所以他们可以同时开展工作。最终的记忆笔记是所有这些建议的结合体。

结果:两全其美

论文声称 PRISM 实现了“Rank-L”更新。用通俗的话说,这意味着图书管理员现在可以同时向多个方向更新他的记忆,从而捕捉到旧有的“快速”模型所错过的复杂细节。

  • 速度: 因为所有人都在并行工作,PRISM 和旧有的“笨模型”一样快。它比旧有的“聪明但慢”的方法快了 174 倍
  • 智力: 它的表现与那些缓慢的深度思考方法一样出色。在推荐系统(如推荐电影或书籍)的测试中,它比快速模型更准确,并且达到了缓慢模型的水平。

总结

PRISM 是一种构建 AI 记忆的新方式。它通过以下方式解决了速度智能之间的矛盾:

  1. 解耦了容易的部分(忘记)和困难的部分(写入)。
  2. 基于输入(小抄)而非等待当前状态来预测必要的修正。
  3. 以并行(专家团队)而非串行链条(一个人循序渐进地思考)的方式运行“思考”过程。

其结果是,诞生了一个既拥有短跑运动员的速度,又拥有马拉松选手智慧的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →