← 最新论文
🤖 AI

KV-PRM: Efficient Process Reward Modeling via KV-Cache Transfer for Multi-Agent Test-Time Scaling

KV-PRM 是一种高效的过程奖励模型,它通过直接利用预计算的 KV 缓存,将评分复杂度从 O(L²) 降低到 O(L),从而消除了基于文本重编码的计算瓶颈,在实现速度和内存大幅提升的同时,在多个推理基准测试中达到或超越了现有方法。

原作者: Peng Kuang, Haibo Jin, Xiaoyu Han, Yanli Wang, Xiaopeng Yuan, Ye Yu, Kaidi Xu, Haohan Wang

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Peng Kuang, Haibo Jin, Xiaoyu Han, Yanli Wang, Xiaopeng Yuan, Ye Yu, Kaidi Xu, Haohan Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在主持一场规模宏大、赌注极高的游戏秀,一支由 AI 侦探组成的团队(我们称之为“多智能体小队”)正试图破解一个超级难的数学谜题。他们不仅仅是猜测答案,而是将问题分解成微小的步骤,并在彼此之间传递线索。为了确保他们不会误入歧途,他们配备了一位“法官”(过程奖励模型,简称 PRM),负责检查他们写下的每一个线索。

旧方法:强迫症式的重读者
在过去,每当法官想要检查一个线索时,他们都必须进行极其耗费精力的工作。想象一下,侦探们写了一个 5,000 字的故事。为了给它评分,法官必须从第一个字到最后一个字,重新坐下来阅读这整个 5,000 字的故事。如果故事变长了,阅读时间并不仅仅是略微增加,而是会发生爆炸式增长。如果你把故事长度翻倍,阅读时间会变为原来的四倍。这就是论文中所说的 O(L2)O(L^2) 成本。这就像是为了找一根针而不得不每次都重新搭建一遍整个干草堆。论文指出,这是一种巨大的能量和时间的浪费,尤其是在侦探们正在编写长篇、复杂的复杂故事时。

新方法:KV-PRM(“神奇记忆”阅读器)
作者 Peng Kuang 及其团队意识到,侦探们其实已经在免费地完成这项艰苦的工作了!当侦探们书写故事时,他们的脑海(AI 的内部“KV 缓存”)自然地存储了一份关于他们思考过的每一个词的高清、超详细的记忆。这就像是故事灵魂的一段完美、连续的录像,而不仅仅是印刷出来的文字。

  • 它是如何工作的: 法官只需取一个微小的“验证标记”(你可以把它想象成一个神奇的问号“?”),然后询问记忆:“基于目前存储的所有信息,这条路径好吗?”
  • 结果: 因为法官不需要重新阅读文本,成本从剧烈的爆炸式增长降为了简单的线性行走。论文在数学上证明了,这份记忆所包含的信息量严格大于文本本身。这就像拥有一个故事的 3D 全息图,而不是一张平面的纸;全息图在更小的空间内承载了更多的细节。

数据:它到底有多快?
团队在一些最难的数学谜题(如 MATH, GSM8K 和 AIME)上测试了不同的 AI 规模(0.6B, 4B 和 8B 参数)。以下是他们的测量结果:

  • 速度: 在实际运行时间中,KV-PRM 快了高达 37 倍。对于一个长故事,旧法官需要 172.0 毫秒 才能完成的一次检查,新法官仅需 4.6 毫秒
  • 能量: 每次检查使用的计算步骤(FLOPs)减少了高达 5,000 倍
  • 内存: 它完成任务所需的计算机内存减少了 34.2 倍
  • 准确率: 尽管速度快了这么多,它不仅“跟上了”步伐,甚至往往比旧的、缓慢的法官得分更高。

他们明确排除了什么
论文非常明确地指出了哪些做法无效或不是答案:

  • 仅仅缩小法官的规模: 团队尝试使用较小的 AI(0.6B 或 4B)作为旧式的文本阅读型法官以节省成本。他们发现,虽然速度变快了,但并不够聪明。即使是一个微小的 8B KV-PRM 也大幅度超越了庞大的 8B 文本阅读型法官。论文认为,解决办法不仅仅是缩小模型,而是改变其“阅读方式”。
  • 阅读更多的标记: 团队想过:“如果我们用不止一个问号来检查故事会怎样?”他们的数学推导(定理 2)和实验表明,第一个问号已经捕捉到了几乎所有的有用信息。增加第二个或第三个问号几乎不会带来额外的收益,但却会增加成本。因此,坚持只使用一个验证标记才是最完美的平衡点。

一个额外的技巧:“KV 转向”
因为新的法官观察的是“神奇记忆”(一个平滑、连续的信号)而非仅仅是文本(一个破碎、离散的信号),团队发现了一个酷炫的副作用。他们可以通过数学梯度,在侦探们思考的过程中对其进行“微调”,从而将对话引导向更好的答案。他们称之为 KV 转向 (KV Steering)。论文显示,这种方法在 AIME 谜题上的概念验证中表现出色,在没有运行搜索的情况下,将准确率提升了高达 3.33 个百分点。论文指出,由于你无法像引导记忆信号那样去“引导”一张纸,因此这在旧的基于文本的法官身上在结构上是不可能实现的。

底线
这篇论文并不仅仅是暗示这可能奏效,他们通过多个数据集和模型规模进行了测量,并在数学上证明了这一点。他们发现,通过复用 AI 自身的“神奇记忆”而非重新阅读文本,我们可以更快、更便宜、通常也更准确地解决复杂问题。这是一种从“重读整本书”到“查阅作者完美笔记”的转变。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →