Fewer Tokens, Smaller Cache: Reward-Coordinated Efficient Reasoning
本文介绍了 ReCo,这是一个奖励协调框架,通过动态调整 KV 缓存压缩、抑制冗余反思以及实现基于过程奖励的提前停止来优化大语言推理模型,从而在保持准确性的同时显著降低推理成本和延迟。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个通过自言自语来解决难题的超级聪明机器人。它不仅仅是在瞎猜;它会在给出最终答案之前,一步步写下一篇详尽且细致的思考过程故事。这就是现代“大语言推理模型”的工作方式。它们就像出色的侦探,在写下每一个线索、每一个死胡同以及每一个“啊哈!”时刻之前,拒绝结案。问题在于,这个侦探有点过于话痨了。有时,面对像“2+2等于几?”这样简单的问题,它竟然会写出一篇关于数学史的长篇小说,最后才回答“4”。这种“过度思考”消耗了大量的计算机内存和时间,使得机器人的运行变得既缓慢又昂贵。
为了解决这个问题,科学家们尝试让机器人的记忆更加高效。把机器人的记忆想象成一块它用来记录想法的白板。随着机器人思考得越来越久,白板会变得越来越满。一种常见的技巧是擦掉那些最旧的、“最不重要”的笔记,以腾出空间给新的内容。这被称为“KV缓存压缩(KV-cache compression)”。然而,这项新论文背后的研究人员注意到,这种擦除方式存在缺陷。他们发现,如果擦除了错误的笔记,机器人就会变得困惑,并开始说得更多,试图通过增加话量来理清思路,这反而抵消了通过擦除笔记所节省的所有时间。这就像是为了节省时间而跳过食谱中的几个步骤,结果却发现你忘了一个关键原料,现在不得不把整道菜重新从头开始做。
这篇论文介绍了一个名为 ReCo(奖励协调压缩,Reward-Coordinated Compression)的新系统来解决这个混乱的问题。ReCo 不再只是随机擦除旧笔记或对所有人使用固定规则,而是像一位站在机器人身边的睿智教练。在机器人的每一步行动之后,教练都会问道:“你对自己正走在正确轨道上的信心有多少?”如果机器人表现出色且正处于稳健的路径上(即“高奖励”步骤),教练会说:“你做得非常好,你不需要保留每一条旧笔记。让我们删掉一些以节省空间吧。”但如果机器人正在挣扎或探索新想法(即“低奖励”步骤),教练会说:“等等,你现在需要所有的笔记;不要删除任何东西。”
巧妙之处在于,同一个“信心得分”同时承担了两项任务。首先,它决定保留或删除多少记忆。其次,它告诉机器人停止过度思考。如果机器人充满信心且处于正确的轨道上,教练会轻轻地提醒它停止唠叨,直接给出答案。如果机器人仍然感到困惑,教练则允许它继续思考和探索。通过协调这两项行动——既清理记忆,又控制机器人的说话量——该系统防止了机器人因困惑而写出更长故事来补偿的行为。
实验结果令人印象深刻。当研究人员在六种不同类型的谜题(从数学问题到科学问题)上对三种推理模型进行 ReCo 测试时,机器人变得更快了,且使用的词汇量也大幅减少。具体而言,该系统使机器人生成的词汇量减少了 37% 到 65%,并使整个过程比标准的、未经优化的方法快了 2.08 到 2.35 倍。至关重要的是,它在做到这些的同时,并没有让机器人显著变笨;准确率几乎保持不变,与那个缓慢且话痨的版本持平。论文表明,仅仅尝试缩小记忆是不够的;你必须同时管理机器人的思考过程,才能获得真正的速度提升。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。