← 最新论文
🤖 AI

KV-Rescue: Recovering Reasoning Language Model KV Eviction Loss via Stepwise Interleaving

KV-Rescue 是一个无需训练的推理框架,它通过将轻量级全上下文辅助模型的步骤与基座模型交织使用,并利用在线检测器来终止不连贯的生成,从而在激进的 KV 缓存驱逐预算下缓解推理语言模型的精度损失和失控退化问题。

原作者: Minsoo Cheong, Woosang Lim, Vincent-Daniel Yun, Sungjoo Yoo

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Minsoo Cheong, Woosang Lim, Vincent-Daniel Yun, Sungjoo Yoo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,大语言模型充当着强大的推理引擎,能够解决复杂的数学问题或规划复杂的任务。为了实现这一点,它们依赖于一个被称为“内存缓存”的庞大内部工作空间,该空间保存了它们在对话中至今所说和所想的一切历史。这种记忆至关重要;如果没有它,模型会忘记自己之前的步骤并失去逻辑脉络。然而,随着这些对话变得越来越长,这种内存需求变成了一种沉重的负担,消耗了大量的计算能力,导致系统变慢甚至崩溃。为了维持运行,工程师们开发了丢弃部分旧内存的方法,仅保留那些看起来最重要的部分。但这种丢弃信息行为是具有风险的。当模型遗忘过多过去的信息时,它不仅仅是犯下一个简单的错误,而是会陷入混乱,不断重复相同的词汇,或者生成毫无意义的内容,直到触及它能说话的最大长度限制。

首尔大学和南加州大学的研究人员发现了这个过程中的一个特定弱点,并设计了一种无需重新训练模型即可修复它的方法。他们发现,由丢弃内存引起的问题并非源于模型本身的智能缺失,而仅仅是一个信息缺口。一个由于遗忘了部分历史而变得强大的大型模型之所以陷入困境,是因为它缺失了上下文,而不是因为它失去了思考的能力。在一个巧妙的转折中,他们发现一个虽然规模更小、能力较弱但却能记住所有内容的模型,往往可以填补大型遗忘模型所遗漏的空白。大型模型可能会忘记某个所需的特定数字,但小型模型却能完美地记住它。反之,小型模型可能缺乏解决问题的深度推理能力,而大型模型虽有这种技能,却缺乏记忆。

为了弥补这一差距,该团队创建了一个名为 KV-Rescue 的新系统。该系统不再让大型模型在记忆不全的情况下独自挣扎,而是将其与一个能够时刻保持完整历史记忆的小型轻量级助手配对。当两个模型协作逐步解决问题时,它们轮流生成想法。在每一个阶段,评分系统都会评估哪个想法更好,并将该想法推进下去,从而创建一个单一的、共享的推理路径。如果大型模型因为遗忘过多而开始陷入胡言乱语或重复循环,系统会及早检测到这一点并立即停止该路径,依靠助手来保持思路不偏离轨道。这个过程使得大型模型能够在不牺牲其自身卓越推理能力的前提下,从小型模型的完美记忆中获益。

这一方法的测试结果令人瞩目。在利用一个强大的 70 亿参数模型进行五项不同数学基准测试时,这种新方法恢复了因激进丢弃内存而损失的近 90% 的准确率。在内存预算极其紧张的情况下,传统的尝试多种答案的方法往往会失败,导致模型出现重复或产生乱码。然而,新系统防止了这些失败,并平均减少了 43% 的无效计算工作。研究人员观察到,小型助手并没有接管整个任务;相反,在最困难的情景下,它仅贡献了大约三分之一的步骤,精准地在大型模型需要过去信息的提醒时介入。通过将大型模型的深度思考能力与小型模型的完美回忆能力相结合,研究人员证明了即使在计算机内存受到严重限制的情况下,也能保持长程推理任务的准确性与高效性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →