← 最新论文
💬 NLP

YOCO++: Enhancing YOCO with KV Residual Connections for Efficient LLM Inference

该论文提出了 YOCO++,一种通过引入底层与中间层之间的加权残差连接来增强 YOCO 的跨层 KV 压缩方法,在保持训练和推理效率的同时显著提升了模型性能,并在 50% 压缩率下超越了标准 Transformer。

原作者: You Wu, Ziheng Chen, Yizhen Zhang, Haoyi Wu, Chengting Yu, Yuchi Xu, Wenbo Su, Bo Zheng, Kewei Tu

发布于 2026-04-16
📖 1 分钟阅读☕ 轻松阅读

原作者: You Wu, Ziheng Chen, Yizhen Zhang, Haoyi Wu, Chengting Yu, Yuchi Xu, Wenbo Su, Bo Zheng, Kewei Tu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 YOCO++ 的新方法,旨在让大型人工智能模型(LLM)在运行得更快、更省内存的同时,还能保持甚至提升它的“聪明程度”。

为了让你轻松理解,我们可以把大模型想象成一家超级繁忙的图书馆,把它的推理过程(回答问题)想象成读者在图书馆里查资料

1. 背景:图书馆的“记忆瓶颈”

  • 大模型的问题:现在的 AI 模型非常聪明,但也很“健忘”且“记性差”。当它处理长文章时,需要把之前读过的所有关键信息(Key-Value,简称 KV)都记在脑子里,这叫 KV 缓存
  • 内存瓶颈:随着对话变长,这个“记忆本”变得越来越大,占满了图书馆的书架(显存),导致图书馆只能接待很少的读者,或者反应变慢。
  • 之前的尝试(YOCO):为了解决这个问题,之前的 YOCO 方法想出了一个妙招:“只记一半,后面复用”
    • 想象图书馆有 20 层楼。YOCO 说:前 10 层楼(底层)正常记笔记;后 10 层楼(顶层)别记了,直接拿第 10 层的笔记来用。
    • 效果:书架占用少了一半,速度也快了。
    • 缺点:就像让后 10 层楼的读者只拿着第 10 层的笔记去回答问题,信息量不够,导致回答质量下降(模型变笨了)。

2. 核心创新:YOCO++ 的“超级笔记”

YOCO++ 的作者觉得:“只拿第 10 层的笔记太可惜了,我们能不能把第 1 层(最底层)的精华也融合进去呢?”

于是,他们提出了 YOCO++,引入了一个**“加权残差连接”**的概念。

创意比喻:老专家与新员工的“师徒传承”

想象一下:

  • 第 1 层是图书馆的创始元老,经验丰富,知道所有基础常识。
  • 第 2 到 10 层中层员工,正在处理具体任务。
  • 第 11 到 20 层高层管理者,负责最终输出。

YOCO 的做法:高层管理者直接照搬中层员工的笔记。
YOCO++ 的做法

  1. 融合智慧:在每一层中层员工(第 2-10 层)记笔记时,不再只记自己的,而是把“创始元老”(第 1 层)的笔记也加进来
  2. 加权混合:不是简单地把两本笔记粘在一起,而是用一个智能配方(可学习的权重)
    • 比如:70% 自己的思考 + 30% 元老的经验。
    • 这个配方是模型自己学出来的,知道什么时候该多听元老的,什么时候该多听自己的。
  3. 结果:中层员工记下的笔记(缓存)变得信息量更丰富、更精准了。当高层管理者复用这些笔记时,它们不再是“缩水版”,而是“精华增强版”。

3. 为什么它既快又好?(效率分析)

你可能会问:“加了这么多信息,会不会让图书馆更慢、更挤?”

  • 内存没变:YOCO++ 依然只存一半的笔记(前 10 层),后 10 层直接复用。所以书架占用率(显存)和 YOCO 一样,省了一半
  • 速度没变
    • 计算量:那个“智能配方”(加权混合)的计算非常轻量,就像在笔记上盖个章,几乎不花时间。
    • 读写速度:虽然多读了一点元老的信息,但在现代计算机里,这点额外的读取时间几乎可以忽略不计。
  • 结论:YOCO++ 做到了**“花同样的钱(内存),办更好的事(效果)”**。

4. 实验结果:真的有效吗?

作者做了很多测试,把 YOCO++ 和原来的 YOCO、以及其他先进方法(如 FusedKV)以及标准的“笨重”大模型做对比:

  • 智商测试(准确率):在常识推理、逻辑问答等任务上,YOCO++ 的表现超越了标准的大模型,也打败了所有其他的压缩方法。它证明了:即使只存一半的笔记,只要笔记质量够高(融合了底层智慧),模型依然可以很聪明。
  • 速度测试:它的反应速度和 YOCO 一样快,比标准模型快很多。

总结

YOCO++ 就像给图书馆的“记忆复用”系统装上了一个“智能过滤器”和“增强器”。

它不再让高层管理者只看中层员工的“半成品”笔记,而是让中层员工在记笔记时,自动融合创始元老的“核心智慧”。这样,既保留了省内存、速度快的优点,又解决了模型变笨的缺点,是目前大模型高效推理领域的一项突破性进展。

一句话概括:YOCO++ 让 AI 在“只记一半笔记”的情况下,通过巧妙融合底层经验,依然能写出满分答案,而且速度飞快。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →