← 最新论文
🤖 AI

Long-Context Fine-Tuning with Limited VRAM

本文提出了一种结合了分层全局注意力、分段反向传播和分级 KV 存储的内存高效长上下文微调框架,旨在使单张 16 GB GPU 能够支持高达 16,384 个标记的序列训练以及高达 131,072 个标记的评估,且性能与密集注意力机制相当。

原作者: Vladimir Fedosov, Aleksandr Sazhin, Artemiy Grinenko, Frank Woernle

发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Vladimir Fedosov, Aleksandr Sazhin, Artemiy Grinenko, Frank Woernle

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人阅读一间充满书籍的图书馆。这个机器人拥有一个卓越的大脑,但它的“工作记忆”——也就是它在阅读时用来思考的小书桌——非常小。在人工智能的世界里,这个书桌被称为 VRAM(显存)。如果机器人尝试阅读一个长篇故事,它需要记住已经读过的每一个词,才能理解当前的句子。但如果故事太长,机器人的书桌就会变得杂乱无章,并在完成课程前崩溃。这就是“长上下文”问题:我们如何教这些模型在不耗尽书桌空间的情况下记住数千个单词?

为了解决这个问题,科学家们开发了一些技巧。其中一种是 QLoRA,它就像把机器人的大脑压缩进一个更小、更轻的背包里,以便放在书桌上。另一种是 密集注意力(dense attention),这是机器人回顾之前读过的每一个单词以寻找线索的方式。虽然这对于短篇故事效果很好,但对于长篇故事来说却变得不可能,因为机器人必须在它微小的记忆中携带整个历史。这篇论文探讨了一种新的方法,教这些机器人如何在不需要巨大书桌的情况下处理宏大的故事,它结合了巧妙的记忆技巧和一种新的“搜索引擎”式的阅读方式。


问题所在:机器人的微型书桌

想象一下你正在为一场历史考试做准备。你有一本 10,000 页的历史教科书,但你的大脑一次只能容纳大约 2,000 页的笔记。如果你在读第 8,000 页时,你需要记住第 100 页发生了什么,但你的笔记已经满了。在过去,AI 模型就像那些试图把读过的每一页都复印一份放在桌子上的学生。如果书太长,书桌就会爆炸。

本文作者想要训练一个名为 Qwen3-8B(一个拥有 80 亿个“神经元”的聪明机器人)的模型,使用的是一块名为 Quadro RTX 5000 的特定显卡,该显卡仅有 16 GB 显存。他们尝试使用一种称为“密集注意力”的标准方法来教它。结果呢?机器人可以处理 2,048 个 token(token 是单词的一个块,比如一个音节或一个短词)长度的故事。但一旦他们尝试将故事增加到 4,096 个 token,机器人的书桌就满了,训练随之崩溃。它根本无法将过去的记忆放入那极其有限的空间中。

解决方案:“层级全局注意力”(HGA)图书馆

团队想出了一个新策略,称为 层级全局注意力(Hierarchical Global Attention, HGA)。与其试图把过去每一个单词都留在桌子上,不如建立一个智能的两级归档系统。

把故事想象成一座巨大的图书馆:

  1. 摘要(目录): 首先,机器人为故事中的每一个 64-token 块 创建一张微小的摘要卡。这些摘要卡非常小,所以它们都能放得下书桌。
  2. 分组(书架): 在这些块内部,还有更小的 8-token 组。机器人也会为这些组保留一份摘要缓存。
  3. 真实的图书(精确的单词): 当机器人需要阅读故事的特定部分时,它不会加载整个图书馆。它会查看书桌上的摘要卡,挑选出最相关的块,然后只从存储室(RAM 或硬盘)中提取这些特定块的精确单词(即“键/Key”和“值/Value”数据)并带到书桌上。

这就像有一位知道你具体需要哪些页面的图书管理员。与其背着整本书,图书管理员只需把你要找的那三页拿给你。书的其余部分留在书架上(在 RAM 或硬盘中),不占用书桌上的任何空间。

实际运作方式

研究人员将长篇故事分割成若干段。他们一次只训练机器人学习一段故事。

  • 活跃段(Active Segment): 当前正在学习的故事部分就在书桌上。
  • 历史(History): 过去的部分被存储在“存储室”里。
  • 魔法之处: 当机器人需要回看时,它使用摘要卡来找到正确的页面,抓取那些特定的页面,并从中学习。一旦完成该段的学习,它会将旧的页面推回存储室,为下一个段落腾出空间。

这种方法被称为 分段反向传播(segment-wise backpropagation)。这就像学习一个章节,参加测试,然后清理书桌去学习下一个章节,同时保留一张关于之前章节重要事实位置的地图。

结果:更大的故事,同样的书桌

团队在他们的 16 GB 显卡上进行了测试。结果如下:

  • 旧方法(密集注意力): 只能处理 2,048 个 token。在 4,096 个 token 时完全失败。
  • 新方法(HGA): 在完全相同的显卡上,成功训练了长达 16,384 个 token 的故事(甚至测试到了 32,768 个 token)。

新方法的峰值显存占用为 15.28 GB,能够舒适地适配 16 GB 的限制。机器人处理的故事长度比以前增加了 8 倍,而无需更大的书桌。

速度与质量:是否存在权衡?

通常,当我们让某样东西变得更聪明或更大时,它会变慢。作者检查了这种新方法是否更慢。

  • 1,024 个 token 时,新方法比旧方法慢了约 20%。这是因为在故事较短时,“搜索”正确页面的过程需要额外的处理时间。
  • 然而,在 2,048 个 token 时,新方法实际上略快一些(217.75 tokens/秒 对比 207.02 tokens/秒)。
  • 作者解释说,随着故事变长,旧方法必须查看越来越多的单词,从而导致速度变慢。而新方法只关注固定数量的少量重要单词,因此其速度保持稳定。他们预测,对于极长的故事,新方法将会更快。

机器人的学习效果如何?他们使用标准的阅读测试(PG19 数据集)测试了机器人的知识水平。

  • 使用新方法训练的机器人得分 2.7405(衡量预测下一个单词好坏的指标)。
  • 使用旧方法训练的机器人得分 2.7383
  • 两者的差异极小(0.0022),这意味着即使观察的单词较少,新方法的学习效果与旧方法几乎一样好。

局限性:机器人目前还做不到的事

论文非常诚实地说明了这种方法目前还不能做到的事情。

  1. 因果泄漏(Causal Leakage): 如果你训练机器人的时间非常长(数亿个 token),它可能会开始“作弊”。因为机器人通过将单词分组来制作摘要,一个早期的单词可能会意外地“看到”后面不该让它知道的信息。这被称为“因果泄漏”。作者表示,这对于短时间的训练任务(如他们进行的 100 步训练)是没有问题的,但目前不建议将其用于从零开始训练一个大规模、跨越数年的大型项目。
  2. 推理(阅读故事): 机器人可以用这种新方法进行学习,但在进行阅读写作故事时,目前仍使用标准的、较慢的方法,以确保能与现有软件兼容。作者正在开发一个“生产级”的版本,届时机器人也可以使用这种快速的新方法来进行阅读,但该版本尚未准备就绪。

总结

这篇论文表明,你不需要一台超级昂贵、巨大的计算机来训练处理长篇故事的 AI。通过使用智能归档系统(HGA)和“逐块”学习模式,你可以将 16,384 个 token 的训练任务放在原本只能处理 2,048 个 token16 GB 显卡上。机器人的学习效果同样出色,而且随着故事变得越来越长,这种新方法会比旧方法更快。这是一个巧妙的技巧,它将内存限制变成了一个可以管理的谜题,为能够阅读整本书籍而不耗尽书桌空间的更智能 AI 打开了大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →