← 最新论文
💬 NLP

YaRN: Efficient Context Window Extension of Large Language Models

本文提出了一种名为 YaRN 的高效旋转位置嵌入(RoPE)扩展方法,能够以更少的计算资源和训练数据,显著提升大语言模型(如 LLaMA)的上下文窗口长度并实现良好的外推能力。

原作者: Bowen Peng, Jeffrey Quesnelle, Honglu Fan, Enrico Shippole

发布于 2026-02-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Bowen Peng, Jeffrey Quesnelle, Honglu Fan, Enrico Shippole

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章介绍了一种名为 YaRN 的新技术,它的目标是让大语言模型(比如 ChatGPT 那样的 AI)拥有“超长记忆力”。

为了让你轻松理解,我们可以把大语言模型想象成一个正在参加超级马拉松的运动员

1. 背景:运动员的“记性”问题

目前的 AI 模型在训练时,就像是在一个固定长度的跑道上练习。如果跑道是 4 公里,它练得再好,一旦你把它扔到 42 公里的全程马拉松赛道上,它就会“大脑宕机”——它记不住前面跑过的路,甚至会因为节奏乱了而直接崩溃。

这种现象在技术上叫**“上下文窗口限制”**。模型能处理的信息长度是有限的,一旦超过这个长度,它就会开始胡言乱语。

2. 之前的尝试:强行拉伸(PI 方法)

以前科学家们想出了一个办法,叫 PI(位置插值)
比喻: 就像是把 4 公里的跑道,强行用橡皮筋拉长到 40 公里。
问题: 这样做虽然跑道变长了,但由于拉得太猛,跑道上的每一个“里程碑”(也就是模型理解位置的标记)都变得模糊不清了。运动员虽然在跑,但由于路标都变虚了,他根本不知道自己现在到底跑到了哪里,导致表现极差。

3. YaRN 的绝招:聪明地“重新规划”

YaRN 的出现,不再是暴力拉伸,而是像一个极其聪明的教练,通过一套组合拳解决了问题:

第一招:分层管理(NTK-by-parts)

比喻: 以前是把所有路标都模糊化,但 YaRN 发现,路标其实分为两种:

  • “远距离路标”(比如:你现在在哪个城市?):这种路标需要拉伸,否则你会迷失方向。
  • “近距离路标”(比如:你现在迈的是左脚还是右脚?):这种路标绝对不能模糊!如果连迈步的节奏都乱了,运动员就彻底废了。

YaRN 会**“区别对待”**:对于远距离的宏观信息进行平滑拉伸,但对于近距离的微观细节,保持原汁原味,不准模糊。这样,模型既能看到长远的全局,又能保持精准的局部细节。

第二招:调整“呼吸频率”(Attention Scaling)

比喻: 当跑道变长时,运动员会感到疲劳,注意力会涣散。
YaRN 在模型计算注意力(即“注意力机制”)时,加入了一个微小的“温度调节器”。这就像是给运动员提供了一定比例的能量饮料,让他在面对超长距离的信息时,依然能保持清醒的头脑,不会因为信息太多而感到“信息过载”。

4. YaRN 厉害在哪里?(总结)

如果用一句话总结 YaRN 的成就:它用极小的代价,让 AI 从“短跑选手”变成了“超长距离耐力选手”。

  • 省钱省力(高效): 以前的方法需要让 AI 重新进行大规模的“魔鬼训练”,而 YaRN 只需要极少量的训练(比以前少 10 倍的资源),就能让 AI 记住更长的内容。
  • 记忆力惊人(长文本): 它能让模型处理比原来长得多的文档(比如从几页纸变成一整本书),而且不会像以前那样“读了后面忘前面”。
  • 即插即用(兼容性): 它非常轻量,不需要改动 AI 的核心架构,就像是给旧引擎换了一个更聪明的电子控制系统。

一句话总结:YaRN 让 AI 不再是“金鱼脑”,而是变成了一个既能看清脚下路标,又能掌控全局方向的“长跑大师”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →