PERK: Long-Context Reasoning as Test-Time Learning
该论文介绍了 PERK,这是一个利用通过嵌套元学习循环进行的测试时梯度更新,将长上下文编码进低秩适配器中的参数高效框架,其在各种模型规模的长上下文推理任务中,表现显著优于标准微调和专门化模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大语言模型是强大的工具,它们通过学习海量文本来掌握阅读和写作。它们擅长在信息就在眼前时寻找模式并回答问题。然而,当模型需要的信息被埋在巨大的文本墙中(例如一本书长度的文档或一段长篇转录稿)时,这些模型会面临一个显著的障碍。随着文本变得越来越长,模型往往难以忽略无关的噪声,并找到解决问题所需的特定事实。由于许多模型倾向于过度关注文本的最开头或最末尾,而丢失隐藏在中间的细节,这一困难变得更加复杂。研究人员长期以来一直在寻求方法,帮助这些模型处理此类“长上下文”任务,而无需从头开始重新训练,因为重新训练的过程通常成本极高且耗时巨大。
在 ICLR 2026 会议上展示的一项新研究中,来自 EPFL 的研究人员提出了一种名为 PERK 的解决方案,其全称为“参数高效的知识推理”(Parameter Efficient Reasoning over Knowledge)。PERK 并不试图强迫模型一次性阅读整篇巨型文档,而是将阅读行为视为一种在提问时刻发生的学习过程。想象一名学生,在收到一本厚教材和一个特定问题时,迅速扫描页面并在笔记本上写下一套简洁的笔记。一旦写好笔记,学生就可以把教科书收起来,仅凭这些笔记来回答问题。PERK 的工作方式与之类似。当呈现一份长文档时,模型并不会将整个文本保留在其活跃内存中。相反,它利用一个简短的内部学习阶段,将该文本最重要的部分压缩成一组对其自身内部设置的微小且高效的调整。这些调整就像是一个专门的记忆模块,存储了长文档的精髓。一旦这个“笔记本”创建完成,原始文本就会被丢弃,模型利用其更新后的新设置来回答有关该内容的问题。
研究人员开发了一种训练方法,教导模型如何有效地进行这种压缩与检索。他们使用了一种涉及两层学习的技术。在第一层中,模型学习如何快速将一段文本编码到其内存设置中。在第二层中,模型学习如何利用这些设置来准确回答问题。为了保持这一过程的高效性并防止计算机内存耗尽,模型仅更新其总参数中极小的一部分——具体来说,是一个被称为“低秩适配器”(low-rank adapter)的轻量级附加组件。这使得模型能够在不改变其核心知识库的情况下,从上下文中学习。研究人员在各种具有挑战性的任务上测试了这种方法,包括在数千页文本中寻找单个特定事实、回答需要连接多条信息的复杂问题,以及从长串看似相似的记录中检索数据。
结果显示,PERK 的表现显著优于那些仅仅通过在长文本上进行训练以随后回答问题的标准方法。在涉及 Qwen-2.5 模型的测试中,与这些标准方法相比,PERK 将准确率提高了高达 20%。即使当模型被要求处理比训练期间见过的文本长得多的文本时,该方法依然表现稳健,成功泛化到了 64,000 甚至 128,000 个 token 的上下文。此外,PERK 展示了忽略信息位置的独特能力。其他模型在相关事实从文本开头或结尾移动到中间时往往会失败,而 PERK 无论信息出现在何处都能保持高准确率。这表明,通过将文本编码为灵活的记忆结构而非依赖固定位置,模型可以进行更可靠的推理。该方法在不同规模的模型上均表现一致,从拥有 5 亿参数的极小型模型到 80 亿参数的模型,其表现甚至达到或超过了专门为长上下文设计的超大规模模型。
除了准确性之外,这项研究还强调了该方法的效率。由于模型将文本处理成较小的、易于管理的块,并在编码后丢弃原始文本,因此在处理极长文档时所需的计算机内存显著减少。在标准方法因内存限制在 128,000 个 token 时崩溃的测试中,PERK 能够继续运行,以极短的时间和极少的内存处理信息。研究人员得出结论,通过将长上下文推理重新定义为一项“测试时学习”(test-time learning)任务——即模型在运行时动态调整其自身的记忆——可以在不产生传统训练那样沉重计算成本的情况下,实现卓越的性能。这种方法为使大语言模型能够处理现实世界中海量且复杂的信息提供了一条充满前景的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。