Do Value Vectors in Deep Layers Need Context from the Residual Stream?
该论文提出了“价值库”(Bank of Values, BoV),这是一种用于深度 Transformer 层的新型注意力机制,它利用存储在查找表中的无上下文、特定于 Token 的价值向量,证明了其在多种模型规模和基准测试中相比标准上下文相关价值向量具有更高的性能和效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一座巨大的图书馆,其中的每一本书(一个词或“Token”)都有一套特定的指令,规定了在故事中应如何被理解。在现代人工智能(大语言模型)中,这些书由一群图书管理员(“注意力层”)来阅读,他们会根据目前为止的故事语境,决定对每本书投入多少注意力。
通常情况下,这些图书管理员会拿起书,观察当前的故事情节,然后为这本书写下一套新的笔记(称为“数值向量”/“Value Vector”),之后再将其传递下去。这个过程就像是图书管理员每读一次书,都要根据前几页发生的事情,重新改写一遍这本书的摘要。
重大发现
研究人员在这篇论文中发现了一个令人惊讶的现象:对于在图书馆“后排房间”(即更深层网络)工作的图书管理员来说,他们实际上并不需要根据故事情节来重写笔记。
相反,这些深层图书管理员如果直接使用一份预先写好的、完美的摘要,且这份摘要不随故事改变,效果反而最好。事实证明,对于这些特定的层级而言,“原始的、脱离语境的”信息,比他们通常创建的“依赖于语境的”笔记更有价值。
解决方案:“数值银行”(Bank of Values)
基于此,作者创建了一个名为“数值银行”(BoV)的新系统。
- 旧方法(标准注意力机制): 每当 AI 阅读一个词时,它都会结合整个故事背景,为这个词计算出一套全新的、复杂的笔记。这在计算上非常昂贵,并且需要消耗大量内存来存储这些临时笔记。
- 新方法(BoV): 对于深层网络,AI 停止了即时计算这些笔记。取而代之的是,它拥有一个巨大的、静态的“银行”(一个查找表),其中存储着每一个可能出现的词汇所对应的完美、预先计算好的笔记。
- 当 AI 需要某个词的笔记时,它只需从银行中查阅即可。
- 这就像是拥有一本定义已经写好并印刷出来的字典,而不是每当你询问一个词时,都要派出一组作家坐下来构思一个新的定义。
为什么这种方法更好?
- 更快、更便宜: 因为 AI 不需要进行“重写”笔记的繁重数学运算,它节省了大量的计算量(FLOPs)。
- 节省内存: 在旧方法中,AI 必须为当前故事中写下的所有笔记维护一个“缓存”(一个临时存放区域)。而在新方法中,由于笔记永久存储在“银行”中,AI 不再需要携带那个沉重的缓存,它只需从书架上取用所需即可。
- 效果更好: 研究人员在不同规模的 AI 模型上进行了测试。他们发现,使用这种“银行”方法实际上让 AI 变得更聪明(错误率更低)且更高效,尽管它所做的工作量更少。
代价(以及解决方法)
论文指出,你不能对图书馆里的每一位图书管理员都这样做。位于最前方的(浅层)图书管理员仍然需要观察故事语境来理解词汇。但在深层后方的图书管理员那里,“银行”方法是一个改变游戏规则的突破。
总结
本文认为,在 AI 大脑的深层部分,词汇不需要根据故事进行重新解读,它们只需要保留其原始、纯粹的身份。通过将这些身份存储在一个永久的“银行”中并进行查阅,而不是进行计算,AI 变得更快、内存占用更少,且表现更佳。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。