Leviathan: Decoupling Input and Output Representations in Language Models
本文介绍了 Leviathan,这是一种 Transformer 架构,它通过将标准共享嵌入矩阵替换为可学习的嵌入向量化(LEV)来解耦输入和输出表示,从而以极小的参数开销在语言建模性能和下游基准测试中实现了显著提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是关于"Leviathan"论文的解读,已用通俗易懂的语言并辅以生动的类比进行翻译。
问题: “一刀切”的字典
想象一下,你正在教一个机器人说话。为此,机器人需要一本字典来同时完成两项截然不同的任务:
- 阅读:查找单词以理解其含义(输入)。
- 写作:查找单词以预测下一个词(输出)。
在大多数现代人工智能模型中,机器人使用同一本巨大的实体字典来完成这两项任务。这被称为“权重绑定”。论文认为,这就像强迫一把瑞士军刀既充当精密的外科手术刀,又充当重型锤子。它试图兼顾两者,但由于要求不同,导致它在两方面都表现不佳。
- 阅读需要平滑性:含义相似的单词(如“猫”和“小猫”)在机器人的思维中应该彼此靠近。
- 写作需要锐度:机器人需要清晰地区分字典中的每一个单词,哪怕是那些生僻的单词。
当你强迫一个工具同时承担这两项任务时,机器人不得不做出妥协。结果就是它在两方面都“还行”,但在任何一方面都算不上“出色”。
失败的修复方案:买两本字典
显而易见的解决方案似乎是:“给机器人两本独立的字典——一本用于阅读,一本用于写作。”
研究人员尝试了这种方法。他们给机器人配备了一本巨大的、完全独立的阅读字典。但这并没有奏效。机器人变得困惑,学习速度变慢,实际表现甚至不如使用单本字典的版本,尽管它拥有多出 50% 的内存(参数)可供使用。这就像给学生两本教科书却没有提供学习指南;额外的信息反而变成了干扰噪音。
解决方案:Leviathan(“智能生成器”)
这篇论文介绍了Leviathan,一种构建机器人大脑的新方法。Leviathan 不再使用用于阅读的巨型实体字典,而是采用智能、紧凑的生成器。
类比:食谱书 vs. 杂货店
- 旧方法(绑定嵌入):想象一家巨大的杂货店,每个物品(每个单词)都有自己特定的货架。如果你想要“苹果”,就去 A 货架;如果你想要“杏”,就去 B 货架。如果你想要一种像“榴莲”这样的稀有水果,你必须找到它那个特定的、微小的货架。如果商店很大,找到那个稀有货架就很困难,机器人经常忘记它在哪里。
- Leviathan 方法(LEV):Leviathan 没有为每个单词设置货架,而是拥有一本食谱书。
- 要制作一个“苹果”,机器人不是去查货架,而是遵循食谱:取 1 份“水果”,加 2 份“红色”,混合“甜味”。
- 要制作一个“榴莲”(一个生僻词),它遵循类似的食谱:取 1 份“水果”,加 2 份“带刺”,混合“强烈气味”。
因为机器人使用的是食谱(数学函数) 而不是货架,它可以即时创造出完美的“苹果”或“榴莲”。
- 魔力所在:如果机器人学会了“苹果”的味道,它自动就会更好地理解“梨”,因为这些食谱共享成分。这被称为平滑性。
- 效率:与巨大的杂货店相比,这本食谱书非常小。这意味着机器人可以保持其“写作字典”(输出头)巨大且独立,而无需额外的内存。它兼得两者之长:一个微小、智能的阅读系统,以及一个庞大、强大的写作系统。
实验中发生了什么?
研究人员将这种新的"Leviathan"机器人与旧的“单本字典”机器人在三种不同规模(小、中、大)下进行了测试。
- 学习更快:Leviathan 机器人达到相同的技能水平,所使用的训练单词数量比旧机器人少了 2.1 倍。
- 变得更聪明:在最大规模下,Leviathan 机器人在预测下一个单词方面(称为困惑度指标)提高了 9%。
- “生僻词”超能力:最大的惊喜在于改进发生的位置。
- 对于常见词(如“的”或“和”),两个机器人的表现大致相同。
- 对于生僻词(机器人每百万次中仅见一次的词),Leviathan 机器人的表现提高了 81%。
- 为什么? 在旧系统中,如果一个词很生僻,机器人几乎没有机会学习它的“货架位置”,因此会遗忘它。而在 Leviathan 中,因为该词是由共享部分的食谱构建的,即使机器人只见过一次,它仍然能够推断出来。
核心结论
这篇论文证明,连接人工智能“阅读”和“写作”部分的方式至关重要。你不需要仅仅通过堆砌更多内存来解决这个问题。相反,通过将巨大的查找表切换为紧凑、平滑的食谱生成器,你可以让人工智能模型变得更聪明、更快速,并且在理解生僻和困难词汇方面表现更好,同时几乎使用相同数量的计算资源。
简而言之:Leviathan 阻止了人工智能去死记硬背一本巨大的电话簿,而是让它学习单词是如何构建的语法,使其成为一个更高效、更有能力的学习者。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。