Controllably Efficient Language Models
本文介绍了压缩与注意力转换器(Compress & Attend Transformer, CAT),这是一种元序列混合器,它通过从压缩的标记块中进行解码,实现了对质量-成本权衡的测试时控制,使得单个模型能够在匹配多种高效架构性能的同时,提供比稠密转换器更高的吞吐量。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个超级聪明的机器人助手,它通过阅读书籍来回答你的问题。问题在于,它读得越多,需要记住的东西就越多,而要记住的东西越多,运行起来就会变得越慢、越昂贵。这就像是试图把一整个图书馆都装进你的背包里;最终,你连路都走不动了。
长期以来,科学家们试图通过构建“高效”的机器人来解决这个问题,比如只记住最后几页的机器人(滑动窗口),或者将所有内容总结成一个微小的、固定大小的笔记(线性注意力)。但问题在于:这篇论文反对那种认为你必须在这些“高效”机器人中选一个并永远坚持下去的观点。如果你选择了一个只能记住最后几页的机器人,它很快,但会忘记故事的情节。如果你选择了一个能记住一切的机器人,它很聪明,但对于写一条短信这种快速任务来说太慢了。
这篇论文的作者说:“为什么要二选一呢?”他们构建了一种新型机器人,叫做 CAT(压缩与注意力转换器,Compress & Attend Transformer)。
魔法技巧:“块状”背包
把 CAT 想象成不是一个一个词去读的机器人,而是一个以**块(chunks)**为单位进行阅读的机器人——就像一次抓起一把词。
- 压缩步骤: 想象你有一个长篇故事。与其记住每一个单词,不如让 CAT 抓取一组词(比如一次抓 8 个词),然后瞬间将它们挤压成一个微小的、单一的“摘要标记(summary token)”。这就像是把一整段话变成一张捕捉了核心思想的小贴纸。
- 注意力步骤: 现在,机器人不再需要试图记住整个图书馆,它只需要看这些微小的贴纸即可。当它需要回答问题时,它会观察过去的贴纸以及它当前正在阅读的这一块词。
最棒的部分:“音量旋钮”
这里是真正的魔法所在。通常,如果你想让一个机器人变快,你必须训练一个更“笨”(记忆力较小)的机器人。如果你想让它变聪明,你就得训练一个“慢速”的机器人。
CAT 则不同。 论文表明,你可以训练同一个模型,它拥有一个可以在使用时的最后一刻进行调节的“音量旋钮”(称为块大小/chunk size)。
- 将旋钮转到“小块模式”(例如 4 个词): 机器人会保留更多细节。这就像拥有高清晰度的记忆。它速度较慢且耗电量大,但非常适合处理复杂的任务,比如编程或解谜,在这些任务中你需要记住 100 页前的一个函数名。
- 将旋钮转到“大块模式”(例如 32 个词): 机器人会将过去的内容挤压成极少数的摘要笔记。它会变得超级快,且占用极少的内存。它非常适合处理像写一封简短邮件这样不需要深度回忆的任务。
论文展示了,只需使用一个训练好的 CAT 模型,你就可以在这些模式之间切换,而无需重新训练。这就像是一个瑞士军刀,只需转动手柄,它就能从一个小螺丝刀变成一把巨大的扳手,而它本身依然是同一个工具。
它真的有效吗?
作者将 CAT 与其他 10 种流行的“高效”机器人(有些使用滑动窗口,有些使用线性数学技巧)进行了对比测试。
- 结果: CAT 机器人即使使用最基础的“稠密(dense)”注意力(即标准的、非专门化的类型),也能在长记忆任务上追平或超越所有那些专门化的机器人。
- 速度: 当作者通过转动旋钮使其变快时,CAT 比标准机器人快了 1.4 到 3.7 倍,同时使用的内存减少了 2.2 到 9.5 倍。
- 内存: 与那些要么会忘掉一切、要么会耗尽内存的机器人不同,CAT 的内存增长非常“优雅”。随着故事变长,它会增加一点点内存,但远没有标准机器人那么多。这使得它比那些“固定内存”的机器人能更好地记住长篇故事。
这篇论文排除了哪些可能性
论文非常明确地指出了哪些方案不如他们的解决方案:
- 固定内存: 那些试图保持固定大小内存(无论故事多长)的机器人,在回忆很久以前的事情时会表现挣扎。论文表明这些模型在长上下文任务中会失败。
- 预训练不同的模型: 旧的方法是为邮件训练一个模型,为编程训练另一个。论文指出这是浪费且没必要的,因为 CAT 可以用一个模型完成这两者。
- 无训练技巧: 有些人尝试在训练完成后,通过忽略部分记忆(例如“无需训练”的稀疏注意力)来让机器人变快。论文认为这是一个坏主意,因为机器人是针对记住一切而训练的,突然忽略部分内容会让它感到困惑。CAT 在训练过程中学习如何压缩,因此它准确地知道该保留什么。
他们有多确定?
作者非常有信心,因为他们不仅仅是在猜测,他们进行了测量。
- 他们在 150 亿个 token 的文本上训练了该模型。
- 他们在现实世界的任务上进行了测试,比如在长文中寻找“大海捞针”(寻找一个特定的数字)以及理解长文档。
- 他们直接与 10 种不同规模和配置的模型进行了对比。
- 他们甚至证明了,如果让 CAT 模型变得更大(更多参数),它会变得更强,而且不会变慢,这在 AI 领域是一个罕见的双赢。
简而言之,这篇论文表明,我们不需要为不同的工作构建成千上万个不同的机器人,我们可以构建一个能够根据情况随时调整自身记忆的“聪明”机器人。这是一个简单的想法——通过压缩文本块——但事实证明,它极其强大。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。