Adaptive Computation Depth via Learned Token Routing in Transformers
本文介绍了 Token 选择性注意力(TSA),这是一种轻量级、端到端可微的门控机制,它使 Transformer 能够根据上下文难度动态跳过各个 Token 的冗余层计算,在实现显著效率提升的同时仅造成极小的质量损失,且无需显式的深度正则化。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你经营着一家工厂,传送带上流下的每一件产品都接受完全相同的处理。无论是简单完美的工件,还是复杂破损的工件,每一件物品在每个工序站停留的时间都完全相同。这正是当前标准人工智能模型(Transformer)的工作方式:无论某个词是容易理解还是难以理解,它们都会通过完全相同数量的“思考层”进行处理。
本文介绍了一种名为**令牌选择注意力(Token-Selective Attention, TSA)**的新系统。可以将 TSA 想象成在工厂的每一个工序站都安装了一位智能的自动守门员。
问题:“一刀切”的工厂
在标准人工智能模型中,如果你让它写下“生存还是毁灭(To be, or not to be)”,模型会以相同的脑力资源处理"To"这个词和"question"这个词。
- 简单的词(如"the"或"is")就像简单的工件。它们不需要太多处理。
- 困难的词(如复杂概念或罕见名称)就像破损的工件。它们需要额外的时间和关注来修复。
目前,工厂以与处理困难工件相同的强度来处理简单工件,从而浪费了能量。
解决方案:智能守门员(TSA)
作者在人工智能的每一层之间添加了一个微小、轻量级的“守门员”(一个小型神经网络)。这位守门员逐个查看每个词(令牌),并问道:“这个词需要进入下一个处理站,还是可以直接跳过?”
- 决策:守门员不仅仅回答“是”或“否”。它给出一个概率分数(就像调光开关)。如果一个词很简单,守门员可能会说:“你可以跳过下一步”,或者“你只需要完成一半的工作”。如果一个词很难,它则会说:“请完整走完所有流程。”
- 神奇之处:最棒的是,这位守门员能够自我学习。它不需要人类告诉它哪些词很难。它纯粹通过尝试最小化错误来学习。如果跳过某个特定词的某一步导致了错误,守门员就会学会下次保持该词处于激活状态。如果跳过它效果良好,它就会学会节省能量。
实际运作方式
本文在两个主要方面测试了这种方法:
- 简单逻辑谜题:当人工智能需要复制数字列表时,守门员意识到“这很简单”,并跳过了约 65% 的工作量。当它需要排序数字(这更难)时,它只跳过了约 27% 的工作量。它自然地推断出更困难的任务需要更多步骤。
- 撰写故事:当被要求模仿莎士比亚写作或总结维基百科文章时,人工智能节省了**14% 到 23%**的计算能力。
- 它学会了标点符号、空格和常见词汇很容易,可以快速处理。
- 它学会了独特的内容词汇需要完整的“工厂”级处理。
结果:更快且更智能
- 无质量损失:人工智能的写作表现与标准模型一样好,但它使用的能量(计算能力)显著减少。
- 优于“提前退出”:其他方法试图在人工智能感到“自信”时提前停止整个句子的处理。TSA 更聪明;它阻止单个词经历不必要的步骤,同时让困难的词继续处理。研究发现,在设定为节省相同能量的情况下,TSA 产生的结果优于这些旧方法。
- 真实速度:当研究人员实际在计算机上运行代码时,他们观察到了真实的速度提升(约快 2.3%),因为计算机确实无需为被跳过的词进行数学运算。
核心结论
本文提出了一种以最聪明的方式让人工智能模型“变懒”的方法。TSA 不再强迫每个词完成相同数量的工作,而是让人工智能实时决定哪些词很简单,哪些词需要额外帮助。这就像拥有一家工厂,其中简单产品飞速通过流水线,而困难产品则获得全套 VIP 待遇,从而在不牺牲质量的情况下节省时间和能量。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。