技术摘要:双重注意力残差 (Dual Attention Residuals, DAR)
问题陈述
Transformer 架构的最新进展沿着两个互补的轴线扩展了残差路径:历史检索 (historical retrieval) 与 多流残差 (multi-stream residuals)。
- 历史检索: 诸如 Transparent Attention、DenseFormer 和 Attention Residuals (AttnRes) 等方法允许后层访问来自更浅深度的表示。在标准的单流检索中,决定深度权重(即“地址”)的表示与被检索的内容(即“值”)源自同一个残差轨迹。这产生了一种“地址-内容耦合”现象,即选择机制受限于单流的状态。
- 多流残差: 诸如 Hyper-Connections 和 mHC 等方法通过多个学习到的轨迹(流)来扩展路径,以进行信息的传输与混合。
虽然这些方法在各自领域已被研究,但简单的结合——即为每个流配备一个独立的历史检索器——却无法利用流之间的交互。在这种设置下,每个轨迹仅决定自身的深度选择,而不受另一方的启发,从而阻止了一个流的互补信号去引导另一个流的检索。核心问题在于:这两个自由度(深度选择与轨迹维持)能否通过积极的交互来提高表示的多样性和检索效率。
方法论:双重注意力残差 (DAR)
作者提出了 双重注意力残差 (DAR),这是一种通过 相互交叉流寻址 (reciprocal cross-stream addressing) 将多流交互集成到深度级历史检索中的机制。
核心机制
DAR 在不改变分支内部计算(注意力或前馈网络)的情况下,修改了每个 Transformer 分支周围的残差路径。对于一个具有两个流 (j∈{0,1}) 的系统:
- 相互交叉键值路由 (Reciprocal Key-Value Routing): 对于目标流 j,深度权重使用来自相反流 (1−j) 的键 (keys) 来计算,而值 (values) 则从目标流自身的历史 (j) 中检索。
- krj=Norm(Hr1−j) (来自相反流的键)
- vrj=Hrj (来自自身流的值)
- 这使得相反的流能够为选择历史深度提供一种互补信号,即使目标流自身的表示与查询并不强烈匹配。
- 状态混合与门控写入 (State Mixing and Gated Writes): 检索到的来自两个流的状态被混合,以形成不变的 Transformer 分支的输入。随后,该分支的输出通过门控写入 (gated writes) 和约束混合 (constrained mixing) 来更新两个残差轨迹。
- 门控机制 (α) 混合检索到的状态。
- 传输机制 (ρ) 和写入门 (β) 更新局部块状态,确保在块内稳定传输现有的局部状态。
变体
- Full DAR: 在层粒度 (K=1) 上运行,其中每个 Transformer 层都为可检索的历史贡献一个完整的条目。
- Block DAR: 将层划分为大小为 K 的块。它从完成的块历史中检索,并可选地包含当前的局部块状态作为候选。通过在更粗的深度粒度上运行,这种方式降低了开销。
设计对比
论文评估了多种路由变体,以隔离出交叉流交互的贡献:
- DAR-SelfKV: 键和值均来自同一流(每个流执行标准的单流检索)。
- DAR-CrossV: 键来自自身流,值来自相反流。
- DAR-FixedKV: 固定分配(流 0 提供键,流 1 提供值,两者共用)。
- DAR (本文提出): 相互交叉流的键与自身流的值。
核心贡献
- 轨迹的交互: 论文证明了独立演化的残差轨迹不仅可以作为平行的信息路径,还可以作为选择历史深度的互补信号。
- DAR 架构: 提出了一种通过相互交叉流的键与自身流的值来实现这种交互,同时保持 Transformer 分支不变的机制。
- 实证验证: 在 0.1B 到 1B 参数的稠密模型以及 7B 稀疏-MoE 模型上的全面实验表明,DAR 相比于标准残差和 Attention Residuals 具有一致的改进。
- 冗余性分析: 通过表示几何学 (CKA) 和干预分析,作者展示了 DAR 保留了深度维度的多样性,并避免了在其他两种流设计中观察到的功能失衡或冗余。
实验结果
作者在与标准残差连接、Attention Residuals (AttnRes) 以及 mHC 匹配的训练预算下对 DAR 进行了评估。
- 验证损失 (Validation Loss): DAR 一致性地实现了最低的验证损失。
- 在 1B 稠密 设置下,DAR-Block 的表现优于残差基准线和 AttnRes-Block。
- 在 7B 稀疏-MoE 设置下,DAR 取得了最低的损失,其训练曲线在整个训练过程中始终低于基准线。
- 在 0.1B、0.3B 和 0.5B 稠密模型中,DAR 变体相对于残差基准线降低了 2.03% 至 5.12% 的验证损失。
- 效率: 虽然 DAR 的计算成本高于标准残差(由于交叉流检索和门控,7B MoE 的吞吐量降低了约 17.5%),但它仍与 AttnRes 具有竞争力。内存开销主要由历史检索机制驱动,而交叉流路由增加的成本较小且可衡量。
- 消融研究:
- 路由: 增益并非由额外的数值投影 (SepV) 或简单的跨流值聚合所解释。特定的相互交叉流键 / 自身流值路由 (DAR) 产生了最佳性能。
- 冗余性: 通过交叉流线性 CKA 分析显示,DAR 在不匹配的深度之间保持了低相似度,表明了不同的轨迹。相比之下,像 DAR-SelfKV 和 mHC-2 这样的变体显示出广泛的高相似度区域,暗示存在冗余。
- 干预: “救援增益 (Rescue gain)”分析显示,在 DAR 中,保留任一流都能比完全不保留更好地恢复清晰的输出。相比之下,其他变体(如 DAR-SelfKV)表现出强烈的非对称性,其中一个流变得在功能上占主导地位,而另一个流则未得到充分利用。
重要性与主张
论文声称 DAR 成功地将多流灵活性引入了深度检索。通过允许一个轨迹影响另一个轨迹的深度选择,DAR 使模型能够访问那些单流检索器可能会遗漏的历史上下文。
作者强调,性能的提升不仅仅是因为存在额外的流或数值投影,而是专门归功于相互交叉流的选择机制。这种设计保留了深度维度的多样性,并避免了功能失衡(即一个流主导另一个流)的问题,而这是其他两种流设计的常见问题。这项工作表明,历史检索与多流拓扑结构并非互斥,而是可以协同结合以改进 Transformer 表示学习。