← 最新论文
🤖 machine learning

RIS-Kernel: A Model-Agnostic Architecture for Long-Context LLM Inference via Sparse Attention

RIS-Kernel 引入了一种与模型无关的稀疏注意力架构,将推理复杂度从 O(N^2) 降低至 O(N log N),在通过随机采样实现达到或超过稠密基准模型的准确度的同时,使长上下文大语言模型(LLM)分析能够在普通 CPU 硬件上实现。

原作者: Anderson R. Santos

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Anderson R. Santos

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:RIS-Kernel

问题陈述

长文本大语言模型(LLM)推理的主要瓶颈在于全自注意力机制的二次方计算与内存复杂度(O(N2)O(N^2))。这种缩放限制了实际的文档分析能力至约 65,536 个 token,并迫使研究者依赖昂贵的 GPU 集群,使得缺乏专业硬件的大多数研究小组难以进行深度文本分析。此外,将上下文窗口扩展到超过原生训练限制往往会导致位置编码退化,即使在计算资源充足的情况下,也会导致检索能力崩溃。

方法论:RIS-Kernel 架构

本文引入了 RIS-Kernel(减少交互采样),这是一种模型无关的推理引擎,它直接向未经修改的语言模型中注入运行时稀疏性。该架构在不改变模型权重、无需微调且不需要 GPU 加速的情况下,将自注意力的复杂度降低至 O(NlogN)O(N \log N)

核心组件

  1. 随机几何结构(Sparse Stochastic Geometry): RIS 使用通过随机采样生成的稀疏掩码取代了稠密注意力矩阵。它在两种不同的模式下运行:
    • 随机模式(Stochastic Mode): 将序列视为一个均匀池,为每个轴心(pivot)抽取全局邻居。覆盖范围随密度和集成种子(ensemble seed)数量的增加而单调增加。
    • 结构模式(Structural Mode): 将序列划分为若干块(blocks),在添加全局冗余边之前,先将每个块作为一个完全图(clique)进行全连接。这种“块-完全图”(block-clique)几何结构保证了即使在极端稀疏的情况下,也能保留局部社区结构和近端锚点。
  2. 混合锚点与预融合统一 Softmax(PFUS): 为了防止随机恢复的 token 在竞争权重中被稀释,RIS 采用了单一的预融合 softmax。它将一个缓存的“随机锚点”(由一次性计算出的所有种子索引组成的并集)与后续 token 的“动态局部窗口”合并。所有选中的 token 会被统一归一化,确保随机检索到的稀有实体与频繁出现的 token 具有相同的竞争权重。
  3. 动态 RoPE 缩放: 系统在加载时拦截配置参数,以动态应用旋转位置嵌入(RoPE)缩放(线性或 YaRN),从而允许模型在不修改模型图的情况下,处理远超其原生训练限制的上下文窗口。
  4. 内存受限实现: 为避免在生成掩码期间发生内存溢出(OOM)故障,RIS 使用了流式设计。它生成种子索引,将其合并到主掩码中,并立即丢弃单个种子数据,使峰值内存使用量始终受限于 O(N2)O(N^2) 布尔矩阵,无论集成规模如何。

核心贡献

  • 模型无关推理: 该架构作为一种运行时注入,兼容包括 Qwen2 和 TinyLlama 在内的现有模型,无需重新训练。
  • 硬件可及性: 该系统在普通的、无加速的 CPU 硬件(范围从 16 GB 到 128 GB RAM)上得到了验证,证明了无需 GPU 集群即可进行长上下文推理。
  • 正则化效应: 本文指出稀疏注意力具有正则化作用。在低密度(例如 1% 密度)且高集成计数的情况下,通过剪枝序列级噪声,模型表现甚至优于原生的稠密注意力基准。
  • 位置编码敏感性: 研究明确了检索失败是由位置编码崩溃(在使用线性插值时)引起的,而非稀疏投影本身导致的,从而强调了使用 YaRN 等方法进行外推的必要性。

实验结果

实验在 Qwen2-1.5B-InstructTinyLlama-1.1B 上使用科学论文语料库进行了测试。

1. 受控精度(32k Tokens)

  • 基准(Baseline): 原生稠密注意力实现的准确率为 71.88%。零上下文底线(zero-context floor)为 59.38%
  • RIS-随机模式: 在 1% 密度和 70–80 个种子的情况下,准确率达到 75.00%,超过了稠密基准。在 5% 密度和 10 个种子的情况下,其准确率与基准完全一致(71.88%)。
  • RIS-结构模式: 在 1% 密度和 10 个种子的情况下,它恢复了 75% 的上下文差距(68.75% 准确率),表现优于需要 50 个种子才能达到相同水平的随机模式。

2. 可扩展性与外推(64k Tokens)

  • 原生限制: 稠密注意力在标准测试平台上触发了 OOM 故障。
  • 线性插值(Linear Interpolation): 导致了严重的位置崩溃,无论密度如何,准确率都会降至 ~15–23%(接近随机猜测)。
  • YaRN 缩放: 保留了位置几何结构。
    • RIS-结构模式(1% 密度,60 个种子): 实现了 65.62% 的准确率,比零上下文底线(51.56%)高出了 14.06 个百分点。根据 McNemar 配对检验,该结果具有边际显著性(p=0.078p = 0.078)。
    • RIS-随机模式(5% 密度,40 个种子): 即使在线性插值下也恢复到了 59.4%,超过了零上下文基准,尽管效果不如 YaNT 模式。
  • TinyLlama 局限性: 该架构在 TinyLlama 进行 4 倍至 16 倍外推时无法检索信息,证实了 RIS 要求宿主模型的旋转位置编码系统至少保持部分功能。

3. 效率前沿

针对结构模式在低于 1% 密度(0.3%–0.5%)下的“甜点位”分析显示,该模型可以在不到 1% 密度基准的一半结构注意力成本下,保留超过 90% 的上下文检索信号。

重要性与主张

本文声称 RIS-Kernel 通过随机稀疏化成功绕过了 O(N2)O(N^2) 注意力瓶颈,同时保留了事实检索能力。其主要意义在于:

  1. 商用硬件的可行性: 证明了在标准的学术硬件(桌面 CPU)上进行深度文档检索是可能的,且无需 GPU 加速。
  2. 通过稀疏性实现正则化: 证明了低密度稀疏注意力可以作为一种正则化器,通过过滤噪声来提高准确率,甚至超越稠密基准。
  3. 架构独立性: 确立了检索内核与位置编码是相互独立的;虽然 RIS 保留了信号,但信号的完整性取决于宿主模型在扩展长度时维持位置相干性的能力(例如通过 YaRN)。
  4. 互补模式: 定义了一个效用边界,即 结构模式 最适合预算紧凑且需要恢复近端锚点的场景,而 随机模式 则在更广泛的全局覆盖和正则化方面表现更优。

作者总结道,该方法并未对扩展到更大参数量设置架构约束,尽管这一点仍有待测试。代码、数据集和推理脚本已公开以供复现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →