← 最新论文
🤖 machine learning

Gram-Space: Structure-Preserving Codebook Compression for Memory-Efficient Neuro-Symbolic AI

本文介绍了 Gram-Space,这是一个利用 Gram-Schmidt 正交化将向量符号架构码本表示为紧凑正交规范系统的压缩框架,从而在显著降低 GPU 显存占用并提高神经符号 AI 推理延迟的同时,保留了本质的点积结构。

原作者: Weilun Wang, Wantong Li

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Weilun Wang, Wantong Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:计算机不仅能像人类大脑一样识别模式,还能像数学家一样遵循严格的逻辑规则。这就是神经符号人工智能(Neuro-symbolic AI)的领域,该领域试图结合两种优势:神经网络的灵活性与符号逻辑的精确性。为了实现这一目标,这些系统通常使用一种被称为“码本”(codebook)的特殊工具。可以将码本想象成一本巨大的秘密代码字典,其中的每个词都是一个巨大的、高维的向量——即一个由数千个数字组成的列表。这些向量就像是不同概念的独特指纹。问题在于,这些指纹如此庞大且繁多,占据了大量的计算机内存,就像试图在口袋里装下一座百科全书图书馆一样。这种对内存的渴求使得这些智能系统难以在日常设备上运行,导致它们变慢甚至崩溃。

于是,由研究员 Weilun Wang 和 Wantong Li 提出的名为“Gram-Space”的新方法应运而生,旨在解决这场内存危机。他们并没有试图通过丢弃信息来缩小字典(因为这会让计算机变得愚笨),而是发现了一种巧妙的方法来重新排列整个图书馆。他们发现,尽管这些码本向量看起来巨大且杂乱,但它们实际上生活在一个更小的、隐藏的房间里。通过使用一种称为“格拉姆-施密特正交化”(Gram-Schmidt orthogonalization)的数学技巧,他们可以将这些巨大的向量投影到一个紧凑、整洁的坐标系中,而不会丢失任何一点意义。这就像是将一座扩张且混乱的城市,意识到所有的建筑其实都可以完美地放入一个精简、高效的网格地图中。论文表明,通过这样做,他们可以将运行这些 AI 模型所需的内存减少高达 15.75 倍,并使运行速度提升高达 3.62 倍,且无需重新训练 AI,也不会牺牲其解决复杂难题的能力。

核心理念:将图书馆装进背包

想象你有一个巨大的图书库,但每本书不是纸质的,而是一份长达 256 页的巨型文档。你需要把这座图书馆带到一个偏远村庄去教当地人,但你的背包只能装下几页纸。大多数人会尝试把书复印成更小的纸张,但这往往会导致文字模糊或丢失重要细节,使故事难以阅读。

Gram-Space 背后的研究人员提出了不同的想法。他们意识到,尽管这些书有 256 页长,但其中的“故事”其实只需要大约 40 页就能完美讲述。剩下的 216 页只是空白空间或重复的模式。因此,他们决定不是缩小纸张,而是用一种全新的、超高效的语言来重写这些书,这种语言仅使用那核心的 40 页。

这正是 Gram-Space 对神经符号 AI 所做的事情。这些 AI 系统使用充满高维向量(即 256 页的书)的“码本”来表示概念。研究人员发现,这些向量虽然巨大,但实际上占据了一个更小的“子空间”。通过应用一种称为格拉姆-施密特正交化的数学技术,他们创建了一个全新的、紧凑的坐标系(即 40 页的语言),能够完美捕捉原始向量的本质。

工作原理: “Gram-Loc” 的魔力

这个过程就像拥有一个大师级的翻译官和一个秘密代码。

  1. 设置: AI 从一个拥有巨型向量的码本开始。研究人员构建了一个特殊的“基”(一组参考向量),它涵盖了所有这些码本向量所生活的空间。
  2. 翻译: 系统不再存储那些巨大的向量,而是为每个向量存储一个微小的“系数”。这个系数会准确告诉你如何利用参考基来重建那个巨大的向量。研究人员将这个压缩后的位置称为“Gram-loc”。
  3. 最棒的部分: 当 AI 需要进行涉及比较这些向量的数学运算(例如检查两个概念之间的相似度)时,它可以直接在微小的系数上进行运算。这就像是在餐巾纸上做算术,而不是在白板上。论文从数学上证明了这完全不会改变答案;其“内积”(衡量相似度的指标)保持完全一致。
  4. 捕获与释放: 有时,AI 需要进行某种特定的逻辑谜题,这需要原始向量的完整形状。在这些罕见时刻,系统会迅速从微小系数中“重建”出巨大的向量,完成谜题,然后回到微小版本。这个过程发生得极快,几乎不会拖慢速度。

数据说明

研究人员在三款不同的 AI 模型(NVSA、LearnVRF 和 ARLC)上使用一款强大的显卡(NVIDIA RTX 5070)测试了这个想法。结果令人印象深刻:

  • 内存节省: 该方法将 GPU 内存占用降低了高达 15.75 倍。对于某些模型,内存占用下降之显著,使得原本需要高端服务器才能执行的任务,现在有可能在消费级硬件上运行。
  • 速度提升: 由于计算机需要移动的数据量减少了,AI 变得更快了。推理延迟(做出决策所需的时间)提升了高达 3.62 倍
  • 准确性: 至关重要的是,这种压缩是“无损”的。当他们重建向量时,新版本与原始版本之间的相似度得分为 100%。AI 并没有变笨,它只是变得更精简了。

为什么这很重要

在此之前,尝试压缩这些码本通常意味着使用“随机”(stochastic)方法(即随机猜测)或丢失信息,这会破坏 AI 的逻辑。其他方法在处理简单任务(如图像分类)时表现良好,但在 AI 需要进行具有严格规则的复杂推理时则会失败。

Gram-Space 的不同之处在于它是“算子感知”(operator-aware)的。它知道 AI 大脑的哪些部分需要全高清的向量,哪些部分可以很乐意地使用压缩后的低带宽版本。它保留了进行正确推理所需的数学结构。

研究人员还调查了内存如此之高的原因。他们发现,瓶颈不仅在于数据的大小,还在于计算机分配空间的方式。通过将数据保持在“Gram-loc”格式下的压缩状态,他们减少了通常会减慢速度的、混乱的“分配密集型”开销。

简而言之,Gram-Space 不仅仅是挤压数据,它还重新组织了整个工作流。它允许这些复杂的神经符号系统在更小、更便宜、更快的硬件上运行,有望将先进的 AI 推理能力从数据中心带入我们的口袋。论文指出,这种方法是使高精度 AI 实现规模化和实用化的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →