🤖 AI
Clark Hash: Stateless Sparse Johnson-Lindenstrauss Quantization for Neural Embeddings
Clark Hash 是一种无状态且无需训练的编解码器,它将神经嵌入压缩为紧凑的 48 字节稀疏有符号约翰逊 - 林登斯特劳斯草图,在无需学习码本或预计算统计信息的情况下,实现了 32 倍的存储缩减,同时保持了高余弦相似度搜索精度。
原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个巨大的图书馆,里面藏书无数,但你并非存储每本书的全文,而是为每本书只保留一张微小的、48 字节的“明信片”。这些明信片小到几乎不占空间,却仍能让你在提问时找到正确的书籍。
这本质上就是Clark Hash所做的,只不过它是针对“神经嵌入”(即人工智能用于表示句子或概念的复杂数学摘要)而言的。
以下是论文如何将该技术拆解为简单概念的解释:
1. 问题:过多的杂乱
通常,人工智能系统将句子存储为长长的数字列表(向量)。单个句子摘要可能占用1,536 字节的空间。如果你有数百万个句子,那将产生大量的数字杂乱。它会消耗内存、拖慢计算机速度,并增加存储成本。
2. 解决方案:“明信片”方法(Clark Hash)
Clark Hash 是一种新方法,可将这些庞大的列表压缩至仅48 字节(缩小了 32 倍!),而无需预先训练专门的 AI 模型。它像一个无状态的单向机器那样运作:
- 无需训练:与其他需要先“研读”整本图书馆书籍才能制作明信片的方法不同,Clark Hash 可立即生效。你可以输入一个句子,它会立即吐出一个微小的代码。你不需要“训练过程”或预先制作的词典。
- 处理流程:
- 归一化:它首先检查句子含义的“方向”,忽略句子的长度。
- 神奇投影(即“哈希”):它使用一种数学技巧(称为稀疏符号 Johnson-Lindenstrauss 投影),将庞大的 384 维列表压缩成更小的 96 个数字列表。这就像将一张大地图折叠成一块小小的口袋方巾。它是随机的,但也是确定性的(如果你使用相同的“种子”或密钥,你总会得到相同的折叠结果)。
- 截断与打包:它截断任何过大的数字(截断),然后将它们四舍五入以适配微小的 4 位插槽。这将数字转化为超紧凑的代码。
3. 如何搜索:“非对称”技巧
这是巧妙之处。
- 数据库:图书馆仅存储微小的、48 字节的明信片(压缩后的代码)。
- 问题:当你提问时,你的计算机在内存中保留你问题的完整、高质量版本(浮点数)。
- 匹配:系统将你的高质量问题与微小的明信片进行比较。这就像将一张高清照片与一幅微小的素描进行比较。数学设计使得即使一方微小而另一方庞大,系统仍能非常准确地判断它们的相似度。
4. 结果:它有效吗?
作者在包含超过 9,000 对句子的多语言数据集(多种语言的句子)上测试了该方法。
- 测试:他们将“明信片”分数与“全尺寸”分数进行比较,以查看它们是否就哪些句子相似达成一致。
- 分数:在 0 到 1 的尺度上,微小的 48 字节素描与庞大的全尺寸版本的相关性达到了0.91 到 0.95。
- 这意味着:如果原始 AI 模型擅长理解句子,那么微小的明信片就保留了几乎所有的这种理解能力。系统并没有仅仅因为数据被压缩而变得“困惑”。
5. 它是什么(以及它不是什么)
论文非常明确地指出了其局限性:
- 它不是一个新的数学定理。它将现有的数学技巧(哈希、投影、量化)组合成一种新的、实用的工具。
- 它不是用于在大型数据库中查找“最近邻”的高级搜索引擎的替代品。它仅仅是一种存储编解码器。
- 它是一种简单的、无状态的节省空间工具。它非常适合那些逐条获取数据并需要立即存储、无需等待训练复杂模型的场景。
总结类比
想象你拥有一座巨大、细致的城市 3D 雕塑(原始数据)。
- 传统存储会保留整个雕塑。
- 学习式压缩可能会先构建一个城市模型,然后存储蓝图。
- Clark Hash 就像从特定角度拍摄雕塑的照片,将照片压平,并将其转化为一个微小的、48 字节的二维码。你无法从该代码重建 3D 雕塑,但如果你有一个新雕塑并想知道它是否看起来像旧雕塑,你可以扫描新雕塑并将其与二维码进行比较。它速度快,几乎不占空间,而且你可以立即完成,无需事先研究这座城市。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。