SemHash-LLM: A Multi-Granularity Semantic Hashing Framework for Document Deduplication
SemHash-LLM 是一个多粒度框架,它统一了语义投影哈希、注意力加权 MinHash 以及选择性 LLM 仲裁,旨在以极低的神经验证成本实现高效且鲁棒的大规模文档去重。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在经营一家规模巨大的图书馆,每天都会收到数百万本新书。你的目标是剔除重复的副本,以免浪费空间,但你面临着一个棘手的问题:有些书是完全一样的复印件,而另一些虽然讲述的是同一个故事,却只是换了不同的字体、增加了广告或稍微调整了句子的顺序。
如果你只寻找完全匹配的内容,你就会错过那些被改写过的版本。但如果你试图阅读每一本书来检查其含义,你的图书馆员工会因精疲力竭而崩溃。
SemHash-LLM 是一个全新的、超级智能的系统,旨在解决这个“图书馆问题”。它通过结合快速技巧与深度思考,扮演着高效团队的角色,在不逐字阅读的情况下找出重复内容。
以下是该系统的运作方式,分为几个简单的步骤:
1. “超级扫描仪”(语义投影哈希)
想象一下,你要寻找讲述相同故事的两本书。传统的扫描仪可能会说:“它们是不同的,因为一本说‘汽车’,另一本说‘轿车’。”
SemHash-LLM 使用一个超级扫描仪(由经过蒸馏的大语言模型驱动)来理解含义。它将整个文档的故事转化为一个简短且唯一的“条形码”(二进制代码)。
- 神奇之处: 即便文字发生了变化,只要含义相同,它们的条形码看起来就会非常相似。这使得系统能够快速将相似的故事归为一类,而无需进行详细阅读。
2. “噪声过滤器”(注意力加权 MinHash)
许多网页都充斥着杂乱的信息。它们可能有相同的导航栏、Cookie 提示以及顶端和底端的广告,即使中间的文章内容是独特的。传统方法会被这些“噪声”所迷惑。
SemHash-LLM 使用一个像聚光灯一样的噪声过滤器。它观察文档并询问:“作者真正谈论的部分是哪些?”
- 运作方式: 它忽略掉那些乏味的、重复的部分(如广告),转而专注于那些重要的、独特的句子。然后,它仅基于这些重要的部分创建一个“指纹”,从而使其很难被模板化的杂乱内容所欺骗。
3. “智能边界”(对比性边界学习)
有时,两份文档几乎一样,但又不完全一样。一个僵化的规则(比如“如果相似度达到 90%,就删除其中一个”)并不适用于所有情况。一份技术手册可能需要 99% 的一致性才能被视为重复,而一篇新闻报道可能在 85% 时就是重复了。
系统学习了智能边界。它不再使用固定的尺子,而是学会了根据文档类型来调整尺子。它能准确判断出“足够相似以至于算作重复”与“足够不同以至于需要保留”之间的界限在哪里。
4. “专家法官”(LLM-as-Judge)
当系统感到困惑时会发生什么?当“超级扫描仪”和“噪声过滤器”无法达成一致时,系统会将这对组合标记为“边缘案例”。
系统不会把时间浪费在每一份文档上,而是只在这些棘手的案例中请出专家法官(一个强大的 AI)。
- 策略: 系统自动处理 97% 的工作。它只在剩下的 3% 令人困惑的配对中请求专家法官介入。这使得系统既快速又廉价,同时仍能做出正确的决策。
5. “漏斗”(级联过滤)
整个过程像一个带有四个层级的巨大漏斗:
- 第一层: 快速检查,剔除明显的完全副本。
- 第二层: “超级扫描仪”对相似含义进行分组。
- 第三层: “噪声过滤器”检查重要部分。
- 第四层: “专家法官”仅查看极少数仍然令人困惑的案例。
结果
论文声称该系统非常有效。它成功地在五种不同的困难场景中找到了重复内容:
- 模板污染: 布局相同但内容不同的页面。
- 短文本: 被轻微修改的微小片段。
- 包含关系: 一个长文章中包含了另一个短文章。
- 病毒式片段: 到处出现的流行短语。
通过使用这种多步骤的方法,该系统实现了 91% 的准确率(击败了以往的方法),同时仅使用不到 1% 的精力来调用昂贵的“专家法官”。它证明了你可以在拥有深度理解的同时,兼顾速度与成本,而无需手动阅读每一份文档。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。