← 最新论文
💬 NLP

Proposal and study of statistical features for string similarity computation and classification

本文提出并验证了源自共现矩阵和游程长度矩阵的与语言无关的统计特征,用于字符串相似度计算与分类,并证明了其在合成实验和真实世界剽窃检测任务中均优于现有最先进指标。

原作者: E. O. Rodrigues, D. Casanova, M. Teixeira, V. Pegorini, F. Favarim, E. Clua, A. Conci, Panos Liatsis

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: E. O. Rodrigues, D. Casanova, M. Teixeira, V. Pegorini, F. Favarim, E. Clua, A. Conci, Panos Liatsis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名侦探,试图判断两段文字究竟是同一故事的不同写法,还是完全无关的内容。也许你正在核查学生是否抄袭了维基百科文章,或者一份旧书的扫描文档是否与数字文本相匹配。

本文介绍了一种让计算机解决这一谜团的新方法。作者建议,不要像简单的拼写检查器那样仅仅计算有多少字母匹配,而是借用图像处理领域的工具,来审视文本的“指纹”。

以下是他们方法的分解,辅以简单的类比:

1. 旧方法与新方法

旧方法(“单词计数”侦探):
传统上,计算机通过寻找最长的匹配字母序列(如寻找最长的匹配句子),或者计算将一个词转换为另一个词所需的编辑次数(添加、删除或交换字母)来比较文本字符串。

  • 问题: 这些方法就像试图仅通过身高来识别一个人。如果两个人身高相同但其他方面毫无相似之处,你可能会感到困惑。此外,如果文本被打乱或语言不同,这些方法往往会失效。

新方法(“纹理”侦探):
作者提出将文本视为图像

  • 共现矩阵(COM): 想象你有一个网格。你查看文本并问:"‘A'字母紧邻'B'字母出现的频率是多少?”你将这些信息绘制在网格上。这就像查看一张像素化照片,并计算红色像素紧邻蓝色像素的频率。这有助于计算机看到文本的结构模式,而不仅仅是单个字母。
  • 游程长度矩阵(RLM): 这就像查看条形码或一排彩色方块。如果你有一段文本如"aaabbb",计算机就会看到三个'a'的“游程”和三个'b'的“游程”。它统计这些方块。如果两段文本具有相似的“方块模式”(即使方块内的字母略有不同),计算机就知道它们很可能相关。

2. 为何这很特别

作者强调,这些工具是语言无关的。

  • 类比: 大多数相似性工具就像一本只讲英语的字典。如果你试图比较一个法语句子和一个西班牙语句子,字典就会失效。
  • 解决方案: COM 和 RLM 方法就像一台相机。相机不在乎物体是猫、狗还是汽车;它只看到形状和图案。同样,这些新特征不在乎文本是英语、葡萄牙语还是计算机代码。它们只关注字符的统计“纹理”。

3. 实验(“试驾”)

研究人员通过两种方式对他们的新侦探工具进行了测试:

测试 A:合成实验室(“伪造”文本)
他们创建了一个计算机程序来生成随机文本字符串,然后故意“打乱”它们,以模拟不同程度的抄袭或错误。

  • 结果: 当文本仅被轻微打乱时,旧方法(如计算匹配字母)表现良好。但随着文本变得更加混乱和随机,旧方法失效了。新的**游程长度(RLM)共现(COM)**方法则保持冷静,更准确地识别出了相似性。
  • 隐喻: 如果你从书中撕下一页并打乱单词,简单的字母计数器会迷失方向。但“纹理”检测器仍然能看到纸张的“纹理”是相同的。

测试 B:现实世界(“抄袭”案件)
他们在学生答案与维基百科文章的真实数据集上测试了他们的系统。目标是检测四个等级:

  1. 近乎复制: 直接粘贴的文本。
  2. 轻微修改: 替换同义词,调整语法。
  3. 重度修改: 句子完全重写。
  4. 非抄袭: 从头开始撰写。
  • 结果: 他们的新方法达到了**84.21%**的准确率。这超过了该领域之前的最佳结果(约为 70%)。
  • 获胜者: **游程长度矩阵(RLM)**特征成为全场明星,证明了观察字符的“游程”是发现抄袭最有力的方法,即使文本已被大幅重写。

4. 结论

本文得出结论,虽然传统方法对于非常相似的文本尚可接受,但当情况变得混乱时,它们就会陷入困境。从图像分析中借鉴的新统计特征(COM 和 RLM)要稳健得多。它们比其他任何测试过的方法都能更好地处理更长的文本和更混乱的变化。

简而言之: 作者为文本构建了一种新的“纹理扫描仪”。它不只是阅读单词,而是分析字母如何相邻以及如何重复的模式。这使得计算机能够更准确地发现抄袭或相似的文本,即使文本经过大量编辑,或者是计算机“不懂”的语言。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →