The Effect of Text Reuse Length and Fragmentation on Similarity Detection: A Controlled Evaluation of WordBinary
本研究表明,尽管 WordBinary 的文本相似度检测性能会随着重复内容被碎片化为更短的段落而系统性下降,但该系统依然保持稳健且有效,即使在大量细小碎片中分散分布的情况下,也能成功恢复超过 90% 的刻意重复词汇。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在写作领域,借鉴创意与窃取文字之间的界限,往往是由软件来划定的。这些被称为相似度检测器的程序通过扫描文档来寻找与其他来源匹配的文本。它们并非读心者;它们无法得知作者是意图剽窃,还是仅仅忘记了引用来源。它们的工作职责严格限于寻找重叠的词汇。但一个根本性的问题仍然存在:软件是否在意这些词汇是如何排列的?如果一名作者从一本书中复制了一段长篇段落,软件会看到一大块匹配的文本。如果同一名作者将完全相同的文字分散在论文各处,变成细碎且不连贯的片段,软件是否仍能识别出这种窃取行为?这正是研究人员试图解决的核心谜题。他们想要知道,复制文本的物理形态——无论是作为一块完整的实体,还是作为一个破碎的马赛克——是否会改变检测器发现它的能力。
为了回答这个问题,一位名叫基亚·库兰(Kiah Curan)的研究人员设计了一个使用特定工具 WordBinary 的受控实验。目标是在模拟作者试图隐藏抄袭材料的情况下测试该系统。研究人员从五十份原始文档开始。针对每一份文档,他们创建了七个不同的版本。在每一个版本中,他们都插入了恰好 300 个取自已知来源的单词。唯一改变的是这 300 个单词的分布方式。在第一个版本中,所有 300 个单词都以一段长而连续的形式出现。在下一个版本中,它们被分为三个 100 词的块。研究人员继续这个过程,将文本拆解成越来越小的碎片:六个 50 词的块、十个 30 词的块、十五个 20 词的块、二十个 15 词的块,最后是三十个仅有 10 词之多的微小块。这共创造了 350 份测试文档,其中包含 105,000 个刻意复制的单词和 4,250 个独立的片段。
结果表明,复制文本的形态确实有影响,但并未导致系统完全失效。当 300 个单词作为一个连续的整体出现时,软件找到了其中的 97.3%。随着文本被拆分成更小的碎片,检测率缓慢下降。当单词被拆分为三十个微小的 10 词片段时,软件找到了其中的 80.3%。这意味着,虽然拆分文本增加了寻找难度,但系统仍能找回五分之四以上的单词,即使在最困难的情境下也是如此。研究还观察了软件是否能识别出单个片段。结果发现,它识别出了每一段长篇文字以及每一个 100 词的块。即使当文本被拆分为 10 词的片段时,软件也成功识别了 78.5% 的这些独立片段。
实验的一个关键部分是确保软件不会被文档的其他部分所干扰。研究人员检查了“背景”文本——即那些非复制的部分——以观察碎片化是否会导致系统在不存在匹配的地方产生误判。背景相似度在所有测试中稳定保持在 2.2% 到 2.4% 之间,这证明了检测率的下降是由于寻找短片段的难度增加所致,而非因为系统发生故障或变得不稳定。研究还指出,该系统在处理 30 词或更长的片段时表现异常出色,能找到 96.9% 的此类段落。这表明,该软件并不依赖于寻找大规模的文本块来完成工作;只要碎片不是过小,即使在素材分散的情况下,它依然保持高效。
研究结果明确了,虽然碎片化会降低检测复制文本的能力,但并不会使软件失效。性能的下降是渐进式的,而非突然发生的。并没有出现某个特定的临界点让系统停止工作;相反,随着碎片变小,系统的效率变得略微降低。这一点非常重要,因为它表明,试图通过将文本拆分为极小碎片来隐藏剽窃行为并不是一个万无一失的策略。该系统能够持续找回绝大部分被重复使用的材料,即使这些材料散布在整个文档之中。研究结论认为,虽然文本的物理排列会影响检测效果,但该软件保持了高度的鲁棒性,无论重复使用的单词是以单一段落形式出现,还是以数十个小片段形式呈现,都能成功识别。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。