Normalisation-Based Likelihood Ratio Estimation for Forensic Authorship Verification
本文介绍了两种新颖的归一化技术,即平方根校正(Square Root Correction)和单次出现校正(Hapax Correction),它们能够直接推导出用于法庭作者身份验证的经过良好校准的似然比,而无需单独的校准模型,从而在减少数据和时间需求的同时,实现了与传统逻辑回归校准相当或更优的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名正在试图破解谜团的侦探:同一个人是否写了这两份不同的笔记? 也许一份是勒索信,另一份是日记。为了解决这个问题,你需要一个特殊的工具,它不仅仅是说“它们看起来很像”,而是要给你一个数字,告诉你同一人创作这两份笔记的可能性究竟高出多少。在法医学领域,这个数字被称为似然比(Likelihood Ratio, LLR)。
长期以来,想要获得一个可靠的数字就像是在没有食谱的情况下尝试烤出一个完美的蛋糕。你必须从计算机程序中获取一个原始分数,然后将其放入一个单独的、复杂的“校准”过程中。这个过程就像一位严厉的老师,在评价你的蛋糕之前,需要先品尝数百个其他蛋糕(数据)的味道,才能告诉你你的蛋糕是真的好,还是仅仅看起来好。这需要大量的时间、大量的数据以及专家的经验判断。
新的捷径:LambdaG 的两个神奇公式
本文介绍了两套全新的、更简单的技巧,用于在不需要那个沉重且依赖数据的“老师”(校准模型)的情况下,修正一个特定的作者身份验证工具——LambdaG 的原始分数。重要提示: 这些技巧是专门为 LambdaG 设计的,而不是作为一种通用的修复方案适用于所有的作者身份验证工具。
之所以需要这些技巧,是因为 LambdaG 的工作方式有一个特定的缺陷。LambdaG 通过累加每个单词的证据来计算分数,并假设每个单词都是一个独立的线索。这被称为**“朴素贝叶斯假设”(naive Bayes assumption)。问题在于,现实生活中的单词并不是独立的;如果作者重复使用一个短语,那么第二次和第三次出现时,所提供的“新信息”并不如第一次多。因为 LambdaG 没有考虑到这一点,它往往会高估**证据的强度,尤其是在长文本或重复性高的文本中。这些新技巧的设计初衷正是为了修正这种高估现象。
研究人员在 15 个不同的文本集合(语料库)上测试了这些技巧,涵盖了从学术论文、推文到电子邮件链和聊天记录等各种文本。他们测试的文本长度从短至 100 个单词到长达 9,500 个单词不等。
以下是他们提出的两个新技巧:
- 平方根修正(The Square Root Correction): 想象计算机的分数是一堆砖块。如果文本非常长,这堆砖块会变得巨大,但其中许多并不是新的或有用的砖块,而只是对旧砖块的重复。这个技巧说:“嘿,不要把每一块砖都当作一次新的发现。”它通过对单词数量进行平方根运算来缩小分数。这就像是意识到当你已经见过 50 辆红车后,第 51 辆红车带给你的新信息并没有第一辆那么多。
- Hapax 修正(The Hapax Correction): 这个甚至更聪明。它观察文本中有多少单词是仅出现一次的(这些被称为 hapax legomena)。如果一个文本充满了重复(比如坏掉的唱片),那么它出现的仅一次的单词就会很少。如果一个文本多样且独特,这类单词就会很多。这个技巧通过“仅一次单词”与总单词数的比例来乘以分数。它本质上是在说:“如果你只是在重复自己,你的分数就不应该这么高。”
大考:它们奏效吗?
研究人员将这两个新技巧与旧的标准方法(逻辑回归校准)进行了对比,以观察哪个能给出最准确的“真相”数字。他们使用了一个名为 的特定分数来衡量准确度(该数值越低越好)。
以下是他们的发现:
- Hapax 修正表现最为出色。 在大约 45.4% 的测试中,Hapax 修正的表现实际上比旧的、复杂的校准方法更好。
- 当它没有胜出时,差距也很小。 在旧方法表现更好的案例中,Hapax 修正的表现通常与旧方法仅差 5% 以内。这就像是一个跑步选手仅以微弱差距落后于冠军。
- 平方根修正 的一致性稍逊一筹。在超过 70% 的测试中,它被其他方法击败了,但它在特定情况下仍展现出了潜力。
这意味着什么(以及它不是什么)
本文认为,旧的方法过于沉重。它需要专家收集海量的特定数据来训练校准模型,而且专家还必须对选择哪些数据进行主观判断。这种新方法跳过了这些步骤。它更快、更简单,也不需要大量的额外数据。
然而,论文也谨慎地指出,这并不是一个解决所有问题的“万能药”。
- 它专门针对 LambdaG: 这些新公式是为 LambdaG 系统设计的。它们不是适用于所有作者身份验证工具的一站式解决方案。
- 它并不完美: Hapax 修正并没有每次都赢。事实上,旧的方法在整体上仍然获胜次数更多。
- 它尚未得到数学证明: 作者承认,他们目前还没有完美的数学证明来解释为什么这些公式效果如此之好;他们有基于语言学原理(例如词汇量随文本增长而增长变慢)的强大理论,但“为什么”仍在探索之中。
- 它具有局限性: 这些结果是基于英语文本的。我们目前还不清楚这些技巧是否适用于法语、日语或其他语言。
- 它有适用范围限制: 在非常短的文本(约 100 个 token)上,Hapax 修正表现得有些吃力,因为数据量不足以准确测量“仅一次单词”的数量。
总结
你可以把这篇论文看作是找到了一双更轻便的登山靴。旧的靴子(逻辑回归)很重,需要很多装备(数据),而且需要很长时间来磨合。新的靴子(Hapax 修正)更轻,也更容易穿上。它们并不总是能让你跑得比旧靴子更快,但在他们测试的大约 45% 的路径中,它们实际上更快了;而在剩下的路径中,它们也几乎一样好。
对于那些需要向陪审团解释其发现,而不希望陷入复杂数据训练过程的法医专家来说,这些新技巧提供了一种无需面对繁琐数据即可获得可靠答案的方法。作者建议,虽然旧方法仍有其地位,但这些更简单、更透明且更易于使用的修正方法,是解决作者身份之谜(特别是使用 LambdaG 工具时)的一个非常有力的替代方案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。