← 最新论文
⚡ electrical engineering

The Voiceprint Fallacy: Why Voices Are Not Unique Biometric Imprints

本文认为,将“声纹”视为一种独特且稳定的生物识别特征的概念在科学上是一个误导性的谬误,并主张应通过经过验证的概率框架来解释语音证据,从而明确考虑到人类言语固有的变异性与不确定性。

原作者: Tianle Yang, Cuiling Zhang, Chengzhe Sun, Siwei Lyu, Phil Rose

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianle Yang, Cuiling Zhang, Chengzhe Sun, Siwei Lyu, Phil Rose

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在嘈杂拥挤的房间里寻找一位朋友。你看不见他们的脸,但你听到了他们呼唤你的名字。你的大脑瞬间就认出了那个声音,对吗?这感觉就像一把神奇的钥匙,一个由声音构成的、只属于他们的独特指纹。长期以来,科学家和警察一直认为声音就是这样运作的:每个人都有一个隐藏在喉咙里的、永久且不可改变的“声纹”,就像手指上的纹路一样。这个想法看起来如此合乎逻辑,以至于被写入了法律并用于法庭上抓捕罪犯。但转折点在于:声音并不是静态的印章或固定的印记。它们更像是一条活生生的、呼吸着的河流,其形状会随着天气、地形和水流的情绪而改变。如果你把一条河流当作一座冰冻的雕像来对待,你就会对流经其中的东西产生错误的理解。这就是旧有的“声纹”理论存在的问题,也是一篇想要拨乱反正的新论文所讲述的核心故事。

这篇题为《声纹谬误》(The Voiceprint Fallacy)的论文指出,“声纹”的概念是一个科学神话。它解释说,虽然你的声音确实携带了一些关于你是谁的线索,但它并不是一个独特的、不可改变的标记。相反,你的声音是你的身体、情绪、健康状况、你正在说的话,甚至是你所使用的麦克风共同构成的一个混乱且复杂的混合体。作者们是一群语言学家和计算机科学家,他们指出,将声音视为指纹是危险的,因为这忽略了声音发生变化的所有方式。他们建议我们不要再寻找完美的“匹配”,而是开始使用一种更聪明、更诚实的方式来比较声音,这种方式能够承认不确定性,并考虑到导致两种声音听起来相似的所有不同原因。

伟大的声纹骗局

那么,为什么大家都相信声纹呢?这一切始于一项被称为“语谱图”(spectrograph)的酷炫技术。想象一下一台能将声波转化为彩色图像的机器,它有点像音乐谱表,但是针对整个声音的。在20世纪60年代,一位名叫劳伦斯·克尔斯塔(Lawrence Kersta)的人观察了这些图像,并说道:“嘿,这些看起来就像指纹!如果我们能通过手指纹路识别身份,我们也就能通过这些声音图像做到这一点。”他声称他的方法准确率高达99.65%。法院开始允许这种“声纹”证据进入法庭,认为它像黄金一样可靠。

但论文指出,这是一个巨大的错误。作者解释说,“声纹”概念是一个谬误——一种思维陷阱。它将一个复杂且多变的事物(你的声音)伪装成一个简单且固定的事物(印章)。论文认为,这种隐喻不仅是错误的,而且是危险的。当你把声音当作指纹对待时,你就忽略了你的声音每次说话时都会发生变化这一事实。

你的声音是变色龙,而非印章

不要把你的声音看作钢琴上的单个音符,而要把它看作一只变色龙。变色龙会根据周围的环境、情绪和食物的变化来改变颜色。你的声音也完全一样。论文拆解了导致你的声音永远不会是两次完全相同的所有原因:

  • 情绪波动: 如果你愤怒、悲伤或兴奋,你的声音听起来会完全不同。如果你疲惫或生病,声音会再次改变。甚至仅仅是脱水,也会让你的声音听起来更加沙哑。
  • 剧本/语境: 你如何表达很重要。如果你是在读稿子、对着婴儿说话,或者在嘈杂的风扇声中大喊,你的声音就会切换模式。为了让人听懂,你可能会说话变慢、变大声,或者改变音调。
  • 衰老过程: 与终身不变的指纹不同,你的声音会随着你成长、变老或经历激素变化而改变。你在20岁时录制的音频,听起来不会和你60岁时的声音完全一样。
  • 面具/伪装: 人们甚至可以故意改变声音!你可以耳语、模仿口音,或者试图听起来像别人。论文指出,虽然你无法改变一切,但你可以改变到足以欺骗人类和计算机的程度。

由于所有这些变化,同一个人在两次不同的录音中听起来可能非常不同。而可怕之处在于:两个不同的人有时听起来也会惊人地相似,尤其是在他们处于不同的录制条件下或说出不同的词句时。

计算机的“声纹”也并非魔法

你可能会想:“好吧,但计算机很聪明。它们一定找到了真正的声纹。”论文回应道:“别急。”现代计算机使用复杂的数学运算将声音转化为数字代码(称为“嵌入向量/embeddings”)。诚然,这些计算机擅长区分不同的声音,但它们并不是在寻找一张神奇且不可改变的身份证。

论文解释说,这些计算机代码实际上是多种因素的混合体:说话者是谁、他们在说什么、背景噪音,甚至是所使用的麦克风类型。如果你用廉价手机和专业录音室麦克风录制同一个人,计算机可能会认为这是不同的人。计算机看到的不是“声纹”,它看到的是特定时刻的一个快照。作者警告说,仅仅因为计算机给出了一个表示“匹配”的高分,并不意味着它是一个完美的、不可改变的真理。它只是意味着在那些特定的条件下,两段录音看起来很相似。

深伪技术的危险

论文还讨论了一个新的、可怕的问题:深伪技术(Deepfakes)。这是指人工智能(AI)创造出听起来与真人完全一致的虚假音频。作者举例说明了犯罪分子如何利用AI伪造老板的声音来诱骗他人转账数百万美元。

关键在于:论文指出,即使一个深伪音频听起来100%像你的朋友,也不代表你的朋友说了这段话。旧有的“声纹”观念假设,如果听起来像你,那就一定是你。但在深伪技术面前,这条规则被打破了。一个伪造的声音可以在当事人从未开口的情况下,听起来就像真实的某人。这证明了“声音”并不是一个独特的指纹;它只是一个可以被复制的声音模式。

我们应该如何应对?

那么,如果声纹是一个神话,我们该如何破案或验证身份呢?论文并没有说“停止使用声音”。它的意思是“停止使用错误的规则”。

与其问“这两段声音是否完美匹配?”(这几乎是不可能的),作者建议我们去问:“考虑到所有的变化和条件,这段声音来自A而不是B的可能性有多大?”

他们希望我们使用一种能够承认不确定性的系统。想象一位侦探说:“基于现有证据,这段声音极有可能属于嫌疑人,但我们必须考虑到录音质量较差、嫌疑人当时生病了,以及AI可能进行了伪造。”这被称为“概率性”方法。这就像是在说,“有90%的概率这是正确的人”,而不是断言“这绝对是正确的人”。

核心结论

这篇论文的核心观点简单而有力:声音不是指纹。 它们是混乱的、变化的,并且充满了惊喜。认为存在“声纹”的想法是一个危险的神话,它让我们对自己的结论过于自信。

作者建议我们在法律和科学中停止使用“声纹”这个词,因为它误导我们认为声音是固定的印章。相反,我们应该将声音证据视为一个缺少拼图块的谜题。我们需要观察所有的线索——情绪、健康状况、录制质量,甚至是AI伪造的可能性——并对说话者进行一次谨慎、诚实的推测。通过这样做,我们不再假装拥有神奇的钥匙,而是开始使用一种更聪明、更可靠的方式去倾听。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →