Real-Time Acoustic Keylogging: A Convolutional Neural Network Based Approach
本文提出了一种新颖的实时声学键盘记录系统,该系统利用训练自对数梅尔频谱图(log-mel spectrograms)的卷积神经网络,实现了高准确度的按键推断,具有低延迟(0.35 秒)的特性,并且即使在训练数据有限的情况下也能保持稳健的性能。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
每当一个人在标准电脑键盘上打字时,都会产生一种微小且独特的声响。在人类听觉中,这些咔哒声和敲击声会融合在一起,形成一种统一的节奏,彼此无法分辨。然而,机器的物理特性却讲述了另一个故事。每个按键,根据其位置和下方的特定机制,都会产生独特的声学特征。正如指纹可以识别一个人一样,这些细微的声音变化可以识别特定的按键。这种现象构成了被称为“声学键盘记录”的安全威胁。与需要向受害者电脑安装恶意软件的传统黑客手段不同,这种攻击依赖于从外部捕捉声音。随着现代智能手机和笔记本电脑中的麦克风变得越来越灵敏,攻击者通过录制这些声音并重构密码或机密信息的潜力,已从一种理论上的可能性转变为现实的担忧。
朴茨茅斯大学的研究人员致力于确定这种攻击在实时发生(而非事后分析)时,其可行性究竟如何。虽然之前的研究已经表明机器可以学会区分这些声音,但它们通常依赖于对完成后的完整打字过程录音进行分析。这种方法忽略了一个关键问题:一个系统能否在监听一个人打字的同时,识别出每一个被按下的键,并且其速度快到足以对攻击者在打字过程中产生实际用途?为了回答这个问题,该团队构建了一个旨在模拟实时监听场景的原型系统。他们使用一部标准的智能手机来录制机械键盘的声音,然后将该音频输入到一个专门的计算机程序中。该程序基于一种被称为卷积神经网络的人工智能技术构建,经过训练以识别声波的视觉模式,将音频转换为计算机可以分析的图像。
团队的实验表明,这样的系统确实具备实时运行的能力。在测试中,该系统处理音频并在每个按键按下后仅以平均 0.35 秒的延迟识别出输入的按键。这个速度快到在大多数实际用途中可以被视为瞬时完成。当研究人员使用常用密码测试该系统时,它成功地以极高的准确率重构了输入的序列,通常能正确恢复整个字符串。该系统偶尔也会出错,但这些错误很少是随机的;当机器猜错时,它几乎总是选择位于正确按键物理相邻位置的按键。这表明系统是在难以区分两个非常相似的声音,而不是完全失效。
然而,这项研究也强调了可以保护用户的显著弱点。系统的成功高度依赖于其训练时的环境。当研究人员引入背景噪音(例如繁忙办公室里的嘈杂声和嗡嗡声)时,系统识别按键的能力大幅下降。同样,如果录音设备移动到距离键盘哪怕很短的一段距离,或者如果打字者的速度或力度发生变化,准确率也会受到影响。最令人震惊的发现是,该系统无法轻易适应不同的键盘。一个针对特定机械键盘进行训练的模型,在尝试监听另一种品牌的键盘时几乎完全失败,这表明此类攻击依赖于非常具体的硬件特性。
对于安全专家而言,最令人担忧的发现是该系统并不需要海量的数据来进行学习。研究人员发现,人工智能只需通过每个按键仅四次的按压录音即可进行有效的训练。这种低要求意味着攻击者不需要花费数周时间收集数据来构建一个可用的工具;一次短暂且有针对性的录制过程就可能足够了。尽管具备这些能力,但研究结论指出,这种威胁并非不可战胜。研究人员提出了几种实际的防御措施,例如在嘈碌的环境中打字、改变打字速度,或者使用能够自动填充密码的软件,从而完全避免物理按键的按下。虽然实时监听按键的技术确实已经存在,但研究表明,通过简单的行为和环境改变可以有效地瓦解这种攻击,将潜在的漏洞转化为可控的风险。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。