← 最新论文
💻 computer science

Attention-Augmented LSTMs for Automatic Homophonic Ciphertext Decipherment

本文表明,一种仅在对齐的密文-明文对上进行训练、且不依赖外部语言资源的注意力增强型 LSTM 模型,能够通过学习跨越不同语言、时期和噪声水平的共享代码池,实现对具有历史动机的同音替换密码的近乎完美的自动解密。

原作者: Micaella Bruton, Meriem Beloucif, Beáta Megyesi

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Micaella Bruton, Meriem Beloucif, Beáta Megyesi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:用“超级阅读者”破解秘密代码

想象一下,你正试图阅读一本 1700 年代的秘密日记。但有一个难点:作者并没有简单地把字母“A”替换成数字“1”,而是有一个巨大的数字袋(一个“池子”),并且可以从这个袋子里挑选任何数字来代表“A”。有时他用“1”,有时用“42”,有时又用“999”。

这被称为同音密码(Homophonic Cipher)。这是一个聪明的诡计,旨在迷惑破译者,因为传统的技巧——统计字母出现频率的方法(频率分析)在这里失效了。如果“A”可以是 1、42 或 999,你就无法仅通过观察数字出现的频率来判断哪个是“A”。

这篇论文提出了一个简单的问题:一个现代计算机程序(具体来说是一个带有“注意力机制”的 LSTM AI)能否自动学会破解这些代码,甚至在没有人类告诉它规则的情况下?

设置:一个共享的“戏法袋”

研究人员不仅仅测试了一个秘密代码。他们创建了一个模拟真实历史的情景:

  • 共享池: 想象一个包含所有可能秘密数字的巨大图书馆(“密钥空间”)。
  • 个人密钥: 不同的作者(或不同的字母)只使用该图书馆的一个子集。一位作者可能用 1–100 中的数字表示“A”,而另一位则使用 50–150。
  • 规则: 至关重要的一点是,在任何单一文档内,如果数字“42”出现了,它始终代表同一个字母(例如“A”)。它绝不会在同一份文档中变成代表“B”。

研究人员在成千上万个由历史英语和瑞典语文本(源自 1500 年至 1899 年)生成的虚构秘密信息上训练了这个 AI。他们给了 AI 秘密代码和真实的原始信息,但没有提供字典、没有语法规则,也没有人类提示。 AI 必须自己摸索出其中的规律。

“注意力”超能力

他们使用的 AI 是一个 LSTM(一种擅长处理序列数据的神经网络类型),并带有一个特殊的插件,叫做注意力机制(Attention)

  • 类比: 想象你在读一个很长的、令人困惑的句子,其中有一个单词缺失了。你可能会回看句子的开头,或者看向句子的结尾,以此来猜测缺失的单词是什么。
  • AI 的任务: “注意力”机制让 AI 可以同时观察整个秘密信息。如果它看到一个奇怪的数字,它可以观察周围的数字来判断:“啊,在这种特定的语境下,这个数字一定是‘E’,因为它周围的数字通常会组成‘THE’这个词。”

结果:近乎完美

研究人员在非常困难的条件下测试了该 AI:

  1. 短消息: 只有 50 个字符长(上下文极少)。
  2. 古老语言: 具有旧拼写方式的 500 年前文本。
  3. 混乱数据: 模拟“笔误”(比如人类在抄录手写笔记时,不小心写错了数字)。
  4. 可变长度: 有些代码是 3 位数,有些是 4 位数。

结果:
该 AI 非常成功。

  • 准确率: 对于清晰的信息,它的解密正确率几乎达到 100%。
  • 噪声: 即使信息中有“笔误”或混合了不同的代码长度,它的正确率仍保持在 99% 以上。
  • 穿越时空: 它在处理 1500 年代的文本和 1800 年代的文本时表现同样出色。它不需要针对不同世纪进行重新训练。

“魔术技巧”:知道自己不知道

研究人员发现了一个非常有意思的结果:当他们给 AI 一个未使用其训练时所用的“数字袋”(共享池)的秘密信息时,会发生什么。

  • 结果: AI 立即失败,且失败得很有规律。它并没有瞎猜,而是直接表示无法解决。
  • 为什么这很重要: 这证明了 AI 并没有仅仅死记硬背它学习过的特定信息。它实际上学习了共享代码池的结构
  • 类比: 这就像一个人学会了识别某个特定品牌的汽车发动机。如果你展示那个发动机,他就能修理它。如果你展示一个完全不同的品牌,他会说:“我不认识这个发动机”,而不是试图把扳手强行塞进错误的地方。这使得该 AI 成为一个有用的工具,供历史学家核实:“这封新的、神秘的信件是否使用了我们已知的那套秘密代码?”

系统中的“小故障”

当 AI 犯错时,通常不是因为它混淆了字母(比如把“A”误认为“B”)。

  • 真正的问题: 错误通常发生在 AI 被“笔误”(转录错误)干扰的时候。它能正确识别出秘密代码,但会对“笔误”出现在哪里感到困惑。
  • 结论: 底层的逻辑仍然是完整的;AI 只是在面对杂乱的模拟手写体时产生了困惑。

总结

这篇论文表明,一种特定类型的 AI 可以学习破解复杂的历史秘密代码,而无需人类教授其英语或瑞典语的规则。

  • 它适用于短消息、长消息、古老文本以及混乱的文本。
  • 它对“共享规则”的学习如此透彻,以至于它能告诉你一个新的信息是否遵循了相同的规则。
  • 它成为了历史学家的强大助手,帮助他们验证一份神秘的文件是否属于已知的秘密信件组,即使手写体非常凌乱或文本非常简短。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →