想象一下《伏尼契手稿》是一本神秘的古书,用一种从未被破解的密码写成。几十年来,一位名叫普雷斯科特·柯里尔(Prescott Currier)的密码学家曾有一个直觉:这本书并非仅用一种“语言”写成。他认为它实际上是两种截然不同的方言的混合体,他将其称为A 语言和B 语言。
多年来,这仅仅是一个基于对单词模式直觉的理论。但在这篇新论文中,作者克里斯托夫·帕里塞尔(Christophe Parisel)决定用数学而非单纯的猜测来验证这一直觉。将这项研究视为对这本书 DNA 的法医审计。
以下是他们所做的工作及发现,使用简单的类比进行分解:
1. 侦探的工具:“字符对”
研究人员没有试图去解读单词(这是不可能的),而是观察作者如何在视觉上相似的字母之间进行选择。
- 类比:想象你在写一个故事。有时你用"color"这个词,有时用"colour"。如果你随机切换,那只是个人习惯。但如果你在前半本书总是用"color",而在后半本书总是用"colour",这就暗示了两位不同的作者或两套不同的规则。
- 研究:他们挑选了 11 对在伏尼契文字中看起来相似的字母对(如
d 与 l,或 or 与 ar)。他们统计了每一页(folio)上每对字母中各个字母的使用频率。
2. 核心问题:是真实的还是巧合?
研究人员提出了三个棘手的问题:
- 这只是随机噪音吗? 在单一语言中,这些差异是否可能偶然发生?
- 这是装订造成的把戏吗? 柯里尔最初的划分恰好与书籍物理缝合的位置(“书帖”)重合。也许书籍风格的改变仅仅是因为抄写员变了,而非语言变了。
- 我们可以预测它吗? 如果我们隐藏标签(A 或 B),让计算机进行猜测,它能否仅通过观察字母计数来判断某一页属于哪种“语言”?
3. 结果:“双语言”理论站得住脚
该研究使用了一种复杂的统计模型(贝塔 - 二项混合模型),它就像一个智能分类器。它在不知道哪一页是 A 或 B 的情况下,直接分析了原始数据。
- “神奇”的分类:即使没有被告知答案,计算机也自然地将页面分成了两个截然不同的组。它与柯里尔最初的 A/B 划分吻合度约为38%(对于此类数据而言,这在统计学上是一个巨大的成就),并且在超过 100 页的页面上达到了**90%**的置信度。
- “盲测”:当他们训练计算机识别书中一半页面的模式,然后让它猜测另一半页面的语言时,其准确率达到了89.2%。
- 排除“装订”理论:他们发现,当语言在单个缝合部分(一个书帖)内部发生变化时,字母模式会急剧跳跃。这证明这种变化不仅仅是关于谁装订了这本书,而是关于文本本身。
4. 字母的三种“性格类型”
研究发现,字母对的行为方式各不相同。它们分为三组,就像公司里不同类型的员工:
- “切换者”(分类型):这些字母非常严格。如果页面是 A 语言,它们使用一个字母;如果是 B 语言,它们就切换到另一个。它们是证明两种语言存在的“身份证”。
- “倾向者”(中间型):这些字母有偏好但不严格。它们倾向于一种风格或另一种,充当微妙的信号。
- “自由灵魂”(自由变异型):这些字母根本不在乎语言。无论页面是 A 还是 B,它们都随机变化。
5. “意外”异常
有一对字母(e/ch)很怪异。它无助于将页面分类为 A 或 B,但它最擅长捕捉语言从一种切换到另一种的确切时刻。这就像一个烟雾探测器,虽然不能告诉你火灾发生在哪个房间,但一旦火灾开始就会尖叫。
结论
该论文得出结论:柯里尔是对的。《伏尼契手稿》并非单一、统一的文本。它包含两种截然不同的“语言”(或书写体系)之间真实的、结构性的分裂。
- 这不是随机的:这些模式太强了,不可能是偶然。
- 这不是物理把戏:即使在书籍的同一物理部分内,变化也会发生。
- 这是可预测的:计算机可以查看字母统计数据并以高准确率猜测语言。
然而,研究也指出,"A 与 B"的分裂仅解释了文本中约**29%**的差异。这意味着书中仍有许多我们尚未解开的隐藏复杂性和结构,但“双语言”理论绝对是一个真实的、可测量的事实,而不仅仅是一个神话。
以下是克里斯托夫·帕里斯尔(Christophe Parisel)所著论文《Currier 语言区分定量确认》的详细技术摘要。
1. 问题陈述
本文探讨了普雷斯科特·柯里尔(Prescott Currier)1976 年提出的假设的有效性,即《伏尼契手稿》包含两种截然不同的“语言”(分别 designated 为 Currier A 和 Currier B)。尽管该区分被广泛引用,但历史上缺乏针对明确零假设的严格定量验证。本研究旨在解决三个具体挑战:
- 统计波动:确定观察到的差异是否仅仅是单一同质文本内的随机噪声。
- 抄本学混杂因素:验证该区分是真正的语言属性,还是手稿物理结构(如书帖边界)的产物,因为柯里尔最初的分配与这些物理划分相关联。
- 内在可预测性:确立 A/B 区分是否是一种无需预先标签即可发现的内在统计属性,并且能够预测未见文本的行为。
2. 方法论
作者采用多面定量方法,使用高木贤治(Takahashi)的 EVA 转写数据(185 张书页,共 32,693 个词元)。
- 数据表示:研究聚焦于 11 对视觉相似的 EVA 字符(例如 k/t、d/l、or/ar)。对于每一张书页,只要每对字符的合并出现次数达到 20 次的最低阈值,便计算比率 r=count(a)+count(b)count(a)。
- 模拟基线:为了检验零假设,生成了三种模型:
- 标签打乱:真实文本但 A/B 标签随机化。
- 单一马尔可夫:来自单一同质马尔可夫模型的合成文本。
- 分裂马尔可夫:来自独立的 A 和 B 马尔可夫模型的合成文本(阳性对照)。
- 无监督恢复:将聚类算法(K-means、GMM 等)应用于书页×字符对比率矩阵,且不访问柯里尔的标签,以观察数据是否自然划分为两组。
- 生成建模:将 Beta-二项混合模型 拟合到原始字符计数上。该模型假设书页计数来自二项分布,其中成功概率遵循特定于潜在机制的 Beta 分布。通过期望最大化(EM)算法拟合模型,以确定最佳机制数量(k)。
- 预测验证:在部分书页子集上训练监督 Beta-二项分类器,以预测保留书页的 A/B 身份。验证包括交叉验证、空间划分(早期与晚期手稿)以及置换检验。
- 边界分析:将书页间的过渡分类为(相同、仅书帖、仅语言、两者皆有),以测量语言边界与物理书本边界处比率跳跃的幅度。
3. 主要贡献
- 无监督发现:证明了拟合原始计数的生成模型在不访问柯里尔标签的情况下,独立恢复了 A/B 分裂(ARI = 0.383),证明该区分是数据结构的内在属性。
- 功能分类:识别出字符对并非表现一致,而是分为三种不同的功能机制:分类型、中间型和自由变异型。
- 与抄本学解耦:提供了统计证据,表明同一书帖内的语言过渡产生的统计跳跃显著大于物理书帖边界,从而排除了物理结构作为变异主要原因的可能性。
- 预测能力:确立了已知 A/B 标签可以高精度预测未见书页上的字符对统计特征,从而超越了单纯的描述而进入预测领域。
4. 主要结果
统计稳健性
- Cramér's V:11 对字符中有 6 对的 Cramér's V 值超过了所有 1,000 次随机标签置换。平均 Cramér's V(0.136)显著高于打乱基线(0.025)。
- 模拟拒绝:
- 单一马尔可夫 模型未能重现观察到的书页间方差或边界效应(200 次模拟中 0 次匹配)。
- 分裂马尔可夫 模型匹配了聚合统计量,但未能重现真实手稿的高书页级方差和边界锐度。
无监督与生成恢复
- 聚类:基于比率矩阵的 K-means 聚类产生了 0.208 的校正兰德指数(ARI)(显著,p<0.001)。移除“噪声”对后,ARI 提高至 0.456。
- Beta-二项混合:基于贝叶斯信息准则(BIC),模型选择 k=2 为最佳组件数量。
- 模型以 >90% 的后验置信度将 185 张书页中的 113 张(61%) 分配给两种机制之一。
- 恢复的分区与柯里尔的手动分配一致(ARI = 0.383)。
预测验证
- 准确率:监督分类器在预测保留书页标签时达到了 89.2% 的准确率(交叉验证)。
- 显著性:500 次标签置换中零次达到可比准确率(p<0.002)。
- 方差解释:A/B 标签解释了未见书页上字符对比率的 29.3% 的方差(R2=0.293)。
- 空间不对称性:前向空间划分(早期 → 晚期)表现良好(79.6%),而后向划分(晚期 → 早期)失败(41.3%),这是由于类别不平衡(晚期书页主要为 B)所致,证实信号是真实的,但对训练集组成敏感。
字符对机制
研究将 11 对字符分为三种机制:
- 分类型(例如 d/l、or/ar):机制间近乎二元的切换;对聚类至关重要。
- 中间型(例如 ol/al、k/t):适度的偏好转移;携带边界信号。
- 自由变异型(例如 o/a、ch/sh):对 A/B 机制的依赖近乎为零;可能代表异体字变异。
- 异常说明:e/ch 对具有近乎零的全局相关性,但最强的局部边界效应,表明其变异受二元机制以外的因素调节(例如词位)。
5. 意义
本文提供了首个严格的定量确认,证明柯里尔 A/B 区分是《伏尼契手稿》的 真实、内在且具有预测性的属性,而非物理结构或随机噪声的产物。
- 对破译的启示:任何关于伏尼契书写系统的理论都必须解释这种双重机制结构,其中特定的字符对在机制间进行分类切换,而其他字符则自由变异。
- 文本性质:结果表明,该手稿并非单一同质文本,而是包含复杂结构,其中二元 A/B 分裂是变异的主要轴,尽管它仅解释了约 29% 的总方差,这意味着存在进一步的子机制或梯度。
- 方法论进步:本研究展示了 Beta-二项混合模型和无监督学习在密码分析中的有效性,提供了一个框架,用于在不依赖手动标签的情况下验证未破译脚本中的语言假设。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。