An Information-Theoretic Approach to Identifying Formulaic Clusters in Textual Data
本文提出了一种利用加权自信息分布的信息论算法,用于识别高维文本数据中的程式化簇与风格层,并证明了其在定量分析多作者希伯来圣经内组成模式方面的有效性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图在一座巨大的、古老的图书馆中破解谜题的侦探。这座图书馆不仅仅充满了随机的故事;它是一个由数百人在数千年中书写、编辑和抄录而成的文本集合。其中一些部分是由单一作者以独特的口吻书写的,而另一些部分则像是从不同来源缝合而成的,就像一件拼布被。挑战在于:如何在不询问裁缝的情况下,弄清楚哪块布料属于哪位裁缝?你不能仅仅观察文字,因为不同的作者可能会出于不同的目的使用相同的词汇。你需要一种测量写作“节奏”或“可预测性”的方法。
这正是信息论(Information Theory)发挥作用的地方。把它想象成一种衡量你在阅读句子中的下一个词时感到多么“惊讶”的方法。如果你正在读一个充满变数的故事,你会不断感到惊讶;信息量很高,写作的感觉显得“松散”或“富有创意”。但如果你在读一份食谱或一份法律合同,你几乎能预料到下一个词是什么。“加入一杯……”之后几乎总是跟着“面粉”。这种可预测性意味着信息量很低,因为其模式是僵化且重复的。在这篇论文中,作者们利用这种“惊讶”(或缺乏惊讶)的概念来寻找古代文本中的隐藏模式。他们想要看看,是否可以仅仅通过测量单词的可预测性,就自动识别出书中的“食谱式”章节与“故事式”章节。
侦探的新工具
作者 Gideon Yoffe、Yair Segev 和 Barak Sober 制造了一个新的数字放大镜。他们称之为无监督信息论方法(unsupervised information-theoretic approach)。让我们来拆解一下这个词:“无监督”意味着计算机不需要老师来告诉它寻找什么,它能自行发现;“信息论”意味着它利用数学来衡量可预测性。
他们的核心思想简单而强大:公式化文本是可预测的。 当作者使用僵化的结构时,比如列举祖先名单或一套宗教法律,他们会反复使用相同的短语。因为这些短语出现得非常频繁,它们变得极其可预测。用信息论的话说,可预测的事物具有低自信息(low self-information,即低惊讶度)。而不确定、富有创意的叙事则具有高自信息(high self-information,即高惊讶度)。
该团队开发了一种算法,用于扫描文本,寻找异常可预测的写作片段。它不仅仅是在猜测;它会根据概率模型对所见词汇感到多么“惊讶”来为每一部分计算一个分数。如果一个章节充满了重复的、公式化的短语,模型就不会感到惊讶,分数就会保持在低位。如果该章节是一个狂野、富有创意的叙事,分数就会上升。通过将低分部分的章节归为一类,算法可以分离出“公式化集群”——即那些感觉像是出自不同人之手或出于不同目的而编写的部分。
在古代文本上测试工具
为了验证这个新工具是否真的有效,作者在希伯来圣经上进行了测试,特别是前三卷书:创世记、出埃及记和利未记。这些书在学者眼中是著名的“复合型”著作,这意味着它们被认为是由不同的来源编织而成的。其中一个最具争议的问题是如何将祭司文献(P)——以其高度结构化、法律化和重复性著同著称——与文本中其他更具叙事性的部分区分开来。
研究人员不仅观察了词汇,还观察了词汇的结构。他们将文本分解成小的块(如句子或诗节),并统计某些模式出现的频率。然后,他们运行算法,看它是否能自然地将文本分为两组:一组是高度重复的(低惊讶度),另一组是更加多变的(高惊讶度)。
以下是他们的发现:
- 在创世记中: 他们观察了冗长的、枯燥的家谱列表与亚伯拉罕和以撒的精彩故事之间的差异。算法成功地将家谱识别为高度可预测的、公式化的集群。这很合理,因为家谱遵循严格、重复的模式,而故事则更加流畅。
- 在出埃及记中: 他们测试了**祭司(P)**部分(包含关于建造帐幕和宗教仪式的法律)与非祭司叙事部分之间的分离情况。算法可靠地分离了这两个层面,符合传统学者长期以来的观点。祭司部分表现为“低惊讶”区域,因为它们充满了重复的指令。
- 在利未记中: 这是最难的测试。利未记充满了法律,但学者们争论它是否包含两个不同的层面:祭司文献(P)和后来的“圣洁法典”(H)。两者都是重复性的,但有着微妙的区别。作者发现,他们的法门确实可以区分它们,但前提是必须通过正确的“透镜”来观察文本。取决于他们分析文本块的大小,算法有时会将祭司规则强调为最重复的部分,有时则会强调圣洁法典。这表明两者都是公式化的,但它们遵循着在不同尺度上呈现出的不同模式。
他们有多确定?
作者非常谨慎,并不声称他们已经彻底解决了圣经之谜。相反,他们展示了其方法如何暗示了一种量化这些差异的方式。
他们首先在人工生成的模拟数据上测试了算法,以确保它能在受控环境中发现模式。在这些模拟中,当数据稀疏且具有高维特征时(这正是古代文本的特征),他们的方法通常比标准的聚类工具(如 k-means 或高斯混合模型)表现得更好。
当他们将此应用于真实的圣经时,结果令人振奋但也充满细微差别。在出埃及记中,在他们尝试的不同参数设置下,该方法与专家学者的分类一致率达到了 68%,而标准 k-means 方法仅为 30%。在创世记中,一致率为 40%,而 k-means 为 14.6%。在利未记中,一致率为 45.5%,而 k-means 为 29.8%。
这些数字表明,信息论方法是寻找这些隐藏层级的有力工具,但它并非每次都能完美运作的魔杖。事实是,结果会随着你切割文本的方式(词组的大小和诗节的窗口)而改变,这告诉我们这些文本的“公式化”本质是复杂的。它不仅仅是一种东西,而是由在不同尺度上呈现出的多种模式组成的。
这为什么重要
这篇论文不仅给了我们一种分类书籍的新方法,更给了我们一种“倾听”它们的新方式。通过使用数学来衡量“惊讶度”,作者提供了一种客观的方法来观察文本节奏的变化。如果一个故事突然变得非常可预测,这可能是一个信号,表明有不同的作者拿起笔,或者该文本是从模板中复制而来的。
作者总结道,这种方法对于那些经过编辑和层叠的文本(如希伯来圣经)特别有用。它允许研究人员在不需要预先猜测哪些词汇重要的情况下,观察文本的“结构支架”。虽然该方法并不能证明究竟是谁写了什么,但它提供了一个量化框架,支持了许多关于这些古书如何构成的传统理论。它将文学分析的艺术转变为一种模式科学,向我们展示了即使在最复杂的故事中,只要你知道如何测量“惊讶度”,就能找到结构与重复留下的指纹。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。