← 最新论文
💬 NLP

Stoicheia: Character-Level Masked Diffusion for Ancient Greek Textual Restoration, Parsing, and Metrical Scansion

Stoicheia 是一个拥有 4.05 亿参数的字符级掩码扩散模型,该模型是在一个经过去污染处理的古希腊语语料库上训练而成的,它将文本修复、解析和格律扫描统一到了一个框架之中,通过显著超越 Ithaca 和 Aeneas 等先前的系统,在多项任务中实现了最先进的性能。

原作者: Eric Cullhed, Albin Thörn Cleland

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Eric Cullhed, Albin Thörn Cleland

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个图书馆,其中的书籍已有数千年的历史,其所使用的语言在数千年中不断演变和变化。这就是**计算文献学(computational philology)**的世界——在这个领域,计算机科学家与历史学家和语言学家联手,共同阅读、修复并理解古老的文本。挑战在于,这些古书往往残破不堪,缺失页面,或者以一种没有空格、逗号或我们今天使用的那些小撇号的混乱连续字母流形式呈现。为了理解它们,研究人员使用 AI 模型——即经过训练可以预测序列中下一个内容的计算机程序,就像你的手机猜测你正在输入的下一个词一样。但问题在于,大多数 AI 模型是基于“子词”(字母块)进行训练的,这使得它们在处理古代石刻或莎草纸上极其细微的、逐个字母级别的缺口时表现不佳。此外,它们还经常“背诵”所学习过的书籍,这意味着它们无法在从未见过的文本上解决谜题。这篇论文提出了一个简单但至关重要的问题:我们能否构建一个更聪明、更诚实的 AI,它能逐个字母地阅读古希腊语,理解文本书写过程中混乱的历史,并能解决从未遇到过的全新古代文献中的谜题?

由此诞生了 Stoicheia,一个专门为古希腊语设计的全新 AI 模型,旨在成为终极侦探。把它想象成一位大师级的修复师,他不仅仅是看着一个破碎的花瓶并猜测其形状;相反,他会同时观察粘土、裂纹、油漆以及碎片是如何契合在一起的。

旧 AI 的问题

在 Stoicheia 出现之前,最好的古希腊语 AI 工具就像是背下了特定考试答案的学生。如果你问它们关于它们学习过的文本,它们表现出色。但如果你交给它们一段从未见过的、受损的铭文,它们可能会只是背诵一段类似的段落,或者感到困惑。此外,这些模型通常将单词视为单一的整体。但古代的损坏并不规整;石头上的裂缝可能会直接切断一个单词的中间。为了修复这一点,你需要看到每一个字母、每一个重音符号和每一个标点符号。

Stoicheia 的工作原理:五层三明治结构

Stoicheia 的创造者构建了一个具有独特“五层三明治”架构的模型。它不仅仅是看到一串字母,而是同时看到五个完美对齐的不同层面:

  1. 字母: 基本的字母表。
  2. 边界: 一个单词在哪里结束,下一个单词在哪里开始(即使原始文本中没有空格)。
  3. 重音: 改变发音的元音上方的微小标记。
  4. 大小写: 哪些字母是大写,哪些是小写。
  5. 标点符号: 逗号、句号和其他停顿。

想象一下尝试修复一张撕裂的地图。普通的 AI 可能会试图一次性猜出整个缺失的城市。然而,Stoicheia 会分别观察撕裂的边缘、墨水的颜色、网格线和指南针,然后将它们缝合在一起。这使得它能够处理一段混乱、无空格、无重音的古文本,并通过填充缺失部分、添加正确的重音以及确定句子断句位置来“修复”它,而无需针对每个特定任务进行重新训练。

“诚实”的训练:从未见过

这个项目最聪明的部分之一是他们如何训练 AI 变得“诚实”。通常,AI 模型是在所有可用数据上进行训练的,这意味着它们可能在你展示谜题之前就已经记住了答案。研究人员希望确保 Stoicheia 实际上是在“解决”问题,而不是仅仅在“记忆”答案。

为此,他们创建了 十一个不同版本 的模型。他们将庞大的 3.61 亿词汇库分成了十个不同的组。每个模型在九个组上进行训练,并在第十个组上进行测试。这意味着对于你抛给它们的任何古代文本,都至少有一个版本的 Stoicheia 在其整个生命周期中从未见过该文本。这就像拥有一个由十名侦探组成的团队,对于每一个新的犯罪现场,你都会挑选出那个从未去过那个社区的侦探。这保证了当模型解决谜题时,它是在运用大脑,而不是依靠记忆。

结果:超越巅峰

团队通过三种主要方式对 Stoicheia 进行了测试,将其与现有的最佳系统(如 Ithaca 和 Aeneas)甚至是一个从随机、“愚笨”权重开始的模型(用以观察训练实际起到了多少作用)进行了对比。

  1. 修复破碎的石碑和卷轴: 当被要求填补受损铭文和莎草纸中的缺失字母时,Stoicheia 表现得像个冠军。在一项针对 3,000 个缺口的标准测试中,它将错误率降低到了 15.5%,击败了此前表现最好的 Ithaca(其错误率为 24.6%)。它在“首选猜测”上的正确率达到了 74.5%,而旧纪录为 63.0%。更令人印象深刻的是,当在其他所有 AI 模型完成训练后编辑出的全新文档上进行测试时,Stoicheia 依然名列前茅,证明它不仅仅是在背诵旧答案。

  2. 理解语法: 团队还测试了 Stoicheia 是否能理解古希腊语的语法(标记单词并弄清它们如何相互关联)。在这里,它击败了包括那些在更大规模数据集上训练的模型在内的所有模型。关键发现是,“预训练”(大规模学习阶段)贡献了巨大的性能提升——比从零开始的模型高出约 12.9 个百分点。这证明了模型的“大脑”在承担重任,而不仅仅是附带的特定工具。

  3. 阅读诗歌的节奏: 古希腊诗歌依赖于元音的长短(长音或短音)来创造节奏,但书面文本并不显示这些信息。Stoicheia 能够以 93.37% 的准确率识别出这些隐藏的长度,击败了一个由于不确定而不得不“放弃”40% 单词的专门规则系统。Stoicheia 从未放弃。

为什么这很重要

论文得出结论认为,Stoicheia 是一个游戏规则改变者,因为它结合了开放性(数据和代码都是公开的)、精确性(它在字母层面工作)和完整性(我们确切知道它看过和没看过的文本)。它允许学者们在查看受损的古代文本时询问:“这段话说了什么?”,并确信 AI 不仅仅是在背诵它记忆中的教科书答案。它是一个让我们用全新的视角阅读过去、确保古希腊故事不是靠记忆而是靠理解得以修复的工具。

然而,作者也谨慎地指出,这并不是一根魔杖。模型的表现取决于它所训练的数据,而且许多数据是由其他 AI 工具“修复”过的,这引入了微小的误差风险。此外,模型总是会给出一个答案,即使它可能并不确定,这意味着人类专家仍然需要对工作进行复核。但这是第一次,我们拥有一个能够以这种以前无法实现的诚实度和精确度来应对这些古代谜题的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →