← 最新论文
💻 computer science

Linking Hadith Narrator Identities Across Heterogeneous Arabic Biographical Databases: A Multi-Signal Entity Resolution Pipeline

本文提出了一种两阶段实体解析流水线,成功地将来自 Sanadset 语料库的超过 185,000 个唯一的圣训传述者姓名变体链接到两个主要的传记数据库,从而构建了一个统一的、富含元数据的传输图谱,并将由此产生的链接数据作为开放资源发布。

原作者: Taufiq Wirahman

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Taufiq Wirahman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图解开一个巨大的、古老的谜题。这些拼图碎片是来自一千多年前成千上万名讲述者的名字。这些被称为“圣训传述者”(Hadith narrators)的讲述者,将宗教故事从老师传授给学生。

问题在于,这些名字散落在三个不同的数字图书馆中,而且它们并不使用同一种语言。一个图书馆可能称某人为“智慧之父”,另一个可能称他为“奥马尔,阿里之子,艾哈迈德之子”,而第三个可能只列出“奥马尔”。他们其实是同一个人,但计算机并不知道这一点。

这篇论文描述了一个全新的“翻译器”和“媒人”系统,旨在连接这些分散的图书馆。它是如何运作的,通过以下简单的步骤分解如下:

三个图书馆

将这三个数据库视为三个不同的档案库:

  1. 故事档案(Sanadset): 这是一个包含65万个故事的庞大集合。它列出了谁向谁讲述了故事,但没有传记信息。它就像是一个派对上的宾客名单,你只有名,没有照片或出生日期。
  2. 传记档案 A(Hawramani): 这是一个拥有10万名传述者目录的庞大名录,包含死卒年份和他们被认为有多可靠等细节。
  3. 传记档案 B(Muslimscholars): 这是一个规模较小、经过精选的2.5万名学者列表,具有类似的细节,但书写格式略有不同。

两阶段匹配流水线

作者构建了一个两步走的流程来链接这些档案。

第一阶段:“仅限姓名”的猜测

由于故事档案(Sanadset)没有额外的细节(如死卒年份),系统只能查看姓名

  • 挑战: 阿拉伯姓名非常复杂。它们可能有不同的拼写、用于强调的额外字母,或者以不同的顺序书写。
  • 解决方法: 系统首先“清洗”姓名,去除装饰性符号并将字母标准化(例如,将所有“A”的变体统一为一种标准版本)。
  • 匹配: 然后它会在姓名中寻找“二元语法”(bigrams,即词对)。如果故事档案中是“穆罕默德·本·伊斯梅尔”,而传记档案中也是“穆罕默德·本·伊斯梅尔”,它们就会匹配成功。
  • 结果: 它成功地将故事档案中约 51% 的姓名链接到了传记档案。它还为这些链接提供了置信度评分:“高”(非常确定)或“中”(比较确定)。

第二阶段:“侦探式”交叉核对

现在,系统尝试将传记档案 A 与传记档案 B 进行链接。

  • 优势: 这次系统拥有更多的线索。它可以对比:
    1. 姓名: 听起来是否相似?
    2. 死卒年份: 他们是否在同一时期去世?(对于像“穆罕默德”这样常见的名字,这是一个巨大的线索)。
    3. 声誉: 其中一个是否被描述为“可靠”,而另一个被描述为“虚弱”?
  • 结果: 因为有了更多线索,它成功地将传记档案 A 中 94.7% 的条目链接到了传记档案 B。

宏大的连接

通过将这两个步骤串联起来,系统创建了一个“传递性”链接。

  • 如果 故事档案中的姓名 A 匹配 传记档案 A 中的姓名 B,且 传记档案 A 中的姓名 B 匹配 传记档案 B 中的姓名 C……
  • 那么 故事档案中的姓名 A 就与 传记档案 B 中的姓名 C 相连。

这使得研究人员可以从一个故事中的简单姓名,瞬间调取来自另外两个数据库的详细传记数据。

最终产物:一张巨大的地图

这项工作的最终成果是一个巨大的有向图(图谱),包含:

  • 185,000 个节点(独特的讲述者)。
  • 814,000 条边(连接老师与学生的线条)。

这张地图现在被“丰富化”了。此前,它仅仅是一个连接图;现在,地图上的每个点都附带了额外的标签(如死卒年份和可靠性等级),这些信息是从其他数据库中提取的。

为什么这很重要(根据论文所述)

论文指出,在此之前,研究人员被迫孤立地研究这些数据库。他们无法轻松地比较一个传述者在不同书籍中的可靠性,因为计算机并不知道这些名字指的是同一个人。

这篇论文提供了第一个大规模的“桥梁”,连接了这些数据库。他们将数据作为开放资源发布,允许其他研究人员以更清晰、更连贯的视角来研究这些历史故事。

简而言之: 作者构建了一个智能系统,清洗了混乱的阿拉伯姓名,通过两步匹配过程连接了三个不同的数据库,并创建了史上最大的伊斯兰讲述者地图,且在每个名字上都附带了传记细节。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →