← 최신 논문
💻 computer science

Linking Hadith Narrator Identities Across Heterogeneous Arabic Biographical Databases: A Multi-Signal Entity Resolution Pipeline

본 논문은 Sanadset 코퍼스에 있는 185,000개 이상의 고유한 하디스 전승자 이름 변체들을 두 개의 주요 전기 데이터베이스와 성공적으로 연결하여, 통합된 메타데이터 풍부 전승 그래프를 생성하고 그 결과물인 연결된 데이터를 오픈 리소스로 공개하는 2단계 엔티티 해상도 파이프라인을 제시한다.

원저자: Taufiq Wirahman

게시일 2026-07-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Taufiq Wirahman

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 오래된 퍼즐을 풀려고 노력하고 있다고 상상해 보십시오. 퍼즐 조각들은 천 년 전의 수천 명의 이야기꾼들의 이름입니다. 하디스(Hadith) 전승자라고 불리는 이 이야기꾼들은 종교적인 이야기들을 스승으로부터 제자에게 전달했습니다.

문제는 이 이름들이 세 개의 서로 다른 디지털 도서관에 흩어져 있으며, 서로 다른 언어를 사용한다는 점입니다. 어떤 도서관은 어떤 남자를 "지혜의 아버지"라고 부를 수도 있고, 다른 도서한은 "알리의 아들, 아흐메드의 아들 오마르"라고 부를 수도 있으며, 세 번째 도서관은 그저 "오마르"라고만 기록할 수도 있습니다. 이들은 모두 동일 인물이지만, 컴퓨터는 이를 알지 못합니다.

이 논문은 이 흩어진 도서관들을 연결하기 위해 구축된 새로운 "번역기"이자 "매치메이커(중매쟁이)" 시스템에 대해 설명합니다. 작동 방식은 다음과 같습니다.

세 가지 도서관

세 개의 데이터베이스를 세 개의 서로 다른 아카이브라고 생각하십시오:

  1. 이야기 아카이브 (Sanadset): 650,000개의 이야기를 담은 거대한 컬렉션입니다. 누가 누구에게 이야기를 전달했는지는 기록되어 있지만, 전기(biography) 정보는 없습니다. 이는 마치 파티의 초대 명단에 사진이나 생년월일 없이 이름만 적혀 있는 것과 같습니다.
  2. 전기 아카이브 A (Hawramani): 사망 연도나 신뢰도와 같은 세부 정보를 포함한 100,000명의 전승자가 담긴 방대한 디렉토리입니다.
  3. 전기 아카이브 B (Muslimscholars): 유사한 세부 정보를 담고 있지만 형식이 약간 다른, 25,000명의 학자로 구성된 더 작은 규모의 정선된 목록입니다.

2단계 매칭 파이프라인

저자들은 이 아카이브들을 연결하기 위해 2단계 프로세스를 구축했습니다.

1단계: "이름만 사용한" 추측

이야기 아카이브(Sanadset)에는 추가적인 세부 정보(사망 연도 등)가 없기 때문에, 시스템은 오직 이름만을 살펴볼 수 있습니다.

  • 도전 과제: 아랍어 이름은 까다롭습니다. 철자가 다르거나, 강조를 위한 추가 문자가 있거나, 순서가 다르게 작성될 수 있습니다.
  • 해결책: 시스템은 먼저 이름을 "정제"하여 장식적인 표식을 제거하고 문자를 표준화합니다(예를 들어, 모든 "A"의 변형을 하나의 표준 버전으로 바꿉니다).
  • 매칭: 그 다음 시스템은 이름 속의 "바이그램(bigrams, 두 단어 쌍)"을 찾습니다. 만약 이야기 아카이브에 "Muhammad ibn Ismail"이라고 되어 있고, 전기 아카이브에 "Muhammad ibn Ismail"이라고 되어 있다면, 이들은 매칭됩니다.
  • 결과: 이 시스템은 이야기 아카이브의 이름 중 약 **51%**를 전기 아카이브와 성공적으로 연결했습니다. 또한 이 연결에 대해 "높음(High)" 또는 "중간(Medium)"이라는 신뢰도 점수를 부여했습니다.

2단계: "탐정" 교차 검증

이제 이야기 아카이브가 전기 아카이브 A와 연결되었으므로, 시스템은 전기 아카이브 A를 전기 아카이브 B와 연결하려고 시도합니다.

  • 장점: 이번에는 더 많은 단서가 있습니다. 시스템은 다음을 비교할 수 있습니다:
    1. 이름: 소리가 비슷한가?
    2. 사망 연도: 비슷한 시기에 사망했는가? (이는 "Muhammad"와 같이 흔한 이름에 매우 중요한 단서가 됩니다.)
    3. 평판: 한 명은 "신뢰할 수 있음"으로 묘사되고 다른 한 명은 "취약함"으로 묘사되었는가?
  • 결과: 더 많은 단서를 가졌기 때문에, 시스템은 전기 아카이브 A의 항목 중 **94.7%**를 전기 아카이브 B와 연결할 수 있었습니다.

거대한 연결

이 두 단계를 체인처럼 연결함으로써, 시스템은 "이행적(transitive)" 연결을 생성합니다.

  • 만약 이야기 아카이브의 이름 A가 전기 A의 이름 B와 일치하고, 전기 A의 이름 B가 전기 B의 이름 C와 일치한다면...
  • 그렇다면 이야기 아카이브의 이름 A는 전기 B의 이름 C와 연결됩니다.

이를 통해 연구자들은 이야기 속의 단순한 이름으로부터 두 다른 출처의 상세한 전기 데이터를 즉시 불러올 수 있습니다.

최종 결과물: 거대한 지도

이 작업의 궁극적인 결과는 다음과 같은 거대한 방향성 지도(그래프)입니다:

  • 185,000개의 노드 (고유한 이야기꾼들).
  • 814,000개의 엣지 (스승과 제자를 잇는 선).

이 지도는 이제 "풍부해진(enriched)" 상태입니다. 이전에는 단순히 연결 관계만을 보여주는 지도였습니다. 이제는 다른 데이터베이스에서 가져온 추가 정보(사망 연도 및 신뢰도 등급)가 모든 지점에 태그로 붙어 있습니다.

이 연구가 중요한 이유 (논문에 따르면)

논문은 이 작업 이전에는 연구자들이 이러한 데이터베이스를 개별적으로만 살펴봐야 했다고 명시합니다. 컴퓨터가 동일한 이름을 가리키고 있다는 것을 알지 못했기 때문에, 서로 다른 책들 사이에서 전승자의 신뢰도를 쉽게 비교할 수 없었습니다.

이 논문은 이러한 데이터베이스 사이의 첫 번째 대규모 "가교"를 제공합니다. 저자들은 이 데이터를 오픈 리소스로 공개하여, 다른 연구자들이 더 명확하고 연결된 관점으로 이 이야기들의 역사를 연구할 수 있도록 하고 있습니다.

요약하자면: 저자들은 지저분한 아랍어 이름을 정제하고, 세 개의 서로 다른 데이터베이스를 연결하기 위한 2단계 매칭 프로세스를 구축했으며, 모든 이름에 전기적 세부 사항이 첨부된 역대 최대 규모의 이슬람 이야기꾼 지도를 만들어냈습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →