← 最新の論文
💻 computer science

Linking Hadith Narrator Identities Across Heterogeneous Arabic Biographical Databases: A Multi-Signal Entity Resolution Pipeline

本論文は、Sanadsetコーパスに含まれる185,000件以上のユニークなハディース伝承者名のバリアントを2つの主要な伝記データベースに紐付け、統合されたメタデータ豊富な伝承グラフを作成し、得られたリンクトデータをオープンリソースとして公開することに成功した、二段階のエンティティ・レゾリューション・パイプラインを提示するものである。

原著者: Taufiq Wirahman

公開日 2026-07-08
📖 1 分で読めます☕ さくっと読める

原著者: Taufiq Wirahman

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、巨大で古めかしいパズルを解こうとしているところだと想像してください。そのピースは、千年以上前の何千人もの語り手たちの名前です。これらの語り手は「ハディース伝承者」として知られ、宗教的な物語を教師から弟子へと受け継いできました。

問題は、これらの名前が3つの異なるデジタル・ライブラリに散らばっており、しかも互いに異なる言語(表記)で書かれていることです。あるライブラリではある男性を「知恵の父」と呼び、別のライブラリでは「オマールの息子、アリの息子、アフメドの息子」と呼び、さらに別のライブラリでは単に「オマール」とだけ記載しているかもしれません。これらはすべて同一人物ですが、コンピュータにはそれが分かりません。

この論文は、これら散在するライブラリを繋ぎ合わせるために構築された、新しい「翻訳機」兼「仲介役」システムについて記述しています。その仕組みを、簡単なステップに分けて説明します。

3つのライブラリ

3つのデータベースを、3つの異なるアーカイブと考えてください:

  1. 物語アーカイブ (Sanadset): 65万件の物語を集めた巨大なコレクションです。誰が誰に物語を伝えたかは記載されていますが、伝承者の伝記情報はありません。これは、パーティーのゲストリストに、写真や生年月日がなく、名前(ファーストネーム)しか載っていないような状態です。
  2. 伝記アーカイブ A (Hawramani): 10万人の伝承者を収録した大規模なディレクトリで、没年や、その人物がどの程度信頼されているかといった詳細が含まれています。
  3. 伝記アーカイブ B (Muslimscholars): 形式が少し異なる、2万5千人の学者をリストアップした、より精選された小規模なアーカイブです。

2段階の照合パイプライン

著者らは、これらのアーカイブを連結させるための2段階のプロセスを構築しました。

フェーズ1:「名前のみ」による推測

物語アーカイブ (Sanadset) には追加の詳細情報(没年など)がないため、システムは名前のみを参照することができます。

  • 課題: アラビア語の名前は非常に複雑です。強調のための装飾的な文字が含まれていたり、綴りが異なっていたり、あるいは記述の順序が違っていたりすることがあります。
  • 解決策: システムはまず、名前を「クリーニング」し、装飾的な記号を取り除き、文字を標準化(例えば、すべてのバリエーションの「A」を一つの標準的な形にするなど)します。
  • 照合: 次に、名前の中にある「バイグラム(2語のペア)」を探します。もし物語アーカイブに「ムハンマド・イブン・イスマイル」とあり、伝記アーカイブにも「ムハンマド・イブン・イスマイル」とあれば、それらは一致します。
  • 結果: このシステムは、物語アーカイブの名前の約**51%**を伝記アーカイブに紐付けることに成功しました。また、これらのリンクに対して「高(非常に確実)」または「中(おそらく確実)」という信頼度スコアを付与しました。

フェーズ2:「探偵」によるクロスチェック

次に、物語アーカイブと伝記アーカイブAが紐付けられた後、システムは伝記アーカイブAと伝記アーカイブBを紐付けようと試みます。

  • 利点: 今回は、より多くの手がかりを利用できます。システムは以下の項目を比較できます:
    1. 名前: 音が似ているか?
    2. 没年: 同時期に亡くなっているか?(これは「ムハンマド」のような一般的な名前を判別する上で非常に大きな手がかりとなります)
    3. 評判: 一方が「信頼できる」とされ、もう一方が「脆弱である」とされているか?
  • 結果: より多くの手がかりがあったため、システムは伝記アーカイブAのエントリの**94.7%**を伝記アーカイブBに紐付けることができました。

大いなる結合

これら2つのステップを連鎖させることで、システムは「推移的」なリンクを作成します。

  • もし、物語アーカイブの名前Aが伝記アーカイブAの名前Bと一致し、かつ伝記アーカイブAの名前Bが伝記アーカイブBの名前Cと一致するならば……
  • 物語アーカイブの名前Aは、伝記アーカイブBの名前Cへと繋がります。

これにより、研究者は物語の中にある単純な名前から、他の2つのソースにある詳細な伝記データを即座に引き出すことができるようになります。

最終成果物:巨大な地図

この研究の究極の結果は、巨大な「有向グラフ(ダイレクテッド・マップ)」です。

  • 18万5千のノード(個々の伝承者)
  • 81万4千のエッジ(教師から弟子への繋がりを示す線)

この地図は今や「拡張(エンリッチ)」されました。以前は単なる繋がりの地図に過ぎませんでしたが、現在は、他のデータベースから取得された追加情報(没年や信頼度グレードなど)が各ポイントにタグ付けされています。

なぜこれが重要なのか(論文による説明)

論文によれば、これまでは研究者たちは、これらのデータベースを孤立した状態で見ていなければなりませんでした。名前が同一人物を指していることをコンピュータが認識できなかったため、異なる書籍間での伝承者の信頼性を簡単に比較することができなかったのです。

この論文は、これらのデータベース間の最初の「大規模な架け橋」を提供しています。著者らはこのデータをオープンリソースとして公開しており、他の研究者がより明確で、より繋がりの強い視点を持って、これらの物語の歴史を研究することを可能にしています。

要約すると: 著者らは、乱れたアラビア語の名前を整理し、2段階の照合プロセスを用いて3つの異なるデータベースを繋ぎ合わせ、伝記の詳細情報が付随した、史上最大のイスラム教の語り手の地図を作り上げたのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →