← 最新の論文
📊 statistics

The name-collision burden of name-based author attribution is unequal across name origins: a measurement in OpenAlex, and an identifier-based remedy (SigmaCV)

本研究は、OpenAlexデータベース内において、東アジアの研究者が英語圏およびその他の研究者と比較して著しく高い名前の衝突(ネーム・コリジョン)の負担に直面していることを定量化しており、名前に基づく属性付与が本質的に不平等であることを示し、公平な研究評価を確実にするためのSigmaCVのような識別子ベースの解決策の採用を提唱するものである。

原著者: Basile Chrétien

公開日 2026-07-17
📖 1 分で読めます☕ さくっと読める

原著者: Basile Chrétien

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

技術要約:OpenAlexにおける名前の衝突負担と、その救済策としてのSigmaCV

問題提起
責任ある研究評価は、学術的成果を特定の研究者に正しく帰属させることに依存している。しかし、現在の慣行の大部分は依然として、永続的識別子(PID)ではなく、氏名の文字列に基づいて帰属を行っている。この手法は、一般的な姓や、非ラテン文字からのローマ字表記(特に東アジア系の名前)に対して系統的な失敗をもたらす。これは「名前の衝突(name collisions)」を引き起こし、複数の異なる研究者エンティティが同一の正規化された名前を共有することになる。本論文は、この曖昧さが対称的ではないと断じている。すなわち、名前の衝突による負担は東アジア系の研究者に不均衡に重くのしかかっており、これが不平等な評価を生む構造的な前提条件となっている。先行研究は、この影響の方向性を確立したが、本論文の目的は、オープンな学術データにおけるORCID保有著者全体において、その負担の大きさを定量化することである。

方法論
本研究では、2026年3月時点のOpenAlexデータベースの完全なスナップショット(約1億1,360万件の著者エンティティを含む)を利用する。分析は、このスナップショットに含まれる約463万人のORCID iDを持つ著者に焦点を当てる。

  • 集団の層別化: 著者は、最終的な所属機関の国に基づき、以下の3つのグループに層別化される。

    • 東アジア: 日本、中国、韓国、台湾、香港。
    • アングロフォン(英語圏): 米国、英国、オーストラリア、カナダ、ニュージーランド、アイルランド。
    • その他: 欧州大陸およびブラジル(粗いラテン文字表記のベースラインとして機能)。
    • 注記: 国は名前の起源およびローマ字表記への露出のプロキシ(代理指標)として使用されており、自己申告による民族性ではない。
  • マッチング演算子: 著者らは、3つの異なる帰属戦略における衝突数を算出するために、透明性の高い、自己定義された完全一致演算子(小文字化、アクセント除去、空白の集約)を定義している。

    1. フルネーム・エンティティ数(上限値): 同一の正規化されたフルネームを共有するOpenAlexの著者エンティティ数。これには、データベースによる過剰な分割が含まれる可能性がある。
    2. ORCID限定数(保守的な下限値): フルネームの一致のうち、ORCIDも保持しているサブセット。異なるORCIDは異なる実在の人物を表すため、これは同一の名前を共有する「異なる実在の個人」の数に関する保守的なプロキシとなる。
    3. イニシャル+姓(レガシーな最悪ケース): 同一の姓名イニシャルと姓を共有するエンティティ数。これは、名前文字列のみによるマッチング(例:レガシーな引用スタイル)における最悪のシナリオを表す。
  • 統計分析: 本研究は、サンプリングによる推定値ではなく、正確な母集団統計(中央値、四分位範囲、90パーセンタイル)を算出する。集団間の効果量を測定するためにランク・バイシリアル相関係数(rr)を用い、出版量、分野、キャリアの長さを調整するために負の二項回帰を用いる。

主な結果
研究の結果、名前の衝突負担は名前の起源によって大きく、かつ鋭く不平等であり、帰属戦略が具体的でなくなるほどその格差は拡大することが判明した。

  • ORCID限定戦略(実在の人物のプロキシ):

    • 東アジア系の研究者の名前の中央値は、3人の異なる実在の人物と重複している(IQR 1–17)。
    • 対照的に、アングロフォンおよび「その他」の研究者の名前は一意である(中央値 1)。
    • 東アジア系研究者の10.5%は、少なくとも100人の異なる実在の人物と名前が重複しているが、アングロフォンでは0.9%、その他では0.1%である。
    • 効果量は大きい(アングロフォンに対して r=0.49r = -0.49、その他に対して r=0.55r = -0.55)。
  • フルネーム・エンティティ戦略:

    • 東アジア系の研究者の中央値は9つのエンティティと一致する(他は1)。これは、実在の衝突とデータベースによる過剰な分割の両方を反映している。
  • イニシャル+姓戦略(レガシーな最悪ケース):

    • ここで格差は最も極端になる。東アジア系の研究者の中央値は、4,846の異なるアイデンティティと衝突する(IQR 1,240–16,548)。
    • この戦略の下では、東アジア系研究者の92.3%が少なくとも100のアイデンティティと衝突する。
    • アングロフォンおよび「その他」の中央値は、それぞれ69および34である。
    • 効果量は非常に大きい(r=0.71r = -0.71 および r=0.74r = -0.74)。
  • 頑健性の検証:

    • 出版量: 出版数によって調整した負の二項回帰の結果、東アジア系の層は、アングロフォンの層と比較して、期待される衝突数の約6.5倍から8.6倍の負担を依然として負っている。この格差は、東アジア系著者の生産性の高さによるアーティファクトではない。
    • 感度分析: 国ではなく姓によって著者を再分類すると、観察された格差はより強固なものとなり、国を用いたプロキシが保守的であることを裏付けている。

貢献

  1. 名前の曖昧さの定量化: 本論文は、オープンな学術データにおける名前の衝突負担を、初の直接的な全集団レベルでの定量化を行ったものである。論文は、この負担を3つの層(フルネーム・エンティティ、ORCID限定の実在の人物、イニシャルに基づくレガシーな一致)に分解し、ローマ字表記された東アジア系の名前にとって、イニシャルに基づく帰属が単なる些細な問題ではなく、カテゴリー的な失敗であることを示している。
  2. SigmaCV: 著者らは、名前ではなく永続的識別子(ORCID)によって学術的履歴書(CV)を組み立てる、オープンソース(Apache-2.0)のFAIRなウェブアプリケーションであるSigmaCVを提示している。これは、「帰属は名前の曖昧さを避けるために識別子にアンカーされるべきである」という原則の、展開された実装例である。

意義と主張
本論文は、名前の曖昧さを測定しているが、これは不平等な帰属をもたらすための「必要条件」であることを明記しており、これを「実証された評価への実害」とは明確に区別している。

  • 主張の範囲: 著者らは、名前の衝突負担(リスクへの露出)を測定しているのであり、そのダウンストリームの結末(例:特定の引用の歪みや評価結果)を測定しているのではないと述べている。彼らは、大きく不平等に分配された負担は、インフレ化した指標や誤った帰属による引用を可能にし、それによって研究評価の公平性を脅かす可能性があると主張している。
  • 救済策: 論文は構造的な解決策を提唱している。すなわち、帰属を名前の文字列から永続的識別子へと移行することである。これは、OpenAlex、Scopus、Web of Science、およびORCIDによって実装されている分野のコンセンサスであり、新しい発明ではないことを強調している。
  • 限界と公平性のトレードオフ: 著者らは、対象となる集団がORCID保持者に限定されていることを認めており、提案された救済策(識別子に基づく帰属)は、現在識別子を保持している人々に恩恵をもたらすと述べている。ORCIDの採用状況は世界的に一様ではないため、識別子によるアンカリングは、特定された人々については名前の曖昧さ問題を解決するものの、「識別子を保持しなければならない」という新たな要件へと公平性の格差を移行させる可能性がある。彼らは、これがすべての研究者に対する完全な解決策であると主張しているのではなく、特定された集団にとって必要な是正措置であると主張している。

要約すると、本論文は、名前による帰属が東アジア系の研究者に対して、アングロフォンやヨーロッパの対照群と比較して、系統的に高い衝突リスクを生み出しているという実証的な証拠を提供しており、公正な研究評価を実現するための、SigmaCVのような識別子ベースのシステムへの移行を動機付けている。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →