A human-validated procedure for linking PhD dissertation metadata to OpenAlex author profiles
本論文は、文字レベル、トピック、およびトランスフォーマーベースの類似度尺度を組み合わせることで、博士論文のメタデータをOpenAlexの著者プロファイルに確実に紐付け、学術的なキャリアの軌跡を追跡する高い精度を実現し、北米の博士号取得者の約17.3%がその後の出版物に紐付けられないことを明らかにする、汎用性があり人間によって検証された手法を提示し、検証するものである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
毎年、世界中で何十万人もの学生が博士号を取得しており、これは彼らが研究の世界へと正式に足を踏み入れたことを示す節目となります。数十年にわたり、学術的なキャリアがどのように展開するかを研究する科学者たちは、次に何が起こるかを教えてくれる特定のグループ、すなわち論文を執筆し続ける人々に頼ってきました。これらの発表された著作物を追跡することで、研究者たちは科学者がどの程度の期間活動し続け、どれほど生産的であり、どのようにキャリアを進展させていくのかという全体像を構築してきました。しかし、この全体像には重大な盲点が存在します。それは、論文を執筆し続けた人々しか含まれていないということです。学術的な出版の世界から完全に離れた人々、例えば産業界、政府、あるいは教育分野へ転身した人々、あるいは単にジャーナルへの執筆をやめた人々が抜け落ちているのです。これらの個人は、科学的成果を追跡するために使用される標準的なデータベースには現れないため、博士号の真の影響力を理解しようとする研究において、事実上「見えない存在」となっています。誰が欠けているのかを知ることなしには、キャリアの成功や離職に関するいかなる推定も、論文発表を継続するという要件によってすでにフィルタリングされたサンプルに基づいたものになってしまいます。
この問題を解決するために、研究チームは、博士論文とその著者のその後のキャリアを、たとえその著者が二度と論文を発表しなかったとしても、結びつける新しい方法を開発しました。彼らは、学位の記録とキャリアの記録の間に存在する巨大な溝に焦点を当てました。その課題は極めて困難です。博士論文はその分野におけるその人物の唯一の記録である場合が多く、また、数百万の科学論文を含むデータベースには、共通の名前を持つ人々が溢れているからです。2009年の論文に登場する「ジョン・スミス」という研究者が、2015年に論文を発表した「J. スミス」と同じ人物である可能性もあれば、全くの別人である可能性もあります。この困難さは、多くの卒業生が名前を変更したり、異なるイニシャルを使用したり、あるいは名前のわずかに異なるバリエーションで発表したりするという事実によってさらに増幅されます。従来の手法は、単純な名前の一致付けや、すでに自身の研究を紐付け済みのボランティアに頼ることが多く、どちらの方法も、出版の世界に留まらない「沈黙の多数派」である卒業生を捉えることはできませんでした。
研究者たちは、博士論文の詳細をOpenAlexと呼ばれる世界の科学出版物データベースにある数百万件の潜在的な一致対象と比較する、高度な技術を持つ司書のような役割を果たすコンピュータ化されたシステムを作成することで、この問題に取り組みました。システムは単に名前を見るだけでなく、博士論文のタイトルと発表された論文のタイトルを読み込み、それらを小さなテキストの断片に分解して、どの程度重複しているかを確認します。また、高度なテクノロジーを用いて、研究の根底にあるトピックを理解し、「機械学習」に関する論文が、たとえ言葉が異なっていても「人工知能」というタイトルの論文と関連していることを認識します。システムは、その論文を書いた人物が論文を書いた人物である可能性を示すスコアを生成します。このシステムが機能することを確認するため、研究者たちは人間の専門家に数千件の潜在的な一致対象をレビューさせ、コンピュータの推測が正しいかどうかを検証しました。その結果、テキストのマッチングとトピック分析を組み合わせることで、システムが異なる記録間で同一人物を高い精度で確実に特定できることが分かりました。
この新手法による結果は、学術労働力に関する驚くべき現実を明らかにしています。研究者たちがこのシステムを北米の博士号取得者の大規模なグループに適用したところ、これらの個人のかなりの割合が、データベース内のその後の出版物と結びつかないことが判明しました。具体的には、典型的な博士号取得者のコホート(集団)において、10.2%から20.7%の範囲で、学位取得後に主要な書誌データベースに一度も登場しない者がいると推定されており、最善の推測値は17.3%です。これは、博士号取得者の約5人に1人が、標準的な科学的キャリアの地図から欠落していることを意味します。このグループは必ずしも失敗しているわけではなく、他の分野で成功している可能性もありますが、彼らの不在が、科学的キャリアの全容に関する理解を歪めています。また、「出版の記録から消える」割合は時間の経過とともに上昇することも示されました。学位取得の直後には約73%の卒業生が依然として論文を発表していますが、その数字は15年後には約50%にまで低下します。論文を一度も発表しなかった卒業生を含めると、この減少はさらに急激になり、多くの研究者が限られた期間のみ科学的文献に貢献していることを示唆しています。
研究者たちはまた、現代の人工知能が彼らの構造化されたコンピュータシステムを代替できるかどうかをテストしました。その結果、大規模言語モデルは非常に高い確信を持っている場合には非常に正確な判断を下せるものの、専用のスコアリングシステムと比較すると、処理速度が遅く、グループ全体にわたる一致を見つけ出す能力においてもわずかに劣ることが分かりました。最も効率的なアプローチは、高速で特化したシステムを使用してすべてのデータをスキャンし、最初のシステムが確信を持てない場合にのみ、人工知能を使用してダブルチェックを行うことであると彼らは示唆しています。この二段階のプロセスにより、複雑なモデルですべての記録をチェックするという時間とコストの負担を負うことなく、データの包括的な把握が可能になります。
結局のところ、この研究は単にデータ照合の技術的な問題を解決するだけでなく、学術的なキャリアの物語を変えるものです。出版を行わない卒業生を考慮に入れることで、本研究は博士課程の訓練の結果について、より誠実で完全な姿を提供しています。それは、PhD(博士号)の後の道が、これまでのデータが許容してきたものよりもはるかに多様であり、かなりの数の人々が学術雑誌への発表を伴わない役割へと移行していることを示しています。ここで開発された手法はオープンであり、他の分野や国にも適用可能であり、政策立案者や研究者が毎年博士号を取得する何百万人もの人々の真の行方を理解するための新しいツールを提供します。それは、論文の終わりが必ずしも科学的キャリアの始まりではないことを、そして博士号の価値はジャーナルのページを遥かに超えて広がっていることを私たちに思い出させてくれます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。