SciSchema.org: A Multidisciplinary Collection of Schemas for Structured Scientific Process Descriptions
本論文は、多様な分野にわたる科学的プロセスの記述を標準化し、ヒューマン・イン・ザ・ループの開発ワークフローを通じて構造化されたアノテーション、再現性、および研究間比較を可能にするために設計された、16種類の専門家による注釈付きスキーマからなる初の多分野横断的なコレクションであるSciSchema.orgを紹介するものである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
科学は、発見がどのように行われたかを共有するために、常に書き言葉に依存してきました。研究者はジャーナル論文の中で、材料のリスト、機械の設定、そしてステップ・バイ・ステップの指示を文章の中に織り交ぜて、実験を記述します。この手法は、文脈を推論し、欠落を補うことができる人間の読者にはうまく機能しますが、機械にとっては大きな障壁となります。コンピュータは、ある論文での「80度に加熱」が、別の論文での「353ケルビンに維持」と同じ意味であることを理解したり、生物学のラボにおける特定の化学プロセスが、化学のラボにおけるプロセスと同様の論理に従っていることを理解したりすることに苦慮します。科学が自動化され、学際的になり、人工知能システムやロボット実験室がこれらの指示を読み取り実行しようとする中で、科学的手法のための共通の構造化された言語の欠如がボトルネックとなっています。発見の散文を、厳格で機械が読み取り可能な形式へと翻訳する方法がなければ、研究を比較し、結果を再現し、研究を自動化する可能性は、依然としてほとんど活用されないままです。
このギャップに対処するため、大規模な国際的研究チームが、人間とコンピュータの両方が理解できる方法で科学的プロセスを記述するための、新しい構造化テンプレートのコレクションであるSciSchema.orgを導入しました。生物学、物理学、心理学、材料科学など、多岐にわたる分野の専門家で構成されるこのチームは、単にこれらのテンプレートを手作業で作成したのではありません。その代わりに、彼らは、人間の専門家が人工知能モデルを導き、数千もの科学論文をマイニングして、特定の実験の不可欠な構成要素を抽出するという、協調的なワークフローを開発しました。その結果、CRISPR-Cas9を用いた遺伝子編集から素粒子物理学におけるニュートリノ事象の再構成に至るまで、さまざまなプロセスをカバーする16の明確な「スキーマ」、すなわち構造化されたアウトラインが得られました。これらのスキーマは、使用された特定の器具、それらが動作した条件、および取られた正確な手順など、特定の種類の実験に対して記録すべき情報を正確に定義しており、従来の論文の乱雑で非構造化された散文を、クリーンで比較可能なデータへと変貌させます。
プロジェクトは、扱うのに十分な材料があることを保証するために、確立されており、文献の中で頻繁に記述されている16の特定の科学的プロセスを特定することから始まりました。チームは、分子生物学者から心理学者まで、各プロセスに応じたドメイン専門家をガイドとして募集しました。これらの専門家は、自身の分野の標準的な手順の基本記述と、関連する科学論文のコレクションを提供しました。作業の核心は、「ヒューマン・イン・ザ・ループ」システムでした。ここでは、高度なテキスト理解が可能な高度なAIツールである大規模言語モデルが、これらの論文を読み、プロセスのための構造化されたアウトラインを提案する任務を負いました。AIはテキストをスキャンし、温度設定や化学濃度のような繰り返される詳細を特定し、これらの詳細を論理的なカテゴリに整理したスキーマをドラフトしました。
しかし、AIは単独で動いたわけではありません。モデルが初期ドラフトを生成した後、人間の専門家がそれらをレビューし、欠落している詳細を指摘し、用語を修正し、異なる情報がどのようにグループ化されるべきかを提案しました。このフィードバックはAIに送り返され、AIはドラフトを洗練させました。この生成と専門家による修正のサイクルは、AIがより多くの論文を読みながら、いくつかの段階にわたって繰り返されました。このプロセスは反復的に設計されており、AIが専門家の修正から学び、徐々に、より正確で包括的な構造を構築できるようにしました。チームは、どの手法が最良の結果をもたらすかを確認するために、小型で高速なモデルから大規模で複雑なモデルまで、12種類の異なるAIモデルを使用してこのワークフローをテストしました。
この厳格なプロセスの成果として、16の最終的な専門家注釈付きスキーマが作成されました。各スキーマは、特定の種類の科学的プロセスのためのマスターテンプレートとして機能します。例えば、DNAを複製するために一般的に使用される技術である「ポリメラーゼ連鎖反応(PCR)」のスキーマは、使用される生物学的材料、遺伝子プライマーの設計、熱サイクル条件、および得られるデータのための特定のフィールドを定義しています。同様に、「金属材料の疲労試験」のスキーマは、金属の種類、試験片の形状、加えられる力、および環境条件のためのフィールドを概説しています。これらのスキーマは、特定の実験からのデータで満たされているのではなく、科学者が自身のデータを標準化された方法で記録するために使用できる「空のフォーム」なのです。これらのテンプレートを使用することで、研究者は実験のあらゆる重要な詳細が、ソフトウェアによって容易に検索、比較、処理できる形式でキャプチャされることを保証できます。
研究者たちは、最終的なスキーマの品質が、AIと人間の専門家の間のコラボレーションに大きく依存していることを見出しました。AIモデルは複雑な構造を生成し、数百の論文にわたるパターンを特定する能力を持っていましたが、科学的な正確性と適切な用語を確保するためには、人間の指導を必要とすることがよくありました。チームは、AIモデルがより多くの論文とより多くの段階的な専門家のフィードバックにさらされるにつれて、より詳細かつ構造的に複雑になることを観察しました。最も大規模で詳細なスキーマは、最も高度な指示追従モデルによって生成され、それらのモデルは、数百の特定のフィールドと複数の階層構造を持つアウトラインを作成しました。しかし、何が「ゴールドスタンダード」の構造であるかという最終決定は、常に人間の専門家に委ねられ、彼らがAIの様々なドラフトから最良の要素を選択して最終版を作成しました。
この研究の主要な発見の一つは、この人間とAIのパートナーシップが、伝統的な手動の方法よりもはるかに速く、高品質でドメイン固有のスキーマを生み出せるということでした。チームは、専門家が数千の論文からあらゆる詳細を手作業で抽出して整理する必要があった場合に不可能であった期間である、わずか2ヶ月間で16の全スキーマを開発し、検証することに成功しました。また、このプロセスは、科学的プロセスによって必要な詳細レベルが異なることも明らかにしました。心理学において反応時間を測定するために使用される「ストループ・タスク」のようなプロセスは、実験のより単純で標準化された性質を反映して、フィールドが少なくネスト(階層化)も少ないスキーマとなりました。一方で、生物学における「バルクRNA-seqライブラリ調製」のようなプロセスは、ウェットラボの手順の複雑で多段階な性質を反映して、深い階層構造を持つ非常に複雑なスキーマとなりました。
公開されたコレクションには、最終的なスキーマだけでなく、それらがどのように作成されたかという履歴全体も含まれています。データアーカイブには、AIによって生成された中間ドラフト、専門家によるフィードバック、およびプロセスに使用された論文のメタデータが含まれています。この透明性により、他の研究者はスキーマがどのように構築されたかを正確に把握し、特定の設計上の選択の背後にある理由を理解し、自身のプロジェクトのために素材を再利用することができます。スキーマは2つの形式で提供されています。一つは標準的なコンピュータ文書用に設計されたものであり、もう一つは、異なる情報源間でデータを連結するために使用されるネットワークであるナレッジグラフ用のものです。この二重の形式により、単純なデータ入力フォームから複雑な科学データベースに至るまで、幅広いソフトウェアシステムで使用できることが保証されます。
この研究の意義は、科学的知識の保存と共有の方法を変える可能性にあります。科学の「どのように(How)」を記述する構造化された方法を提供することで、SciSchema.orgは、テキストベースの検索の限界を超えることを可能にします。研究者は、特定のキーワードに言及している論文を探す代わりに、元の著者が散文の中でどのように記述したかにかかわらず、特定の器具、条件、および材料の組み合わせを使用したすべての実験を、最終的には検索できるようになります。この能力は、複雑な世界の課題を解決するために、実験の比較、再現、および自動化が不可れるとなる科学の未来にとって不可欠です。このプロジェクトは、人工知能が情報を整理するための強力なツールである一方で、人間の専門知識によって導かれるときに最も効果的であり、その相乗効果によって科学の実践のニュアンスと深さを、機械が読み取り可能な形式で捉えることができるということを示しています。
チームは、これらのリソースをオープンライセンスの下で、スキーマ、生成に使用されたコード、および分析ツールとともに、一般に無料で公開しました。これにより、科学コミュニックがこの基盤の上に構築し、他のプロセスに対する新しいスキーマを追加したり、既存のものを洗練させたりできることが保証されます。プロジェクトには、これらの構造化された記述を元の科学論文に直接リンクさせるシステムである「Open Research Knowledge Graph」への接続も含まれており、発見の生のテキストと、再現性のための構造化されたデータとの間の架け橋を築いています。そうすることで、SciSchema.orgは、科学の手法が、その結果自体と同様にアクセス可能で、比較可能で、再利用可能である未来への実用的な一歩を提供しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。