Context-aware LLM extraction and controlled-vocabulary normalization of GEO transcriptomic sample metadata
本論文は、非構造化されたGEOトランスクリプトミクス・メタデータを、組織、条件、および治療に関する構造化された制御語彙ラベルへと抽出・正規化する、ローカル展開可能な大規模言語モデルパイプラインを提示するものであり、高い精度を実現し、決定論的なマッチング手法を大幅に上回る性能を示している。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
現代生物学の膨大なアーカイブには、健康な人と疾患を持つ人の細胞内で遺伝子がどのようにオン・オフされるかを捉えた、分子レベルでの生命の瞬間を記録した数百万ものスナップショットが含まれている。Gene Expression Omnibusのような公開リポジトリに保存されているこれらの記録は、科学者が数千の研究にわたってパターンを検索できる共有ライブラリとなることを目的としている。しかし、このライブラリの有用性は、長らく単純な問題によって阻まれてきた。それは、各サンプルに付随するメモが、人間の言語の混沌とした混在状態で書かれていることである。ある研究者はサンプルを「乳房腫瘍(breast tumor)」と記述し、別の研究者は「乳腺癌(mammary carcinoma)」と書き、また別の研究者は、自身のラボ内でのみ意味を成す不可解な略語を使用することもある。これらの記述は非構造的で一貫性がないため、特定の疾患や組織型に関連するすべてのサンプルを見つけ出すことは、あらゆるタイトルの本が異なる方言で書かれ、棚のあちこちに散らばっている図書館の中で、たった一冊の本を探し出すようなものである。
これを解決するために、オクラホマ医療研究財団のマテウス・シュチェパニャクとジョナサン・レンは、これらの生物学的記録の「ユニバーサル翻訳機」として機能する新しいシステムを構築した。彼らは、80万件以上のヒトサンプルの付随する乱雑な自由形式のテキストを読み取り、クリーンで標準化されたラベルに変換するように設計された、ローカルで動作する人工知能パイプラインを開発した。このシステムは、3つの重要な情報、すなわち、サンプルが由来する組織、患者または生物の状態、およびサンプルが受けた治療に焦点を当てている。単にテキストを読み取るだけでなく、システムは研究全体の文脈を理解し、単一のメモでは欠落している可能性のある詳細な情報を補完することができる。情報を抽出した後、システムはすべてのラベルを制御された語彙に紐付け、「乳がん(breast cancer)」と「乳腺腫瘍(mammary tumor)」が同じものであると認識させると同時に、まだ標準的な名称がない用語もグループ化する。
研究者らは、大規模なヒトサンプルのデータセットを用いてこのシステムをテストし、情報が利用可能な場合にはほぼすべてのケースで組織タイプを特定することに成功し、厳密にチェックされたベンチマークにおいて99.7パーセントに近い精度を達成した。疾患や状態の特定については、約95パーセントの確率で正解を出した。おそらく最も重要な点は、システムが単に推測したのではなく、研究のより広い文脈を利用して曖昧さを解消したことである。もし単一のサンプルメモに疾患の指定なしに「コントロールグループ(対照群)」とだけ書かれていた場合、システムは研究全体の設計や、その実験内の他のサンプルのラベルを確認することで、欠落している文脈を正しく推論した。このステップにより、システムは、当初「未指定」とされていた組織ラベルの4分の3以上に対して、欠落していた情報を復元することができた。
この研究の主要な特徴は、既存の医学辞書に適合しない用語の扱い方にある。奇妙な、あるいは独特な用語を、不適切なカテゴリーに無理やり押し込むのではなく、システムはこれらの「語彙外(out-of-vocabulary)」の概念を、その類似性に基づいてグループ化する。これにより、元の研究の具体的な詳細を保持しながら、データを検索可能にしている。チームはまた、機密データを外部サーバーに送信することなく、ローカルコンピュータ上でシステムを実行できるようにし、プロセスの透明性と再現性を確保した。数百万の非構造化されたメモを構造化され検索可能なデータに変換することで、このパイプラインは科学的発見の大きな障壁を取り除く。これにより、研究者は異なる研究からのデータを容易に組み合わせ、疾患がどのように作用するかについての新たな洞察を見出すことが可能になり、断片的なメモのコレクションを、科学界全体にとって一貫性のある利用可能なリソースへと変貌させるのである。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。