← 最新の論文
🧬 biology

OmicFormer: a statistical priors–informed transformer for accurate and generalizable omics prediction of diseases and complex traits

OmicFormerは、統計的な事前知識を埋め込むことで複雑な生物学的依存関係を捉える新しいTransformerベースのアーキテクチャであり、多様な疾患予測タスクやオミクスデータセットにおいて、既存の手法を精度と汎用性の両面で大幅に上回っています。

原著者: Weikang Gong, Hanlin Jiang, Chang Yang, Menghan Qin, Jia You, Jianfeng Feng, Jin-Tai Yu, Wei Cheng

公開日 2026-08-04
📖 1 分で読めます☕ さくっと読める

原著者: Weikang Gong, Hanlin Jiang, Chang Yang, Menghan Qin, Jia You, Jianfeng Feng, Jin-Tai Yu, Wei Cheng

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ⚕️ これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む

あなたは未来を予測しようとしているのだと想像してみてください。しかし、それは水晶玉を見るのではなく、生物学的データの膨大なスプレッドシートを見つめる作業です。これが「オミクス」の世界です。そこでは、科学者たちが私たちの体から得られる膨大な測定値のリスト——例えば、血液中に漂う数千のタンパク質や、代謝における数百の化学物質、あるいは脳の配線の詳細なマップなど——を収集しています。これらのリストを、あらゆる本が一冊のあなたの生物学的な断片を表している、混沌とした図書館だと考えてみてください。目標は、これらの本を読み解くことで、将来その人が糖尿病や心臓病などの病気になる可能性を予測し、早期に治療を受けられるようにすること、つまり精密医療(プレシジョン・メディシン)です。

しかし、この図書館を読み解くことは非常に困難です。本は乱雑で、本同士のつながりは複雑であり、情報はしばめて数百ページにわたって散らばっています。長い間、科学者たちはこのデータを整理するために標準的なツールを使用してきました。それは、まるで干し草の山の中から針を見つけ出すための単純なルールブックを使っているようなものです。これらのツールは優秀でしたが、体の異なる部分間の微妙で遠距離にあるつながりを見逃してしまうことがよくありました。データが少し変化したとき、例えばある病院の患者と別の病院の患者を比較するときなどに、彼らは苦戦しました。ここで新しいアイデアが登場します。もし、コンピュータに単に本を読むだけでなく、生物学が実際に機能する隠れたパターンを用いて、それらの本が共に語る「物語」を理解するように教えることができたらどうでしょうか?

これこそが、研究者たちが「OmicFormer」の開発において成し遂げようとしたことです。彼らは、これらの乱雑な生物学的スプレッドシートを理解するために特別に設計された、新しい種類の人工知能(AI)を構築しました。OmicFormerは、すべてのデータを孤立した事実として扱うのではなく、学習を開始する前にデータを整理するための巧妙なトリックを使用します。あなたが新しい言語を学んでいるところを想像してみてください。もし辞書を単にアルファベット順に暗記しようとしたら、言葉同士の関係性を見出すのは難しいでしょう。しかし、もし「コーヒー」と「カップ」のように、よく一緒に使われる言葉が隣り合わせになるように辞書を並べ替えたとしたら、パターンは明白になります。OmicFormerも同様のことを行います。それは、2つの「統計的事前分布(statistical priors)」——これは数学に基づいた賢い推測という意味ですが——を使用して、生物学的データを再配置します。

第一に、各要素が特定の疾患をどの程度予測する可能性が高いかに基づいてデータを整列させます。第二に、複雑な数学的マップ(グロモフ・ワッサーシュタイン最適輸送と呼ばれます)を使用して、タンパク質が同じチームで働くように、自然に共存している生物学的特徴をグループ化します。この整理されたデータを、「Transformer」と呼ばれる強力なAIエンジン(チャットボットが人間の会話を理解するのを助けるのと同じ技術です)に投入することで、モデルは他の手法が見逃してしまうようなつながりを特定することができます。これは、AIに対して単に情報を推測させるのではなく、どの本が関連しているかを示す「図書館の地図」を与えるようなものです。

研究チームはこの新しいAIを、約50万人の情報を含むUKバイオバンクの膨大なデータセットを用いてテストしました。彼らはOmicFormerに対し、タンパク質、代謝、および脳スキャンのデータを用いて、450種類の異なる疾患のリスクを予測し、900種類の異なる健康特性を推定することを求めました。結果は目覚ましいものでした。OmicFormerは、科学者が長年頼りにしてきた人気の高い「決定木ベース」の手法を含む、既存の最高のツールを一貫して上回りました。例えば、タンパク質データを用いた疾患予測において、OmicFormerは次に優れた手法と比較して精度を約3.5%向上させました。これは小さく聞こえるかもしれませんが、希少な疾患や複雑な疾患を予測する世界においては、問題を早期に発見できるか、それとも見逃してしまうかの違いを生むほどの大きな飛躍なのです。

この発見をさらにエキサイティングなものにしているのは、それが現実世界の「乱雑さ」をいかにうまく処理するかという点です。研究者たちは単に学習に使用したデータでテストしただけではありません。彼らは、全く異なるデータセットを投げ込みました。彼らは、Global Neurodegeneration Proteomics Consortiumからの別の人々のグループや、世界中の異なる病院からの脳スキャンを用いてテストを行いました。データがわずかに異なって見えるこれらの「外部」の環境においても、OmicFormerは躓くことがありませんでした。それは既存の手法よりも優れた性能を維持し続け、OmicFormerが単に示された特定の例を暗記したのではなく、生物学の「ルール」を学習したことを示唆しています。これは極めて重要です。なぜなら、医学において、一つの病院でしか機能しないツールはあまり役に立たないからです。

研究者たちはまた、AIが単に推測しているのではないことを確認するために、その意思決定プロセスを調査しました。彼らは、OmicFormerが、心臓病や炎症に関連する特定のタンパク質のように、医師がすでに重要であると知っている生物学的マーカーを強調していることを見出しました。これにより、科学者はAIが真の生物学的信号を見つけているという確信を持つことができます。さらに、彼らは、AIに複数の疾患を同時に見せるように教えること(マルチタスク学習と呼ばれる手法)で、より一般的な疾患から知識を借りることで、希少な疾患の予測精度をさらに高められることを示しました。

要するに、OmicFormerは、生物学的データの自然な構造を尊重し、分析の前に知的に整理することで、より正確で、かつ異なる集団に対しても信頼性の高いAIモデルを構築できることを示唆しています。これは、あらゆる医学的謎をすべて解明したと主張するものではありませんが、私たちの健康の複雑な物語を読み解くための強力な新しい方法を提供しており、幅広い疾患に対するより良い予測と早期介入につながる可能性があります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →