Tree-aware conditional language modeling recovers mutational patterns of viral evolution
本論文は、系統学的コンテキストを統合することでウイルスの変異パターンと系統特異的な進化の軌跡を正確に予測し、実験的な機能的制約との強い整合性を示す、樹形構造を考慮した条件付き言語モデルであるevoPLM-Treeを提案している。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
ウイルスは変化の達人です。彼らは、感染する宿主の免疫系を回避するために、自身のタンパク質のパーツを入れ替えながら、自らの遺伝的指示書を絶えず書き換えることで生き延びています。このプロセスはランダムな混沌ではなく、一つの経路に従っています。あるウイルスにとって今日役立つ変異が、その特定の家系ですでに起こった他の変化によっては、明日には役に立たなくなったり、あるいは有害になったりすることさえあります。科学者たちは、タンパク質の言語を読み解き、特定の単語が他の単語よりもうまく組み合わさる文章のように扱うコンピュータモデルを用いて、これらの変化を予測しようと長年試みてきました。しかし、これらのモデルの多くは、最終的な結果のみに注目し、その過程には注意を払いません。彼らは目的地は見ているものの、ウイルスがそこに到達したまでの地図を見ておらず、ウイルスの歴史が次に安全に行える変化を形作っているという事実を見落としているのです。
研究チームは、この問題に対する新しいアプローチを開発しました。それは、コンピュータに家族の系譜(ファミリーツリー)に注意を向けるよう強制するものです。彼らは、進化を理解する言語モデルとして機能する「evoPLM-Tree」と呼ばれるシステムを作り上げました。このモデルは、単にタンパク質の配列がどのようなものかを推測するのではなく、祖先となるウイルスの配列と特定の系統樹を起点として取ります。そして、ウイルスが時間の経過とともにどのように変化してきたかという歴史をガイドとして使い、系統における次のステップを予測することを学習します。研究者たちは、SARS-CoV-2ウイルスのスパイクタンパク質(ウイルスがヒト細胞に侵入することを可能にする部分)を用いてこの手法をテストしました。彼らは、系統樹(異なるウイルス株間の進化関係をマッピングした図)における位置に基づき、オミクロン株の初期バージョンの配列とその祖先を組み合わせました。
チームがモデルに子孫の配列を生成するよう求めたところ、標準的なモデルでは到達できないレベルの精度を発揮しました。進化の文脈をモデルに与えることで、コンピュータは一般的なパターンに基づいて推測するのではなく、実際の入力情報に大きく依存していることが研究者によって判明しました。モデルが作成した配列は単なるランダムな変異ではなく、現実の世界で実際に変異が起こるタンパク質上の特定の箇所を正確に再現していました。モデルによる、異なる位置における変異の出現頻度の予測は、観察されたデータと強い相関を示しており、コンピュータが予測したものと自然が実際に行ったこととの間に明確なつながりがあることを示しました。これは、スパイクタンパク質全体と、ウイルスがヒト細胞に結合する部分である受容体結合ドメイン(RBD)の両方において当てはまりました。
また、この研究では、ウイルスが開始点から時間の経過とともにどれほど遠くへ移動した際に、予測がどの程度維持されるかについても調査されました。進化の距離が大きくなるにつれて、モデルは一文字単位の正確な変化を予測する精度は低下したものの、タンパク質全体の変化の全体的なパターンを捉える能力は極めて高いままでした。これらのパターンが現実的な意味を持つかどうかを確認するため、研究者たちは、ウイルスが壊れることなく耐えられる変異をテストした実験室での実験と比較しました。モデルが高確率であると割り当てた変異は、科学者がすでにラボの設定で生存可能であることを確認していた変異と同じものでした。モデルは、学習中に実験データを一度も示されていなかったにもかかわらず、ウイルスがヒト細胞への結合能を維持することを可能にする変異を特定することに成功しました。
この研究は、コンピュータモデルにウイルスの家族の歴史という明確な視点を与えることで、その系統の進化に関する固有のルールを学習できることを示しています。祖先の経路を明示的に含めることにより、モデルはその系統の進化を定義する独自の変異パターンを復元することができます。この結果は、このアプローチがタンパク質の進化を理解するための信頼できる枠組みを提供し、すでに存在するゲノムデータに基づいて、将来どのような変異が現れる可能性が最も高いかを科学者が優先順位付けするのに役立つことを示唆しています。それは、ウイルスが単に何になる可能性があるかだけでなく、祖先の実際の歴史に基づいた上で、どのようにそこに到達する可能性が高いかを見るための方法を提供しているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。