Deciphering the Language of Nature: A transformer-based language model for deleterious mutations in proteins
本論文は、自己注意機構と畳み込み層を組み合わせることでヒトタンパク質における有害なミスセンス変異を予測するトランスフォーマーベースのモデルであるMutFormerを紹介しており、短距離および長距離の配列依存性を効果的に捉えることにより、既存のツールと同等またはそれ以上の性能を示すことを実証している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
あなたの体が、巨大な取扱説明書から作られた、活気に満ちた巨大な都市であると想像してみてください。この説明書は、4つの文字(A、C、T、G)によるコードで書かれており、あなたの細胞が生命を維持するための機械をどのように構築すべきかを教えてくれます。時として、この説明書の中のたった一つの文字にタイポ(誤字)が生じることがあります。ほとんどの場合、これらのタイポは無害です。レシピにおける綴り間違いのようなもので、味には問題ありません。しかし、たまに、そのタイポが極めて重要な材料を変えてしまい、美味しいケーキをレンガに変えてしまうことがあります。タンパク質を作るための説明書における、こうした「タイポ」は、ミスセンス変異と呼ばれます。科学者たちは、危険なタイポを無害なものから見分けるためのデジタル探偵を構築しようと長く試みてきましたが、指示書があまりにも複雑で文脈依存的であるため、それは非常に困難な仕事でした。
この論文で説明されている新しいツールを理解するには、2つのことを知っておく必要があります。第一に、タンパク質はアミノ酸と呼ばれるビルディングブロックの長い鎖です。これらのブロックの順序が、タンパク質の折り畳み方とその機能を決定します。第二に、コンピュータの世界には、「トランスフォーマー」と呼ばれる一種の人工知能があります。スマートなチャットボットや、言葉がどれほど離れていても文中の単語同士がどのように関係しているかを理解する翻訳アプリの背後にある脳として知られているものです。科学者たちは最近、これらの「言語」の脳を生物学の「言語」を読むために使い始め、タンパク質の鎖を文章として、アミノ酸を単語として扱っています。大きな疑問は、人間の言語を学ぶことができたコンピュータは、どの遺伝子のタイポが疾患を引き起こすかを予測できるほど、生命の言語をうまく読み解くことができるのか?ということです。
ここで、研究者であるTheodore T. Jiang、Li Fang、そしてKai Wangによって生み出された新しいデジタル探偵、MutFormerが登場します。彼らは、タンパク質の「文法」を理解するために特別に訓練されたトランスフォーマーモデルを構築することに決めました。MutFormerは、単一の変異を孤立して見るのではなく、タンパク質の全配列を読み取り、近くにあるアミノ酸も遠くにあるアミノ酸も、あらゆるアミノ酸が互いにどのように相互作用しているかに注意を払います。
研究者たちは、まずMutFormerに大規模な学習計画を教えることから始めました。彼らは128,000以上のヒトタンパク質配列をMutFormerに読み込ませました。これには、「正しい」バージョンと、一般の人々に見られる一般的な無害な変異を持つバージョンが含まれています。これは、AIに対して、どれが「間違い」であるかを教えられることなく、タンパク質の文法のルールを学ぶために何百万もの文章を見せるようなものです。このトレーニング中に、MutFormerは欠落した部分やバラバラになった部分の配列を予測することを学び、事実上、生命の「構文(シンタックス)」を学んだのです。
モデルの事前学習が終わると、研究者たちは、どの変異が危険であるかを特定するという具体的なテストをMutFormerに与えました。彼らは、既知の疾患を引き起こす変異と無害な変異のデータセットを使用して、MutFormerを微調整(ファインチューニング)しました。彼らは、モデルに仕事をさせるための3つの異なる方法を実験しました:
- 残基ごと(Per Residue): チェーン内のあらゆるアミノ酸に対して、「安全」か「不安全」かのラベルを貼るようモデルに求める。
- 単一配列(Single Sequence): 変異したタンパク質だけを見せ、「これは全体として壊れていますか?」と尋ねる。
- ペア配列(Paired Sequence): 元のタンパク質と変異したバージョンを並べて見せ、両方を比較して、その変化が有害かどうかを判断するよう求める。
結果は明白でした。ペア配列の方法が最も効果的でした。それは、探偵に元の設計図と変更された設計図の両方を与えて、違いを見つけさせるようなものでした。
しかし、ここからがMutFormerの真に巧妙なところです。この仕事のためのほとんどの既存のAIモデルは、固定された「単語」(アミノ酸のパターン)の辞書を使用していました。MutFormerは、しかし、**畳み込み層(convolutional layers)**を用いた特別なトリックを使用しています。これらは、モデルがタンパク質をスキャンするために使用する、調整可能なレンズのようなものです。あらかじめ用意された辞書に頼る代わりに、MutFormerはトレーニング中に、重要なパターンの独自の「語彙」を自ら学習するために、これらのレンズを使用します。それは、探偵が単に辞書を暗記しただけでなく、タンパク質特有の手書きのスタイルや筆致を認識することを学んだようなものです。
研究者がMutFormerを既存のツール(現在の分野における「探偵」たち)と比較した際、MutFormerは健闘しました。トレーニングデータに似た一般的なデータセットにおいて、MutFormerは既存の最高の手法と同等、あるいはそれ以上の性能を発揮しました。さらに、モデルがほとんどデータを見ていない特定の遺伝子における変異を扱うような、非常に異なるデータセットにおいても、他のトップツールと同等の性能を維持しました。
この論文はまた、MutFormerが単に他のツールの意見を繰り返しているのではないことも示唆しています。進化の歴史(種が数百万年かけてどのように変化してきたか)に依存するEVEというツールとMutFormerの予測を比較したところ、両者は必ずしも一致しないことが分かりました。これは、MutFormerが、進化的なツールが見逃している可能性のある、より直接的な「文法」、具体的にはタンパク質配列の即時的な手がかりを捉えていることを示唆しています。
研究者たちは、Mutiferが強力な新たなプレイヤーではあるものの、すべてを解決する魔法の杖ではないことにも注意深く言及しています。モデルは特定のデータセットでトレーニングされており、学生と同様に、見たことがない問いに対して苦戦する可能性があります。彼らはまた、現在のモデルは主に文字の配列に依存しており、3D構造やメチル化などの他の生物学的要因をまだ完全には組み込んでいないことも指摘しており、将来的にこれらを組み込むことでさらに賢くなれる可能性があるとしています。
要約すると、MutFormerは、タンパク質を言語として扱い、独自の語彙を学習できる洗練された「言語モデル」を使用することで、どの遺伝子のタイポが危険であるかについて、新鮮で強力な視点を得られることを示唆しています。これは、どの遺伝的変異に最も注意を払うべきかを医師や科学者が優先順位付けするのを助け、人間の健康に関するより明確な全体像を提供するための、既存のツールを補完する有望な一歩です。コードとモデルは、他の人々が利用し、さらに発展させられるよう公開されており、この「自然の言語」がいかに解読できるかを確認するための、さらなる実験への扉を開いています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。