FlexRibbon: Joint Sequence and Structure Pretraining for Protein Modeling
FlexRibbonは、アミノ酸配列と3D構造を、マスクされた言語モデリングと拡散ベースのデノイジングの組み合わせを用いて共同で事前学習させる新しいタンパク質基盤モデルであり、多重配列アライメント(MSA)に依存することなく、従来のMSAベースの手法が苦戦する変異の多い領域において、多様なタスクにわたって最先端の性能を達成している。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
タンパク質の世界を、巨大で活気あふれる都市として想像してみてください。長い間、この都市を理解しようとする科学者たちは、二つの全く異なる地図のどちらかを選ばなければなりませんでした。
第一の地図は、文法の教科書のようなものでした。それはタンパク質を構成する文字(アミノ酸)の配列のみに注目し、都市が実際にどのような姿をしているかは無視していました。それは生命の「言語」を理解することには優れていましたが、建物の3D形状を特定しようとすると、道に迷ってしまうことがよくありました。
第二の地図は、クラウドソーシングによる調査のようなものでした。それは、数千もの似たような都市(進化上の従兄弟たち)を見ることに頼り、新しい都市がどのような姿になるかを推測していました。これは標準的な建物については非常に正確でしたが、もし全く新しい、奇妙な形のスカイスクレイパーや、レイアウトが変わりすぎた都市をマッピングしようとすると、比較できる類似の例が存在しないため、その調査は失敗しました。
そこで登場したのが、教科書と調査のどちらかを選ぶのではなく、両方を同時に学ぶことに決めた新しい種類の地図作成者、FlexRibbonです。
秘訣:双方向の道
従来のモデルの多くは一方通行の道のようなものでした。それらは一連の文字を受け取り、その形を推測しようとしました。しかし、FlexRibbonは双方向の道を築きました。文字が形を決定するというだけでなく、形もまた、どのような文字であるべきかを教えてくれるのだということを学んだのです。
これを教えるために、研究者たちは巧妙なトレーニング・ゲームを用いました。彼らはあるタンパク質を取り出し、その3D形状にノイズを加えて(スノーグローブを振るように)かき乱し、モデルにそれをクリーンアップさせました。同時に、配列の中のいくつかの文字を隠し、モデルにそれらを推測させるのですが、ここにはひねりがありました。モデルは、正しい推測をするためのヒントとして、乱れた3D形状を使わなければならなかったのです。これにより、モデルは配列と構造が、切り離すことのできない鍵と鍵穴のように、互いに固く結びついていることを理解せざるを得なくなりました。
なぜこれが重要なのか:「乱れた」部分
真の魔法は、都市の「乱れた」部分で起こります。生物学において、一部のタンパク質は柔軟で、ゆらゆらとした腕(抗体のループなど)を持っていたり、何かに掴みつく際に形を変えたりします。従来の「調査」モデル(進化的な類似関係に依存するもの)は、これらのゆらゆらとした部分において、進化的なデータの中に明確なパターンが見出せないため、しばしば行き詰まってしまいます。
しかし、FlexRibbonはこれらのトリッキーな領域を、異なる方法で処理します。この「従兄弟の群れ」に頼ってパターンを見つける代わりに、FlexRibbonはその調査の必要性を完全に回避します。個々の配列と構造の間の直接的なつながりを直接モデリングすることで、進化的なシグナルが弱い、あるいは欠落している領域であっても、驚くべき精度でこれらの柔軟で高度に変異した領域を予測できるのです。
証拠:12の異なる挑戦
チームは単に「うまくいく」と言っただけではありません。彼らはFlexRibbonが現実世界の課題に対処できるかどうかを確認するために、12の異なるタスクという試練にかけました。結果は以下の通りです。
- 抗体設計: ウイルスに付着する抗体(体の防御因子)を設計するよう求められた際、FlexRibないは標準的な抗体で61.3%、ナノボディ(小さな抗体)で**51.1%の成功率を記録しました。これは、約46.7%と44.0%**で停滞していた従来の最高の手法を大きく上回る数値でした。
- ペプチド結合: 小さなタンパク質鎖(ペプチド)がより大きなタンパク質にどのように付着するかを予測する際、FlexRibbonは**91.4%の成功率を叩き出し、次点の優れた手法を7.0%から10.2%**上回りました。
- 創薬: 薬物分子がタンパク質にどの程度結合するかを推測する際、FlexRibbonは0.848の相関スコアと1.150の誤差率を達成し、テストされた他のすべての手法を凌駕しました。
- 形状変化: このモデルは、薬物が結合したときにタンパク質がどのように形を変えるかも予測でき、あるテストケースでは、実物に極めて近い0.985という構造類似度(TM-score)を達成しました。
それが「行わない」こと
FlexRibbonが行わないことも知っておくことが重要です。それは、古いモデルが予測を行うために使用していた「クラウドソーシングによる調査」(多重配列アラインメント)には依存しません。もし、進化的な従兄弟が非常に少ないタンパク質を与えられた場合、古いモデルはその調査データがないために苦戦するかもしれませんが、FlexRibbonは、配列と構造の直接的なつながりに対する内部的な理解に頼ることで成功します。これにより、アラインメントのシグナルが弱い領域でも進むことができるのです。
結論
この論文は、配列と構造を後から順番に学ぶのではなく、一緒に学ぶようにモデルを教えることで、より柔軟で正確なツールが得られることを示唆しています。これは単に優れた推測器ではなく、より優れた「設計者」なのです。病気と戦うための新しい抗体を作ることでも、薬がその標的にどのように適合するかを解明することでも、配列と構造が互いに会話することを許せば、システム全体がより良く機能することを示すのがFlexRibbonです。
著者らは、CASP15チャレンジやPoseBusters V1データセットといった特定のベンチマークでこれらの結果を測定し、他の手法が躓きやすい、変異の多いトリッキーな領域において、FlexRibbonが常に高いスコアを叩き出していることを明らかにしました。これは、タンパク質を文章を書くのと同じくらい容易にゼロから設計できる未来への一歩です。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。