RegimeFormer: A Large Protein Model of Global Perturbation Regimes
RegimeFormerは、2億を超える配列を含む関連データベースであるRegimeAtlasを通じて、残基レベルの変異効果を予測し、特に未知のタンパク質やファミリーに対するダウンストリームの生物学的モデリングを向上させるためのグローバルな摂動レジームを確立する大規模タンパク質モデルである。
原著者: Ma, S., Chai, Y., Wu, Y., Zhang, Q., Yuan, Y., Zhao, K., Chen, Z., Wang, H., Cao, S., Yu, X., Han, X., Liu, Y., Liu, Y., Zhu, T., Tao, D.
原著者: Ma, S., Chai, Y., Wu, Y., Zhang, Q., Yuan, Y., Zhao, K., Chen, Z., Wang, H., Cao, S., Yu, X., Han, X., Liu, Y., Liu, Y., Zhu, T., Tao, D.
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ⚕️ これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
技術要約: RegimeFormer および RegimeAtlas
問題提起
タンパク質配列空間は広大であり、公開リソースには数億もの配列が記録されているが、実験的にアクセス可能な部分は極めて限定的である。深層変異スキャニング(DMS)やマルチプレックス・アッセイは、変異の影響が高度に不均一であることを明らかにした。すなわち、ある位置は変化を許容する一方で、別の位置は制約を受けており、さらに一部の位置は有益な置換を支持する。しかし、これらの実験的なマップは疎であり、特定のタンパク質やプロトコルに紐付いており、グローバルな配列宇宙へとスケールアップすることはできない。
進化ベースのモデル(例:DeepSequence, EVE)やタンパク質言語モデル(PLM)といった既存の計算手法は、相同配列から置換の適合性を推論したり、大規模な表現を学習したりすることで、このギャップを縮小させてきた。構造を考慮したモデルは局所的な幾何学的コンテキストを改善するが、数億のタンパク質というスケールにおいて、依然として未解決の重要な問いが残っている。「変異ランドスケープ全体が、再現可能なグローバルな状態(レジーム)を占有しており、それが、あるタンパク質では許容される摂動がなぜ別のタンパク質では不安定化をもたらすのかを説明しているのか?」 現在の手法には、ファミリーや分類群を超えて、残基レベルの脆弱性、適応性、および不確実性を整理するための、タンパク質レベルで定義された座標系が欠けている。
手法
1. RegimeAtlas: グローバルな配列基質
著者らは、UniProtKB、NCBI RefSeq、Ensembl/GENCODE、MGnify、およびメタゲノムソースから得られた4億2,400万件の生レコードから抽出された、202,556,313個の非冗長なタンパク質配列からなる調和されたデータセット、RegimeAtlasを構築した。
- 処理: 不適切なアルファベット、短い断片、および冗長なレコードを除去した。タクソノミー(分類)は96.73%のエントリに対して解決された。
- 表現: Atlas内のタンパク質は、学習済みESMファミリーエンコーダを用いて埋め込まれ、連続的なタンパク質レジーム空間へと投影された。この空間は、従来のPfamやタクソノミーのようなグループ化とは異なり、分類学的およびファミリー間の境界を横断する摂動状態を捉える。
- レジーム信号の検証: コントロール分析により、レジーム信号が、長さのみ、シャッフルされた埋め込み、ランダムなトークン、アミノ酸組成、および種のみの特徴による信号を上回ることが確認された。レジーム座標は、従来の共変量よりも、摂動の読み出しにおける分散を有意に多く説明する。
2. RegimeFormer: 摂動モデル
RegimeFormerは、RegimeAtlasから抽出された多様性を保持する1,000,000個のタンパク質のサブセットで学習された、大規模なタンパク質摂動モデルである。これは、置換特異的な影響と残基レベルのサマリーを予測するように設計されている。
- アーキテクチャ: モデルは以下を組み合わせている:
- 残基レベルのPLM表現 (hi)。
- 野生型および変異型アミノ酸の埋め込み。
- タンパク質レジーム座標 (zregime)、これはグローバルなコンテキスト・プライアとして機能する。
- アッセイ・コンテキスト (qassay) およびオプションの構造的/進化的特徴。
- メカニズム: レジーム認識型のアテンション・ブロックとアッセイ・コンディショニング(FiLM様)を利用して、以下を生成する:
- 置換特異的な効果サイズと不確実性。
- 3クラス分類(有害、許容、有益)。
- 残基レベルのサマリー: 脆弱性(有害な影響が生じる傾向)、適応性(有益または許容される影響の可能性)、および予測不確実性の集約されたトラック。
3. スケーリングと推論
モデルは、995,995個のタンパク質をカバーする407,048,356個の残基の高解像度マップを生成するためにスケールアップされた。
- ストレージ戦略: すべての残基に対して完全な L×19 置換行列を実体化させることは、ストレージ容量の観点から不可能であるため、システムは残基レベルのサマリー(脆弱性、適応性、不確実性)とトップ-Kサイトを保存する。完全な置換行列は、特定のクエリに対してオンデマンドで生成される。これにより、オフライン計算とのほぼ完璧な一致を維持しながら、ストレージ要件を2桁以上削減している。
主な結果
1. 残基レベルの感受性の整理
学習されたレジーム空間は、残基レベルの機能的制約を整理する:
- 機能的濃縮: 高い脆弱性を持つ残基は、活性部位(OR 11.3)、リガンド結合部位(OR 6.1)、タンパク質間相互作用界面、疾患関連ポジション、および保存されたモチーフに強く濃縮されている。
- 連続的な勾配: 変異感受性は、脆弱なレジームから適応的なレジームへと単調に減少する。この連続的な座標は、カテゴリカルなビンによって圧縮されてしまう中間状態を解決する。
- 予測器の困難性: レジーム軸は、確立された変異効果予測器(例:ESM, EVE)のエラー率と相関している。予測器は「脆弱」なビンにおいて最も高いエラーを発生させ、レジーム座標はこれらの失敗モードを予測できる(AUROC 0.861)。
2. 実験的ランドスケープの再構成
RegimeFormerは、217の置換アッセイと186のDMSタンパク質に対して評価された:
- 性能: 合計Spearman相関係数 0.698 を達成し、最高性能の教師ありベースライン(AUTOSCIENTISTS, ρ=0.700)に匹敵し、ゼロショットおよび埋め込みのみのベースラインを上回った。
- 分布外(OOD)への汎化: モデルは、厳格なOOD設定において堅牢性を示した:
- 未知のタンパク質: イン分布の性能の約82%を維持。
- 未知のファミリー: 約62%を維持。
- 低相同性(同一性 <30%): 約38%を維持し、低相同性範囲においてPLMのみやトポロジーベースの手法を大幅に上回った。
- アブレーション: タンパク質レジーム座標を除去すると性能が低下し、レジームが、特に局所的な配列近傍が疎な場合に、重要なコンテキスト・プライアとして機能していることが確認された。
3. 構造的および進化的制約との整合性
- 構造的整合性: AlphaFold DBの構造を持つ988,600個のタンパク質の検証セットにおいて、レジームの証拠はpLDDTと相関した(Spearman ρ=0.375)。脆弱性が高いタンパク質は低信頼度(低pLDDT)領域に、適応性が高いタンパク質は高信頼度領域に濃縮されていた。
- 進化的整合性: 保存スコア(phyloP)は、脆弱なレジームから適応的なレジームへと単調に増加した(ρ=0.59)。これにより、レジームが特定のコドンモデルとは独立して進化的制約を捉えていることが確認された。
- 領域間の一貫性: レジーム座標は細菌、古細菌、真核生物、およびウイルス間で一般化されるが、菌域(Kingdom)によって中央値がシフトするため、タクソノミーのラベルではなく、クロス種的な座標であることが支持された。
4. 細胞応答への架け橋
著者らは、タンパク質摂動マップを細胞の出力へと拡張した:
- トランスクリプトミクス: RegimeFormerは、摂動に対する遺伝子発現の変化(SciPlex3, Norman, Dixitデータセット)の予測において、ベースラインと比較してRMSEを減少させ、トップ50の差発現遺伝子(DEG)の回収率を向上させた。
- 薬物応答: PRISM薬物応答ベンチマークにおいて、モデルはランダム分割および未知の細胞株に対して高い R2 を達成した。しかし、未知の化合物に対しては性能が著しく低下した(R2=0.038)。これは、タンパク質としてのプライアは強力であるが、遠く離れた化学空間への応答を予測するには追加の化学的表現が必要であることを示唆している。
意義および主張
本論文は、グローバルな配列空間におけるタンパク質摂動ランドスケープをマッピング、予測、およびクエリするための大規模モデルのフレームワークを確立したと主張している。
- グローバルな座標系: RegimeAtlasとRegimeFormerは、配列、構造、および機能に補完的な、摂動挙動のための座標系を提供する。これらは、変異ランドスケープが再現可能なグローバルな状態を占有する「タンパク質レジームマップ」を整理する。
- 実用的な有用性: 本システムは、実験設計のための残基および変異の優先順位付けを可能にする。遡及的解析により、RegimeFormerによるランキングは、固定予算の制約下において、ベースラインよりも効率的に有益な変異を回収できることが示された。
- スケーラブルなリソース: 2つの解像度を持つアーキテクチャ(グローバルなAtlas + 高解像度の残基スキャン)とオンデマンド推論の組み合わせにより、プロキシなしでの膨大なストレージコストを抑えつつ、数億の残基をクエリすることが可能となる。
- 解釈可能性: RegimeAtlas Explorerは、これらのモデルを、バージョン管理されたプロベナンス(由来)、較正された不確実性、残基トラック、構造オーバーレイ、および細胞応答と結びついた、検査可能な研究システムへと統合している。
著者らは、本研究を生成的なタンパク質設計の代替物としてではなく、特に局所的な配列相同性が不十分な領域において、実験の優先順位を付け、生命の樹におけるタンパク質の「脆弱性」と「適応性」を理解するための補完的なツールとして位置づけている。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。
毎週最高の bioinformatics 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。