✨ 要約🔬 技術概要
あなたは、ある非常に有名で非常に多忙なセレブリティの家系図を辿ろうとしているところだと想像してください。これを行うためには、ある家族の一人が時間の経過とともに別の誰かに変わる確率がどのくらいであるかを教えてくれる「ルールブック」が必要です。生物学の世界では、このルールブックは「置換モデル(substitution model)」と呼ばれます。科学者たちは、このモデルを使って、ウイルス、動物、植物の家系図(系統樹)を作成します。目的は、誰が誰と親戚関係にあり、どのように変化してきたのかを解明することです。しかし、既存のルールの多くは「汎用的な」ガイドであり、あらゆる種類のタンパク質に対してそこそこ機能するものです。それは、ケーキの焼き方からステーキの焼き方までをすべてカバーしようとする、一般的な「料理の作り方」本のようなものです。問題は、タンパク質にはそれぞれ非常に特定の役割があるということです。ウイルスのエンジンの役割を果たすタンパク質(プロテアーゼ)は、細胞のロックを解除するための鍵となるタンパク質(スパイクタンパク質)とは異なるルールを持っています。もし特定の仕事に対して汎用的なルールブックを使ってしまうと、作成される家系図は少しグラグラしてしまい、不正確なものになってしまいます。これは、急速に進化し、世界を変えつつあるSARS-CoV-2(新型コロナウイルス)において特に顕著です。これまで、科学者たちはこのウイルス専用のカスタム・ルールブックを持っていませんでした。そのため、彼らは丸い穴に四角い杭を打ち込もうとしていたのです。
この研究において、研究者たちはSARS-CoV-2専用のカスタム・ルールブックを自ら書き上げることにしました。彼らは、数千もの実際のウイルス配列を調査し、ウイルスの主要なプロテアーゼ、パパイン様プロテアーゼ、スパイクタンパク質、そしてウイルス全体において、アミノ酸(タンパク質の構成要素)がどのように入れ替わっているかを正確に観察しました。これは、ウイルスの巨大なリアルタイムのダンスフロアを観察して、どのダンサーが実際にパートナーを替え、どのダンサーがそのままの場所に留まっているのかを見るようなものです。彼らは、ウイルスには汎用的なルールブックでは決して捉えきれない、独自のダンスステップがあることを発見しました。例えば、ウイルスのプロテアーゼ(他のタンパク質を分解する酵素)においては、構造が非常にタイトで壊れやすいため、特定の入れ替わりは極めて稀にしか起こらないことが分かりました。一方で、スパイクタンパク質はより柔軟であり、特にウイルスが私たちの免疫系から逃れるのを助けるような、より激しい変化を許容しています。
チームは、この新しいカスタム・ルールブックを古い汎用的なものと比較テストしました。これは2つの方法で行われました。第一に、収集した実際のデータに対して、どのルールブックが最もよく説明できるかを、まるで探偵がどの理論が手がかりに最も合致するかを確認するようにチェックしました。彼らのカスタムモデルはほとんどのケースで勝利し、この特定のウイルスがどのように進化するかを記述する上で、それらがはるかに優れていることを示しました。第二に、彼らはコンピュータ・シミュレーションを実行し、新しいルールと古いルールを用いて、ウイルスが時間を進めて進化していく様子をシミュレートしました。彼らは、生成されたタンパク質の「折り畳み安定性(folding stability)」をチェックしました。これは、新しいルールで作られた折り紙の鶴が形を保っている一方で、古いルールで作られたものが崩れたり、硬すぎたりしないかを確認するようなものです。新しいSARS-CoV-2特化型モデルを用いて進化したタンパク質は、自然界に見られる実際のウイルス・タンパク質とよく似た、より現実的な形状を保っていました。
研究者たちは、これらの新しいウイルス特化型モデルを使用することで、SARS-CoV-2がどのように変化しているのかについて、より明確で正確な全体像が得られると結論付けています。彼らは、最善の結果を得るためには、科学者が「ワンサイズ・フィッツ・オール(万能型)」のルールブックを使うのをやめ、これらのカスタム・ガイドに切り替えるべきであると提案しています。この研究は、これらのモデルがシミュレーションにおいてより良く機能し、データにより密接に適合することを示していますが、著者らは、これがウイルスの過去を理解し、その将来の動きを予測するための重要な一歩であり、進行中のウイルスとの戦いにおいて一歩先を行く助けになるものであると述べています。
技術要約:SARS-CoV-2タンパク質の進化における経験的置換モデル
問題提起 確率的な系統発生学的推論は、分子進化の置換モデルに依拠して正確な予測を生成する。タンパク質進化において経験的置換モデルは確立されているものの、利用可能なレパートリーはタンパク質ファミリーの多様性に対して依然として限定的である。極めて重要な点として、本研究以前にはSARS-CoV-2タンパク質に特化した経験的置換モデルは開発されていなかった。著者らは、進化パターンはタンパク質間で異なることを指摘しており、特定のウイルス性タンパク質に対して汎用モデルを使用することは、非現実的なモデリングを招き、系統樹、祖先配列の再構成、および進化の軌跡予測の精度を損なう可能性があるとしている。
手法 本研究では、最大尤度(ML)アプローチを用いて、SARS-CoV-2のための新しい経験的置換モデルを推定した。
データキュレーション: 配列はGISAIDおよびNCBIから取得された。フィルタリングプロセスにより、曖昧性を持つ配列、リファレンス(NCBI Protein ID: YP_009724389.1)に対して10個以上の連続したアミノ酸欠失(indel)を持つ配列、およびリファレンスと75%未満のアミノ酸同一性を共有する配列を除外した。
データセット構築:
メソッド・データセット: Spike、メインプロテアーゼ(Mpro/nsp5)、およびパパイン様プロテアーゼ(PLpro/nsp3)については、100,000個のランダムサンプリングされた配列からなるデータセットを構築した。全プロテオームについては、20,000個の配列を用いたデータセットを使用した。
テスト・データセット: 各タンパク質に対して10個の独立したテストデータセット(各1,000配列)を、およびプロテオームに対して100個の配列からなるデータセットを、メソッド・データセットで使用した配列を除外して生成した。
モデル推定: IQ-TREE2に実装されているQMaker法を用い、各ターゲットに対して、一般的な時間可逆な20×20交換行列(Q Q Q )および平衡アミノ酸頻度(π \pi π )を推定した。推定に必要な系統樹は、ModelFinderによって選択された、最も適合度の高い既存モデルを用いて再構成した。
検証:
系統学的尤度: 新しいモデル(SC2-Mpro, SC2-PLpro, SC2-Spike, SC2-Proteome)の適合性を、テストデータセットに対するベイズ情報量基準(BIC)および赤池情報量基準(AIC)を用いて既存の経験的モデルと比較した。
タンパク質折り畳み安定性: MproおよびPLproについて、新しいモデル、最も適合度の高い従来のモデル、および構造制約置換(SCS)モデルの下で、前方時間進化シミュレーションを実施した。得られたシミュレーション配列の折り畳み安定性(Δ G \Delta G Δ G )をDeltaGREMを用いて評価し、実在の配列と比較した。
類似性解析: 正規化された速度行列に対して主成分分析(PCA)を行い、SARS-CoV-2モデルと他の経験的モデル(例:JTT, HIVw, FLU)との間の距離を評価した。
主な貢献 著者らは、以下の4つの新しい経験的置換モデルを提示している:
SC2-Mpro: メインプロテアーゼに特化したもの。
SC2-PLpro: パパイン様プロテアーゼに特化したもの。
SC2-Spike: Spikeタンパク質に特化したもの。
SC2-Proteome: SARS-CoV-2の全プロテオームに対する汎用モデル。
これらのモデルは、eModelDBデータベースを通じて公開されている。
結果
置換パターン: モデルは明確な進化パターンを明らかにした。プロテアーゼモデル(SC2-Mpr, SC2-PLpro)は、Spikeおよびプロテオームモデルと比較して、より制限的な置換率を示した。
物理化学的傾向: サイズと疎水性を維持する置換(例:Ala-Val, Val-Ile)において高い置換率が観察された。また、モデルは特定の電荷保存的な置換(例:MproにおけるLys-Arg、SpikeにおけるArg-Lys)や、多様化イベント(例:Pro-His, Pro-Ser)も捉えていた。
定常頻度: 特徴的なアミノ酸頻度が認められた。例えば、Mproにおけるプロリンの増加、PLproにおけるロイシン/イソロイシン、Spikeにおけるフェニルアラニン/バリン、およびプロテオームにおけるリシンなどが挙げられる。
系統学的適合度: SARS-CoV-2特異的モデルは、既存の経験的モデルを概して上回り、テストデータセット全体でより低いBICおよびAICスコアを示した。
頻度の取り扱い: MproおよびPLproについては、推定された平衡頻度を用いたモデルの方が、観測されたテスト頻度を用いたモデルよりも優れた性能を示した。逆に、Spikeおよびプロテオームについては、テストデータからの観測アミノ酸頻度を組み込むことで、モデルの性能がさらに向上した。
PCA解析: SARS-CoV-2特異的モデルは、汎用モデル(例:JTT, VT)や系統特異的モデル(例:HIVw, FLU)から分離してクラスターを形成した。特に、アラニン-バリン(A-V)置換率は、標準的なモデルと比較してSARS-CoV-2モデルにおいて有意に高かった一方、トレオニン-セリン(T-S)の置換率は低かった。
折り畳み安定性: 前方時間シミュレーションにおいて、SC2-MproおよびSC2-PLproモデルの下で進化した配列は、従来の経験的モデルやSCSモデルによって生成された配列よりも、実在のウイルス性タンパク質に近い折り畳み安定性を示した。具体的には、SC2-PLproモデルは、過度に安定したタンパク質を生成する傾向があるSCSモデルよりも、より現実的な安定性プロファイルを生み出した。
意義および主張 著者らは、タンパク質特異的な置換モデルに基づく進化推論は、汎用モデルに基づくものよりも一般的、かつ生物学的に現実的であると結論付けている。本研究は、SARS-CoV-2のタンパク質が、既存のモデルでは捉えきれない独自の制約の下で進化していることを示している。
正確性: 新しいモデルはSARS-CoV-2のデータへの適合性を向上させており、これは、モデルがウイルスに作用する特定の選択圧をより良く捉えていることを示唆している。
生物学的リアリズム: 現実的なタンパク質構造と機能に関連する進化的な制約を、これらのモデルが暗黙的に捉えていることは、現実的な折り畳み安定性を持つタンパク質変異体を生成できる能力によって示されている。
推奨事項: 著者らは、系統発生学的推論および軌跡予測の信頼性を高めるために、SARS-CoV-2タンパク質の進化予測においてこれらの特異的モデルを使用することを推奨している。また、系統発生学的枠組みに対し、このようなタンパク質特異的な選択肢を含むモデルセットの実装を拡大することを求めている。
毎週最高の biology 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×