Joint optimisation of amino acid and coding sequence for de novo designed proteins
本論文は、実験的な欠陥を排除し合成成功率を向上させるために逆折り畳みエントロピーを活用することで、アミノ酸配列とコーディング配列を同時に設計する共同最適化フレームワークであるJANUSを紹介するものであり、これらを個別に扱う従来の手法を凌駕している。
原著者: Anees Ahmed Mahaboob Ali, Radhakrishnan Delhibabu, Everette Jacob Remington Nelson
原著者: Anees Ahmed Mahaboob Ali, Radhakrishnan Delhibabu, Everette Jacob Remington Nelson
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ⚕️ これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
技術要約:de novo 設計タンパク質におけるアミノ酸配列とコーディング配列の共同最適化
問題提起
現在の de novo タンパク質設計パイプラインは、決定的な非対称性に直面している。計算手法によって優れた予測構造を持つバックボーンを生成することは日常的となっている一方で、それらの設計が実験的に成功する割合は半分にも満たない。主要なボトルネックは遺伝子合成のステップである。天然のタンパク質は選択の下で進化したネイティブなコーディング配列を持つが、de novo タンパク質はゼロから構築された遺伝子を必要とする。既存のワークフローは、これを逐次的なプロセスとして扱う。すなわち、逆フォールディングモデルがまず固定されたアミノ酸配列を出力し、その後にコドン最適化器が遺伝子を設計する。このアプローチは、逆フォールディングの事後分布が持つ「エントロピー」——すなわち、複数のアミノ酸がしばしば設計されたフォールドに対してほぼ等しく適合可能であるという事実——を放棄してしまう。アミノ酸配列を遺伝子設計の前に固定してしまうことで、このパイプラインは、コドン最適化器だけでは対処できない遺伝子レベルの特性(例:mRNA構造、合成可能性)やタンパク質レベルの不備(例:分解シグナル、凝集)を改善するためにアミノ酸配列を調整できる広大な探索空間を無視している。
手法
著者らは、アミノ酸配列とコーディング配列の設計を、結合された多目的最適化問題として扱うフレームワークである JANUS を提案している。
- アミノ酸デジェネレート・ラティス(Amino-Acid-Degenerate Lattice): 正確な mRNA 設計に使用されるコドン・ラティスの一般化が核心的な革新である。アミノ酸を固定する代わりに、ラティスは「デジェネレート(縮退)」しており、位置 i において無条件逆フォールディング周辺確率が最大値の定義されたエントロピー予算(δ)の範囲内にある任意のアミノ酸を許容する。
- 動的計画法: このラティスを横断する動的計画法により、最適な k 個の結合(タンパク質、遺伝子)ペアを返す。ラティスのノードの重みは加法的であり、無条件逆フォールディング周辺(ProteinMPNNを使用)、フォールド適合性、コドン適応、コドン・ペア・バイアス、および GC コンテンツから導出される。
- 2ティア・アーキテクチャ:
- ティア 1: 分解可能な項(コドン使用量、ペア・バイアスなど)にわたる正確なラティス・パースを実行し、トップ k のパスを特定する。
- ティア 2: これらの候補に対し、非分解的な項(mRNA のグローバルな折り畳みエネルギー、タンパク質レベルの不備(低複雑性領域、デグロン負荷、リピート、露出した疎水性)を含む)を用いて再スコアリングを行う。
- ホストモデル: システムには、E. coli(シャイン・ダルガノ配列のアクセシビリティに焦点を当てる)および HEK293(キャップ依存性スキャニングおよびグローバルな転写構造に焦点を当てる)に特化したホストモデルが組み込まれており、ホスト固有の最適化を可能にしている。
- 評価: 本手法は、10 個のベースライン(ベンダー型のコドン最適化、固定タンパク質を用いた LinearDesign、CodonMPNN、および各種 MPNN ベースのアプローチを含む)と比較して、MegaScale データセットから抽出された 447 個の de novo 設計に対してテストされた。
主な結果
- 位置的エントロピー: 862 個のバックボーン全体で、逆フォールディング事後分布は設計あたり中央値 93 ナッツの位置的エントロピーを保持しており、実質的に固定されている位置は存在しない。この「自由度」は一様に分布しており、開始部位付近に集中していない。
- 不備の除去: 公表されている 447 個の設計のうち 99.1% が、除去可能なタンパク質レベルの不備(例:デグロン、低複雑性領域)を少なくとも一つ持っている。結合手法は、これら不備を低いコストで除去できる:低複雑性コンテンツ、デグロン負荷、またはタンパク質リピートの担体(キャリア)を解消するコストは、93 ナッツの予算のうちわずか ~0.2 ナッツ(約 1/5 ナット)であった。
- 合成制約: 最も実用的な知見は、遺伝子レベルの制約を考慮せずに残基を移動させると、ベンダーの合成違反率が高くなることである。遺伝子項を持たずに残基を移動させた手法は、設計あたり 1.4~1.7 個の商業的制約に抵触したが、結合 JANUS アームはこれを 0.14~0.21 に減少させた。
- 開始ウィンドウ: 5' 開始ウィンドウに関して、「安価な」利得は主に同義置換によるものである。同義置換のみで開始率における結合ゲインの約 87.6% を回収でき、アミノ酸軸の寄与はごくわずかであった。
- 安定性: 結合手法による置換は、ランダムな抽出や ProteinMPNN サンプリングと比較して、測定されたフォールディング安定性に対して劣っていない(中央値の変化は +0.023 kcal/mol)。しかし、著者らは、複数置換を含む設計の集約的な安定性予測は、非加法性により不正確なままであると注記している。
- 予測能: 信頼度の高いモデル(pLDDT > 70)のコホートにおいて、配列のみの不備スコアは ESMFold pLDDT よりも実験的成功の予測において優れており、構造的信頼性の指標単独では失敗する設計をフィルタリングするには不十分であることを示唆している。
意義と主張
本論文は、逆フォールディングとコドン最適化の間のギャップは不可能ではなく、価格設定の誤りであると主張している。すなわち、アミノ酸配列を調整するための「自由度」は利用可能であり、かつ安価に消費できるものである。
- 共同最適化の必要性: 結合ラティスは、テストされたすべての 447 個のバックボーンにおいて、固定タンパク質を用いた動的計画法を上回る。これは単に一つの目的関数を別のものとトレードオフしているのではなく、コドンのみの最適化器では到達できないタンパク質レベルの不備を、効果的に除去している。
- 実用的影響: ベンダーの合成制約違反の減少は最も直接的な成果である。なぜなら、ベンダーのチェックに失敗した遺伝子は注文できず、生物学的テストを開始する前にプロジェクトが停止してしまうからである。
- 主張の謙虚さ: 著者らは、ラティスの正確性は無条件の周辺分布に関するものであり、完全な条件付き事後分布に関するものではないことを明示している。また、mRNA 折り畳み項はラティス自体ではなく、再スコアリング・ティアで扱われていること、および本手法が多置換変異体に対して安定性を中立にする設計を約束できるものではないことも認めている。さらに、結果は、すでに選択を生き残った設計(MegaScale データセットから)に関するものであり、必ずしもジェネレーターの生の出力ではない。
結論として、本研究は、タンパク質と遺伝子を結合したシステムとして扱うことで、逐次的なパイプラインが見落とす不備を解決できることを示しており、最も堅牢な利益は合成可能な遺伝子の生成である。著者らは、次の論理的なステップは、mRNA 折り畳みと合成制約を直接ラティスのパースに統合することであると示唆している。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。
毎週最高の biology 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。