Shetti-AI: Precise prediction of protein sequence mutational landscapes to accelerate functional assays
Shetti-AIは、物理化学的特性、遺伝的距離、および敵対的生成ネットワークを統合してタンパク質の変異ランドスケープを予測し、最適化されたモチーフ様変異体を生成することで、合成生物学およびウイルス学における機能アッセイを加速させ、実験的な探索空間を削減する計算フレームワークである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
タンパク質は生命の働き手であり、特定のタスクを実行するために複雑な形状へと折り畳まれるアミノ酸の鎖からなる、極小の機械です。これらの長い鎖の中には、わずか数個のアミノ酸からなる短い配列が存在し、それらがしばる「スイッチ」や「ドッキングポイント」として機能することがあり、これらはモチーフと呼ばれます。これらの小さな領域が、タンパク質が他の分子とどのように相互作用するかを決定しており、これらの一文字の変化がタンパク質全体の挙動を変えてしまうこともあります。科学者たちは、タンパク質を理解するためには、これらのモチーフを理解しなければならないことを古くから知っています。しかし、これらの短い配列のあらゆる可能なバリエーションを実験室でテストすることは、時間がかかり、コストも高く、しばしば不可能な作業です。潜在的な変化の空間はあまりにも広大であるため、手作業で探索することは不可能であり、研究者はどの変異が機能し、どれが失敗するかを推測するしかない状況に置かれてきました。
この問題を解決するために、ハイサム・ソビーという研究者が、Shetti-AIと呼ばれる新しい計算ツールを開発しました。このシステムは、科学者が実験室に入る前に、タンパク質の短いモチーフに対する変化が成功する可能性が高いかどうかを予測するように設計されています。自然界が過去に進化させてきたタンパク質にのみ頼るのではなく、Shetti-AIは、タンパク質が将来どのように変化するかをシミュレートすることで、先を見据えます。システムは、既知の機能しているモチーフから出発し、新しく、かつ類似した候補のリストを生成します。このシステムは、細胞の遺伝コードがいかにその変化を作りやすいかという点と、新しいアミノ酸がいかにタンパク質の機能を維持するために必要な物理的特性を保持できるかという、2つの主要な要因のバランスを取ることによって機能します。起こりそうにない選択肢を排除し、最も有望なものを強調することで、このツールは膨大な探索空間を、管理可能な実験リストへと縮小することを目指しています。
この論文は、生物学で使用されている現在の人工知能ツールの具体的な問題点を指摘しています。多くの現代的なプログラム(しばしばタンパク質言語モデルと呼ばれます)は、膨大な遺伝データの中から一般的なパターンを見つけ出すことには非常に優れています。しかし、それらはこれらの短いモチーフの詳細なディテールについては苦戦します。例えば、これらのツールは、広範なスケールでは似ているように見えるために、二つの非常に異なる配列をほぼ同一のものとして扱ってしまうことがありますが、実際には、その中の微細な変化がタンパク質の標的への結合能力を破壊してしまうことがあります。著者は、既存のツールが、電荷を持つ粒子を中性的なものに入れ替えるといった、アミノ酸間の微妙な物理的差異を見落としがちであることを指摘しています。このような変化は、タンパク質の機能を完全に破壊しかねません。Shetti-AIは、これら小さな、かつ重要な領域を支配する精密な物理的および遺伝的なルールに焦点を当てることで、この盲点を修正するために特別に構築されました。
このフレームワークは、まず検証済みのモチーフ(自然界で機能することが知られている短い配列)を取り込み、その特性を詳細な数値プロファイルへとマッピングすることによって動作します。このプロファイルは、アミノ酸のサイズ、電荷、水との相互作用など、18種類の異なる物理的特性を考慮に入れます。システムは、一連の数学的モデルを使用して、新しいバリエーションを生成します。システムの一部の機能は保守的なフィルターとして機能し、単一の変化が遺伝的にアクセス可能であるか、そして元のものと物理的に類似しているかを確認します。もう一方の部分は、より高度な生成的アプローチを用いて、自然界にはまだ存在しないかもしれないが、物理法則に従っている全く新しいアミノ酸の組み合わせを想像します。これらの生成された候補は、その実現の可能性と、それを作成する際の遺伝的な難易度を重み付けしたスコアに基づいてランク付けされます。
システムのテストにおいて、研究者たちはヒトのタンパク質を制御する既知のモチーフをベンチマークとして使用しました。このツールは、自然界で機能することが知られている変異、例えば、一文字または二文字の違いはあるものの、同じ形状と挙動を維持している配列を特定することに成功しました。さらに重要なことに、システムの生成的な部分は、元のモチーフと同じ物理的特性を共有する、新しい独創的な配列を提案しました。既知の異なる制御配列と比較した際、ツールは、生成された候補が元の機能的なものに非常に近いことを正しく特定しました。結果は、一部のモデルは小さく安全な変化を見つけるのが得意である一方で、他のモデルはより遠い可能性を探索することが可能であり、研究者が何を必要としているかに応じて幅広い選択肢を提供できることを示しました。
この論文は、このアプローチが、科学者が新しい変異体をテストするための時間が極めて少ない新興ウイルスを研究する際に、特に有用であることを示唆しています。関連するウイルスの既知のモチーフを起点として利用することで、ツールは実験室でテストすべき可能性の高い候補のリストを迅速に生成できます。また、合成生物学のためのカスタムタンパク質を設計する方法も提供しており、研究者が何千もの失敗作を合成することなく、特定の物理的特性を持つ新しいツールを作成することを可能にします。著者は、このシステムが柔軟であることを述べています。研究者は、設定を非常に厳格にして、元のものとほぼ同一の変更のみを探すようにしたり、より探索的にして、大胆な新しい設計を探したりするように調整できます。
結局のところ、Shetti-AIは実験室での実験の必要性を置き換えるものではなく、実験が行われる「順序」を変えるものです。ランダムな推測をテストする代わりに、科学者はこのツールを使用して、最も有望な候補に優先順位を付けることができ、時間と資源を節約できます。このシステムは、遺伝学の厳格なルールと、タンパク質設計の流動的な可能性との間の溝を埋め、膨大な潜在的な突然変異の風景を自信を持ってナビゲートする方法を提供します。統計的なパターンだけでなく、タンパク質が機能する物理的な現実に焦点を当てることで、このツールは、生命がいかに適応するか、そして私たちがどのように未来に向けてそれを設計できるかを知るための、より明確な道筋を提供しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。