Automated in situ CryoET Structure Determination with a Self-Configuring Workflow
本論文は、自己構成型ディープラーニング検出器であるOctopiと標準化されたpy2relyワークフローを統合することで、最小限の専門家による介入で、多様な生物学的試料にわたる高分解能(3–20 Å)のin situクライオ電子断層撮影構造決定を可能にする自動化フレームワークを紹介するものである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
あらゆる生細胞の内部では、タンパク質を構築し、遺伝コードを複製し、物質を輸送する分子機械の活気ある都市が三次元的に稼働しています。生命がその最も根本的なレベルでどのように機能しているかを理解するために、科学者たちはこれらの機械を単なる孤立した部品としてではなく、自然で混雑した環境の中に存在する姿として見る必要があります。長年、研究者たちはクライオ電子断層撮影法(cryo-electron tomography)を用いて、凍結された細胞の三次元的なスナップショットを撮ってきました。この手法によって細胞内の景観を覗き見ることができますが、それらの生の画像を鮮明で高解像度の構造へと変換することは、依然として困難な手作業のプロセスでした。それは、すべての本が少しずつ異なる、ぼやけた写真のライブラリを持っているようなものです。テキストを読み取るには、人間の専門家が各本を注意深く選び出し、他の本と整列させ、手作業で画像をシャープにする必要があります。このボトルネックが、科学者が研究できる構造の数を制限しており、細胞世界の多くが未探索のまま残されてきました。
チャン・ザッカーバーグ・バイオハブの研究チームは、このプロセス全体を自動化し、労働集約的なタスクを自己構成型のワークフローへと変えるシステムを構築しました。彼らは、共に機能する2つの主要なツールを開発しました。一つは複雑な細胞内のノイズの中から分子機械を見つけ出すためのもので、もう一つは、それらの発見から鮮明な構造を組み立てるためのものです。Octopiと呼ばれる最初のツールは、インテリジェントな検出器として機能します。新しい実験ごとに人間が何を探すべきかを教える代わりに、Octopiは試行錯誤の手法を用いて、分析している特定のデータに合わせて自身の内部設定を自動的に調整します。これにより、ターゲットとなる分子が膜や他の細胞の破片に囲まれている場合でも、その分子の形状や信号を認識することを学習します。Octopiがこれらの分子の位置を特定すると、py2relyと呼ばれる二番目のツールが引き継ぎます。このシステムは、特定された断片を集め、数学的に結合し、シャープな三次元構造が現れるまで繰り返しのサイクルを通じて画像を精緻化していきます。
研究者たちは、試験管内の精製された分子から、複雑で完全な状態の細菌細胞やヒト細胞に至るまで、17種類の異なるタスクに対してこの自動化システムをテストしました。あらゆるケースにおいて、システムは新しいデータセットごとにソフトウェアを再構成する必要なく動作しました。彼らが6種類の異なる分子を含む標準的なベンチマークデータセットに適用した際、自動検出器は、最近の国際コンペティションにおけるトップクラスの人間設計モデルと同等の精度でターゲットを見つけ出しました。さらに重要なことに、これらの自動化された発見から構築された構造は、同等の鮮明さを持っていました。一部のターゲットに対して、システムは個々の原子が見えるほどの詳細度である3.0オングストロームの解像度の画像を作成しました。細胞膜に付着した分子のような他の困難なケースにおいても、システムは依然として10から20オングストロームの解像度を実現し、複合体の全体的な形状や主要な特徴を明らかにしました。
最も顕著な成果の一つは、信号が弱い、あるいは遮られている困難な環境に対処するシステムの能力でした。ヒト細胞において、研究者たちはシステムに対し、細胞液中に自由に浮遊しているリボソームと、細胞の内部膜に付着しているリボソームを区別するように求めました。わずか数件の手動ラベル付けの例を用いて検出器を訓練することで、システムは両方のグループと膜自体を同時に認識することを学習しました。システムはこれら二つの集団を正常に分離し、それぞれに対して鮮明な構造を構築し、過去の研究で見られた膜に付着したタンパク質複合体さえも明らかにしました。同様に、細菌細胞において、システムは少数のトレーニング例のみを使用して、高密度の細菌細胞質内にある大きなタンパク質のリングやウイルス様粒子を特定しました。システムは未知の新しいデータセットにも汎用性を発揮し、さらなるチューニングなしに、異なるタイプの細胞調製物においても正しく動作しました。
この研究はまた、この自動化されたアプローチが以前の結果を改善できることも示しました。チームがコンペティションのデータにこの自動構造構築ワークフローを適用したところ、得られた画像は元々公開されていたものよりも大幅に鮮明でした。例えば、以前は6.8オングストロームで解像されていたリボソーム構造は、この新しい一貫した処理手順を使用するだけで、3.7オングストロームに改善されました。これは、以前の制限がデータ自体の問題ではなく、分析の受動的で変動しやすい性質によるものであったことを示唆しています。研究者たちは、システムが非常に乏しい情報からも学習できることを見出しました。ある困難なターゲットに対しては、わずか50個の手動マーキング例で訓練されたモデルが、高品質な構造を生成するのに十分でした。
このシステムは非常に効果的ですが、研究者たちは、人間の介入が依然として必要とされる領域があることも指摘しました。シナプス小胞に見られる特定のタンパク質複合体については、自動ワークフローにおいて、人間が最適な粒子のグループを選択し、解析マスクを調整する必要がありました。この例外は、システムがほとんどのシナリオを処理できる一方で、最も複雑な膜結合ターゲットには依然として専門家の監視が有益であることを浮き彫りにしています。しかし、プロジェクトの全体的な成功は、生データから原子構造への一般的な自動化経路が可能であることを証明しています。専門家による粒子選択やカスタムワークフローの組み立ての必要性を排除することで、この新しいフレームワークは、膨大な数の細胞構造をこれまでにないスピードと一貫性をもってマッピングすることを可能にし、細胞内の分子機械の研究に新たな扉を開きました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。