✨ 要約🔬 技術概要
生命は遺伝子のコードによって記述されていますが、そのコードの長さは固定されていません。図書館が時間の経過とともに新しい本を加えたり古い本を失ったりするのと同様に、生物種のゲノムは遺伝子のコピーを獲得したり失ったりします。ある時は遺伝子が重複して、新しい機能を獲得できる余分なコピーが作られ、またある時は遺伝子が完全に消失します。こうした遺伝子コピー数の変化は、系統が新しい環境に適応したり、複雑な形質を発達させたり、あるいは宿主と病原体の間の終わりのない生物学的軍拡競争に従事したりするための主要な手段です。ある種がどのように進化したかを理解するために、科学者たちはしばしば、生命の樹全体におけるこれらの特定の拡大や収縮を探ります。しかし、これらを見つけ出すことは歴史的に困難な作業であり、データをダウンロードし、クリーニングを行い、これらの変化を生命の樹全体で追跡する複雑な統計モデルを実行するためには、高度な技術的スキルが必要でした。
ユニバーシティ・カレッジ・ロンドンの一チームは、この障壁を取り除き、多段階で専門家のみが行っていたプロセスを、単一の自動化されたワークフローへと変えるツールを構築しました。彼らは、遺伝子ファミリーがどのように増減するかを分析するための完全なガイドとして機能する「EXCON」と呼ばれるパイプラインを作成しました。研究者が手動でゲノムファイルをダウンロードし、フォーマットを整え、関連する遺伝子を見つけるための別々のプログラムを実行する必要がある代わりに、EXCONは最初から最後まであらゆるステップを処理します。このシステムは、ゲノムデータの収集から始まり、そのデータの品質をチェックし、異なる種間における関連遺伝子のグループを特定し、統計モデルを用いて遺伝子ファミリーが正確にいつ、どこで拡大または収縮したかを算出します。このシステムはポータブル(移植可能)に設計されており、標準的なノートパソコン、強力な大学のスーパーコンピュータ、あるいはクラウド上で実行することができ、結果の信頼性を確保するために計算を自動的に調整します。
この新しいツールが機能するかどうかをテストするために、研究者たちは、レムール、ロリスからサル、類人猿、そしてヒトに至るまで、24種の多様な霊長類グループにこれを適用しました。このデータセットは約7,100万年の進化をカバーしています。パイプラインはデータを正常に処理し、霊長類の家系図全体を通じてコピー数に著しい変化を示している、急速に進化している358の遺伝子ファミリーを特定しました。最も驚くべき発見の一つは、ゲノムの非常に不安定な領域に位置する「DUX」として知られる特定の遺伝子ファミリーに関するものでした。解析の結果、この遺伝子ファミリーは単一の系統で一度だけ変化したのではなく、霊長類の樹の多くの異なる枝において、繰り返される独立した拡大と収縮のバースト(急増・急減)を経験していたことが明らかになりました。例えば、この遺伝子ファミリーはマカクやゴリラで劇的に拡大しましたが、ヒヒやその他の種では収縮しました。このパターンは、この遺伝子が位置するDNA領域の物理的な不安定性について科学者がすでに知っていた事実と一致しており、自動化されたパイプラインが、事前の人間によるキュレーションなしに、真正で複雑な進化のシグナルを検出できることを裏付けました。
特定の遺伝子を特定することを超えて、研究者たちは、変化している遺伝子のより広範な機能を理解するためにこのパイプラインを使用しました。彼らは、リボソームに見られるようなタンパク質生成の基本的な機構に関与する遺伝子が、霊長類全体で拡大する傾向があることを見出しました。対照的に、ミトコンドリアにおけるエネルギー生産に関連する遺伝子は、ヒトや特定のサルなどの特定の系統においてのみ、収縮の兆候を示しました。特に明確なシグナルはレムールにおいて現れ、嗅覚を司る遺伝子が大幅に拡大していました。これは、視覚よりも嗅覚に大きく依存しているという、これらの動物の既知の生物学的特性と一致しており、この特性は研究対象となった他の霊長類と彼らを区別するものです。研究者たちは、このツールは堅牢であるものの、非常に断片化されていたり低品質であったりするゲノムアセンブリに対しては、遺伝子の消失や獲得の偽のシグナルを生み出す可能性があるため、ユーザーには利用可能な最善のデータを使用することが推奨されるとも指摘しました。
EXCONの開発は、複雑なゲノム解析を、コンピュータサイエンスの専門的な訓練を受けていない幅広い生物学コミュニティにとってアクセス可能なものにするための転換を意味しています。全ワークフローを単一の再現可能なパッケージに統合することで、このツールは、誰もが、どこでも、結果を検証し、繰り返すことができることを保証します。研究者たちは、このパイプラインが細菌から昆虫、哺乳類に至るまでのデータセットを扱い、異なるレベルの遺伝的多様性とゲノム品質に適応できることを実証しました。現在、このツールは遺伝子ファミリーの進化に焦点を当てていますが、チームは将来的に、他の種類のゲノム解析を含むように機能を拡張することを計画しています。現時点において、EXCONは、生命が時間の経過とともにどのように変化するかという根本的な問いを投げかけることを可能にする、完全に自動化されたソリューションとして、かつては困難であった技術的な課題を、単純明快で信頼できるプロセスへと変えています。
技術要約:EXCON:CAFEに基づく遺伝子拡張・収縮解析のためのスケーラブルで再現可能なNextflowパイプライン
問題提起 遺伝子ファミリーの拡張および収縮の解析は、系統特異的な進化圧を特定するために用いられる、進化比較ゲノミクスの基盤となる手法である。CAFE(Computational Analysis of gene Family Evolution)は、確率的な出生・死滅プロセスを通じてこれらの変化をモデル化するために広く使用されているフレームワークである。しかし、生のゲノムデータからCAFE解析の全工程を実行することは、技術的に非常に困難である。それは、ゲノムのダウンロード、アノテーションの標準化、オーソログ遺伝子ファミリーの同定、種系統樹の構築、および機能濃縮解析といった、性質の異なるツールを用いた複雑で多段階のワークフローを必要とする。現在、ゲノム取得から生物学的解釈までの一連のワークフローを、ポータブルかつコミュニティ指向の形で統合したツールは存在しない。統合されたパイプラインの欠如により、解析の再現性が異なる計算環境や研究グループ間で確保されにくくなっており、高度なバイオインフォマティクスの専門知識や手動によるパラメータ調整を必要とする場合が多い。
手法 著者らは、nf-coreのガイドラインに基づいて開発された、自動化された完全に再現可能なNextflowパイプライン(v2.4.0)であるEXCON を提示する。EXCONは、以下のステージを単一のモジュール式ワークフローに統合している:
ゲノム取得: ユーザーが提供するローカルファイルを受け取るか、NCBI RefSeqからアセンブリおよびアノテーションを直接ダウンロードする。
品質管理 (QC): BUSCO、QUAST、およびAGATを用いてアセンブリとアノテーションの統計量を算出し、データの比較可能性を評価する。
前処理: GFF/GTFファイルをフィルタリングして、遺伝子あたりの最長のコーディングアイソフォームを保持し、設定可能な戦略(除去、ドロップ、または最長ORF)を用いて、フレーム内の早期終止コドンの問題を解決する。
オーソロジー推論: OrthoFinder(v2.5.5またはv3.1.4)を用いてオーソログ遺伝子ファミリーを同定する。これには、様々な系統樹推論法(DendroBLAST、MAFFT、MUSCLE、FastTree、RAxML、IQ-TREE)をサポートする。
種系統樹の準備: 入力された系統樹を超計量形式(ultrametric formats)に変換し、オプションとして化石データや既報のノード年代を用いて時間較正を行う。
CAFE5モデリング:
モデル選択: 離散ガンマ率カテゴリ(k = 1 k=1 k = 1 から$6$)を自動的にテストし、赤池情報量基準(AIC)に基づいて最適なモデルを選択する。
収束処理: 漸進的差分フィルタリング戦略を実装する。高分散のオーソグループによってCAFE5の収束が失敗した場合、パイプラインは自動的に、より厳格な除外閾値(各ステップで最大差分を半分にする)を用いて再試行し、高分散ファミリーを個別に独立したλ \lambda λ 推定値を用いて再解析する。
誤差モデリング: アセンブリ/アノテーションの誤差モデルを推定し、Poisson分布と一様分布のルート頻度事前分布を比較する。
機能解析: 有意に拡張または収縮したファミリーに対して、eggNOG-mapperとTopGOを用いた遺伝子オントロジー(GO)濃縮解析を行う。
本パイプラインは、ソフトウェアのバージョンの再現性を保証するためにコンテナ化(Docker/Singularity)されており、ローカル、HPC、およびクラウド(AWS Batch)での実行をサポートしている。
主な貢献
エンドツーエンドの自動化: EXCONは、ゲノムダウンロード、前処理、オーソロジー推論、CAFE5モデリング、およびGO濃縮解析を単一のポータブルなワークフローに統合した初のパイプラインである。
自動化されたモデル選択: 最適なガンマ率カテゴリ数(k k k )を自動選択し、Poisson分布と一様分布の事前分布を比較することで、手動によるモデルチューニングの必要性を排除する。
堅牢な収束回復: 「漸進的差分フィルタリング」という新しいメカニックを導入している。高分散のファミリーによって収束が妨げられた際に失敗して停止するのではなく、それらを反復的に除外し、個別に解析した上で結果を統合することで、困難なデータセットであってもパイプニラインを完遂させる。
アクセシビリティ: 最小限のユーザー設定(多くの場合、種リストのみ)で動作するように設計されており、専門的なバイオインフォマティクスの知識を持たない研究者でも、厳密な比較ゲノミクスへのアクセスを可能にする。
結果 パイプラインは、狭鼻類(Catarrhini)、広鼻類(Platyrrhini)、およびStrepsirrhiniにわたる24種の霊長類データセットを用いて検証された。
パフォーマンス: EXCONはデータセットの処理に成功し、出生・死滅率 λ = 0.009635 \lambda = 0.009635 λ = 0.009635 で収束した。選択された最適モデルは2カテゴリのガンマモデル(k = 2 k=2 k = 2 )であり、これはファミリー間で中程度の率の変動があることを示している。
生物学的知見: 解析により358個の急速に進化する遺伝子ファミリーが特定された。特筆すべきは、複数の系統においてDUX (double homeobox) 遺伝子ファミリー(OG0000017)における独立した双方向のコピー数ターンオーバーが検出されたことである。この知見は、DUXが存在するD4Z4マクロサテライトリピートの既知の不安定性と一致しており、事前のキュレーションなしに真の進化シグナルを回収できる本パイプラインの能力を証明している。
機能濃縮: GO解析により明確なパターンが明らかになった。拡張したファミリーは翻訳機構やリボソームサブユニットに濃縮されており、一方で特定の系統(例:Homo sapiens )における収縮したファミリーは、ミトコンドリアおよび酸化リン酸化の用語に濃縮されていた。また、Eulemur frifrons においては、霊長類における嗅覚受容体の保持と一致する、化学感覚の拡張に関する強い系統特異的なシグナルが見出された。
スケーラビability: 細菌、昆虫、哺乳類にわたるベンチマークでは、パイプラインの実行時間はOrthoFinderとCAFE5の実行時間に支配されることが示された。高度に断片化されたゲノムや多様なデータセットは処理時間を増加させる可能性があるが、パイ beenは多様な入力を正常に処理した。ただし、極めて多様な細菌グループでは収束の失敗が観察された。
意義と主張 著者らは、EXCONが遺伝子ファミリーの進化解析のための完全に自動化され、ポータブルで、再現可能な ソリューションを提供することで、比較ゲノミクスにおける重要なギャップを埋めるものであると主張している。手動のファイル変換、アドホックなパラメータ選択、および文書化されていない中間ステップを排除することで、EXCONは遺伝子ファミリーの拡張および収縮の解析を標準化する。著者らは、EXCONをCAFEの統計的な厳密さを置き換えるものではなく、CAFEの厳密な適用をより広いコミュニティに開放するための不可欠なインフラストラクチャとして位置づけている。ブラインド解析において既知の生物学的現象(DUXの不安定性)を回収できたことは、本パイプラインが真の進化シグナルを追跡していることの概念実証となっている。著者らは、本パイプラインは多様なデータセットを良好に扱うものの、不完全なアセンブリは遺伝子の獲得および喪失の推定を膨らませる可能性があるため、ユーザーは注意すべきであると控えめに述べている。今後の開発では、追加の機能データベース(KEKG)、トランスポゾンのフィルタリング、および強化された可視化の組み込みを目指している。
毎週最高の evolutionary biology 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×