Entropy-Driven Alignment-Free Phylogenetic Analysis via K-mer Encoding, DNA Physicochemical Properties, and Rough Set Feature Selection
本研究は、k-mer統計量とDNAの物理化学的特性および鎖の対称性を特徴ベクトルへと統合し、それを強化された粗近似集合に基づく選択手法を用いて最適化することで、効率的かつ解釈可能な全ゲノム進化推論を実現する、アライメントフリーな系統解析フレームワークを提案するものである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
生命の歴史を理解するために、科学者たちはしばしば、あらゆる生細胞の中に書き込まれた分子レベルの指示書、すなわちDNA配列に注目します。数十年にわたり、異なる種の間でこれらの指示書を比較するための標準的な方法は、二つの長い段落を並べてどこが一致しどこが異なっているかを確認するように、文字ごとに一列に並べることでした。「多重配列アラインメント」として知られるこの手法は、配列が短く、かつ非常に類似している場合にはうまく機能します。しかし、技術が進歩するにつれ、研究者は数百万文字にも及ぶ全ゲノムを解読できるようになりました。これらの膨大な配列を比較する場合、特に生物が遺伝物質を入れ替えたり急速に進化したりした場合には、伝統的なアラインメント法では低速になり、計算負荷が高くなりすぎ、時には正確に行うことが不可能になります。これにより、科学者たちは「アラインメントフリー(配列整列を用いない)」な手法を模索することとなりました。これは、配列を強固な一列に強制することなく、進化の関係を見出そうとする試みです。すべての文字を照合する代わりに、これらの新しいアプローチは、DNAの小さな塊全体のパターンや頻度を見て、二つの生物がいかに密接に関連しているかを推論します。
最近の研究において、中国の研究チームは、これらのアラインメントフリーの手法をより高速かつ正確にするための新たな洗練方法を提案しました。彼らは、既存の多くの手法が単にある種の短いDNAパターンの出現回数をカウントしているだけであり、それらが二つの決定的な情報、つまりDNA構成要素の特定の化学的特性と、それらのパターンの出現順序の両方を見逃していることが多いことに気づきました。これを解決するため、研究者たちはDNA配列を七種類の異なる「マップ」へと変換するシステムを開発しました。各マップは、その塩基が強い結合を持つか弱い結合を持つのか、あるいは特定の化学ファミリーに属しているのかといった、DNAの異なる物理的特徴を強調しています。元のDNA配列をこれら七つの明確なバイナリ・パターンに変換することで、彼らは各マップ内における短い語のようなセグメントの頻度をカウントすることができました。このプロセスにより、DNAの化学的な性質とパーツの特定順序の両方を保持した、詳細で多層的なゲノムプロファイルが作成されました。
しかし、この詳細なプロファイルは、何千もの潜在的なパターンを含む膨大なデータを生み出し、その多くは冗長であったり、進化史を判断する上で役に立たなかったりするものでした。このノイズを切り抜けるために、チームは「粗近似集合理論(ラフセット理論)」として知られる数学的戦略を適用しました。このプロセスは、大きな情報の山の中から、実際にグループ間の違いを識別するのに役立つ手がかりだけを選別する、極めて効率的なフィルターだと考えてください。研究者たちは、東アジアに見られるウイルスの一種であるハントウイルス11株を用いたトレーニングセットを使用して、このフィルタリングシステムをテストしました。異なるパターンがどれほど上手くウイルスを既知の型へと分離できるかを分析することにより、システムは元々の14,336通りの可能性の中から、特定の3,005個のパターンを特定しました。選ばれたこれらのパターンが、ウイルスを分析するための核となる「指紋」となったのです。
次に、チームはこの手法を全く異なる三つのウイルスのグループに適用し、それが正しく系統樹を再構築できるかどうかを検証しました。まず、SARS関連のウイルスや最新のSARS-CoV-2を含む三十三種類のコロナウイルスのゲノムを分析しました。この手法は、ウイルスを既知の科学的分類に一致する四つの明確な分岐にグルーピングすることに成功し、SARS関連ウイルスを他のウイルスから明確に区別し、さらにはオリジナルのSARSウイルスと新しいSARS-CoV-2をも判別しました。次に、三十九株の日本脳炎ウイルスを調べました。ここでも、手法はウイルスを既知の四つの遺伝的グループへと正しく分類し、従来のはるかに時間がかかるアラインメント法による結果を再現しました。最後に、H7N9鳥インフルエンザウイルスの五十五株を分析しました。得られた系統樹は、北米由来のものとユーラシア由来のものの二つの主要な系統を示しており、同じ地理的領域および時期に分離されたウイルスを正しくグループ化していました。
これらのテストを通じて、この新しいアプローチは驚くべき速さを証明しました。長いDNA配列を解析するための他のグラフィカルな手法が数分を要することも多い中、本手法は、今回の研究の中で最も長い31,000文字を超える配列さえもわずか4秒で処理しました。研究者たちは、彼らのアプローチは配列を整列させるという複雑で時間のかかるステップを必要としない一方で、正確な系統樹を構築するために必要な不可欠な生物学的シグナルを依然として捉えていると指摘しました。この手法は強力ですが、著者らは、これが他のツールのようにはシーケンスの違いに関する視覚的な図を提供しないこと、また、複雑な遺伝子のシャッフル現象を明示的にモデル化するものではないことを認めています。それでもなお、本研究は、化学的特性とスマートなデータ・フィルタリングを組み合わせることによって、科学者がゲノム全体にわたってウイルスやその他の生物の進化の歴史を辿るための、効率的かつ信頼できるツールを作成できることを実証しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。