An RNA Language Model trained on sequence alone reveals the structural logic of Internal Ribosome Entry Sites
著者らは、配列データのみで学習されたRNA言語モデルであるAlbatrossを紹介しており、これは内部リボソーム進入部位(IRES)構造の予測において既存の手法を大幅に上回り、新たな機能的サブクラスの発見を可能にし、抗ウイルス標的の特定を加速させるものである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
ウイルスは変装の名手ですが、その最も重要な秘密は、しばしばその遺伝コードの中に、目の前にあるのに気づかないほど明白な形で隠されています。一般的な風邪から壊滅的な神経疾患までを引き起こすピコルナウイルスを含む多くのウイルスにとって、新しいウイルス粒子を作るための指示は、単なる文字のリストではありません。それらは複雑な三次元の形へと折り畳まれています。これらの形はスイッチやハンドルとして機能し、ウイルスが細胞のタンパク質合成機構を乗っ取ることを可能にします。これらの形状の中で最も重要なものの一つが、内部リボソーム進入部位(IRES)と呼ばれるものです。人間の細胞は通常、遺伝情報の読み取りを開始するために開始位置に特定の「キャップ」を必要としますが、これらのウイルスのIRESは直接的な招待状として機能し、ウイルスが即座に、かつ独立してタンパク質の構築を開始することを可能にします。これらのIRESがどのように折り畳まれるかを正確に理解することは、なぜ一部のウイルスが特定の組織に感染するのか、なぜ一部のウイルスが重篤な疾患を引き起こし、他のウイルスはそうならないのか、そしてどのようにそれらを阻止するための薬を設計できるのかを解明するために不可欠です。しかし、これらの構造をマッピングすることは非常に困難であることで知られています。それらは長く、極めて多様であり、環境に応じて形を変えるため、従来の方法による予測は遅く、しばしば不正確になります。
研究チームは今回、高価で時間のかかる実験を回避して、これら隠された形を可視化する新しい手法を開発しました。彼らは、数千ものこれらウイルスの要素の生の遺伝配列のみを用いて訓練された、「Albatross(アルバトロス)」と名付けられた人工知能システムを作成しました。このシステムは、RNAがどのように折り畳まれるかという情報も、化学の規則も、安定性の物理学も受け取りませんでした。単に数百万の配列を読み込ませ、その中のパターンを学習するように求められたのです。驚くべきことに、このモデルは配列内の文字間の統計的な関係性を認識することによって、これらウイルスの要素の三次元構造を高い精度で予測することを学習しました。研究者がAlbatrossを96種類の異なるフルレングスのウイルスIRESのライブラリに対してテストしたところ、モデルの予測は既存の最良の手法よりもはるかに正確でした。他のツールが実際の構造的結合の半分未満しか正しく特定できなかった一方で、Albatrossは8割の確率で正解を出しました。
このアプローチの力は、モデルが実際に何を学習したかにあります。モデルは単に形を暗記したのではなく、ウイルスの論理を学習したのです。配列の一部の変化が別の部分の予測にどのように影響するかを分析することで、モデルはどのRNA片が機能するために近くに位置していなければならないかを特定しました。これにより、研究者は単に安定しているだけの形状と、ウイルスが機能するために不可欠な形状を区別することができました。実際、モデルは機能的な構造を見つけ出す能力が非常に高かったため、RNAのどの部分が感染プロセスを開始することに関与している可能性が最も高いかを予測することができました。この能力により、チームは、これまで詳細に研究されたことのない膨大な多様なウイルスを網羅する、7万5,000以上の予測構造からなる巨大なアトラス(地図)を構築することができました。
この新しい地図を用いて、研究者たちは全く新しい発見をしました。彼らは、拡張ステムを含む、これまでこのクラスのウイルスでは見られなかった特定の折り畳みパターンを含む、未知のウイルス構造のサブグループを発見しました。彼らはラボでの実験を通じてこの発見を検証し、拡張ステムが実在し、ウイルスの機能において極めて重要な役割を果たしていることを確認しました。この知見は、モデルが科学者には以前は見えなかった生物学的な真実を明らかにできることを示唆しています。さらに、チームはこの手法が単一のタイプのウイルスに限定されないことも示しました。彼らが同じ訓練戦略をハンタウイルスの遺伝物質や細菌センサーに適用したところ、モデルは複雑な長距離相互作用や、単一のRNA分子が環境に応じて二つの異なる形状の間で切り替わる能力さえも特定することに成功しました。
この取り組みの意義は、ウイルスのマッピングをはるかに超えたところにあります。何十年もの間、科学者たちはRNAの構造を予測することに苦労してきました。なぜなら、これらの分子は非常に柔軟であり、それらを支配する規則が非常に複雑だからです。従来の方法は、あらゆる可能な形状のエネルギーを計算することに依存することが多いですが、これは長い配列に対しては不可能なプロセスとなります。他の手法は、多くの類似したウイルスを比較してパターンを見つけ出すことを必要としますが、ウイルスがあまりに異なっている場合には機能しません。Albatrossは、配列データ自体から直接学ぶことで、これらの問題を回避します。研究者たちは、訓練データのサイズとモデルのサイズを大きくするにつれてモデルの精度が向上することを発見しており、これはこのアプローチがより多くのデータを得ることで継続的に改善できることを示唆しています。
この研究は、RNA生物学へのアプローチにおける重大な転換を象表しています。これらの分子を物理方程式で解くべき静的なパズルとして扱うのではなく、研究者たちはそれらを「学習すべき言語」として扱いました。その結果は、ウイルスの進化の歴史が、人工知能によって解読可能な形でその配列の中にエンコードされていることを示しています。これらのウイルスの構造的論理を明らかにすることで、この研究はウイルスがどのように機能し、どのようにしてそれを阻止できるかを理解するための強力な新しいツールを提供します。これらの構造を大規模に予測できる能力は、科学者がこれまで研究が困難であった数千のウイルス配列の機能的可能性を探求することを可能にし、ウイルス学と医学における新たな発見への扉を開いています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。