RNASeek: A Cross-Phyla Generative Foundation Model for Multipurpose RNA Modeling and Reinforcement Learning-Based Design
RNASeekは、強化学習を活用してRNA配列の表現、機能予測、およびデノボ設計を統合する16億パラメータの生成基盤モデルであり、実験的に検証されたリボザイムおよび3' UTRを優れた性能で生成することに成功しています。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
あらゆる生細胞の内部では、言葉ではなく分子を用いた、広大かつ複雑な対話が行われています。この対話の中核を担うのはRNAであり、それは遺伝的な設計図からの指示を運び、その指示がいかに実行されるかを決定する、メッセンジャーと調節因子の両方の役割を果たす多才な分子です。数十年にわたり、科学者たちは、RNA鎖における文字の特定の順序が、文章における文字の配置が意味を決定するのと同様に、その形状と機能を決定することを理解してきました。しかし、新しい文字の配列がどのように振る舞うかを正確に予測することは、困難な課題でした。そのルールは複雑であり、手作業でマッピングすることが困難な長距離相互作用や微妙な構造的ニュアンスを含んでいます。現在、研究者たちは、生命自体の生物学的文献を読み取ることでこれらのルールを学習し、RNAがどのように振る舞うかを予測するだけでなく、特定の望ましい特性を持つ全く新しい分子を設計することを可能にする新しいツールを開発しました。
この研究の背後にあるチームは、カリフォルニア大学リバーサイド校とコロンビア大学の研究者たちによって率いられ、RNASeekと呼ばれる巨大なコンピュータプログラムを作成しました。このプログラムを、植物や動物から真菌やウイルスに至るまで、100種類以上の異なる種の遺伝的指示を含む図書館にあるすべての本を読んだ学生と考えてください。特定のパズルを解くだけのために設計された従来のツールとは異なり、RNASeekはRNAの一般的な言語を理解するように構築されました。これは約150億個の遺伝情報のデータセットで学習され、異なる生物がどのようにRNAを構築するかというパターンを認識することを学びました。また、このプログラムは自然言語による指示を読み取ることにも長けており、つまり、科学者は単に「安定したRNA配列を作成せよ」や「自身を切断する分子を設計せよ」といったように、自分が何を望んでいるかを伝えるだけで、モデルは解決策の生成を試みることができます。
このデジタルな学生が本当に言語を習得したかどうかをテストするために、研究者たちはまず、リボザイムの挙限を予測させました。リボザイムとは、自身や他の分子を切断することができる酵素として機能するRNA分子のことです。チームはモデルに、既知の数千のリボザイム配列とその切断速度を与えました。RNASeekは、どの配列が速く切れ、どの配列が遅く切れるかを予測することに成功し、分子構造における特定のループの柔軟性といった、速度に寄与する微妙な特徴を特定しました。モデルは、このタスクに特化して設計された多くの専門的なツールと同等、あるいはそれ以上の性能を発揮し、RNAの構造がいかに機能を決定するかという根本的な原理を把握していることを証明しました。
この成功に勇気づけられた研究者たちは、モデルをさらに推し進め、ゼロから新しいRNA配列を設計させました。彼らは、RNAが細胞内でどのくらい生存するかを決定するのに役立つセクションである、3'非翻訳領域に見られる異なるタイプのRNAに焦点を当てました。寿命が長いということは、そのRNAがコードするタンパク質が細胞内でより多く生産されることを意味し、これはmRNAワクチンなどの治療において極めて重要です。研究者たちは、強化学習と呼ばれる手法を用いました。これは、コンピュータプログラムが試行錯誤のゲームを行う手法です。プログラムは数千の候補配列を生成し、モデルの別の部分が、それらがどれほど安定していると予測されるかに基づいてスコアを付ける「審判」として機能しました。プログラムはその後、より優れた候補を生成するように戦略を調整し、高度に安定した配列を生成することを段階的に学習していきました。
結果は驚くすべきものでした。RNASeekによって設計された配列は、単なるランダムな文字の組み合わせではなく、RNAを安定させるのに役立つことが知られているアデニンやウラシルの豊富さといった、特定のパターンを含んでいました。研究者がこれらのコンピュータ生成のデザインを実験室環境でテストしたところ、新しい配列は非常に優れた性能を示すことがわかりました。設計された分子の中には、自然界で見られる最良の配列や、他の人工知能ツールによって作成されたものよりも安定しているものさえありました。決定的なことに、研究者がこれらの成功したデザインの文字を入れ替え、同じ成分を保ちながらその順序をバラバラにしたところ、安定性は消失しました。これにより、成功の要因が単なる化学組成ではなく、文字の特定の配置にあることが確認され、モデルが言語の真の構文を学習したことが証明されました。
この研究は、モデルが複雑な指示に従えることも示しました。科学者は、クローニングのための特定のモチーフを含めるか、あるいは問題を引き起こす可能性のある特定のパターンを除外した、安定したRNA配列を生成するようにプログラムに命じることができます。モデルは、安定性を最適化しながら、これらの制約をうまく遵守しました。自然言語のコマンドに従って機能的な生物学的パーツを生成できるこの能力は、生命のエンジニアリングにおける新しい方法を示唆しています。実験室での遅くて高価な試行錯誤のサイクルに頼る代わりに、科学者は今や、RNAがどのように振る舞うかを予測し、精密なニーズを満たすための新しい分子を設計するための統一されたシステムを使用できるのです。この研究は、単一の大規模なモデルが、生物学的データの理解と新しい機能的な生物学的ツールの創造との間の溝を埋めることができることを確立しており、より効率的な治療法や研究ツールの設計への扉を開いています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。