mRNA Design and Optimization with Deep Knowledge-Infused Approach
本論文は、メカニズムに整合した損失関数を統合することで、絶対的な配列忠実度、大幅に改善された生物学的指標、および高スループットを実現し、mRNA設計をブラックボックスなプロセスから予測可能で説明可能なエンジニアリング問題へと変貌させる、知識注入型TransformerモデルであるRNopを導入するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
メッセンジャーRNA、すなわちmRNAは、細胞の「指示書」です。それはDNAからタンパク質製造工場へと遺伝的な設計図を運び、細胞に対してどのタンパク質をどの程度の量で作るべきかを正確に伝えます。数十年にわたり、科学者たちは医療用途のためにこれらの指示書を書き換えることに苦心してきました。研究者がワクチンや治療法を作るためにmRNAを設計する際、彼らは困難なバランス調整に直面します。細胞がより多くのタンパク質を生成するように配列を微調整しなければなりませんが、作られるタンパク質そのものを変えてしまうと治療は失敗するため、変更することはできません。また、これらを一度に数千もの配列に対して設計できるほど迅速に行う必要があります。これまで、既存のツールは科学者に目標の選択を強いてきました。つまり、タンパク質が正しい状態であることを保証するか、あるいは速度と量を最適化するか、そのどちらか一方を選ぶ必要があり、両方を同時に達成することは極めて稀でした。
現在、ある研究チームが、この膠着状態を打破する新しいアプローチを開発しました。コンピュータモデルに単にパターンを推測させるのではなく、特定の生物学的ルールに従うよう学習させることで、彼らは完璧な精度、高い速度、そして向上したタンパク質生産量を備えた、mRNA配列を最適化できるシステムを作り上げました。RNopと呼ばれるこの手法は、設計プロセスを「謎めいた推測ゲーム」としてではなく、あらゆる変更が既知の生物学的原理によって導かれる「制御されたエンジニアリング・タスク」として扱います。その結果、このツールは、最終的なタンパク質が意図した通りであることを保証しながら、従来の手法よりも大幅に効果的なmRNA配列を生成することができます。
mRNA設計における核心的な課題は、しばしば「不可能な三角形」と表現されます。一つの角にあるのは「忠実性(フィデリティ)」であり、新しい配列が元の配列と全く同じタンパク質を生成しなければならないという要件です。二つ目の角は、「複数の生物学的目標を同時に最適化する能力」であり、例えばmRNAをより安定させたり、細胞が読み取りやすくしたりすることなどが含まれます。そして三つ目の角は「速度」、すなわち膨大な数の配列を迅速に処理する必要性です。従来のコンピュータ・アルゴリズムは、タンパク質が正しいことを保証できましたが、大規模な使用には遅すぎました。最新の人工知能モデルは高速で多くの目標を最適化できましたが、しばしば小さな意図しないミスを犯してタンパク質を変えてしまい、設計を使い物にならなくさせてしまいました。これらのモデルは、膨大なデータから学習するものの、基礎となるルールを理解せずに動く「ブラックボックス」のように機能しており、エラーを制御したり、なぜ特定の選択をしたのかを説明したりすることは不可能でした。
研究者たちは、コンピュータの学習方法を変えることでこの問題を解決しました。モデルにデータから単独でルールを推測させるのではなく、トレーニング中のペナルティと報酬のシステムを通じて、生物学のルールを明示的に教え込んだのです。彼らは、遺伝暗号と結果として得られるタンパク質との関係を理解するモデルを構築しました。もしモデルがタンパク質を変化させるような変更を提案した場合、システムは即座にその提案にペナルティを課し、タンパク質を同一に保つための別の経路を見つけるようモデルを強制します。これにより、最終的な出力が常に元のタンパク質に対して忠実であることが保証されます。同時に、モデルは、細胞の機構が好む遺伝暗号の選択や、配列をより安定させるための配置など、他の有益な変更を行うことに対して報酬を与えられます。
このアプローチにより、チームは600万以上の遺伝配列を用いてシステムを訓練することができました。コンピュータ・シミュレーションによるテストでは、この新モデルは元のタンパク質と完全に一致する配列を一貫して生成し、エラーはゼロでした。同時に、これらの最適化された配列は、細胞がそれらをどれほど読み取りやすいかを予測する生物学的指標において、顕著な改善を示しました。モデルは、さまざまな長さの配列を扱い、細菌からヒトに至るまで異なる種を横断して機能することができ、それが単に特定の例を暗記したのではなく、生物学の一般的なルールを学習したことを証明しました。長い配列に苦戦したり、一つの設計に数時間を要したりした旧来の手法とは異なり、この新システムは毎秒数十の最適化された配列を生成することができ、高スループットな産業応用にも適しています。
実世界での知見を確認するため、研究者たちは生きている細胞を用いて最適化された配列をテストしました。ラボの培養皿の中でヒト細胞を用い、新しい指示書からどれだけのタンパク質が生成されるかを観察しました。その結果は驚くべきものでした。この新システムによって設計された配列は、すでに商業基準で高度に最適化されているとされる配列よりも、最大2.28倍多くのタンパク質を生成しました。ある特定のテストでは、競合他社の手法が、メッセージの構造を変えすぎてしまったためにタンパク質をほとんど生成できず、完全に失敗しました。新システムは、すべての必要な要素をバランスよく調整することでこの失敗を回避し、メッセージが読み取りやすく安定した状態であることを確実にしました。これは、コンピュータの予測が実際の生物学的成功に直結していることを示しました。
このシステムの強みはその透明性にあります。ルールがモデルに組み込まれているため、科学者は異なる目標の重要度を調整できます。タンパク質を変えないことを極めて厳格にしたい場合は、ルールを厳しく設定できます。もし新しい可能性を探求するために少し柔軟性を持ちたい場合は、ルールを緩めることができます。この制御により、設計プロセスは謎めいた試行錯誤の演習から、予測可能なエンジニアリングの規律へと変わります。研究者たちは、モデルに解釈可能な知識を注入することで、以前は互いに排他的であると考えられていた結果を達成できることを示しました。
この研究は、科学者が生物学的設計にどのようにアプローチするかという点における転換を意味しています。それは、人工知能を自然界のパターンを盲目的に見つけるために使うのではなく、既知の科学的原理を厳密に適用するために使う方向へのシフトです。このシステムは柔軟性に富んでおり、科学者が新しい生物学的ルールを発見した際には、システム全体を再構築することなく、そのルールをモデルに追加できます。これは、新しいワクチンから工業的なタンパク質生産に至るまで、より幅広い用途に向けてmRNAを設計するための扉を開きます。忠実性、最適化、そして速度という「不可能な三角形」を解決することで、研究者たちは、生命の指示書のエンジニアリングをより精密かつ強力にする新しいツールを提供したのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。