命を救うタンパク質製剤を作ること自体は、戦いの半分に過ぎません。もう半分の戦いは、棚の上や注射器の中、あるいは人体の中で生き残れるほど、それを十分に安定させることです。抗体やその他の複雑なタンパク質を含むバイオ医薬品は、溶けている液体が完璧にバランスが取れていないと、容易に凝集したり形状を失ったりしてしまう脆弱な分子です。数十年にわたり、その完璧なバランスを見つけ出す作業は、試行錯誤による遅い手作業のプロセスでした。科学者はタンパク質をさまざまな緩衝液、糖、塩と混合し、それが耐えうるかどうかを確認するために数週間待ちます。このボトルネックはコストがかさみ、特に信頼できる冷蔵設備のない地域において、新しい薬が患者に届くスピードを制限しています。核心となる課題は、科学者はタンパク質とその環境との相互作用に関する基本的なルールを知っているものの、コンピュータに新しい薬の適切な混合比を予測させるための、実世界のデータがほとんど存在しないことです。既存のほとんどのコンピュータツールは、人間がすでに提案した混合物のリストをランク付けすることしかできず、ゼロから新しい安定した混合物を発明することはできません。
ある研究者が、コンピュータに安定した薬の混合物を「想像」させることを目的とした、BioForm-LMと呼ばれる新しいシステムを導入しました。ほとんどの新しいタンパク質については膨大な過去の実験ライブラリが存在しないため、このシステムは、過去のデータに頼るのではなく、3つの戦略を用いています。第一に、タンパク質がさまざまな液体の中でどのように振る舞うかを模倣する、高速の物理ベースのシミュレーションを実行します。このシミュレーターは、100万通りの合成されたタンパク質混合物とその安定性を生成し、コンピュータに化学と物理学の基本法則を教え込みます。第二に、システムはわずかな例から学習できるタイプの人工知能を使用します。科学者が新しいタンパク質を安定させたい場合、その特定のタンパク質に関する3つから10個の実際の測定値のみをコンピュータに提供します。システムは、これらの少数のデータポイントを使用して、再学習することなく、即座に理解を適応させます。最後に、同じ物理法則に基づいて訓練された専門のチェッカーが、コンピュータの提案をレビューし、実世界で最も機能する可能性が高いものを選び出します。
研究者は、科学文献に見られる18種類の実際の薬の処方を厳選した小さなコレクションを用いて、この手法のテストを行いました。その結果、このシステムは、ランダムな推測よりも大幅に優れた、実行可能な新しい混合レシピを生成できることが示されました。ある小さな抗体断片に関する特定のケースでは、システムは、わずか3つの実データのポイントを用いて、予測と実際の実験結果との完全な一致を実現しました。平均して、システムはランダムな探索がカバーする範囲の約5倍近い化学空間を探索しており、これはシステムが単に古いデータを記憶しているのではなく、タンパク質を安定させる方法に関する真のパターンを学習したことを示唆しています。また、システムは異なる種類のタンパク質に適応でき、救おうとしている特定の分子に応じて戦略を変化させられることも実証しました。
しかし、著者は、これらの結果はあくまで計算上の仮説であり、完成した医薬品ではないことに注意を払っています。生成された混合物が、実際の試験管の中で実際に機能するかどうかを確認するためのウェットラボでのテストはまだ行われていません。テストに使用されたデータセットはわずか18件の記録であり、非常に小さいため、今日における知見の広範な適用には限界があります。研究者は、このツールは科学者がテストするための候補を提案するように設計されており、実験室での作業を完全に置き換えるためのものではないと強調しています。彼らはこれを、コンピュータが数千もの可能な混合物を、最も有望な一握りのものへと迅速に絞り込むことができる未来への第一歩であると考えており、それによって手動のスクリーニングに要する数ヶ月の時間を節約できると考えています。システムはシミュレーションにおいて大きな有望性を示しましたが、究極の証明は、コンピュータが生成したレシピが、実際に脆弱なタンパク質を長年にわたって安定させ続けられるかどうかを検証する物理的な実験によってもたらされることになります。
技術要約:BioForm-LM
問題提起
バイオ製剤(タンパク質、抗体)の安定な製剤設計は、依然として創薬における重要なボトルネックであり、手動のスクリーニング、専門家の経験則、および低速な反復実験サイクルに依存しているという課題がある。重大なデータ不足の問題も存在する。公開文献に含まれる実際の製剤データは、あらゆるタンパク質を合わせても約100〜200件程度であり、ほとんどのスクリーニングデータは企業秘密である。さらに、既存の計算ツールは固定された候補セットのスコアリングやランキングに限定されており、レシピをde novo(新規に)生成する能力を持つ手法はこれまで存在しなかった。現在の生成モデルは小分子(SMILES)やタンパク質配列に焦点を当てており、製剤に特化したツールには生成能力が欠けている。
手法
BioForm-LMは、データの希少性と製剤設計における生成能力の欠如に対処するために設計された、3段階の生成システムである。これは、メカニスティック・シミュレーション、インコンテキスト(文脈内)・フューショット学習、および物理学に基づいたデコーディングを組み合わせたものである。
メカニスティック・シミュレーター(事前学習データの生成):
物理ベースのフォワードモデルを用いて、(タンパク質記述子、レシピ) → 安定性スコア という構成の合成トレーニング・トリプル 105 個を生成する。このシミュレーターは2つの物理的要素をエンコードしている:
- DLVOコロイド理論: pH、イオン強度、および緩衝液種によって変調される静電相互作用およびファンデルワールス力に基づき、相互作用エネルギー(UDLVO)を算出する。
- Lumry–Eyring凝集キネティクス: 文献の示差走査蛍光法(DSF)データに対して較正された凝集速度(kagg)をモデル化する。
安定剤の効果(例:トレハロース、スクロース)は、優先的水和およびオスモライトによる混雑効果に基づくヒューリスティックとして適用される。
インコンテキスト生成トランスフォーマー:
合成コーパスで事前学習された、小規模なデコーダーのみのトランスフォーマー(パラメータ数10〜150M)を用いる。製剤は、バッファー成分、pHビン、イオン強度ビン、および安定剤濃度を含む、199個のトークンからなる離散的なシーケンスとしてトークン化され、タンパク質記述子(MW、pI、ベースライン Tm)によって条件付けられる。
- 推論: 新規のタンパク質に対し、モデルはインコンテキスト学習を行う。公開文献から得られた K=3–10 個の実測安定性データをプレフィックス・コンテキストとして提供する。モデルは、勾配更新(重みの凍結)を行うことなく、これを用いて N 個の候補レシピを自己回帰的に生成し、これによりベイズ適応をフォワードパスへと実質的にアモルタイズ(償却)させる。
物理学に基づいたクリティック(評価器)とBest-of-Nデコーディング:
メカニスティック・シミュレーターから蒸留された2層のMLPである軽量なクリティックが、N 個の生成候補を再ランキングする。このクリティックは、保持された合成データに対するシミュレーターの出力との平均二乗誤差を最小化するように学習される。システムはBest-of-Nデコーディングを採用し、出力が物理的に妥当かつ実データと整合した領域内に留まるよう、最も高いクリティック・スコアを持つ候補を選択する。
主な貢献
- 初の生成型製剤システム: BioForm-LMは、バイオ製剤の製剤設計に生成言語モデルを適用した初の研究であり、既存のレシピのランキングを超えて、新しいレシピをde novoで提案することを可能にした。
- 斬新なアーキテクチャ: メカニスティック・シミュレーター、インコンテキスト・トランスフォーマー、および物理学ベースのクリティックを、離散的なレシピ設計のための単一の「Sim-to-Real」パイプラインに統合した。
- フューショット適応: 極端なデータ不足下においても、わずか3〜10個の実データを用いて特化できる、適応的なフューショット生成を実現した。
- オープンベンチマーク: 著者らは、厳格なLeave-One-Protein-Out(LOPO)評価に使用するための、18の文献収集済み製剤レコード(IgG、scFv、Fabタンパク質にまたがる)からなる精選データセットBioFormBenchを導入した。
結果
BioFormBenchを用いたLOPOクロスバリデーションによる評価:
- Recall@10: BioForm-LMは 0.167 のRecall@10を達成し、ランダムフォレスト(0.080)およびSVM(0.050)のベースラインを上回った。
- カバレッジ: モデルは離散化された製剤空間の 35.3% をカバーしており、これはランダムサンプリング(7.5%)の 4.7倍 であり、無指向的な探索ではなく、基礎となる物理構造を学習していることを示している。
- 較正(キャリブレーション): モデルの較正精度はタンパク質によって変動した。特筆すべきは、3つのインコンテキスト・エキサンプルのみを用いて、保持されたscFv(P2)に対して完全な較正(Spearman r=1.0,p=0.0)を達成した点である。逆に、IgG(P1)は探索的レジーム(r=−0.60)を示し、ランク相関を犠牲にしてより広いカバレッジを獲得した。
- アブレーション研究: インコンテキスト適応を除去するとRecall@10は 67% 低下し、物理クリティックを除去すると 33% 低下した。これにより、両方のコンポーネントが不可欠であることが確認された。
- 多様性: 生成された候補は、全タンパク質にわたって高い多様性(平均ペアワイズ距離 ≈0.404)を維持し、モード崩壊を回避した。
意義と主張
本論文は、メカニスティックな事前学習とインコンテキスト適応を組み合わせることが、真のデータが高価で希少な領域における生成設計への有効な経路であることを示していると主張している。
- 実用的な影響: 本システムは、物理学に基づいた50個の候補を数秒で提案できるため、安定な製剤の特定に要する時間を数ヶ月から数日へと短縮し、治療への到達時間を加速させ、コストを削減できる可能性がある。
- 謙虚さと限界: 著者は、ベンチマークが予備的なものである(18の製剤)こと、およびウェットラボでの検証が行われていないことを明示している。生成されたレシピは実験的スクリーニングのための計算上の仮説であり、そのまま展開可能な製剤ではない。scFvにおける完全な較正は、実験的な代替物としてではなく、実験テストへの動機付けとして提示されている。
- 今後のロードマップ: 直近の優先事項は、ベンチマークを100件以上のレコードにスケールアップすること、およびウェットラボでの検証を求めることである。中期的目標は、ヒューリスティックな物理学を分子動力学シミュレーターに置き換え、免疫原性や製造可能性を含む目的関数を拡張することである。
毎週最高の biology 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録