細胞は生命の基本単位であり、それぞれが数千もの遺伝子が共に働き、機能を維持し変化に対応する複雑な工場として機能しています。科学者が、薬物や遺伝的変化といった特定のストレス因子に対して細胞がどのように反応するかを理解したいとき、彼らはしばしば、個々の遺伝子の活動がどのように変化するかを知る必要があります。機能ゲノミクスとして知られるこの分野は、あらゆる可能性に対して高価で時間のかかる実験を行うことなく、これらの変化を予測することを目指しています。長年、研究者たちは細胞の遺伝的活動を一度に生成される単一の統合された図として扱い、これらの細胞応答をシミュレートするためのコンピュータモデルを構築してきました。しかし、このアプローチは、ある重要な生物学的現実を見落としています。それは、遺伝子は孤立して、あるいは同時に反応するのではないということです。むしろ、一つの遺伝子の反応が別の遺伝子の反応を誘発したり影響を与えたりするという「指揮系統」の中で機能し、時間の経過とともに展開される特定のイベントの連鎖を作り出しているのです。
新しい研究は、この自然な順序を尊重することで予測のあり方を変える「D2R2」と呼ばれる手法を紹介しています。予測全体を一気に推測するのではなく、研究者たちは遺伝子を一つずつ、段階的に構築していくシステムを設計しました。核心となるアイデアは、どの順番で遺伝子を予測するかということが、予測そのものと同じくらい重要であるということです。これを実現するために、チームは2つの異なるツールを組み合わせました。第一に、遺伝的数値を連続的なぼやけとしてではなく、離散的なステップのシーケンスとして生成するモデルを使用しました。第二に、より重要な点として、生物学的なルールに基づいて次にどの遺伝子を予測すべきかを決定するガイドとして機能する「制御ポリシー」モジュールを追加しました。このガイドは、摂動のない細胞において遺伝子が通常どのように互いを制御しているかというマップから始まりますが、特定の変化が生じた際にそのマップを適応させることができ、新しい条件下でどの遺伝子を最初に予測することが最も重要になるかを学習します。
研究者たちは、ヒト細胞の実際のデータを含む2つの大規模なデータセットを用いて、このアプローチをテストしました。一方のデータセットは、特定の種類の血球における1,000種類以上の異なる遺伝的変化を含んでおり、もう一方は胚性幹細胞における数百の遺伝的介入に焦点を当てたものでした。これらのテストにおいて、この新手法は測定されたすべての指標において既存のすべてのモデルを上回りました。この手法は、細胞が異なる種類の変化に対してどのように反応するかという微妙な違いを捉えることに特に成功しましたが、これは従来のモデルがしばしば苦戦してきた課題でした。研究は、この手法の成功がデータの生成順序に大きく依存していることを示しました。研究者がシステムに遺伝子をランダムに選ばせたとき、結果は芳しくありませんでした。モデル自身の不確実性を用いて順序を決定しようとしたとき、結果は一貫性がなく、しばしばランダムな場合よりも悪化しました。しかし、システムが遺伝子制御の生物学的マップに従ったとき、予測は大幅に向上しました。さらに明白なことに、研究者が意図的に生物学的順序を逆転させ、最後に予測されるべき遺伝子を最初に予測させたところ、パフォーマンスはランダムな試行を下回りました。これは、生物学的な影響の自然な方向に従うことが不可欠であることを証明しています。
さらなる分析により、システムが適切なタイミングで適切な遺伝子を優先的に選択することを学習していることが明らかになりました。システムは、制御対象となる遺伝子を予測する前に、細胞のマスタースイッチとして機能する制御遺伝子の活動を予測することを一貫して選択しました。これは、実細胞が情報を処理する方法、すなわち下流の詳細を埋める前に上流のコンテキストを確立するという方法を模倣しています。また、システムは特定の条件下でのみ活性化する特定の遺伝子を特定し、それらが関連する場合には予測シーケンスの前方に持ってくることも学習しました。細胞の遺伝的応答の生成を、単一のスナップショットではなく、ガイドされた逐次的なプロセスとして扱うことで、この研究は細胞の振る舞いをモデル化する新しい方法を確立しました。これは、予測が辿る経路が目的地と同じくらい重要であることを示しており、細胞が周囲の世界にどのように反応するかを理解するための、より正確で生物学的な根拠に基づいた方法を提供しています。
技術要約: D2R2 – 単一細胞摂動予測のための調節強化を用いた離散拡散モデル
問題提起
遺伝的摂動に対する単一細胞トランスクリプトーム応答を正確に予測することは、機能ゲノミクスおよび創薬における中心的な課題である。高スループットの実験データは存在するものの、その生成には多大なコストがかかるため、in silico(コンピュータ内)の仮想細胞モデルの開発が求められている。トランスフォーマーベースのシングルパス予測器、変分オートエンコーダー、および拡散モデルを含む既存のアプローチは、主にプロファイルレベルの生成パラダイムに従っている。プロファイル全体を一度に生成するか、あるいはプロファイル全体を反復的にデノイジング(ノイズ除去)するかに関わらず、これらの手法は個々の遺伝子応答が生成される順序をモデル化していない。この欠落は極めて重要である。なぜなら、遺伝子の応答は相互依存的であり、構造化された順序で予測を行うことで、初期の予測が後続の予測に対して情報提供的なコンテキスト(文脈)を提供できる可能性があるからである。さらに、単純な順序付け戦略(例:ランダム選択やモデルの不確実性に基づくもの)は、潜在的な遺伝子制御構造を活用できていない。また、コントロール細胞から導出された固定的な制御事前分布は、特定の摂動や進化する生成状態に適応することができない。
メソドロジー: D2R2 フレームワーク
著者らは、摂動予測を調節ガイド型の遺伝子単位の逐次生成タスクとして再定式化したD2R2 (Discrete Diffusion with Regulation Reinforcement) を提案する。このフレームワークは、主に2つのコンポーネントで構成される。
1. マスクされた離散拡散モデル (MDDM)
D2R2は、連続的な発現値を等頻度ビン分割による順序離散トークンとして表現する。
- 生成プロセス: モデルは完全にマスクされたプロファイルから開始し、ステップバイステップでこれを再構成する。各ステップにおいて、未解決(マスクされた)遺伝子のサブセットが選択され、MDDMはその発現トークンを予測する。
- コンテキストによる条件付け: トークンが予測されると、それは固定され、後続のステップのための明示的なコンテキストとして機能する。これにより、生成された遺伝子応答が、依然としてマスクされている遺伝子に対して条件付けを行うことが可能になる。
- 学習: MDDMは、ランダムにマスクされた位置に対する x0 予測目的関数を用いて学習され、コントロールプロファイル、摂動条件、および細胞共変量に基づき、部分的にマスクされたプロファイルから元の離散トークンを再構成することを学習する。
2. 調節ポリシーモジュール (RPM)
次にどの遺伝子を生成すべきかを決定するために、D2R2は適応的な生成ポリシーを学習するRPM (Regulatory Policy Module) を導入する。
- 生物学的初期化: ポリシーは、DeepSEMを用いて非摂動のコントロール細胞から推論された遺伝子制御ネットワーク (GRN) から導出された生物学的事前分布を使用して初期化される。遺伝子はGRN上のPageRankスコアによってランク付けされ、影響力の強い上流のレギュレーター(調節因子)が優先される。
- GRPOによる適応的精緻化: RPMはこの静的な事前分布を、状態および摂動に特異的なポリシーへと変換する。グループ相対方策最適化 (GRPO) を用いて、MDDMジェネレータを凍結した状態で、RPMを精緻化する。
- 報酬信号: 報酬は、予測された摂動効果とグラウンドトゥルース(正解)との最終的な一致度(差分的発現の相関として測定)に基づく。
- メカニズム: ポリシーは、マスクを解除する遺伝子のサブセットをサンプリングする。この最適化は、解決された遺伝子が、残りの遺伝子に対して最も情報量の多いコンテキストを提供し、最終的な予測品質を向上させるような遺伝子の選択を促進する。
学習と推論
学習は2段階で進行する。
- MDDMの学習: マスクされた入力から発現トークンを再構成することを学習する。
- RPMの精緻化: RPMを生物学的事前分布を再現するように初期化し、その後、MDDMを凍結し、最終的な摂動効果の一致度を報酬としてGRPOを用いて順序付けポリシーを精緻化する。
推論時には、MDDMは各ステップでRPMによって選択された遺伝子のサブセットに対してトークンを予測し、全プロファイルが生成されるまで反復する。
主な貢献
- 遺伝子単位の逐次生成の定式化: 本論文は、単一細胞摂動予測を、マスクされた離散拡散モデル (MDDM) を用いた遺伝子単位の逐次生成タスクとして定式化し、生成順序を明示的にし、解決された遺伝子がマスクされた遺伝子を条件付けできるようにした。
- 調節ポリシーモジュール (RPM): 著者らは、コントロール由来の生物学的事前分布から初期化され、GRPOを用いて(生成器を固定したまま)精緻化される順序付けポリシーを導入した。これにより、摂動および現在の生成状態に特異的な生成順序が生成される。
- 生成順序の制御された分析: 制御されたアブレーション研究を通じて、本研究は、生成順序とその方向性が実質的な設計上の選択肢であることを確立し、生物学的に根拠のある順序付けが、ランダムまたは不確実性に基づく戦略よりも優れていることを示した。
実験結果
本手法は、Norman19 (K562細胞, Perturb-seq) および VCC-H1 (H1胚性幹細胞, CRISPRi) の2つのベンチマークで評価された。
- 性能: D2R2は、Norman19データセットにおいて5つの指標すべてで最高の性能を達成し、H1データセットにおいても競争力のある結果(ほとんどの指標でトップ)を示した。特に、差分的発現指標(Pearson Δ, Cos. LogFC, Cos. LogFC Rank)において、最先端のベースライン(SAMS-VAE, Cell Flow, Squidiff, scDFMを含む)を凌駕した。
- アブレーション研究:
- 順序付け戦略: MDDMを固定した場合、生物学的事前分布による順序付けは、ランダムな順序付けや不確実性(信頼度/エントロピー)に基づく戦略よりも大幅に優れた性能を示した。
- 方向性: 生物学的事前分布の順序を逆にすると、性能はランダムな順序付けを下回るまで低下した。これは、規制依存性を正しい方向で追うことが不可欠であることを示している。
- RPMの有効性: ランダムな初期化であっても、RPMはランダムな順序付けよりも指標を改善した。生物学的初期化を用いると、精緻化されたRPMはすべての摂動効果指標を改善し、強化学習が静的な事前分布を特定の摂動に適応させることに成功したことを示した。
- 生物学的分析:
- 精緻化されたポリシーは、生成の初期段階で制御遺伝子を優先し、下流の応答を生成する前に上流のコンテキストを確立した。
- RPMは、摂動特異的な転写因子 (TF) および応答遺伝子を優先的に進展させ、摂動によって引き起こされる特定の制御再編成を捉えた。
- RPMによって促進された遺伝子は、摂動に応答する差分的発現(DE)遺伝子および細胞周期関連のパスウェイに富んでいた。
意義と主張
本論文は、D2R2が、単一細胞摂動予測における効果的で制御可能、かつ生物学的に解釈可能な次元として遺伝子生成順序を確立したと主張している。生成モデルと生成順序学習を分離することで、本フレームワークは以下を実証している:
- 構造の重要性: 制御生物学に導かれた遺伝子解決の順序を明示的にモデル化することは、プロファイルレベルの生成や構造化されていない順序付けと比較して、優れた予測性能をもたらす。
- 適応性の鍵: 静的な生物学的事前分布だけでは不十分である。強化学習を通じて、特定の摂動および進化する生成状態に順序付けポリシーを適応させる能力が、複雑で摂動特異的な依存関係を捉える上で極めて重要である。
- 解釈可能性: 生成順序自体が生物学的洞察を提供し、モデルが自然に上流のレギュレーターと摂動特異的なドライバーを優先していることを明らかにし、既知の細胞応答の生物学的メカニズムと一致している。
著者らは、本アプローチが、表現(レプリゼンテーション)のためだけでなく、動的なガイドとして制御構造を活用する、仮想細胞モデリングの新しいパラダイムを提示していると結論付けている。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録