Additive-input encoding fails operator-level target-held-out prediction on current Perturb-seq screens
本研究は、現在のPerturb-seqスクリーニングで使用されている加法的な入力エンコーディングモデルが、新たな保持された摂動ターゲットに対して汎化できないことを示しており、これは、推論された制御オペレーターが数学的な識別可能性を備えているにもかかわらず、未知の遺伝子に対する応答を予測するための検証がなされていないことを明らかにしている。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
科学者が、細胞内の個々の遺伝子を同時にオフにし、その結果を観察できる世界を想像してみてください。これは「Perturb-seq」と呼ばれる技術が約束する未来です。特定の遺伝子を抑制する分子ツールを用い、その後に細胞全体の遺伝的応答を読み取ることで、研究者たちは遺伝子がどのように互いに情報を伝達しているのか、その地図を構築しようとしています。究極の目標は、生命の隠れたルール、すなわち、一つの糸を引いたとき、どの他の糸が締まり、どの糸が緩むのかを理解することです。長年、これら膨大な実験を解釈するための標準的な手法は、細胞の応答は構成要素の単純な総和であると仮定することでした。もし遺伝子Aをオフにすれば特定の変化が加わり、遺伝子Bをオフにすれば別の変化が加わるという考え方です。もし両方をオフにしたなら、その結果は単にこれら2つの変化を足し合わせたものになるはずだというわけです。この「加法的(アディティブ)」な見方は、数学的に明快で計算が容易であるため魅力的であり、それによって科学者は細胞内部の配線のマスターコントロール・マップを推論することができます。
しかし、ブリガムヤング大学の研究者による新しい研究は、この単純な加法のルールを実際の生物学的データに適用した場合、根本的に破綻している可能性を示唆しています。カイラー・フルマー、ダルトン・クッツェン、トミー・W・テロテア率いるチームは、これまでに行われた最も大規模で信頼性の高い遺伝子サイレンシング実験のうち3つを取り上げ、加法モデルが、研究者がこれまで見たことのない遺伝子に対して何が起こるかを実際に予測できるかどうかをテストしました。彼らは単にデータを眺めたのではありません。モデルが汎用性を持ち得るかどうかを確認するために、厳格なテスト環境を構築したのです。彼らは次のような率直な問いを立てました。「もしコンピュータがある既知の遺伝子のセットからゲームのルールを学習した場合、遭遇したことのない新しい遺伝子の結果を正しく推測できるだろうか?」
彼らの答えは、「ノー」という明確なものでした。研究者が加法モデルを用いて未知の遺伝子の挙動を予測しようとしたところ、モデルは完全に失敗しました。実際、そのモデルの性能は、何も変化しないと単に推測する人物と比較しても、全く改善が見られませんでした。この失敗が単なる偶然や、データの乱れによるものではないことを確実にするため、チームは完璧なシミュレーションを作成しました。彼らは、理論が主張する通り、ルールが完全に加法的である架空のデータを生成しました。この偽のデータに対してモデルを実行したところ、モデルは非常にうまく機能し、隠されたルールを高精度に復元できました。これは、彼らのテスト手法が健全であり、コンピュータには学習能力があることを証明しました。したがって、問題は数学やデータのノイズではなく、「実在の細胞は単純な総和のように振る舞う」という仮定にあったのです。
研究者たちは、このテストを3つの異なるデータセットに対して行いました。2つは培養皿の中で育てられたヒト細胞を用いた大規模なスクリーンであり、もう1つは異なる用量の遺伝子サイレンシングをテストしたものです。どのケースにおいても、遺伝子が単にその効果を足し合わせるという仮定に基づいたモデルは、新しい遺伝子の結果を予測できませんでした。エラー率は非常に高く、モデルの予測はランダムな推測と区別がつかないレベルでした。チームは、この失敗の原因として考えられるいくつかの可能性を排除しました。研究対象として「最も簡単な」遺伝子を選んだことが原因かどうかをチェックしましたが、遺伝子をランダムに選択した場合でも、モデルは依然として失敗しました。また、研究されている遺伝子の数や、遺伝子が測定される特定の方法が原因であるかどうかも確認しましたが、失敗はこれらの要因に関わらず持続しました。遺伝子サイレンシングの強さの詳細を削ぎ落とし、変化の方向性のみに注目した場合でも、モデルは依然として結果を予測できませんでした。
唯一、わずかな希望の光を示す例外もありましたが、それは控えめなものでした。特定の細胞セットにおいてのみ、モデルは平均的な結果を予測するよりもわずかに優れた精度で新しい遺伝子の結果を予測できました。しかし、このベストケースのシナリオにおいても、モデルが復元できた情報は、完璧で整ったシステムが提供する情報のわずか7パーセント程度でした。それは、失敗の海における小さな勝利に過ぎませんでした。研究者たちは、遺伝子の情報をエンコードするより洗練された方法についてもテストしました。これには、細胞内の自然な状態における遺伝子のつながりを利用する方法や、機械学習を用いてデータから遺伝子の「指紋」を学習する方法が含まれます。しかし、これらの高度な手法も根本的な問題に対処することはできませんでした。彼らは2つの細胞タイプにおいて新しい遺伝子の予測に失敗し、3つ目の細胞タイプにおいては、わずかな改善は見られたものの、理論が約束する水準には遠く及びませんでした。
本研究は、現在の遺伝子サイレンシング・スクリーンの解釈方法はおそらく欠陥がある、と結論付けています。遺伝子が独立したスイッチとして機能し、その効果を単に足し合わせるという仮定は、未知の標的に対してテストを行うと成立しないのです。研究者たちは、なぜこのようなことが起こるのかについて、主に2つの可能性を示唆しています。第一に、遺伝子のアイデンティティを数学的な入力へと変換する方法が、重要な情報の大部分を捨ててしまっている可能性です。これは、複雑な風景を、たった一枚のぼやけた写真だけで説明しようとするようなものです。第二に、生物学的な現実として、遺伝子は単純な線形的な方法では作用せず、その効果が飽和したり閾値に達したりするため、遺伝子をオフにしても一定かつ予測可能な変化が生じるとは限らないという可能性です。
この研究は、遺伝子サイレンシング・スクリーンが無意味であることを意味するものではありませんが、それらから現在構築されているマップは、新しい遺伝子を標的にした際に何が起こるかを予測するための信頼できるガイドではない可能性があることを示しています。研究者たちは、他の科学者が自身のモデルをこれらの厳格な基準に照らして検証できるように、新しいツールキットを公開しました。これにより、将来の発見が確かな基盤の上に築かれることが期待されます。教訓は明白です。生物学はしばしば私たちの最も単純な方程式よりも複雑であり、その複雑さを捉える方法を見つけ出さない限り、細胞が新しい介入に対してどのように反応するかという予測は、不確実なままとなるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。