Evaluation of multiple sclerosis risk loci reveals that genomic oracles fail to generalise sequence effects across host contexts
本研究は、ディープラーニングによるゲノム・オラクルが異なるホスト環境間で配列効果を汎化させることに失敗しており、それらの調節エレメント活性の予測は特定のゲノム位置に強く依存し、配列特徴のみでは信頼性高く予測できないことを実証している。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ヒトゲノムという広大な景観の中で、特定のDNA領域はスイッチとして機能し、遺伝子のオン・オフを切り替えて細胞の機能を制御しています。科学者たちは、これらのスイッチがどこでどのように作動するかを指示する正確なコードを理解しようと長年試みてきました。近年、この言語を解読するために強力なコンピュータプログラムが登場しました。「ゲノミック・オラクル(ゲノムの神託)」としばしば呼ばれるこれらのプログラムは、DNAの文字の列を見て、それが生細胞内でどのように振る舞うか、つまり、遺伝子活動を許容するために開くのか、あるいは閉じたままになるのかを予測することができます。これらのデジタルツールは、実験室での実験と比較して高速かつ安価であるため、研究者は新しいDNA配列を設計するためにますます利用しており、意図した通りに機能するカスタム・スイッチを作り出すことを期待しています。その根底にある希望は、もし特定のDNA配列がゲノムのある部分で優れたスイッチであるとコンピュータプログラムが示したならば、それを別の場所に移動させても優れたスイッチであり続けるだろう、というものです。
新しい研究は、同じDNA配列をゲノム内の異なる場所に配置したときに、これらのデジタルな予測が維持されるかどうかをテストすることで、この根本的な仮定に異議を唱えています。研究者たちは、免疫系が神経系を攻撃する疾患である多発性硬化症に焦点を当て、その発症リスクを高めることが知られている特定の遺伝領域を調査しました。彼らは人工知能モデルを用いて、免疫細胞内で調節スイッチとして機能しそうな数千の候補DNA配列を生成しました。次に、ゲノミック・オラクルを使用してこれらの候補をスコアリングし、コンピュータが最も活性が高いと予測したものを選択しました。チームは厳格なテストを実施しました。すなわち、選択された全く同じ配列をゲノム内の24の異なる場所に配置し、コンピュータの予測が一貫性を保っているかどうかを確認したのです。
結果は、驚くべき一貫性の欠如を明らかにしました。コンピュータプログラムは単一の場所内では配列をうまくランク付けできましたが、配列を移動させるとその予測は失敗しました。DNA配列への特定の変更による効果は、配列自体の固定された特性ではなく、その配列がゲノムのどこに位置しているかに完全に依存していました。ある場所では、DNA配列への特定の編集が配列をより活性化させましたが、他の場所では、全く同じ編集が活性を低下させるか、あるいは何の影響も与えませんでした。研究者たちは、配列の振る舞いが周囲の環境に非常に依存していることを発見しました。場所による変動は極めて大きく、テストされたサイトのほぼ半分で効果の方向が逆転していました。
コンピュータが実際に何を「見て」いたのかを理解するために、チームはDNA配列への直接的な介入を行いました。彼らは、コンピュータの好みが、遺伝を制御することが知られているタンパク質の特定の結合部位の存在によるものか、あるいはそれらの結合部位の密度によるものかをテストしました。答えはノーでした。これらの結合部位を取り除いたり、その数を変えたりしても、コンピュータのスコアが予測可能な形で変化することはありませんでした。代わりに、真に重要であった要因は、2つのDNA文字のペアリングを伴う「CpG」と呼ばれる特定の化学構造の含有量でした。しかし、この要因さえも単独では作用しませんでした。DNA内のこの構造の量を増やすことは、一部のゲノム領域ではスコアを向上させましたが、他の領域ではスコアを低下させました。効果の方向は、編集そのものではなく、ホストとなる場所によって決定されていました。
研究では、別の独立して訓練されたコンピュータプログラムが同様の結果を示すかどうかもテストされました。異なるアーキテクチャと異なるデータを用いて構築されたこの新しいモデルは、主要な発見を裏付けました。すなわち、DNA編集の効果は非常に不安定であり、ゲノムの位置によって激しく変動するという事実です。しかし、2つのプログラムは、どの場所がプラスまたはマイナスの影響を示すかについては一致しませんでした。これは、不安定性は実在する現象であるものの、モデルが場所をどのように解釈するかという具体的な詳細は、そのモデル固有のものであることを示唆しています。
おそらく最も重要な点として、研究者たちは、コンピュータによって選択された配列が現実の世界の実験において実際にうまく機能するかどうかを確認しました。彼らは、コンピュータのスコアを、数千のDNA要素を含む大規模な実験室のアッセイから得られた測定された活性と比較しました。コンピュータの選択基準は、どの配列が細胞内で真に活性を持つかを予測することに失敗しました。実際、コンピュータが最高のパフォーマンスを示すと評価した配列は、実験室では逆の挙動を示すことが多く、最も特異的で活性の高い要素ほど、オラクルによるスコアが低くなっていました。この乖離は、コンピュータが最適化しようとしている特定の目標が、DNAの実際の生物学的活性を反映していないことを示唆しています。
研究者たちはまた、DNAの文字のパターンを数えることに基づく、より単純な数学的手法が、複雑なディープラーニング人工知能モデルと同等の配列を生成できることも発見しました。この単純な手法は、強力なコンピュータを必要とせず、数秒で適合させることができ、高度なニューラルネットワークと同等の性能をあらゆる指標で達成しました。この発見は、この文脈におけるDNA配列の不可欠なパターンを捉えるために、ディープラーニングモデルの複雑さは必ずしも必要ではないことを示唆しています。
最終的に、本研究は、ゲノミック・オラクルによって学習または測定された配列レベルの効果は、配列単独の特性ではないと結論付けています。それは、配列と、それが位置する特定のゲノム環境との組み合わせによる特性なのです。この場所への依存性は、周囲のDNAの単純で安価な特徴からは予測できません。設計された遺伝要素を設計する科学者にとって、これは、コンピュータ・シミュレーションにおいてある場所で検証・選択された設計が、一度移動したり挿入されたりした際にどのように振る舞うかについて、何の保証も持たないことを意味します。これらの強力なデジタルツールは有用ではあるものの、複数の場所での直接的な実験的検証なしには、設計された配列の挙動を予測するためにまだ信頼することはできない、ということがこの知見による警告となっています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。