Towards reconstruction of the human interactome from positive and negative experimental evidence
本論文は、タンパク質間相互作用(PPI)スクリーニングの実験的探索空間を再構成して相互作用しない可能性が高いタンパク質ペアを推論する手法を提示するものであり、これにより、より正確で完全なヒト・インタラクトームのマッピングを実現するための、エラー率の推定、モデルの較正、および機械学習のトレーニングの改善を可能にする。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
あらゆる生細胞の中では、何千ものタンパク質が浮遊し、衝突しながら、絶えず互いに掴み合おうとしています。2つのタンパク質が結合すると、それらは構造を構築したり、信号を送ったり、あるいは廃棄物を分解したりするためのチームを形成します。これらのパートナーシップは「タンパク質間相互作用」と呼ばれ、生命の基本的な配線となっています。これらがなければ、細胞は組織化された機械ではなく、単なる部品の混沌とした集まりになってしまうでしょう。何十年もの間、科学者たちはこれらのつながりをマッピングし、人体の中で誰が誰と対話しているのかを示す巨大なネットワーク図を作成しようとしてきました。この地図は、私たちの体が健康な時にどのように機能し、病気によってどのように崩壊するのかを理解する助けとなります。しかし、現在の地図には穴や誤りが満ちています。私たちは数百万ものこれらのつながりを知っていますが、報告されているリンクの多くが間違いであり、多くの真のリンクが欠落していることも知っています。最大の問題は、科学者たちが「成功した出会い」だけを記録してきたことです。彼らはどのタンパク質が握手を交わしたかは書き留めてきましたが、どのタンパク質が隣に立ちながら互いに無視し合ったかについては、ほとんど書き留めてきませんでした。
この沈黙が盲点を作り出しています。誰が出会ったかだけを知っていては、その出会いが稀で特別な出来事だったのか、それとも単なる幸運な偶然だったのかを判断できません。さらに悪いことに、コンピュータを使って新しい出会いを予測しようとする際、コンピュータには「出会わなかったこと」がどのようなものかを教えなければなりません。通常、科学者は、まだ一緒に見られていない2つのタンパク質は「他人」であると仮定することでコンピュータを学習させます。しかし、これは危険な推測です。2つのタンパク質が一緒にテストされていないからといって、それらが相互作用しないことを意味するわけではありません。単に誰も彼らを同じ部屋に入れたことがないだけかもしれないのです。これを解決するために、研究チームはこれらの実験の失われた歴史を再構築することに着手しました。彼らは、タンパク質がテストされたものの、結合に失敗したすべての目に見えない記録を見つけ出そうとしたのです。
研究者たちは、すでに発表されている5,500以上の異なる実験結果を統合した、膨大な既存のデータセットからスタートしました。これらの実験では、主に2つの手法が用いられました。一つは試験管内でタンパク質を混合する方法であり、もう一つは酵母細胞の中でそれらを増殖させる方法です。これらの実験では、通常、ある一つの「餌(ベイト)」タンパク質を多くの「獲物(プレイ)」タンパク質に対してテストし、どれがくっつくかを確認します。標準的な慣習は、成功した結合のみを報告することでした。しかし、研究チームは、成功した結合のリストの中に、失敗に関する隠された手がかりが含まれていることに気づきました。もし特定の獲物タンパク質が試験管内で特定の餌タンパク質に結合したことが判明すれば、その獲物がその特定の実験において存在し、機能していたことが証明されます。したがって、もし同じ獲物が同じ試験管の中に存在していたにもかかわらず、別の餌に対して結合しなかったならば、それは真の「非結合」であるはずです。成功した結合を利用して実験が行われた「部屋全体」をマッピングすることで、チームはどのタンパク質がテストされたものの結合に失敗したのかを推論することができたのです。
この論理を用いて、研究者たちは約50万件の報告された相互作用のリストを、1億8,200万件近い個別のテストを含むより大きなデータセットへと変貌させました。ここから、彼らはテストされた9700万組のユニークなタンパク質ペアを特定しました。決定的なのは、彼らが「相互作用することが判明したペア」と、「テストされたが相互作用しないことが判明したペア」を明確に区別できるようになったことです。彼らは最も信頼性の高いデータ、すなわち複数回テストされたペアに焦点を当てました。その結果、少なくとも3回テストされ、一度も結合の兆候を示さなかった1,800万組以上のペアを特定しました。これらは推測ではありません。実験的に確認された「非結合」なのです。また、繰り返しテストされ、一貫して結合を示さなかった6,000組以上のペアも見つけ出しました。これにより、これらの相互作用が実在することへの高い信頼性が得られました。
研究者たちは、これらの新たに発見された「非結合」が生物学的に理にかなっているかどうかを検証しました。彼らは、相互作用するタンパク質が、細胞内の同じ場所に存在したり、似たような役割を果たしたりといった共通の特性を共有している一方で、相互作用しないペアはそれらを持たないかどうかを調べました。その結果は期待通りでした。確認された相互作用ペアは、確認された非相互作用ペアよりも、これらの特性を共有している可能性がはるかに高かったのです。この検証は、彼らの手法が機能したことを証明しました。チームは、以前は失われていた「負のエビデンス(否定的な証拠)」の層を、見事に回収したのです。結合できなかったタンパク質は、結合したタンパク質とは確かに機能的に異なっていました。これは、再構築されたデータが単なるランダムなノイズではなく、生物学的な現実を真に反映していることを裏付けています。
この検証済みの「非結合」リストを用いて、チームは科学者がネットワーク研究に用いるツールの改善方法をテストしました。第一に、彼らはこのデータを使用して、他の大規模な実験の精度を検証しました。これらの新しい「負の」ペアが他の研究においてどの程度出現するかを見ることで、それらの研究がどれほどの誤報を生み出した可能性があるかを算出できました。その結果、一部の実験ではエラー率が40%にも達しており、報告された結合の大部分が間違いである可能性が高いことが分かりました。これは、将来の実験を較正し、整理するための新しい方法を提供します。第二に、彼らは相互作用を予測するために設計されたコンピュータモデルに対して、このデータをテストしました。ランダムな推測ではなく、この新しい現実世界の負のデータを用いてモデルを訓練したところ、モデルは以前とは異なる、より明確な予測を出力しました。現実の負のデータで訓練されたモデルは、ランダムな推測で訓練されたモデルよりも同じ間違いを犯す可能性が低く、これは「何が起こらないか」という真の記録を持つことが、「何が起こるか」をコンピュータに教える上で不可欠であることを示唆しています。
この研究は、タンパク質自体についても驚くべき事実を明らかにしました。中には、触れるものすべてにまとわりつく「生物学的な接着剤」のように振る舞うタンパク質や、酵母実験において誤作動を引き起こす「オートアクティベーター(自己活性化因子)」のようなタンパク質が存在します。あるタンパク質がどれほど多くの異なるパートナーに対してテストされ、どれほど頻繁に結合に失敗したかを見ることで、チームはこれらの問題のあるタンパク質を特定することができました。彼らは、既知の「トラブルメーカー」が、まさに相手に関係なく無差別に結合してしまうタンパク質であることを突き止めました。これは、将来の研究において、こうしたノイズとなるタンパク質をフラグ立てし、フィルタリングするための新しい方法を提供し、よりクリーンで正確なマップへと導きます。
最後に、研究者たちはこのデータを用いて、ヒトの相互作用ネットワーク全体の形状を再考しました。長い間、科学者たちは、少数のタンパク質が数千もの接続を持ち、ほとんどのタンパク質はごくわずかな接続しか持たないという特定の数学的パターンに従っていると考えてきました。しかし、一部のタンパク質が他のタンパク質よりも頻繁にテストされているという事実を補正したところ、このパターンは消失しました。代わりに、接続の分布はベルカーブ(正規分布)のような形を示しました。これは、従来のマップで見られた極端な「ハブ」が、生物学的な真の特徴ではなく、実験の実施方法による人工的な産物であった可能性を示唆しています。この発見は、細胞ネットワークがどのように構築されているかという長年の仮説に疑問を投げかけるものです。
この研究は、ヒトのインタラクトーム(相互作用全集)の地図を完成させたと言っているわけではありません。真のネットワークは依然として広大であり、大部分が未探索のままです。しかし、失敗した実験の歴史を復元することで、チームはパズルの極めて重要な欠片を提供しました。彼らは、「証拠の不在」を適切に再構築すれば、それは「不在の証拠」になるということを示しました。確認された数百万の非結合を含むこの新しいリソースは、現在、他の科学者が利用できるようになっています。それは、より優れたコンピュータを訓練し、より優れた実験を較正し、最終的には、最も根本的なレベルで人間の体がどのように機能しているのかという、より正確で完全な全体像を構築するための手段となるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。