← 最新の論文
📄 evolutionary biology

Ancestral Sequences Cannot be Accurately Reconstructed via Interpolation in a Variational Autoencoder's Latent Space

本研究は、変分オートエンコーダーがエピスタシス相互作用をモデル化する潜在性を有しているにもかかわらず、デコーディング過程における固有の情報損失によって祖先配列を正確に再構成することが妨げられており、標準的な尤度法や節約法に一貫して劣ることを示している。

原著者: Gorstein, E., Tang, M., Bruzzone, H., Solis-Lemus, C.

公開日 2026-09-01
📖 1 分で読めます☕ さくっと読める

原著者: Gorstein, E., Tang, M., Bruzzone, H., Solis-Lemus, C.

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ⚕️ これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む

生命の歴史の奥深く、あらゆる生物は自らの祖先の分子記録を刻み込んでいます。科学者たちは長年、この記録を読み解こうと試みてきました。これは「祖先配列再構築(ancestral sequence reconstruction)」として知られるプロセスです。多くの曾孫たちが持っている写し本だけを頼りに、曾祖父母が書いた手紙の正確な言葉を推測しようとする場面を想像してみてください。生物学において、これらの「文字」とは、あらゆる細胞の働き手であるタンパク質を構成するアミノ酸の鎖のことです。数十年にわたり、研究者たちは統計モデルを用いて欠落した言葉を補ってきました。そこでは、鎖の中の各文字は他の文字とは無関係に変化する、つまり文章の中の一単語が全体の意味に影響を与えることなく入れ替わるようなものだと想定されています。この手法は、数百万年にわたるタンパク質の進化を理解するための標準的なツールとなってきました。

しかし、生物学はそれほど単純ではありません。実際には、タンパク質の鎖における文字同士はしばしば互いに依存しています。あるアミノ酸の変化は、近くにある特定の別の変化が同時に起こらない限り、安全ではない場合があるのです。この「エピスタシス(上位性)」として知られる複雑な相互依存関係を、従来の統計ツールで捉えることは困難です。近年、人工知能技術の新世代、具体的には「変分オートエンコーダー」と呼ばれる種類のディープラーニング・モデルが、異なる道筋を提示しました。これらのモデルは、膨大なデータの中から隠れたパターンを見つけ出すことに長けています。これらは長いタンパク質配列をコンパクトな数学的要約、すなわち「埋め込み(embedding)」へと圧縮し、その後、その要約から元の配列を再構築しようと試みます。これらのモデルは、文字間のつながりを無視するように指示されることなくデータから直接学習するため、多くの科学者は、ディープラーニングがエピスタシスの問題を解決し、かつてない精度で古代のタンパク質を再構築できるのではないかと期待しました。

ある研究チームは、この期待を直接検証することに乗り出しました。彼らは、これらのAIモデルを用いて古代のタンパク質の配列を推測するパイプラインを構築しました。そのアイデアは明快でした。現在存在する現代のタンパク質を取り出し、これらを数学的要約へと圧縮し、次にタンパク質の既知の系統樹を用いて、古代の祖先の要約がどのようなものであったかを補間(あるいは推測)するというものです。一度これらの推測された要約が得られたら、それを再びAIに入力して、実際のアミノ酸配列を生成させます。もしこれが成功すれば、ディープラーニングが従来の統計学の限界を突破し、たとえその歴史が分子の異なる部分間の複雑な相互作用によって形作られていたとしても、真のタンパク質の歴史を明らかにできることを意味します。

研究者たちは、コンピュータ・シミュレーションを用いてこのアイデアをテストしました。彼らは、まず従来のモデルが想定する単純で独立したルールを用いて、次に自然界に見られるような相互依存的な変化を含む複雑なルールを用いて、数千の架空のタンパク質ファミリーを作成しました。そして、これら架空のファミリーの祖先を、新しいAI手法と確立された統計的手法の両方を用いて再構築することを試みました。結果は明白かつ一貫していました。タンパク質が単純に進化した場合でも、複雑な依存関係を伴って進化した場合でも、あらゆるシナリオにおいて、従来の統計的手法がAIのアプローチを上回りました。ディープラーニング・モデルは、それが最も輝くはずであった状況においてさえ、正確な祖先配列を生成できず失敗したのです。

研究は、なぜAIが失敗したのかを理解するためにさらに深く掘り下げました。問題は、AIが家系図の構造を見落としていたことではありませんでした。研究者が数学的要約を調べたところ、AIは確かにタンパク質の進化関係を反映した方法でタンパク質を整理できていることが分かりました。失敗の原因は、再構築のステップそのものにありました。AIモデルは、データを小さな要約へと圧縮する過程で、必然的に元の配列の微細な詳細を失ってしまうのです。研究者がこれらの要約から古代のタンパク質を再構築しようとしたとき、情報はあまりにも不鮮明になっていました。モデルは、真の歴史と一致するほどの精度で配列を生成することができなかったのです。より多くの情報を保持するために数学的要約のサイズを大きくしても、得られる成果はわずかであり、モデルは進化の一般的なルールを学習するのではなく、単に現代のタンパク質を暗記し始めてしまうだけでした。

研究者たちはまた、訓練中に家系図を明示的に教え込まれた、より高度なバージョンのAIもテストしました。この追加のガイダンスが助けになることを期待しましたが、結果は改善されませんでした。根本的なボトルネックは依然として同じでした。配列を要約へと圧縮し、それを再び展開するというプロセスが、過去を推測するという繊細な作業に対して、あまりにも情報の損失(ロス)が大きすぎたのです。この研究は、これらのAIによる埋め込みがタンパク質ファミリーを可視化したり現代のタンパク質の振る舞いを予測したりするための強力なツールである一方で、過去を再構築する準備はまだ整っていないことを結論付けています。ディープラーニングが複雑な進化の相互作用を容易に解決できるという期待は、この特定の応用においては、行き止まりであったのです。単純な仮定に基づいているにもかかわらず、伝統的な手法こそが、生命の分子的な歴史を読み解くためのより信頼できる方法であり続けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →