← 最新の論文
🧬 biology

JEPA-DNA: Grounding Genomic Foundation Models through Joint-Embedding Predictive Architectures

JEPA-DNAは、結合埋め込み予測アーキテクチャを従来の生成目的関数と統合することで、ゲノム基盤モデルをトークンレベルの再構成から意味的整合へとシフトさせ、多様なゲノムベンチマークにおいて最先端の性能を達成する、モデルに依存しない継続的学習フレームワークを導入する。

原著者: Ariel Larey, Elay Dahan, Amit Bleiweiss, Raizy Kellerman, Guy Leib, Omri Nayshool, Dan Ofer, Tal Zinger, Dan Dominissini, Gideon Rechavi, Nicole Bussola, Simon Lee, Shane O'Connell, Dung Hoang, Mariss
公開日 2026-08-12
📖 1 分で読めます☕ さくっと読める

原著者: Ariel Larey, Elay Dahan, Amit Bleiweiss, Raizy Kellerman, Guy Leib, Omri Nayshool, Dan Ofer, Tal Zinger, Dan Dominissini, Gideon Rechavi, Nicole Bussola, Simon Lee, Shane O'Connell, Dung Hoang, Marissa Wirth, Alexander W. Charney, Nati Daniel, Yoli Shavit

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ⚕️ これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む

人間の体を、巨大で古めかしい図書館だと想像してみてください。その中には、人間を作り上げ、動かすためのあらゆる指示が、A、C、G、Tというわずか4つの文字で作られたコードで書かれています。これがDNAです。長い間、科学者たちはコンピュータにこの図書館を読ませる方法を模索してきました。もしコンピュータがDNAの「文法」を理解できれば、私たちの体がどのように機能しているのか、なぜ病気になるのか、あるいは遺伝的な不具合をどのように修正できるのかを予測できるのではないかと考えたのです。

これを行うために、研究者たちは「基盤モデル(Foundation Models)」と呼ばれるものを使用しています。これは、何百万冊もの本(DNA配列)を読み込み、その言語のルールを学んだ超優秀な学生のようなものだと考えてください。通常、これらの学生は「穴埋め問題」というゲームを通じて学習します。文章の中の単語を隠したとき、学生は周囲の単語に基づいて、そこにあった単語を推測しなければなりません。これは、単語がどのように組み合わさるかといった、局所的な文法のルールを学ぶには非常に効果的です。しかし、ここに問題があります。文法を知っていることが、必ずしもその「物語」を理解していることを意味するわけではないのです。学生は「猫が……の上に座った」の次には通常「マット」が来る、ということを知っているかもしれませんが、その猫が実は犬から隠れていることや、場面全体がより大きなミステリーの一部であることまでは理解していないかもしれません。DNAにおいて、これはコンピュータが小さなパターンを見つけることには長けているものの、異なるコードの断片がどのように連携して生命を制御しているかという、大きな全体像を見落としがちであることを意味します。

ここで、JEPA-DNAと呼ばれる新しい研究が登場します。NVIDIAとイスラエルおよび米国の医療センターのチームによる研究者たちは、このDNAを読む学生をアップグレードすることに決めました。彼らは、コンピュータに単に欠落した文字を推測させるのではなく、欠落した部分の「意味」を推測させるように強制する、新しい学習方法を導入しました。単に「ここにどの文字が入るか?」と問うのではなく、「このDNAの塊の役割は何であるか?」と問うのです。

チームはこの新しい手法を、遺伝子の開始点(プロモーター)の特定から、遺伝的変異が健康にどのように影響するかを予測することまで、17種類の異なるタスクでテストしました。また、この手法がすべての人に通用することを確認するために、3種類の異なるDNA読み取りコンピュータ(DNABERT-2、NTv3、HyenaDNA)で試行しました。結果は目覚ましいものでした。この新しい「意味重視」の学習を加えることで、コンピュータはほぼすべてのタスクにおいて性能が向上しました。例えば、「GUE Promoter」と呼ばれるタスクでは、性能が11%以上向上しました。疾患変異に関する別のタスクでは、問題を特定する能力が12%以上向上しました。

論文は、このアプローチが効果的な理由として、コンピュータに「木を見て森を見ず」ではなく、森全体を見るように教えているからだと示唆しています。従来の手法は局所的な構文(特定の文字の順序)を暗記することには優れていましたが、JEPA-DNAはグローバルな機能的コンテキスト(その配列が体の中で実際に何をしているのか)を理解するのを助けます。研究者たちは、この新しい学習方法が、コンピュータに単なる綴りではなく、生命のルールを理解させる「世界モデル(world model)」を作り出すことを発見しました。彼らは、この手法が現在の最高水準のモデルよりも優れていることを示し、これらのAIシステムが達成できる新たな高みを設定しました。それは、スペリングが得意な学生を、プロットや登場人物、そしてテーマまでも一度に理解できる文芸批評家に育て上げるようなものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →