← 最新の論文
🤖 AI

Mind-Omni: A Unified Multi-Task Framework for Brain-Vision-Language Modeling via Discrete Diffusion

Mind-Omni は、新しい離散拡散パラダイムと Brain Tokenizer を活用して連続的な神経信号を離散トークンに変換する統合的なマルチタスクフレームワークを導入し、7 つの異なる脳・視覚・言語タスクにわたって多様なエンコーディング、デコーディング、推論を可能にするとともに、マルチタスクの相乗効果を通じて最先端の性能を達成します。

原著者: Yizhuo Lu, Changde Du, Qingyu Shi, Hang Chen, Jie Peng, Liuyun Jiang, Shuangchen Zhao, Huiguang He

公開日 2026-05-29
📖 1 分で読めます☕ さくっと読める

原著者: Yizhuo Lu, Changde Du, Qingyu Shi, Hang Chen, Jie Peng, Liuyun Jiang, Shuangchen Zhao, Huiguang He

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたの脳を、経験するすべての思考、イメージ、言葉が、それぞれ固有で複雑なコードとして保存されている、巨大で賑やかな図書館だと想像してください。長年、この図書館を読み解こうとしてきた科学者たちは、それぞれの作業ごとに異なる専門家を手配する必要がありました。ある専門家は脳信号を画像に変換することしかできず、別の専門家はそれを言葉に変えることしかできず、さらに別の専門家は逆の変換しかできませんでした。彼らは単一機能のスイスアーミーナイフのようでした。一つのことは得意ですが、それ以外には役に立たないのです。

この論文は、ゲームのルールを変える新しい「万能翻訳機」であるMind-Omniを紹介しています。専門家のチームを雇う代わりに、Mind-Omni は単一の多目的フレームワークであり、7 つの異なる作業を同時に処理できます。画像を入力して脳が何を考えているかを推測したり、脳波を入力して見た画像を再構成したり、思考を言葉に変換したり、あるいは見たことに基づいて質問に答えたりすることができます。

以下に、いくつかの簡単な比喩を用いてその仕組みを説明します。

1. 問題:異なる言語を話す

脳は、電気の奔流のような連続的で入り混じった言語を話します。一方、コンピュータはレゴブロックのような離散的でブロック状の言語を話します。従来のモデルはこれら二つの間に橋を架けようとしましたが、それはしばしば不安定であったり、一方向にしか機能しなかったりしました。

2. 解決策:「脳トークナイザー」

これを解決するため、研究者たちはBrain Tokenizer(脳トークナイザー)と呼ばれる特別なツールを構築しました。これは、万国共通の両替所のようだと考えてください。

  • 連続的で流れるような脳信号(fMRI データ)の川を受け取り、標準的な「硬貨」やトークンに切り刻みます。
  • これらのトークンは、画像やテキストが使用するのと同じ「通貨」となります。
  • 突然、脳、カメラ、キーボードはすべて同じ言語を話すようになります。これにより、特定の文ごとに翻訳者を必要とせず、直接互いに会話できるようになります。

3. エンジン:「離散拡散」モデル

すべてが同じ言語を話すようになると、Mind-Omni はDiscrete Diffusion(離散拡散)と呼ばれる巧妙なエンジンを使用します。

  • 誰かが囁きながらメッセージを伝える「電話ゲーム」を想像してください。ただし、そのメッセージはノイズで少しかき乱されます。
  • ほとんどの AI モデルは、左から右へ本を読むように、文の次の単語を一つずつ推測しようとします。
  • Mind-Omni は異なります。それは、かき乱されたメッセージ全体を一度に見て、ノイズを除去し、元の画像や文を明らかにする方法を推測します。厳密な順序で推測する必要がないため、異なる部分(画像、テキスト、脳)が互いにどのように助け合うかを把握できます。

4. 「アハ!」の瞬間:相乗効果

この論文で最も興奮すべき発見はSynergy(相乗効果)です。

  • モデルが脳信号を画像と説明の両方に同時にデコードしようとすると、別々に実行する場合よりも優れた結果を出します。
  • 比喩:映画のあらすじを推測しようとするようなものです。視覚的な手がかりだけがあれば、文脈を見逃すかもしれません。対話だけがあれば、舞台設定を見逃すかもしれません。しかし、両方を同時に持てば、物語をずっと深く理解できます。
  • この論文は、脳も自然にこれを行っていることを示しています。私たちが画像を見ると、脳はそれを理解するために自動的に言語や概念を引き出します。Mind-Omni は、この自然な「1 + 1 = 3」の効果を模倣します。

5. 何ができるのか?(7 つのタスク)

Mind-Omni は以下のことができる「スイスアーミーナイフ」です。

  1. 見て考える:画像を見せると、あなたの脳がどのように見えるかを予測します。
  2. 考えて見る:脳波を読み取り、あなたが想像していた画像を描きます。
  3. 読んで考える:文を見せると、あなたの脳活動を予測します。
  4. 考えて読む:脳波を読み取り、あなたが考えていたことを書き出します。
  5. 組み合わせ:上記のすべてを同時に実行し、画像とテキストを混合してより良い結果を得ることができます。
  6. クイズ:脳活動を見るだけで、見たことに関する質問に答えることさえできます(脳質問応答)。

結論

著者らは、Mind-Omni が単なるトリックの集まりではなく、「脳の基盤モデル(Foundation Model for the Brain)」への一歩であると主張しています。大規模言語モデル(今あなたと話しているようなもの)がほぼあらゆるテキストを理解することを学んだように、Mind-Omni は、私たちの脳、見る画像、話す言葉の間のほぼあらゆる相互作用を理解できる最初のモデルを目指しています。

まだすべてのタスクにおいてすべての専門家モデルを凌駕しているわけではありません(結局のところ、これはまだ一般論者です)。しかし、これらのタスクを統合することで、脳の働きに対するより深い理解を解き放つことができることを証明しており、私たちの思考、視覚、言葉が深く相互に関連していることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →