← 最新论文
🤖 AI

Mind-Omni: A Unified Multi-Task Framework for Brain-Vision-Language Modeling via Discrete Diffusion

Mind-Omi 引入了一个统一的多任务框架,该框架利用一种新颖的离散扩散范式和脑标记器将连续神经信号转化为离散标记,从而在七个不同的脑 - 视觉 - 语言任务中实现灵活的编码、解码与推理,并通过多任务协同达到最先进的性能。

原作者: Yizhuo Lu, Changde Du, Qingyu Shi, Hang Chen, Jie Peng, Liuyun Jiang, Shuangchen Zhao, Huiguang He

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yizhuo Lu, Changde Du, Qingyu Shi, Hang Chen, Jie Peng, Liuyun Jiang, Shuangchen Zhao, Huiguang He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你的大脑是一座庞大而繁忙的图书馆,你经历的每一个想法、图像和单词都以独特而复杂的代码形式存储其中。多年来,试图解读这座图书馆的科学家们不得不为每一项任务聘请不同的专家。一位专家只能将大脑信号翻译成图像,另一位只能将它们转化为文字,第三位则只能做相反的工作。他们就像单功能的瑞士军刀:擅长一件事,但对其他任何事都无能为力。

这篇论文介绍了Mind-Omni,一种改变游戏规则的新型“通用翻译器”。它不再需要聘请一支专家团队,而是一个单一、多功能的框架,能够同时处理七项不同的任务。它可以接收一张图片并推测你的大脑正在思考什么,接收你的脑电波并重构你所看到的图像,将你的想法转化为文字,甚至根据你所见的内容回答问题。

以下是其工作原理,借助一些简单的类比来说明:

1. 问题:说着不同的语言

大脑说着一种连续而杂乱的语言(就像一条流动的电流之河)。计算机则说着一种离散而块状的语言(就像乐高积木)。以往的模型试图在这两者之间搭建桥梁,但这些桥梁往往摇摇欲坠,或者只能单向工作。

2. 解决方案:“大脑分词器”

为了解决这个问题,研究人员构建了一种名为大脑分词器(Brain Tokenizer)的特殊工具。你可以把它想象成一个通用的货币兑换亭。

  • 它将连续流动的脑信号(fMRI 数据)之河切割成标准的“硬币”或令牌(tokens)。
  • 这些令牌现在成为了图像和文字所使用的同一种“货币”。
  • 突然间,大脑、相机和键盘都在说着同一种语言。它们现在可以直接相互对话,而无需为每一句特定的话配备专门的翻译。

3. 引擎:“离散扩散”模型

当所有事物都说着同一种语言后,Mind-Omni 利用一种名为离散扩散(Discrete Diffusion)的巧妙引擎。

  • 想象一个“传话”游戏:有人低声传递一条信息,但信息在传递过程中被轻微的静电干扰所扭曲。
  • 大多数 AI 模型试图逐个猜测句子中的下一个词(就像从左到右阅读一本书)。
  • Mind-Omni 则不同。它一次性审视整个被扭曲的信息,并找出如何消除静电干扰,从而揭示出原始的图像或句子。由于它不必按严格顺序进行猜测,它能够看到不同部分(图像、文本和大脑)是如何相互辅助的。

4. “顿悟”时刻:协同效应

这篇论文中最令人兴奋的发现是协同效应(Synergy)。

  • 当模型尝试将大脑信号同时解码为图像和描述时,其效果优于分别进行这两项任务。
  • 类比:这就像试图猜测电影情节。如果你只有视觉线索,可能会错过背景语境;如果你只有对话,可能会错过场景设定。但如果你同时拥有两者,你就能更好地理解故事。
  • 论文表明,大脑本身也是如此:当我们看到一张图像时,我们的大脑会自动调用语言和概念来理解它。Mind-Omni 模仿了这种自然的"1 + 1 = 3"效应。

5. 它能做什么?(七项任务)

Mind-Omni 是一把“瑞士军刀”,能够:

  1. 从看到想:给它一张图片,它就能预测你的大脑看起来是什么样。
  2. 从想到看:读取你的脑电波,并画出你正在想象的图像。
  3. 从读到想:给它一个句子,它就能预测你的大脑活动。
  4. 从想到读:读取你的脑电波,并写出你正在思考的内容。
  5. 组合模式:它可以同时完成上述所有任务,混合图像和文本以获得更好的结果。
  6. 问答测试:它甚至可以通过观察你的大脑活动来回答关于你所见内容的问题(大脑问答)。

核心结论

作者声称,Mind-Omni 不仅仅是一系列技巧的集合;它是迈向**“大脑基础模型”**的一步。正如大型语言模型(就像你现在正在与之对话的这个模型)学会了理解几乎任何文本一样,Mind-Omni 旨在成为第一个能够理解我们的大脑、我们看到的图像以及我们说出的词语之间几乎任何交互的模型。

虽然它尚未在每一项任务上都超越每一个专门的模型(毕竟它仍然是一个通才),但它证明了通过统一这些任务,我们可以解锁对大脑运作方式的更深层次理解,表明我们的思想、视觉和语言是紧密相连的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →