Seeing Through the Brain: New Insights from Decoding Visual Stimuli with fMRI
本文提出了 PRISM,这是一个新颖的框架,它将功能性磁共振成像信号投影到结构化的文本空间中,并采用以对象为中心的扩散模型结合属性 - 关系搜索,通过更好地与神经活动的组合特性相一致,实现了最先进的视觉刺激重建。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你的大脑是一座繁忙的图书馆,每次你看到一幅图像时,它并不会仅仅“存储”这张图片。相反,它会编写一个非常具体、复杂的关于所见内容的故事。多年来,科学家们一直试图解读这些故事(通过功能性磁共振成像脑扫描),并将它们还原为你所看到的原始图像。
你所询问的这篇论文,PRISM,就像一种更智能的新翻译器,终于破解了如何更好地完成这一任务的密码。以下是他们发现并构建内容的简明分解:
1. 大惊喜:大脑说的是“文字”,而非“图片”
此前大多数尝试从脑扫描重建图像的方法,都试图将大脑信号直接翻译成“图片语言”(如数字照片文件)。他们假设,因为你看到了图片,所以大脑一定是将其作为图片存储的。
PRISM 团队发现这是错误的。
他们发现,大脑的活动实际上更像文字(如书中的句子),而不像照片或视频。
- 类比: 想象一下尝试翻译一门外语。以往的方法试图将大脑的“语言”直接翻译成另一种视觉语言(就像将一部法语电影直接翻译成德语电影)。PRISM 意识到,大脑实际上是在说英语(文字)。因此,理解它的最佳方式是先将其翻译成英语,然后再利用这些英语来描述图片。
2. “模糊”描述的问题
即使科学家使用了文字,他们往往也会犯一个错误。他们会写一个单一的长句来描述整张图片,例如:“一只灰色带条纹的猫正坐在长椅上。”
当计算机尝试绘制这幅画面时,往往会感到困惑。它可能会画出一只“灰色的老虎”而不是“猫”,或者混淆颜色。这被称为“属性绑定错误”——计算机知道这些词,但忘记了哪个词属于哪个物体。
人类大脑不会这样做。
当你观察一个场景时,你的大脑看到的不是一个巨大的色块。它看到的是独立的物品:“那里有一只猫。它是灰色的。它有条纹。它在长椅上。”它是逐块构建场景的。
3. 解决方案:PRISM(“乐高”构建者)
作者们构建了一个名为 PRISM(将功能性磁共振成像信号投射到结构化文本空间)的新系统。把它想象成一位使用乐高积木而非单一巨大模具的大师级建造者。
以下是 PRISM 逐步的工作原理:
步骤 1:翻译器(从功能性磁共振成像到文本)
该系统接收脑扫描数据,并将其翻译成结构化的文本列表。它不是一段长段落,而是将图像分解为具体部分:- 物体 1: 一辆汽车。
- 物体 2: 一头大象。
- 关系: 汽车跟在大象后面。
- 属性: 汽车是白色的;大象是灰色的。
步骤 2:智能搜索(寻找最合适的词语)
该系统使用“搜索引擎”来确定哪些词语最为关键。它测试了数千种不同的描述方式,发现空间词汇(如“左”、“右”、“在……之上”、“在……旁边”)对于匹配大脑活动最为重要。这就像意识到,要向一个蒙着眼睛的人描述一个房间时,告诉他们物品在哪里比告诉他们窗帘是什么颜色更重要。步骤 3:乐高构建者(以物体为中心的生成)
PRISM 不是要求人工智能一次性画出整幅画面,而是要求它先画汽车,再画大象,然后根据文本描述将它们放置在正确的位置。- 为什么这有效: 它防止了计算机产生混淆。它确保汽车保持为汽车,大象保持为大象,并且它们不会意外融合成“汽车 - 大象”混合体。
4. 结果
当他们在真实人类观看图像时测试这一方法时,PRISM 的表现远优于以往的方法。
- 得分: 它将“感知损失”(新图像与原始图像的差异程度)降低了约 6%。
- 证明: 如果你将重建后的图像展示给一个智能人工智能,并问:“这张图片里有什么?”,与旧方法相比,人工智能使用 PRISM 生成的图像能更频繁地给出正确答案。
总结
该论文声称,要解读大脑的视觉思维,我们不应试图强迫大脑用“像素”说话。相反,我们应该像听它撰写关于物体及其位置的结构化故事一样去倾听它。通过将脑扫描翻译成这种特定的“基于物体的文本”,然后逐块构建图像,我们可以以更清晰的视野看到这个人当时在看什么。
注意: 该论文严格专注于从脑扫描重建静态图像的技术方法。它并未声称具有临床应用、医疗用途,或在现阶段具备实时读取思维以进行交流的能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。