← 最新论文
🧬 biology

Real-time Reconstruction of Human Visual Perception from fMRI

本文介绍了利用 RT-Cloud 平台对最先进的 MindEye2 流水线进行的实时兼容性适配,证明了在数秒内从 fMRI 数据中实现可靠、细粒度的感知自然图像重建是可行的,并为先进的脑机接口铺平了道路。

原作者: Rishab S. Iyer, Jiaxin Cindy Tu, Cesar Kadir Torrico Villanueva, Anish Mahishi, Ross P. Kempner, Jacob S. Prince, Ernest W. Lo, Akash Bhowmick, Hritik Arasu, Amaar Chughtai, Elizabeth A. McDevitt, Pau
发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Rishab S. Iyer, Jiaxin Cindy Tu, Cesar Kadir Torrico Villanueva, Anish Mahishi, Ross P. Kempner, Jacob S. Prince, Ernest W. Lo, Akash Bhowmick, Hritik Arasu, Amaar Chughtai, Elizabeth A. McDevitt, Paul S. Scotti, Kenneth A. Norman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,如果你能窥视一个人的内心,仅仅通过观察他们大脑中微小的血流波动,就能准确看到他们正在注视的画面。这就是认知神经科学的梦想:将大脑活动转化为通往思想的窗口。长期以来,科学家们一直使用一种叫做 fMRI(功能性磁共振成像)的工具来做这件事。你可以把 fMRI 想象成一部超慢速、高清晰度的脑部电影摄像机。它并不直接拍摄神经元的放电,而是追踪富含氧气的血液流向,这有点像通过观察交通信号灯的亮起情况来判断一座城市中哪些部分最繁忙。问题在于,这种“交通”移动得很慢,在想法或图像出现后需要几秒钟才能达到峰值。

近年来,计算机变得异常聪明,能够根据这些缓慢的血流模式来猜测一个人正在看什么。利用大规模 AI 模型,科学家现在可以以惊人的准确度重建一个人所看到的图像。然而,这里有一个大问题:这些聪明的计算机通常需要数小时甚至数天的时间来处理数据。这就像是一位天才厨师,虽然能做出完美的佳肴,但他们需要一整天的时间来切菜。这使得它们无法用于“实时”实验——即当你希望在人还在扫描仪内时就能立即看到结果。如果你能让这个过程足够快,你就可以创造出一种“脑机接口”,让一个人可以用思想控制屏幕,或者获得关于大脑正在关注什么的即时反馈。

这篇论文讲述的是如何教这位“慢速天才厨师”在 15 秒内完成烹饪。由 Rishab Iyer 及其同事领导的研究团队成功地使强大的复杂 AI 系统 MindEye2 能够实时工作。他们成功解码了一个人正在看什么(基于 fMRI 扫描),并在那个人注视图像后的短短几秒钟内,就在屏幕上重建了图像。他们不仅是在完美的、慢动作的实验室环境中完成了这项工作;他们还在标准的 3 Tesla 磁共振扫描仪(这种设备常见于普通医院,而非仅限于高端研究实验室)上进行了测试,并证明即使只有来自一个新人的一小时训练数据,该系统也能正常工作。虽然重建的图像与那些“慢速、过夜版”相比还不够完美,但它们已经清晰到足以辨认出物体,这证明了我们终于可以开始“实时”读取思想,而不仅仅是在事后进行分析。

“读心术”机器获得了速度提升

多年来,用于从脑部扫描中读取思想的最佳 AI 系统一直就像是慢动作回放。你会向处于 MRI 机器中的人展示一张图片,等待他们完成实验,然后花费数小时甚至数天的时间来处理数据,以猜测他们看到了什么。这篇论文描述了一种全新的方法,它极大地提高了速度,将“隔日”的结果变成了“隔秒”的结果。

该团队使用了一个名为 MindEye2 的系统,这是一个经过大规模训练、旨在理解大脑活动与图像之间联系的巨型 AI 模型。你可以把 MindEye2 想象成一个精通两种语言的翻译官:一种是“大脑流”(fMRI 数据),另一种是“图像描述”(关于事物外观的数字地图)。在过去,这个翻译官需要很长时间来思考。研究人员想看看是否能让它思考得足够快,从而在人还在机器内时就能工作。

为了实现这一目标,他们利用一个名为 RT-Cloud 的云端平台构建了一个特殊的流水线。这就像是一个高速快递服务,能在记录下大脑数据的瞬间将其提取出来,进行即时处理,并将结果传回。他们通过让参与者观看自然图像(如动物或风景的照片)进行了测试。

结果:快速,但不完美

论文展示了一种有趣的“速度与质量”之间的权衡。他们测试了三种不同的速度:

  1. “快速”模式: 这是实时的魔力所在。系统会在图像出现约 7.9 秒后(以等待大脑血流反应达到峰值)进行解码。从看到图像到获得重建图像的总时间约为 14.5 秒
  2. “慢速”模式: 他们收集了约 29 秒的数据,这略微提升了质量。
  3. “运行结束”模式: 这是传统的方法,即等待整个扫描过程结束(约 5 分钟)后再对所有内容进行分析。

结果显示,即使是“快速”模式也表现得相当出色。当被要求从 50 个候选图像中选出正确的一张时,快速系统的准确率约为 36%(这远高于随机猜测的 2%)。当候选池变小(仅剩 2 个选项)时,准确率跃升至 90.6%。重建的图像与“过夜版”相比略显模糊,但你仍然可以清晰地辨认出这个人是在看狗、汽车还是风景。

为什么这很重要(以及它目前还做不到什么)

论文谨慎地指出,这是一个“概念验证”。它证明了实时进行此类操作是可能的,但这并不意味着我们现在拥有了一台完美的读心设备。作者明确指出,当你追求速度时,质量会下降。“快速”模式并不像耗时数日的“离线”模式那样准确。他们还指出,目前的系统依赖于特定的 AI 架构,且其速度受限于大脑血流的速度(血流动力学滞后),这是一个我们无法改变的生物学事实。

然而,其意义是巨大的。由于该系统可以在 15 秒内运行,它为**神经反馈(neurofeedback)**打开了大门。想象一下,一位患有抑郁症的患者可以实时看到大脑对一张悲伤照片的反应。如果他们的大脑过度关注负面部分,系统可以显示一个强调该部分的重建图像,从而帮助他们学习如何改变注意力。根据以往的研究,论文指出,10 到 30 秒的延迟对于大脑学习这种反馈实际上是足够的。

研究人员还表明,你不需要极其昂贵且罕见的 7 Tesla 扫描仪;只要用一个人的大约一小时数据进行微调,标准的 3 Tesla 扫描仪(在数千家医院中都能找到)完全可以胜任。

总结

这篇论文是实现将“大脑读取”从缓慢的死后分析转变为实时交互式体验的重要一步。通过将重型 AI 适配为实时运行,该团队展示了我们可以在 14.5 秒内重建一个人正在看的内容。虽然图像目前还不算清晰,但已足以识别物体,而且其速度足以让人们潜在地控制自己的大脑状态或与机器进行交流。这就像是将一部慢速的高清摄像机,教会了如何进行直播视频。画面虽然有些颗粒感,但我们第一次能够在表演发生时,实时看到这场演出。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →