← 最新论文
🧠 neuroscience

Cross-cue reconstruction of perceived 3D object structure from human visual cortex

这项研究表明,人类视觉皮层的 fMRI 活动可以被解码以重建对深度线索具有不变性的显式 3D 物体结构,成功地从 2D 训练图像泛化到新的 3D 立体刺激,从而使大脑内部的 3D 世界模型外部化。

原作者: Aoki, S. C., Tsukasa, R., Yang, S., Tanaka, M., Doi, E., Nakamura, T., Ho, J.-K., Kamitani, Y.

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Aoki, S. C., Tsukasa, R., Yang, S., Tanaka, M., Doi, E., Nakamura, T., Ho, J.-K., Kamitani, Y.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你的大脑就像一位大师级厨师,只需品尝一口汤,就能准确说出里面包含哪些食材,哪怕你只给了他一小勺。但不同的是,这里的“食材”是世界上物体的3D形状,而那“一小勺”则是你大脑中的电活动。

长期以来,科学家们已知我们的大脑利用不同的“线索”(比如阴影、我们的眼球运动方式或物体是如何重叠的)来构建世界的3D图像。然而,他们无法看到大脑最终生成的那个3D图像,因为它隐藏在我们的脑袋里。他们能看到线索,却看不到结果。

这篇论文就像是找到了一个神奇的解码环,能将那些隐藏的大脑信号翻译回可见的3D物体。以下是他们是如何实现的,我们用一个简单的类比来说明:

翻译官与蓝图
你可以把研究人员想象成正在建造一台由两部分组成的机器:

  1. 翻译官(解码器): 这部分负责学习如何读取你的fMRI信号(大脑的“电噪声”),并将其翻译成一种秘密代码。这种代码不是一张图片,而是一组描述物体形状的数学指令,就像是30模型的一份蓝图。
  2. 建造者(生成器): 这部分负责接收那份秘密蓝图,并用成千上万个微小的点(一个“点云”)构建出一个真实的3D模型,就像3D打印机根据数字文件创作雕塑一样。

三项严苛的测试
为了证明这台机器实际上是在读取“形状”而非仅仅在猜测,他们让这台机器通过了三场难度递增的考试:

  1. “新口味”测试: 他们只用日常物品(如杯子和椅子)的图片来训练机器。然后,他们向机器展示了它从未见过的物体的脑部扫描图(比如一个奇怪的外星玩具)。机器成功构建了那个新物体的3D形状。它并没有死记硬背旧的形状,而是学会了3D形状的“语言”。
  2. “魔法眼镜”测试: 这是最关键的一次。他们用平面的2D图片来训练机器。接着,他们向机器展示了人们观看**随机点立体图(RDS)*时的脑部扫描图。这些图像在肉眼看来就像是静态噪声,但如果你戴上特制的眼镜(或通过交叉注视),一个3D形状就会跳出来。至关重要的一点是,屏幕上的2D图片本身完全没有形状*——它只是一堆噪声。然而,机器却构建出了正确的3D形状。这证明了机器读取的是大脑的3D感知,而不仅仅是在复制屏幕上的平面图像。
  3. “倾斜”测试: 他们向机器展示了两张从正面看看起来完全相同的图像(轮廓相同),但其中一个在3D空间中的倾斜角度不同。机器正确地构建出了具有特定倾斜度的物体,证明它理解深度几何结构,而不只是2D轮廓。

魔法发生之处
研究人员发现,这种“翻译”在大脑的后部和顶部(背侧流)效果最好,而这些区域是负责处理空间信息的。

核心结论
这项研究表明,我们现在可以“外显化”大脑所看到的内容。我们可以将大脑从不同线索中构建出的不可见的3D模型,转化为计算机屏幕上可见的3D物体。这是迈向读取大脑内部“世界模型”的一步——即当你的眼睛获取的原始数据不完整或令人困惑时,你的大脑是如何预测世界长什么样的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →