← 最新论文
🧬 biology

Task-guided cross-subject latent alignment: a multi-encoder-decoder VAE

本文介绍了多编码器-解码器变分自编码器(MED-VAE),该框架通过将神经表示锚定到由预训练人工神经网络提供的共同支架上,在不需要共享刺激的情况下,实现了卓越的跨受试者神经对齐和可泛化的解码。

原作者: Angeliki Papathanasiou, Jascha Achterberg, Thomas E. Nichols, Rui Ponte Costa

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Angeliki Papathanasiou, Jascha Achterberg, Thomas E. Nichols, Rui Ponte Costa

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正在尝试翻译一本用秘密代码编写的书。问题在于,有 8 个不同的人,每个人都有自己独特的代码版本。尽管他们读的是完全相同的故事,但 A 先生将“苹果”写成“红色的水果圆圈”,B 先生将其写成“脆甜”,而 C 先生将其写成“果园-1”。

如果你想了解他们在思考故事中的什么内容,你不能直接比较他们的笔记,因为词汇并不匹配。传统上,科学家试图通过让每个人阅读相同的 872 页书来解决这个问题,从而建立一个基于这些共享页面的词典。但如果这些人阅读的是不同的书,或者页面并不重叠呢?旧的方法就会失效。

这篇论文介绍了一种名为 MED-VAE 的新工具,它解决了这个问题,且不需要每个人都阅读相同的页面。以下是它的工作原理,使用简单的类比:

1. “通用翻译器”(ANN 支架)

与其强迫人们直接进行交流,研究人员引入了一个通用翻译器(一种人工神经网络,具体为 ResNet-50)。这个翻译器已经阅读了数百万张图像,并且非常清楚一个标准的、“完美”的“苹果”、“汽车”或“人”是什么样子的。

  • 旧方法: 你要求 A 先生和 B 先生描述同一个苹果,然后你尝试匹配他们的描述。
  • 新方法: 你要求 A 先生描述这个苹果,同时要求 B 先生也描述这个苹果。然后,你要求两人都将他们的描述翻译成通用翻译器的语言。

因为通用翻译器对“苹果”有一个完美的共同定义,所以即使 A 先生和 B 先生从未交谈过,他们在向它表达时也会被迫“说同一种语言”。

2. “双向通道”(架构)

研究人员构建了一个具有两个侧面的机器:

  • 输入侧: 每个人都有自己的私人翻译器,将他们的脑电波(fMRI)转化为通用翻译器的语言。
  • 输出侧: 有一个共享解码器,试图将那种“通用语言”转回通用翻译器原始的“完美”图像特征。

神奇之处在于,该机器被训练为同时完成两件事:

  1. 确保通用翻译器的语言可以被转回一张完美的图像。
  2. 确保通用翻译器的语言可以被转回那个特定人的脑电波。

这在每个人的脑电波之间产生了一种“压力”。为了满足机器的要求,当 A 先生和 B 先生看到相似的事物(如猫)时,他们的脑电波必须最终落在“通用语言”中的完全相同的位置,即使他们看到的图片整体上是不同的。

3. 结果:更好的地图

当研究人员测试此方法时,他们发现了三个主要发现:

  • 整齐有序的图书馆: 在新的共享空间中,“书”(图像)是按类别完美分类的。如果你观察数据的地图,所有的“动物”都在一个簇中,而所有的“车辆”都在另一个簇中。旧方法就像一个混乱的堆积物,动物和汽车混杂在一起。
  • 无需“共享页面”: 旧方法(如 SRM 和 Procrustes)需要每个人观看相同的 872 张图像才能学习如何对齐。MED-VAE 则不需要。它仅仅通过使用通用翻译器作为引导,就学会了这种对齐。
  • 更好的预测能力: 由于对齐效果极佳,如果你提取 A 先生的脑电波活动,将其翻译成通用语言,然后再将其翻译回 B 先生的脑电波语言,你会得到一个非常准确的关于 B 先生脑电波活动的预测。这就像是仅通过观察 A 先生的数据,就能读懂 B 先生的思想,而无需见过 B 先生的数据。

4. “噪声”过滤器

一个有趣的发现是关于“噪声”的问题。旧方法似乎在实验过程中能更好地重建精确的脑电波,然而研究人员意识到,这是因为旧方法在无意中记住了实验那一刻发生的“静态”或“噪声”(例如人的心跳或呼吸)。

当他们在的试验中测试这些方法(检查信号是真实的还是噪声)时,旧方法失败了。然而,MED-VAE 忽略了噪声并保留了真实的信号。这就像旧方法在记录语音的同时也记录了背景杂音,而 MED-VAE 则过滤掉了杂音,只保留了清晰的人声。

总结

这篇论文提出了一种在不需要人们观看相同图片的情况下,对齐不同人脑电波活动的方法。它通过使用预训练的 AI 作为“共同基础”或支架来实现这一点。这创造了一个共享的精神地图,使得不同的脑电波可以进行比较,从而让我们更好地理解人类是如何看待世界的,并允许我们基于一个人的脑电波来预测另一个人的脑电波。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →