Rethinking Brain Decoding with CLIP: The Role of Adversarial Robustness
本文表明,利用对抗鲁棒变体 CLIP 而非标准模型,通过促进与神经活动更佳对齐的稳定且具有感知结构的表征,显著提升了基于 fMRI 的大脑解码性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心理念:用 AI 读取思想
想象一下,科学家们正试图制造一台“读心术”机器。他们使用 MRI 扫描仪,在一个人注视图片时观察其大脑活动。目标是仅仅通过观察大脑活动,就能准确判断出这个人正在看什么样的图片。
为了实现这一目标,他们需要一个“翻译官”。大脑使用的是“神经信号”(fMRI 数据),但我们需要将其翻译成我们能理解的东西,比如对图像的描述。长期以来,科学家们一直使用一种非常流行的 AI 翻译官,叫做 CLIP。CLIP 非常擅长理解图片与文字之间的联系。
问题所在: 尽管 CLIP 很流行,但它并不是一个完美的脑部翻译官。这篇论文指出,CLIP 就像一个通过记忆“技巧”或“捷径”(比如注意到一张狗的照片通常背景里会有草地)来通过特定考试的优等生,而不是真正理解了“狗”这个核心概念。然而,人类的大脑并不依赖这些捷径;大脑看到的是狗本身。因为 AI 和大脑观察图片的方式略有不同,导致这种翻译并不完美。
解决方案:“压力测试”翻译官
作者提出了一个简单的问题:如果我们使用一个经过“压力测试”、能够忽略这些技巧的 AI 版本,情况会怎样?
在 AI 世界中,有一种技术叫做对抗训练(Adversarial Training)。想象你在教一个学生识别停止标志。
- 标准学生 (CLIP): 你给他看一个停止标志,他学会了。但如果你在上面贴一个微小的、肉眼几乎看不见的贴纸,让它在计算机看来像是一个限速标志,他可能会感到困惑,误以为那是限速标志。他依赖的是脆弱的细节。
- 压力测试过的学生 (Robust CLIP): 你给他看停止标志,但你同时也给他看成千上万个带有奇怪贴纸、模糊或扭曲的版本。你强迫他学习标志的“本质形状”,从而忽略掉杂乱的背景或微小的把戏。他变得更加“鲁棒”(稳健)。
论文认为,这个“压力测试过的学生”(即具有对抗鲁棒性的 CLIP)比标准学生更能更好地理解人类大脑的语言。
他们做了什么(实验)
研究人员设置了一场公平的竞赛。他们保持所有内容完全一致——大脑扫描器数据、计算机代码和训练方法。他们唯一改变的是“翻译官”(目标表示)。
- A 队: 使用标准的 CLIP 模型。
- B 队: 使用“压力测试”过的版本(称为 FARE 和 TeCoA)。
他们在两组不同的脑部数据(数据集)上进行了测试,以观察谁能更准确地根据脑部扫描结果猜出图像。
结果:压力测试团队获胜
结果清晰且一致:
- 更高的猜测准确率: “压力测试”模型在根据大脑活动猜测人正在看哪张图片方面表现得更好。在其中一项测试中,准确率提升了 13%,这在这一领域是一个巨大的突破。
- 更好的对齐度: 当他们测量 AI 的内部图谱与大脑图谱的匹配程度时,鲁棒模型与大脑的匹配度更高。这就像是 AI 和大脑终于在同一个频道上交流了。
- 零样本成功(Zero-Shot Success): 即使面对 AI 从未见过的脑部图像,鲁棒模型依然比标准模型能更频繁地正确猜测。
为什么:观察地图
研究人员不仅停留在“它效果更好”这一层面。他们想知道“为什么”。他们使用了一种叫做**归因图(Attribution Map)**的工具,这就像一张热力图,显示了 AI 正在关注图像的哪些部分。
- 标准 CLIP: 热力图有些分散。它似乎在观察整张图片,包括可能作为“技巧”存在的背景细节。
- 鲁棒 CLIP: 热力图更加集中且具有结构性。它忽略了背景“噪声”,专注于主要物体,就像人类一样。
最有趣的发现是,这两个模型观察图像的方式是完全不同的。它们不仅仅是微调了特征,而是重新组织了看待世界的方式。鲁棒模型停止依赖标准模型所使用的“捷径”,这种转变正是它能更好地与人类大脑对齐的原因。
总结
论文得出结论:如果你想解码人类大脑活动,选择合适的 AI 模型比你想象的要重要得多。
你不需要建造一台全新的机器,也不需要更换脑部扫描仪。你只需要将标准的 AI 翻译官更换为经过“压力测试”、能够抵御各种干扰的鲁棒版本。通过这样做,AI 会停止寻找简单的捷径,转而开始像我们的大脑一样观察世界,从而实现更好的“读心”效果。
简而言之: 要读取人类的思想,请使用一个学会了忽略干扰并专注于真相的 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。