The Capacity of Thought: Benchmarking Llama 3.2 in Semantic fMRI Neural Language Decoding and Improving the Huth Encoding-Model Baseline
本文提出了关于基于 fMRI 的语言解码的两项互补性研究:一项通过改进传统的 Huth 编码模型基准,以实现更高的 METEOR 和 BLEU 分数;另一项则引入了 fMRIFlamingo,该研究揭示了在缺乏严格盲控评估的情况下,像 Llama 3.2 这样高容量的语言模型可能会产生由其内部先验而非实际神经信号驱动的、具有误导性的高解码指标。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你的大脑就像一个繁忙、嘈杂的广播电台,正在播放着一个秘密故事。科学家们一直试图构建一个“思想解码器”,想要调频到这个电台,捕捉到信号,并把故事逐字逐句地写下来。长期以来,实现这一目标的最佳方式是使用一张非常特定的、老式的地图(一种被称为 GPT-1 的模型)来猜测广播里在说什么。
加州大学圣克拉拉分校的两组研究人员决定测试两种不同的升级解码器的方法。他们想看看,是应该使用一个超级聪明、现代化的 AI(Llama-3.2)来直接读取思想,还是应该仅仅把那张旧地图做得更好。
“更好的地图”升级版
首先,他们对那个旧的、可靠的方法进行了认真的调优。把旧方法想象成尝试用只有 10,000 个微小天线来听广播。研究人员又增加了 5,000 个天线(使总数达到 15,000 个)以捕捉更多信号。他们还把旧的词典换成了稍微新一点的词典(GPT-2),以帮助猜测故事中的下一个词,并使用了超快速的计算机芯片(GPU)来进行计算,速度提升了 10 倍。
结果: 这种升级奏效了!通过增加天线和更好的词典,他们提高了猜测正确单词的能力。他们的得分从大约 13.4% 提高到了 14.9%。这算不上是魔术般的飞跃,但这是一个扎实且可衡量的进步。它证明了,如果你只是给旧方法提供更多的数据和一个更好的助手,它就会变得更好,从而更好地读取大脑的故事。
“超级大脑”实验
接下来,他们尝试了一些疯狂的尝试。他们构建了一个名为 fMRIFlamingo 的新机器。这个机器不再是使用地图来猜测故事,而是尝试将大脑的无线电信号直接接入一个巨大的、冻结的超级 AI(Llama-3.2)。其核心理念是:“如果我们把大脑信号喂给这个超级聪明的 AI,也许这个 AI 就会自然而然地‘知道’这个人正在想什么。”
乍一看,这似乎是一个巨大的成功。当他们要求 AI 从 100 个选项中选出正确的单词(一个排序任务)时,它在 42.86% 的情况下选择了正确答案。这听起来很惊人,对吧?比随机猜测(即 1%)要好得多。
但这里有一个转折: 研究人员并没有止步于此。他们玩了一个诡计。他们完全关闭了大脑信号——给 AI 提供了一个“空白”信号,而不是真实的脑部数据。然后,他们再次提出了同样的排序问题。
令人震惊的发现: AI 竟然又一次在 42.86% 的情况下选择了正确答案。
事实证明,AI 根本没有在读取大脑。它只是利用了自身庞大的语言运作知识来猜测答案。这就像一个学生在参加考试,他不需要阅读题目,因为他已经背下了答案解析。所谓的“大脑信号”实际上并没有起到帮助作用,反而略微让 AI 的猜测变得更糟了。
深刻的教训
这篇论文表明,仅仅因为一个超级聪明的 AI 能猜对单词,并不意味着它正在读取你的思想。事实上,这些大型 AI 极其擅长基于自身的训练进行猜测,以至于它们可以掩盖自己未能读取大脑的事实。
研究人员发现:
- 当进行全文叙事重建时,改进后的“旧方法”实际上比这种花哨的新方法效果更好。 虽然新方法在正确选择窗口内的单个单词方面显示出了微小的进步(10.3% 的准确率),但“更好的地图”方法在尝试重建实际叙事时取得了更高的分数。
- 新方法(fMRIFlamingo)主要依赖于它自身的“语言先验”(即它内部的语言知识)而非大脑信号。 当他们使用“盲控实验”(将大脑数据归零)进行测试时,排序性能并未下降,这证明了大脑数据并不是真正的功臣。
- 除非你进行盲测,否则你不能信任大脑解码中的“成功”。 如果你不检查 AI 是否仅仅是基于自身的知识进行猜测,你可能会误以为自己破解了思想的代码,而实际上并没有。
简而言之,研究人员表明,虽然我们可以让旧的“地图”方法变得稍好一些,但仅仅将大脑接入一个巨大的 AI 并不会自动解锁思想。这个 AI 太聪明了,以至于它经常为了得到正确答案而采取“歪门邪道”。为了真正解码思想,我们需要比仅仅看一个高分要更加谨慎和严谨。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。