← 最新论文
🤖 AI

MindVoice: Reconstructing Intelligible Speech from Non-invasive Neural Signals with Pretrained Priors

MindVoice 是一个利用预训练模型从噪声较大的非侵入性神经记录(EEG/MEG)中解耦并重建高层语义内容与细粒度声学属性的新型框架,能够合成自然且具有可理解性的语音,其性能显著优于现有方法。

原作者: Guangyin Bao, Taiping Zeng, Jianfeng Feng, Xiangyang Xue

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Guangyin Bao, Taiping Zeng, Jianfeng Feng, Xiangyang Xue

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图理解一个极其嘈杂房间里的对话:墙壁很厚,而说话者又在低声细语。现在,想象你只能通过一个固定在建筑物外的麦克风来记录这段对话。你得到的信号模糊不清,充满了杂音,只能捕捉到零星的几个词。

这本质上就是科学家在使用非侵入性工具(如 EEG,即脑电图,使用贴在头皮上的传感器帽;或 MEG,即脑磁图,使用类似头盔的扫描仪)尝试从人类大脑中读取语音时所面临的挑战。这些工具安全且易于使用,但它们捕捉到的信号是“嘈杂”且“模糊”的。它们包含了语音的“意图”,但细节往往在静电噪声中丢失了。

长期以来,研究人员一直试图建立一条从这种模糊的脑信号到清晰语音的直接桥梁。这就像是试图仅用一小把浑浊的水彩画出一幅杰作。结果通常是破碎、机械化,或者只是一堆听起来像是在说话但无法理解的声音。

“MindVoice”登场了。

来自复旦大学的论文作者们决定不再强求脑信号承担所有的重任。相反,他们构建了一个名为 MindVoice 的系统,它就像一个拥有庞大知识库的智能翻译官。

以下是其工作原理,分为简单的步骤:

1. 双轨系统(“双流”机制)

MindVoice 没有试图一次性猜出整个句子,而是将任务拆分为两个独立的团队,其灵感源自我们大脑处理语音的自然方式:

  • “意义”团队(语义流): 这个团队观察模糊的脑信号,并询问:“这个人正在思考什么?”它使用一个强大的预训练 AI(类似于超智能的语音转文本引擎)来推测单词。你可以把它想象成一名侦探,通过模糊的线索判断:“我有 80% 的把握确定他们说了‘苹果’和‘红色’。”
  • “声音”团队(声学流): 这个团队询问:“听起来是怎么样的?”它专注于音高、语调、情感以及说话者特有的声音特征。它使用另一个预训练 AI(该 AI 在数千小时的音乐和语音数据上进行了训练)来推测音乐性的音符和声音的“色彩”。

2. “预训练先验”(秘密武器)

这是最关键的部分。脑信号是不完整的,它们就像是缺失了一半拼图的拼图。

  • 旧方法试图仅根据现有的少量数据来猜测缺失的部分。
  • MindVoice 则利用了预训练先验。想象你在听一个句子,但只能听到前几个词。你不会随机猜测单词,而是会利用你对语言运作方式的认知来补全剩余部分。MindVoice 通过使用已经“读过”整个互联网并“听过”数百万小时语音的 AI 模型来实现这一点。当脑信号太弱,无法分辨是“猫(cat)”还是“蝙蝠(bat)”时,系统会利用其庞大的知识库做出最符合逻辑的猜测,从而完成句子。

3. 最终组装

一旦“意义”团队拿到了单词,而“声速”团队拿到了语调,它们会将笔记交给一个文本转语音(TTS)引擎。这个引擎就像一位专业的配音演员。它提取重建的文字和声音特征并将其朗读出来。因为这位“配音演员”知道如何自然地说话,所以结果听起来像是一个真实的人在说话,而不是机器人。

他们发现了什么?

研究人员在两个主要数据集(EEG 和 MEG)上测试了该系统,实验对象在听故事。

  • 结果: 与以往的方法相比,MindVoice 取得了巨大的成功。它生成的语音是可理解的。如果你把输出的声音播放给人类(或一个非常聪明的 AI)听,他们确实能理解其中的句子。
  • 权衡: 有趣的是,MindVoice 产生的声波与原始录音在数学上并不完全匹配(原始数据中包含了一些“静电”)。然而,其含义要清晰得多。这就像是两张照片的区别:一张照片虽然像素级地还原了原图,但看起来难以辨认;而另一张照片虽然略有不同,但非常清晰,你能瞬间辨认出照片里的人是谁。MindVoice 优先考虑的是可理解性,而非完全一致性

核心结论

MindVoice 证明了我们可以从非侵入性脑扫描中重建清晰、可理解的语音,但前提是我们不能仅靠脑信号“单打独斗”。通过让脑信号提供“提示”,并让强大的 AI 模型提供“知识”来填补空白,我们终于可以听到大脑想要表达的内容。

重要提示: 该论文严格聚焦于聆听语音(即当人听到故事时)。它并不声称适用于人们在脑海中“构思”语音或大声说话的情况,因为那些脑信号是不同的,且更难解码。目前的目标仅仅是理解一个人正在听到什么。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →