LibriBrain100: One Hundred Hours of Broad and Deep MEG Data for Neural Speech Decoding at Scale
本文介绍了 LibriBrain100,这是一个大规模 MEG 数据集,其特点是包含超过 100 小时的自然语言神经录制数据,通过结合深度受试者内数据与广泛的多受试者采样,旨在建立一个标准化的基准并开展公开竞赛,以推进非侵入式脑机接口文本解码技术的发展。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:一个因瘫痪而失去说话能力的人,能够再次进行交流,不是通过打字或眨眼,而是仅仅通过思考自己的语言。这就是脑机接口(BCI)所承诺的前景——这种技术通过读取大脑的电信号和磁信号,来解码一个人正在说的话或试图表达的意思。多年来,这项技术最成功的版本都需要外科医生将电极直接植入大脑,这是一种风险极高的手术,限制了其仅能在极少数患者中使用。科学界长期以来一直在寻求一种非侵入性的替代方案,即通过头盔或帽子的形式从外部读取大脑信息,使这项技术对任何人来说都既安全又易于获取。然而,该领域的进展一直很缓慢且难以衡量。由于缺乏共享的数据集和测试新想法的标准方法,研究人员一直难以确定他们的研究方法是真的在进步,还是仅仅靠运气。为了解决这个问题,科学家们需要一个庞大的脑部录音库,这些录音需在严格的条件下采集,供所有人用于构建和测试其解码工具。
一组研究人员现在发布了这样一个库,一个名为 LibriBrain100 的数据集,它代表了在探索无需手术即可从大脑读取语音的征途中迈出了重要一步。该项目专注于脑磁图(MEG)技术,这种技术使用极其灵敏的传感器来检测大脑活动产生的微弱磁场。虽然人类大脑是一个复杂的器官,但它在处理语言时产生的磁信号足够独特,只要设备足够灵敏且数据充足,就可以被捕捉到。挑战一直在于收集这类数据既困难又耗时。为了获得大脑如何处理语言的清晰图像,研究人员需要同一人在听取语音时长达数小时的录音,同时也需要来自许多不同人的录制数据,以观察不同个体的语言中枢有何差异。在此新版本发布之前,现有的最大规模此类数据集非常有限,通常仅侧重于单个人或仅几小时的录音,这使得训练用于实际应用的强大计算机模型变得十分困难。
新的 LibriBrain100 数据集完全改变了问题的规模。它包含了一百多个小时的高质量脑部录音,这一容量是此前最大数据集的两倍多。该数据集的核心来自于一名志愿者,他在听取自然、连续的语音时录制了大约 80 小时。这个人听取了完整的《福尔摩斯探案集》、一套旨在覆盖广泛语音特征的语音练习,以及一系列涵盖多样化主题的播客叙述。这种对单个个体的深度聚焦,使研究人员能够以前所未有的细节程度来研究大脑的语言处理过程,捕捉大脑在长时间内对同一说话者做出反应的细微方式。为了解决理解这些发现如何应用于其他人的需求,研究人员还记录了 32 名额外志愿者约 40 分钟的数据,他们听取的是部分《福尔摩斯探案集》。这种组合创造了一个独特的资源,它既具有深度(拥有来自一个人的海量数据),又具有广度(拥有来自许多人的数据),允许科学家测试在一个人的数据上训练的模型是否可以通过极少的新数据适配到另一个人身上。
研究人员利用该数据集测试了一个特定的任务:词汇分类。在这次实验中,计算机模型“聆听”记录的人听到某个单词时的脑信号,并尝试猜测刚才说出的单词是否属于 50 个常用词汇列表中的一个。这是迈向最终目标——全脑到文本解码的重要一步。当他们使用来自该单一志愿者的深度数据来训练计算机模型时,该模型达到了此类非侵入性任务的有史以来最高的性能记录。这一结果验证了录音的质量,并证明了拥有来自单一个体的海量数据对于教计算机如何读取该特定大脑是非常有价值的。然而,对于一个实用的设备来说,真正的考验在于它是否能在不需要 80 小时训练的情况下为新用户工作。研究人员发现,通过将基于深度数据训练的模型提供约 40 分钟的新人数据,模型可以进行微调以很好地适配该新人。这表明,可以构建这样一种系统:通过一个经过大规模预训练的模型,仅通过一段简短的聆听过程即可适配到新患者身上,从而使这项技术在现实应用中更具可行性。
该数据集还包含了不同类型的语音录音,以确保模型的鲁棒性。福尔摩斯故事提供了连贯的叙事,语音练习提供了受控的混合声音,而播客则引入了具有多样化主题和说话者的自然、自发的语音。通过包含这些不同的来源,研究人员可以研究大脑如何处理声音的声学特性与语言的语义内容。他们发现,大脑信号既包含关于声音的声学属性的信息,也包含关于故事语义内容的信息。研究人员已将所有这些数据以及一个让其他科学家能够轻松下载和使用录音的软件库向公众开放。他们还发起了一项公开竞赛,让全球的研究人员可以在相同的标准基准下测试自己的解码方法。这种做法借鉴了人工智能领域大型数据集取得成功的经验,即通过共享资源加速进步,让每个人都能在同一个基础上进行构建。
尽管结果令人鼓舞,但研究人员也谨慎地指出了目前的局限性。数据是在人们被动聆听故事时收集的,这与主动努力尝试说话或想象说话的状态不同,而后者对于瘫痪者的沟通设备而言至关重要。团队目前正在积极收集关于“内心语音”的数据,并计划在未来发布。此外,目前的成功仅限于识别 50 个词汇中的单词,而非生成完整的句子。研究人员在本次发布中没有包含全脑到文本解码的基准,因为该领域的发展过于迅速,以至于单一标准尚不稳定。然而,该数据集提供了迈向这一目标的必要基础设施。通过提供一个大规模、高质量且标准化的资源,Libri-Brain100 移除了研究人员面临的主要障碍。它使整个领域能够专注于开发更好的算法,而不是在收集数据上苦苦挣扎,其最终目标是创造一种非侵入性的工具,为那些生活在严重瘫痪中的人们恢复沟通能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。