← 最新论文
🧬 biology

A 1000-hour EEG-EMG-audio dataset of Japanese speech production

本文介绍了一个公开可用的、包含1020小时多模态数据的数据集,该数据集由三位日语母语者在言语过程中同步采集的头皮脑电图(EEG)、面部肌电图(EMG)和音频录音组成,通过多种设备和多次会话收集,旨在支持语音解码、伪影建模及脑电表示学习领域的研究。

原作者: Motoshige Sato, Ilya Horiguchi, Masakazu Inoue, Kenichi Tomeoka, Eri Hatakeyama, Yuya Kita, Atsushi Yamamoto, Ippei Fujisawa, Shuntaro Sasai

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Motoshige Sato, Ilya Horiguchi, Masakazu Inoue, Kenichi Tomeoka, Eri Hatakeyama, Yuya Kita, Atsushi Yamamoto, Ippei Fujisawa, Shuntaro Sasai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,如果你想教计算机理解人类说话时大脑是如何工作的。为此,你需要一个庞大的记录库,它不仅要捕捉声音,还要捕捉大脑的电信号以及面部肌肉的微小抽动,且这一切都必须在同一时刻发生。

这篇论文介绍了 JapanEEG,这是一个包含 1,020 小时此类记录的全新大规模“资料库”。这就像是为正在说话的日语使用者构建了一部高清晰度、多角度的脑部活动“高清电影”。

以下是他们工作的详细拆解,使用了简单的类比:

1. “三相机”设置

通常情况下,科学家可能会使用一种类型的传感器来记录大脑活动。然而,这个团队在同一批受试者身上同时使用了 三种不同的“相机”(EEG 系统):

  • 超高清相机: 一个拥有 128 个传感器的系统 (g.Pangolin),就像一台 4K 相机,能够捕捉极其细腻的电信号。
  • 广角相机: 另外两个分别拥有 62–63 个传感器的系统 (g.SCARABEO 和 eego™sports),充当标准广角镜头,用以观察整个大脑。

通过在数月内对同一受试者使用三种不同的“相机”,他们创建了一个数据集,可以帮助研究人员了解如何将数据从一种类型的机器转换到另一种机器,从而解决了脑科学研究中一个常见的难题。

2. “三镜头”录制

为了确保数据既干净又可用,他们不仅仅是记录大脑。他们同时记录了三样东西,并像多轨音频录制一样实现了完美的同步:

  • 大脑 (EEG): 思维的电活动。
  • 面部 (EMG): 来自嘴唇和眼睛的微弱电信号。可以把它看作是一个“噪声过滤器”镜头。当我们说话时,面部肌肉会运动,产生电学“静电”,这可能会干扰并弄脏大脑信号。通过单独记录面部,研究人员稍后可以减去这种“噪声”,从而看到纯净的大脑信号。
  • 声音 (Audio): 实际发出的语音。

3. “开卷”剧本

参与者并不仅仅是读几句固定的句子。他们进行的是 开放式词汇语音 (open-vocabulary speech) 活动,这就像是在阅读一座浩瀚无垠的图书馆,而不是只读十行台词。

  • 他们阅读小说、非虚构类书籍、漫画,甚至在玩文字类游戏时朗读对话。
  • 他们还进行了“默读”(想象自己在说话)和“聆听”任务。
  • 这种多样性至关重要,因为它捕捉到了大脑进行多种不同类型的“语言工作”,而不仅仅是重复同一个短语。

4. “质量控制”检查

在发布这些数据之前,团队进行了“试音”以确保录制内容真实且高质量。

  • “指纹”测试: 他们观察了脑波的电学“指纹”(功率谱密度)。他们确认其符合健康大脑的特征(即随着频率增加,功率呈现预期的下降趋势),并且来自电源线的“静电”已被成功去除。
  • “反应”测试: 他们检查了大脑对语音任务的反应。他们发现,每当参与者开始说话或聆听时,大脑都会出现特定的、有时序性的电脉冲(事件相关电位)。这些反应表现为在头部移动的有组织波形,证明了信号源自大脑而非随机的电噪声。

5. 为什么这很重要(根据论文所述)

作者指出,该数据集是未来研究的 基础

  • 对于语音解码: 它有助于构建更好的工具,将大脑信号转化为语音(对无法说话的人群非常有用)。
  • 对于通用脑科学研究: 由于其数据量巨大、涵盖多种设备,并包含了面部肌肉和音频信息,它允许科学家研究如何清理大脑信号、如何利用脑数据训练 AI 模型,以及如何让这些模型在不同的人群和机器之间通用。

简而言之: 作者构建了一部关于日语大脑说话过程的大规模、高质量、多角度的“电影”。他们已经证明了这部电影画面清晰且对焦准确,并将原始胶片向所有人开放供研究,从而助力于训练下一代脑机接口和信号处理工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →