Towards simultaneous decoding of kinetic and kinematic movement parameters during grasp and lift task by noninvasive brain imaging
本文提出并评估了三种用于从脑电信号(EEG)中解码多个动力学和运动学运动参数的回归模型,证明了基于注意力的回归器在同时进行多参数解码方面取得了优于偏最小二乘法和多层感知机模型的性能(=0.8),从而推动了直观、实时脑机接口的发展。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下这样一个世界:你的想法可以直接控制机械臂、轮椅或电脑光标,而你甚至不需要移动任何肌肉。这并非科幻小说,而是脑机接口(BMI)的目标。可以将 BMI 想象成一个翻译官,它倾听大脑电信号的细微低语,并将它们转化为机器的指令。对于那些因中风或截肢而失去运动能力的人来说,这项技术可能是重获独立的关键。然而,这里有一个问题:目前大多数“翻译官”就像只有几个按钮的老式遥控器。它们可以告诉机器“向左移动”或“向右移动”,但难以处理现实生活中的细微差别,比如如何用力挤压一颗葡萄,或者举起杯子时要多快。为了让这些设备真正变得有用,科学家们需要解码的不只是肢体在“哪里”移动,还要同时解码它移动得“有多快”以及施加了“多少力”。
这正是 Parth G. Dangi 和 Yogesh Kumar Meena 在他们最近的研究中所应对的挑战。他们提出了一个宏大的问题:我们能否构建一个能够同时理解复杂运动信号“交响乐”的脑部读取系统,而不是一次只听一种乐器的声音?为了寻找答案,他们设计了一个数字实验,利用人们在执行简单的“抓取并抬起”任务(即拿起一个物体并移动它)时的脑波数据。他们测试了三种不同的“解码器”(数学模型),以观察哪一个能最好地将这些脑波转化为完整的运动图景,包括握力的强弱以及手指和手腕在三维空间中的位置。
研究人员比较了三种截然不同的方法。首先,他们尝试了偏最小二乘法(PLS)回归器,这是一种传统的、老派的数学模型。接着,他们使用了多层感知器(MLP),这是一种深度学习模型,其作用类似于简单的神经网络,试图在数据中寻找模式。最后,他们引入了一个新的竞争者:基于注意力的回归器(具体而言是基于 Transformer 的模型),这是一种复杂的 AI 架构,以其能够关注不同信息片段之间随时间变化的关系而闻名,就像人类听众会专注于一句话是如何与下一句话相连一样。
结果呈现出两种截然不同的优势。传统的 PLS 模型表现得非常吃力,就像一个在多人同时说话时会迷失方向的翻译官;它无法以任何实际的准确度同时解码多个参数。MLP 模型则更为稳定,像是一个可靠但平庸的学生,虽然能完成任务但并不擅长处理复杂部分。然而,当涉及到同步解码时,**基于注意力的回归器(TBR)**成为了绝对的明星。
当 TBR 被要求同时解码全部 24 个运动参数(如手指、拇指和手腕的力度、位置和旋转)时,它取得了惊人的准确度得分(R² 为 0.8),并且速度极快,延迟仅为 29.2 毫秒。这表明该模型完全有能力处理脑部信号的“管弦乐团”,理解运动各部分之间的联系。事实上,研究发现运动参数在大脑中是天然相关的;“我挤压得有多紧”的信号与“我的手在何处移动”是紧密相连的。TBR 之所以表现出色,是因为它能够捕捉到这些隐藏的联系。
然而,情况发生了转折。当研究人员要求 TBR 仅单独解码一个参数(忽略其他参数)时,它的性能大幅下降。事实证明,该模型由于过于擅长利用参数之间的关系,以至于在这些关系被移除时反而会出错。相比之下,MLP 模型在两种情景下都更加稳定,尽管它在共同解码时从未达到过 TBR 的高度。
研究结论指出,虽然 MLP 提供了一个稳定但精度较低的选择,但基于注意力的模型在构建直觉化、实时且能处理复杂多指令任务的脑控设备方面,展现出了最大的潜力。作者认为,这种方法可以引导开发出使用起来感觉更加自然的假肢或康复工具。不过,他们也指出,这些发现是基于特定的数据集和模拟实验,在将这些系统部署到医院或家庭之前,还需要使用更多样化的数据进行现实世界的测试。目前,研究表明,如果我们希望脑机接口能像人类运动一样流畅且富有表现力,我们需要能够倾听“整场对话”,而不仅仅是“单个词汇”的模型。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。