Learning Generalizable Action Representations via Pre-training AEMG
本文介绍了 AEMG,这是首个大规模自监督框架,它通过一种新颖的神经肌肉收缩分词器将肌电信号视为一种生理语言,从而在仅需少量目标数据的情况下,实现跨受试者、跨设备和跨任务的最先进泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你的肌肉就像一个合唱团,每次你移动手,它们就唱出一首特定的歌。长期以来,试图理解这些歌曲(以控制机械臂或假肢)的计算机面临一个主要问题:每个人的声音听起来都不同,每个麦克风(传感器)的录音方式也不同,每首歌的结构也各不相同。为了解决这个问题,研究人员通常不得不为每个人单独教计算机一种新的“语言”,这既缓慢又低效。
本文介绍了AEMG,这是一个新系统,它教会计算机理解肌肉信号的“通用语法”,无论谁在歌唱,也无论使用何种麦克风录音。
以下是他们如何实现这一点的简单类比解释:
1. 问题:巴别塔
目前,如果你想让计算机理解你的手势,你必须花费数小时专门为你校准设备。如果你切换到不同的设备或不同的人,计算机就会感到困惑。这就像试图翻译一本书,其中每一页都用不同的方言书写,使用不同的字体,并带有不同的标点符号。计算机无法找到规律。
2. 解决方案:将肌肉信号转化为“句子”
由黄正浩和林舒领导的研究人员决定,不再将肌肉信号视为杂乱的电波,而是将其视为语言。
- “分词器”(NCT): 想象你在听一个合唱团。你不是记录整个连续的噪音,而是聆听独特的“音符”或“单词”(单个肌肉收缩)。系统的神经肌肉收缩分词器就像一个智能编辑器,将连续信号切割成这些有意义的“单词”。它忽略音符之间的静默和噪音,只关注肌肉实际发出的“单词”。
- “词汇表”(代码本): 尽管每个人的声音不同,但他们用来表达“拿起杯子”的单词在本质上是相似的。系统构建了一个包含 8,192 个标准“肌肉单词”的巨大字典(代码本)。它迫使每个人的独特信号映射到这些标准单词上。这就像将法语使用者和日语使用者翻译成一种共享的、通用的“肌肉语言”,这样计算机只需学习一种语法。
- “语法”(Transformer): 正如单词需要排列成句子才有意义一样,肌肉也是成组(协同)工作的。系统使用Transformer(与 ChatGPT 等工具背后相同的 AI 技术)来理解这些肌肉单词的顺序和上下文。它学习到,特定的肌肉“单词”如果后面跟着拇指动作,可能意味着“捏”,但如果后面跟着整个手的闭合,则意味着“抓”。
3. 训练:“填空题”
为了在不需人工标记每个手势的情况下学习这种语言,系统使用了一种填词游戏(Mad Libs)。
- AI 被展示一个带有部分隐藏(掩码)单词的肌肉信号“句子”。
- 它必须根据周围单词的上下文猜测缺失的单词。
- 通过使用来自 500 多人和多种不同设备的数据玩数百万次这个游戏,AI 学会了肌肉如何协同工作的深层规则,而不仅仅是死记硬背特定的手势。
4. 结果:“零样本”超能力
该论文在尽可能困难的情景中测试了这个系统:留一法(Leave-One-Subject-Out)。
- 测试: AI 在 99 个人的数据上进行了训练,然后被要求理解第 100 个人的手势,而该人是它从未见过的,且完全没有针对该特定人的先期训练。
- 结果: AEMG 显著优于所有先前的方法。与现有最佳模型相比,其准确率提高了近 10%。
- “少样本”奇迹: 如果他们仅提供新人物**5%的数据供系统微调,其准确率就能达到90%**以上。这就像教一个新语言使用者几个短语,他们就能瞬间理解对话的其余部分。
5. 为什么这很重要(根据论文)
论文声称,这是首次为肌肉信号构建“基础模型”(一个巨大的、预训练的“大脑”)。
- 以前: 我们必须为每个新用户建造一座定制的、孤立的房子。
- 现在: 我们建造了一个通用的公寓大楼。结构已经存在;我们只需要挂几幅画(5% 的数据)就能让它适应新住户。
作者强调,这种方法将肌肉信号视为一种“跨设备生理语言”,使 AI 能够从海量原始数据中学习运动的“语法”,使其能够抵御不同设备、不同人和不同录音条件的影响。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。