← 最新论文
🤖 machine learning

Chameleon: A Multiplier-Free Temporal Convolutional Network Accelerator for End-to-End Few-Shot and Continual Learning from Sequential Data

Chameleon 是一款 40-nm CMOS 加速器,通过利用统一架构和双模、无乘法器计算阵列,以极小的面积开销和超低功耗,在序列数据上实现了突破性的端到端少样本学习和持续学习。

原作者: Douwe den Blanken, Charlotte Frenkel

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Douwe den Blanken, Charlotte Frenkel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

学习的边缘:为什么你的设备需要“长大”

想象一下,你的智能手机或智能音箱是一个聪明但固执的学生。目前,它非常擅长回答在离开工厂前就在教室(云端)里学过的题目。但如果你让它识别一个你刚刚发明的词,或者一个因为你感冒而听起来略有不同的声音,它就会陷入僵局。它无法在工作中学习。为了解决这个问题,我们通常必须将你的数据传回云端的巨型服务器,重新训练模型,然后再传回。这既缓慢,又消耗电池,还会引发隐私担忧,因为你正在把个人秘密交给第三方。

“边缘人工智能”(Edge AI)的梦想是赋予这些设备在它们居住的地方实时学习的能力,而无需依赖云端。这就像是在你的客厅里教宠物一个新把戏,而不是把它送到城另一头的学校。挑战在于,这些设备体积微小、依靠电池运行,且内存极少。它们无法携带一座巨大的图书馆(模型),也无法进行学习所需的繁重数学运算。它们需要一种能够仅通过极少数示例(比如看到一次或两次新关键词)就能学习并永久记住的方法,同时还要像蜂鸟吸蜜一样节省电力。这正是开发“变色龙”(Charmed)芯片的研究人员试图解决的难题。


变色龙:微型设备的变形大脑

认识一下“变色龙”。它不是一种蜥蜴,而是一款旨在成为人工智能终极“变形者”的微芯片。在电子世界中,大多数芯片就像专门的工具:锤子擅长钉钉子,但不擅长拧螺丝。通常,你需要一个芯片负责“思考”(推理),而另一个完全不同、更大且耗电量更高的装置负责“学习”。本文的作者希望构建一种能够无缝兼顾两者的芯片,就像一把在增加新刀片时重量也不会增加的瑞士军刀。

“一站式”架构
团队面临的最大障碍是,学习通常需要大量的额外硬件。想象一下,试图在一棵小树屋里加建一座图书馆;屋顶会塌陷的。变色龙通过意识到学习和思考实际上是非常相似的过程,从而解决了这个问题。他们构建了一个统一的系统,使芯片使用完全相同的“肌肉”(硬件电路)来学习新任务和执行旧任务。

变色龙并没有需要一个单独、笨重的学习引擎,而是将学习视为思考过程中的一个普通步骤。他们通过一种巧妙的数学技巧实现了这一点,将“学习”步骤转化为芯片已经掌握的简单计算。结果如何?学习能力的加入仅增加了芯片体积的 0.5%。这就像是在你的背包里加了一个秘密隔层,虽然能装下整个学校图书馆,却不会让书包变得更重或更大。

长程记忆(TCN)
现实世界的数据(如你的声音或心跳)是随时间变化的。它是一个故事,而不是一张快照。大多数 AI 芯片都不擅长记忆长篇故事;当它们读到结尾时,往往已经忘了开头。为了解决这个问题,变ло龙使用了被称为“时间卷积网络”(TCN)的技术。

可以将 TCN 想象成一个带着超级放大镜的侦探。其他芯片可能只能观察过去几秒钟的音频(就像一句短句),而变色龙可以回溯查看长达 16,000 步的历史。这是一个巨大的飞跃。之前的芯片只能看到一个很小的窗口,迫使工程师先对音频进行压缩,这就像把一部小说挤压成一条推文,从而丢失了所有细节。变色龙的 TCN 可以直接阅读整部小说而不进行挤压,使其能够理解原始音频中的复杂模式。

无乘法魔法
变色龙最有趣的部分在于它是如何进行数学运算的。通常,AI 芯片就像不断进行数字乘法的计算器,这需要大量的能量和空间。变色龙决定完全停止乘法。相反,它使用“位移”(bit shifting),这就像是将小数点向左或向右移动。

想象你有一组电灯开关。与其计算要开启多少光亮(乘法),不如直接将开关滑动到一个新位置(位移)。这使得芯片可以在没有“乘法器”(计算机中最耗能的部分)的情况下运行。这种设计让变色龙可以在两种模式之间切换:

  1. 超低功耗模式: 它仅消耗 3.1 µW(微瓦)的功率,这微小到理论上可以用微型太阳能电池或震动驱动。在这种模式下,它非常适合全天候监听像“嘿 Siri”这样的关键词,而不会耗尽电池。
  2. 高速模式: 当它需要快速学习新任务时,它可以切换到高速档,运行速度比目前该领域最优秀的芯片快 4.3 倍

芯片实际表现如何
研究人员不仅制造了芯片,还在现实世界中进行了测试。他们使用标准的 40 纳米制造工艺(现代芯片的常见尺寸)制造了变色龙。

  • 从零学习: 他们在名为 Omniglot 的数据集上进行了测试,该数据集包含来自不同字母表的数千个手写字符。变色龙在仅看 一次或五次示例(shot)后,就能学会识别新字符。它在 1-shot 学习中达到了 96.8% 的准确率,在 5-shot 学习中达到了 98.8% 的准确率。这是此类完全脱离云端辅助的芯片所创下的新纪录。
  • 永不遗忘: 他们还测试了“持续学习”,即芯片随着时间的推移逐一学习 250 个不同的类别。在学习完所有 250 个类别后,它仍然能以 82.2% 的准确率记住它们。这证明了该芯片不仅能学习新事物,还能保持旧有的记忆完整。
  • 聆听原始音频: 最后,他们在 Google Speech Commands 数据集上进行了测试。在“超低功耗”模式下,它能以 3.1 µW 的功耗正确识别 12 种不同的语音命令(如“是”、“否”、“上”、“下”),准确率为 93.3%。更令人印象深刻的是,它在处理原始、未经处理的音频(无需单独的特征提取器)时,仍能达到 86.4% 的准确率,证明了其处理长且复杂的声波的能力。

它不是什么
需要注意的是,变色龙并不是一种可以瞬间学会任何东西且无需任何努力的魔杖。它仍然需要一个预训练模型作为起点;它并非从绝对的虚无中学习。它也不会取代云端处理所有事务;对于大规模、复杂的任务,云端仍然是王者。然而,对于在电力有限的微型设备上学习新小型任务这一特定工作,变色龙展示了一条新的路径。

作者是在他们制造的物理芯片上测量了这些结果,而不仅仅是在计算机模拟中。他们表明,通过结合统一的学习架构、长程记忆系统(TCN)和无乘法设计,拥有一个能够即时学习、拥有长久记忆并在极低功耗下运行的设备是完全可能的。这是迈向未来的一步——在那个未来,你的设备不仅了解你,而且能与你共同成长。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →