FTerViT: Fully Ternary Vision Transformer
本文介绍了 FTerViT,这是一种完全三值化的视觉 Transformer,它将所有权重和归一化参数量化,以实现显著的内存压缩,使微控制器上的设备端高效部署成为可能,同时保持具有竞争力的 ImageNet-1K 准确率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位才华横溢、受过高等教育的图书管理员(即视觉 Transformer或ViT),他能够查看图片并准确告诉你它是什么。这位图书管理员极其聪明,但他脑海中携带着海量的书籍。如果你试图将这位图书管理员塞进一个微型背包(例如智能手表或廉价相机中的微控制器),背包会被撑破,因为书籍太重且占用空间太大。
通常,为了将智能 AI 适配到微型设备中,工程师们会尝试压缩这些“书籍”。他们可能会将文本转换为更短的代码,但往往将最重要、最精细的页面(如封面、目录和最终摘要)保留在原本庞大笨重的格式中。该论文指出,这就像试图通过仅压缩百科全书的中间章节来将其塞进口袋;封面和目录仍然过重。
以下是FTerViT的作者为解决这一问题所采取的方法:
1. “三色”字典
作者没有使用复数(如 3.14159...)来存储信息,而是强制 AI 仅使用三个简单符号:-1、0 和 +1。
- 这就像一本字典,其中每个单词都被替换为红、绿或蓝点。
- 通过仅使用这三种选项,他们可以将信息极其紧密地打包。这就像将一张巨大的地图折叠成一个小方块。
- 他们将此称为三值(意为“三”)。
2. “脆弱”部分
此前尝试压缩这些 AI 模型的努力都未能彻底完成。他们压缩了主脑(即“编码器”),但保留了Patch Embedding(AI 首次瞥见图像的方式)、LayerNorm(AI 平衡其思考的方式)和Classifier(最终决策者)的沉重、全尺寸格式。
- 作者意识到,在微型设备中,这些剩余的“沉重”部分实际上占据了最大空间,尽管它们的数量很少。
- FTerViT是首个将所有部分(包括这些脆弱部分)压缩为简单的 -1、0、+1 格式的模型。
3. “导师与学生”技巧
将巨大的大脑压缩成微小的通常会导致其忘记如何思考,从而犯下愚蠢的错误。为了解决这个问题,作者使用了一种称为知识蒸馏的技术。
- 想象一位大师级厨师(原始、庞大的 AI)正在教导一位初级厨师(微小、压缩后的 AI)。
- 大师级厨师不仅仅告诉初级厨师“这是一只猫”,而是向他们展示如何看到这只猫。“看看耳朵、胡须、形状。”
- 初级厨师通过模仿大师的思维过程来学习,而不仅仅是最终答案。这使得微小的 AI 即使在被压缩到绝对最小尺寸后,仍能保持智能。
4. 结果:10 美元相机中的智能 AI
作者在一种非常廉价、常见的微控制器芯片ESP32-S3(用于约 10 美元的设备)上测试了这种方法。
- 之前:原始 AI 大小为 88.3 MB。它太大,甚至无法放入芯片。
- 之后:他们的新FTerViT模型仅为5.81 MB。它完美适配。
- 性能:尽管它非常微小,但仍然非常智能。它正确识别图像的比例约为79.6%。这远优于此前压缩 AI 的尝试,那些尝试的准确率往往降至 74% 或更低。
5. 这对你的口袋意味着什么
该论文表明,你不需要超级计算机来运行智能视觉。你可以在仅有8 MB 内存(约等于一个小文本文件的大小)的设备上运行它。
- 速度:由于数据非常小,设备无需费力获取信息。它运行更快,耗电更少。
- 效率:作者构建了一个自定义“引擎”(软件),可在芯片上完全运行这个微小的 AI,无需连接互联网或云服务器。
总结:该论文提出了一种方法,将最先进的图像识别 AI 模型压缩到微小鹅卵石的大小,使它们能够在以前因太弱而无法处理的廉价、电池供电设备上运行。他们通过将数学简化为仅三个数字,并利用“导师”教导微小模型如何正确思考,实现了这一目标。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。