Unified Pix Token And Word Token Generative Language Model
本文提出了一种新颖的生成式语言模型,该模型通过色彩折叠和全局条件注意力等特定架构创新,将像素与词元统一起来,以克服当前基于视觉 Transformer 的视觉编码器在识别精细视觉细节方面的局限性,并证明即使在模型规模较小且数据有限的情况下也能展现出强劲的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教一台计算机同时“看”和“说”。目前,最先进的计算机使用一种称为ViT(Vision Transformer,视觉 Transformer)的方法来观察图片。本文的作者认为,这种现有方法就像试图通过只看一张模糊的、概括性的草图来描述一幅复杂的画作。它会遗漏微小的细节,比如汽车上的车牌号或标志牌上的小字。
以下是他们的新想法——统一像素令牌与单词令牌模型(Unified Pix Token and Word Token Model)——的简要拆解,并辅以日常类比。
1. 问题所在:“模糊草图”与“逐像素现实”的对比
现有方法(ViT/CLIP):
想象你有一块由 100 万块小瓷砖组成的巨大马赛克。当前的 AI 并不查看每一块瓷砖。相反,它将它们分组为大的块(patches),然后问:“整个这一块看起来像什么?”它将这一块转化为一个单一的“单词”或摘要。
- 缺陷: 如果你只改变其中一块微小的瓷砖(例如将车牌号从 1 改为 6),整个块的摘要就会完全改变。这就像如果你改变了一个句子中的一个字母,AI 就会认为整个段落的意思完全不同。这使得它难以发现微小的细节。
新方法(Pix Token):
作者们说:“让我们停止概括。让我们给图像中的每一个像素(图像中最小的色点)赋予一个独特的名称标签和它自己的字典条目。”
- 类比: 我们不再将瓷砖分组为块,而是给马赛克中的每一块瓷砖都颁发一张独特的身份证。如果你改变了一块瓷砖,只有那张身份证会改变。图片的其余部分保持完全不变。这使得 AI 对微小细节更加敏感。
2. 挑战:需要记住的名字太多
问题:
如果你给每个像素都起一个名字,而一个像素可以是 1670 万种颜色中的任何一种,你最终会得到一本大得离谱的字典。要查阅每一种颜色,需要消耗过多的计算机算力。
解决方案:“颜色折叠”
作者们提出了一种巧妙的技巧,称为颜色折叠(Color Folding)。
- 类比: 想象你有一个装有 1670 万种不同蓝色色调的盒子。在人类眼中,“天蓝”和“天蓝 + 一点点白色斑点”之间的差异是看不见的。
- 修正: 模型将这些微小且无法区分的色调归为一组。它说:“我们不需要 1600 万个名字;让我们只用 4000 个名字来涵盖人类实际能看到的所有颜色。”
- 结果: 这极大地缩小了字典的规模(就像将一张巨大的地图折叠成口袋大小),而不会让人眼觉得图片变得模糊。它节省了巨大的计算资源。
3. 魔法技巧:“从全局到局部”的注意力机制
问题:
即使字典变小了,逐像素地查看整张图片仍然是一项繁重的工作。如果你试图一次性将每个像素与其他所有像素进行比较(全局注意力),计算机就会不堪重负,就像试图同时听 10,000 个人说话一样。
解决方案:“窗口化注意力”
模型将图像分割成小窗口(就像透过一个小方框观看)。
- 第一步: 它查看一小块像素窗口,并弄清楚它们彼此之间的关系。
- 第二步: 它提取该窗口的“摘要”,然后移动到下一个窗口。
- 第三步: 它将这些窗口摘要结合起来,以理解整张图片。
- 类比: 与其试图一次性理解音乐会现场整个人群在说什么,不如先听一小群朋友交谈,再听下一群,最后拼凑出整个人群在说什么。作者们声称,这是一种“智能近似”,效果几乎与同时听所有人说话一样好,但速度快得多。
4. 宏大目标:统一文字与图像
目前,AI 模型将文本和图像视为两种不同的事物。它们用一种“大脑”阅读文本,用另一个单独的“翻译器”(ViT 编码器)观察图像。
新模型:
该模型对待像素的方式与对待单词的方式完全相同。
- 类比: 想象一种语言,其中“苹果”是一个单词,而某种特定的红色也是一种单词。AI 可以像阅读“苹果在桌子上”一样轻松地阅读“该 [红色像素] 位于 [绿色像素] 上”。
- 优势: 因为它像对待单词一样对待像素,所以它可以利用无监督数据进行学习。这意味着它可以通过在互联网上直接查看数百万张原始图像来学习,而无需人类编写诸如“这是一只猫”这样的标签。这就像一个孩子通过观察世界来学习视觉,而不是通过闪卡被教导。
5. 他们实际做了什么?
作者们构建了这个模型的一个小型版本(1.2 亿个参数),并仅使用图像对其进行了训练(尚未混合文本)。
- 结果: 模型成功学习了。“损失”(衡量 AI 困惑程度的指标)下降了,这意味着它开始理解像素的模式。
- 主张: 他们相信,如果给予该模型更多的计算能力和数据,它将变得更好,并遵循使基于文本的 AI(如 GPT-3)取得成功的相同“缩放定律”。
总结
这篇论文提出了一种计算机视觉的新方法:
- 停止概括图像;给每个像素赋予独特的身份。
- 简化颜色(颜色折叠),以免计算机不堪重负。
- 分窗口查看而不是一次性全部查看,以节省能量。
- 像对待单词一样对待像素,使 AI 能够从原始图像中学习,而无需人类教师。
作者们认为,这比现有方法是未来 AI 视觉更好的基础,尽管他们承认需要更多的计算能力来在大规模上证明这一点。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。