From Pixels to Prompts: Vision-Language Models
本书旨在为读者提供清晰的思维导图和直观理解,帮助他们在快速发展的视觉语言模型领域中充满信心地前行,而不是迷失在不断的各种新术语和模型变体之中。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
视觉与语言之间的桥梁
想象一下,你正试图向一位从未见过某个混乱场景的朋友描述那个场景。你的脑海中有一个画面(视觉部分),但你需要使用语言来解释它(语言部分)。长期以来,计算机在这方面表现得很糟糕。它们拥有两个独立的“大脑”:一个擅长识别照片中的形状和颜色,另一个擅长编写句子和回答问题。但这两个大脑并不互通。“视觉”大脑可以告诉你那里有一只狗,而“语言”大脑可以写一个关于狗的故事,但它们无法协同工作来表达:“看那只戴着红帽子的特定的小狗!”
这本书,《从像素到提示词》(From Pixels to Prompts),讲述的就是如何在这些大脑之间搭建一座桥梁。它探讨了视觉-语言模型(VLMs),这是一种新型的人工智能,旨在同时理解图像和文本。可以将它想象成教计算机不仅要“看到”一张图片或仅仅“读到”一个句子,而是同时进行这两者,从而让它能以一种更接近人类的方式来理解世界。书中的观点是,通过结合这些技能,我们可以创造出不仅能处理数据,还能理解语境、回答有关所见内容的提问,甚至能像得力助手一样遵循指令的机器。
书中的核心思想:AI 多重宇宙的地图
这本书并非关于某一个单一科学实验或某个单一“灵光一现”瞬间的作品;相反,它是一本综合指南——一张心理地图——旨在帮助我们导航于快速变化的多种模态智能世界。作者 Vo Hoang Nhat Khang 指出,由于每天都有新的模型名称涌现,该领域发展极快,人们很容易迷失在术语之中。本书的主要目标是提供一个清晰、持久的结构来理解这些系统是如何运作的,而不仅仅是记忆一系列缩写词。
书中的核心发现是,几乎所有的视觉-语言模型,无论多么复杂,都在反复进行三件简单的事情:
- 编码(Encoding): 将原始像素(图像)和文本(文字)转化为一种共享的数字语言(向量)。
- 推理(Reasoning): 使用“推理引擎”(通常是大语言模型)来思考这些数字,并弄清楚它们共同代表了什么含义。
- 解码(Decoding): 将这些想法转化回有用的输出,例如一个句子、一幅画作或一个特定的答案。
书中明确反对那种认为我们需要为每一个新任务都从头构建一个全新的、巨大的大脑的观点。相反,它建议最有效的路径是利用强大的、预先存在的“冻结”大脑(例如一个已经学会说话的语言模型和一个已经学会看图的视觉模型),并在它们之间构建一个小巧且聪明的“桥梁”。这个桥梁通常被称为适配器(adapter)或投影器(projector),它允许这两个独立的专家进行交流,而无需从头开始重新学习一切。
作者们非常确定这种“模块化”方法——保持大模型冻结并仅训练桥梁——是一个主流且有效的发展趋势,正如 BLIP-2 和 Flamingo 等模型所展示的那样。然而,他们也指出(而非将其作为最终定律证明)这种方法存在局限性。他们指出,尽管这些模型正在变得越来越好,但在处理诸如“幻觉”(自信地描述并不存在的事物)和“组合泛化”(难以将已知概念以全新的方式结合起来,例如计算特定数量的稀有物体)等方面仍然存在困难。
本书如何展开叙述
本书带领读者进行了一场由下而上的探索之旅。它首先解释了“视觉编码器”(Visual Encoders),即系统中负责将图片转化为一系列标记(tokens)的部分,就像将一幅画转化为一份食材清单一样。接着,它转向了“语言模型”,即处理单词和逻辑的部分。书中最令人兴奋的部分是中间章节,它详细介绍了“融合机制”(Fusion Mechanisms)——即工程师们发现的将这两个部分粘合在一起的不同方法。
书中描述的一种流行方法是交叉注意力(Cross-Attention),它就像一个翻译官,让大脑的语言部分在需要时可以“窥视”图像部分。另一种方法是前缀调节(Prefix Conditioning),即图像被转化为一个特殊的“提示词”,置于句子的最前端,告诉语言模型:“这就是我们要讨论的内容,现在请写完剩下的部分。”书中强调,实现这一目标并没有唯一的“正确”方式;不同的模型根据其需求是追求速度、精确度还是擅长遵循复杂指令,会使用不同的桥梁。
此外,本书还深入探讨了驱动这些模型的“燃料”:数据。它解释了这些系统是在海量的互联网图像和文本上进行训练的。作者指出,虽然这些数据规模巨大,但也非常混乱且带有偏见,这会导致模型有时犯错或学习到刻板印象。他们讨论了研究人员如何通过使用更好的数据集和“指令微调”(instruction tuning)来修复这些问题,即通过给模型提供如何礼貌且准确地回答问题的示例,来教会它们扮演得力助手的角色。
最后,本书展望了这项技术的未来走向。它表明,未来的目标不仅仅是让模型在回答琐碎知识方面变得更聪明,而是要让它们变得更可靠、能够诚实地面对自己不知道的事物,并具备理解物理世界的能力(例如物体如何移动或相互作用)。书末提醒我们,虽然这些模型功能强大,但它们是人类制造的工具,理解它们的优势与弱点是我们共同承担的责任。这不仅仅是为了制造更酷的技术,更是为了构建能够帮助我们更清晰地观察世界的、值得信赖的技术。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。