Zamba2-VL Technical Report
Zamba2-VL 是一套基于混合 Zamba2 架构构建的高效视觉语言模型套件,该架构将 Mamba2 状态空间层与 Transformer 模块相结合,在实现与领先的开源视觉语言模型(VLM)相媲美的竞争性能的同时,显著提升了首 token 响应速度,尤其适用于适合边缘部署的小规模场景。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心理念:更聪明、更快速的图像大脑
想象你有一个机器人助手,它需要观察一张图片并回答相关问题。通常,这些助手就像一个拥有庞大且不断增长的索引卡堆叠的图书馆。每当它们看到图像的新部分时,就会向卡片堆中添加一张新卡。如果图像非常巨大或复杂,卡片堆就会变得非常高,导致机器人必须把所有时间都花在搜索这些卡片以寻找下一张卡片上。这使得它们运行起来既缓慢又昂贵。
Zamba2-VL 团队打造了另一种不同类型的机器人。他们没有给机器人一个不断增长的卡片堆,而是给了它一个紧凑、高速的记忆笔记本,无论阅读多少内容,这个笔记本的大小都保持不变。他们称之为“混合”模型,因为它融合了两种思考方式:
- 快车道 (Mamba2): 这部分处理大部分工作,以恒定且极快的速度阅读长列表信息(例如一整幅图像),而不会陷入停滞。
- 聚光灯 (Transformer): 这是一个小型、专门的工具,仅在机器人需要精准放大并完美记住某个特定细节时才会使用。
他们解决的问题
目前的 AI 模型(称为 Transformer)非常擅长理解图像,但它们很“重”。当你输入一张高分辨率照片时,它会将照片分解成数千个微小的碎片(token)。模型必须保留对目前所见每一个碎片的“记忆”。随着图像变大,内存需求会呈爆炸式增长,导致模型启动变慢,且在手机或笔记本电脑等普通设备上运行起来成本很高。
此前解决这一问题的尝试使用了“纯粹”的快速记忆系统 (SSM),但那些模型在寻找图像特定细节(例如在人群中指出某个人)方面表现较差。它们虽然很快,但在细节处理上显得有些“笨”。
Zamba2-VL 的解决方案
Zamba2-VL 团队创造了一个兼具两者优势的模型。
- 引擎: 他们使用了一个名为 Zamba2 的新引擎。它就像一辆混合动力汽车:它主要使用电力(快速、高效的 Mamba2 层)进行巡航,但在需要爆发力量来处理复杂任务时,会启动一个小型的燃油发动机(Transformer 层)。
- 结果: 这个模型在理解图像方面的能力与那些庞大、沉重的模型一样出色,但其启动速度(首个 Token 生成时间)快了 10 倍。
他们是如何训练它的
为了让这个快速模型变得聪明,他们并没有随机投喂图片。他们策划了一份特定的“饮食计划”:
- “OCR”饮食: 他们注意到模型在处理通用图片时表现良好,但在处理文本密集的文档(如图表或扫描件)时表现挣扎。因此,他们增加了文档和文本数据的摄入量,以“强壮”其阅读技能。
- “指向”技能: 他们教会了模型如何指向图像中的物体。如果你问“这里有多少个骑行者?”,模型不仅会说“6”,它还能用坐标实际指向每一个骑行者。这就像是教一个孩子不仅要会数苹果,还要在数数的同时用手触摸每一个苹果。
性能表现:快速且准确
论文将他们的新模型(提供小、中、大三种尺寸:1.2B、2.7B 和 7B 参数)与来自其他公司的当前顶尖模型进行了对比。
- 准确度: 在涉及物体计数、阅读图表和理解复杂场景的测试中,Zamba2-VL 的表现与领先的、重型模型一样出色。
- 速度: 这是它的闪光点。由于采用了“紧凑笔记本”式的记忆机制,它回答问题的速度比竞争对手快约 10 倍。
- 黄金平衡点: 这种速度优势在较小的模型(1.2B 和 2.7B)中最为显著。这些尺寸最适合在个人设备(如笔记本电脑或手机)上运行,因为它们虽然轻量化,但功能依然极其强大。
总结
可以将 Zamba2-VL 想象成一个既是短跑选手又是国际象棋大师。之前的快速模型像是只会冲刺却无法预判局势的短跑选手,而之前的智能模型则像是移动缓慢的国际象棋大师。Zamba2-VL 结合了短跑选手的速度和国际象棋大师的战略记忆,使其能够快速处理复杂的图像,而无需依赖昂贵的大型计算机来运行。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。