HANCLIP: A Family of Hyperbolic Angular Negation Vision Language Models
HANCLIP 引入了一系列视觉-语言模型,这些模型利用双曲几何和角度三元组目标在一个紧凑的训练框架内显式地编码否定,在显著提高 NegBench 等基准测试上否定敏感性的同时,无需大规模重新训练即可保持在标准任务上的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位非常聪明的图书管理员(一个视觉语言模型),他读过数百万本书,看过数百万张照片。这位管理员非常擅长将“猫”的照片与“猫”这个词进行匹配。然而,这位图书管理员有一个有趣的盲点:他很难理解“不/不是”(not)这个词。
如果你给他看一张猫的照片,并问他:“这不是一只狗吗?”图书管理员就会感到困惑。因为他是通过记忆模式来学习的,当他看到“狗”这个词和猫的照片时,他的大脑会想:“哦,这两个东西在我的训练数据中经常一起出现,”尽管句子是在告诉他它们是相反的概念。他依赖于浅层的词汇匹配,而不是真正的逻辑理解。
这篇论文介绍了一个名为 HANCLIP 的新系统来解决这个问题。以下是它的工作原理,我们使用简单的类比来解释:
1. 问题所在:“平坦”的地图
把图书管理员的大脑想象成一张巨大的、平坦的地图(欧几里得空间)。在这张地图上,一切都只是一个点。
- “猫”的点靠近“小猫”的点。
- “狗”的点离得很远。
- 但是当图书管理员看到短语“不是一只狗”时,他不知道该把这个点放在哪里。它离“狗”太远,但又不太像“猫”。平坦的地图变得一团糟,于是图书管理员就猜错了。
2. 解决方案:“树状”地图(双曲空间)
作者建议将图书管理员的大脑移动到一个树状地图(双曲空间)上。
- 想象一棵树,树干是中心。你越接近中心,概念就越通用(比如“动物”)。当你向树枝和叶子移动时,事物就变得越具体(比如“猫”、“狗”、“不是狗”)。
- 在这个树的世界里,“猫”和“不是狗”可以坐在同一根树枝上,因为它们是相关的概念,而“狗”则在完全不同的另一根树枝上。
- 这使得模型能够理解“图像是什么”和“图像不是什么”是同一棵树上不同的分支,而不是平坦地面上随机的散点。
3. “角度”技巧(角三元组否定损失)
该系统使用了第二个技巧,叫做角三元组(Angular Triplet)。想象房间里站着三个人:
- 负向锚点 (N): 一个举着“狗”牌子的人。
- 正向对象 (P): 一个举着“猫”牌子的人。
- 被否定的正向对象 (P'): 一个举着“不是狗”牌子的人。
系统教模型观察他们之间的角度:
- 对齐: 从“狗”的角度来看,“猫”和“不是狗”应该站在大致相同的方向。他们都是“非狗”的存在。
- 分离: 然而,“猫”和“不是狗”必须站得足够远,以免产生混淆。
通过调整这些角度,模型学会了“不是狗”指向的方向与“猫”相似(因为它们都是非狗),但它也能保持两者的区别,从而避免错误。
4. 结果:一次聪明且高效的升级
作者并没有从头开始重建图书管理员的大脑。相反,他们使用了一个规模很小的、专注的训练集,仅包含 20,000 个示例(与通常需要的数百万个示例相比,这简直是沧海一粟)。
他们在四个不同的现有模型(CLIP, LongCLIP, SmartCLIP, 和 HiMo-CLIP)上测试了这个新的“HANCLIP”系统。结果如下:
- 更好的逻辑性: 模型在回答涉及“不/不是”的问题(例如“哪张图片中不包含汽车?”)时,表现得显著更好。
- 没有记忆丢失: 至关重要的是,这些模型并没有忘记它们原本的工作。它们在根据简单描述寻找图片或进行图像分类方面,依然表现得同样出色。
- 高效性: 他们在无需大量新数据或重新训练整个系统的情况下,就实现了这些改进。
简而言之: HANCLIP 为 AI 模型提供了一个更好的“心理地图”和一套几何规则,使其能够理解“不是”这一概念,从而让模型能够在不丧失理解“是什么”的能力的同时,也能推理出“不是什么”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。