v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning
本文介绍了 v1,这是一种用于多模态语言模型的轻量级扩展,它通过一种语义点选与复制机制实现了主动视觉引用,使模型能够在推理过程中动态地检索并重新锚定相关的图像块,从而克服静态视觉编码的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图解开一个棘手的谜题,但拼图碎片隐藏在一个巨大且复杂的图像之中。在人工智能的世界里,有一些特殊的“多模态”大脑,它们可以同时观察图片并阅读文本。通常情况下,当这些 AI 模型尝试解决涉及图表的数学问题时,它们只是快速扫一眼图像,记住大致的氛围,然后仅凭文字来尝试解决剩余的问题。这就像是看了一眼地图,看了五秒钟,然后闭上眼睛,在从未再看一眼地图的情况下,尝试开车前往一个新的城市。问题在于,随着驾驶指令变得越来越长、越来越复杂,AI 开始忘记转弯的具体位置或地标的长相。它失去了“接地性”(grounding),这意味着它会偏离实现正确所需的视觉证据。
这篇论文介绍了一种新的 AI 大脑思考方式,称为 v1。v1 不仅仅是让模型看一眼然后进行猜测,而是教会模型主动指向图像中它需要记住的具体部分,复制该信息,并在遇到困难时将其粘贴回思考过程中。这就像是一个非常聪明的学生,在解决一道长数学题时,会不断伸手去轻点图表,说:“等等,让我再检查一下这个角度,”然后将那个特定的视觉细节直接带回到他们的笔记中,以帮助他们完成计算。研究人员发现,这种简单的“指向并复制”(point-and-copy)技巧能帮助 AI 保持对图像正确部分的关注,从而在困难的视觉数学测试中获得更好的答案。
问题所在:“一瞥”陷阱
目前大多数能够看图识字的 AI 模型,就像是那些被要求对着图表学习片刻,然后就闭上眼睛的学生。它们将图像编码进记忆中一次,然后尝试仅通过文本进行推理。研究人员注意到这种方法存在一个缺陷:随着推理过程变得更长、更复杂,模型的注意力开始涣散。这就像是学生的眼神变得呆滞;他们不再关注图片中的重要细节。论文表明,随着 AI 写出解决问题的更多步骤,它对实际图像的注意力会逐渐减弱,并开始犯错,因为它不再“注视”着它所需要的证据。
解决方案:指向并复制
为了解决这个问题,团队创建了 v1,这是一个轻量级的升级版 AI 模型。把 v1 想象成给了 AI 一个神奇的指针和一个复印机。当 AI 在思考问题并意识到它需要检查图像的特定部分时——比如三角形中的一个角度或图表中的一个条形——它不会仅仅靠猜测。相反,它使用一种“指向”机制来选择图像中那个精确的区域。
一旦它指向了某个地方,它就会从那个位置“复制”视觉信息,并将其直接粘贴回其思维流中。这意味着 AI 可以根据需要多次重新访问视觉证据,在做数学运算的同时保持图像信息的鲜活。至关重要的是,这并不是关于生成新的图像或绘制新的图片;而是关于以手术般的精准度重新访问原始图像数据。模型学会了说:“我需要再次查看那个红色的条形,”指向它,复制其数据,然后带着那份新鲜的视觉语境继续其推理。
他们是如何教导 AI 的
你不能仅仅告诉 AI “看仔细点”;它需要接受如何操作的训练。研究人员构建了一个庞大的数据集 v1g,其中包含 30 亿个数学问题的示例,在这些示例中,推理步骤与图像的具体部分有着明确的联系。他们使用了一种巧妙的自动化过程来创建这些数据:
- 他们提取了来自其他 AI 模型的现有推理路径。
- 他们使用一个强大的语言模型将这些路径拆解,识别出 AI 应该 在何处观察图像。
- 他们添加了“接地性”(grounding)标注,这些标注就像数字便利贴,上面写着:“当你提到这个角度时,你必须看向图像的这个特定区域。”
这个数据集教会了 v1 模型:当它陷入困境或需要验证某个步骤时,它应该伸手指向正确的地点,并复制信息。
结果:更聪明、更专注的推理
团队在几个具有挑战性的数学基准测试上测试了 v1,包括 MathVista、MathVision 和 MathVerse。这些测试充满了需要仔细观察的图表、图示和几何图形。
结果令人印象深刻。尽管 v1 是一个相对较小的模型(70 亿参数),但它的表现超越了许多更大的模型和其他专门的推理模型。
- 在 MathVision 基准测试中,没有添加指向功能的基座模型得分是 23.6。
- 当在训练期间添加了指向功能但在测试期间未使用时,得分略微上升至 25.3。
- 但当模型被允许在测试期间使用 指向并复制 功能时,得分跃升至 34.5。
这表明,能够主动重新访问图像是成功的关键驱动力。模型不仅变得更擅长数学,还变得更擅长在做数学的同时进行“观察”。例如,在其他模型误判了图表中最高的条形时,v1 正确地指向了那个特定的条形,复制了其数据,并计算出了正确的百分比。在另一个涉及六边形路径寻优的任务中,v1 成功地指向了正确的形状以验证路线,而其他模型则迷失了方向。
这意味着什么
论文指出,多模态推理的未来不仅仅在于让模型变得更大或在文本生成方面更聪明。而在于赋予它们在需要时动态访问视觉信息的能力。通过让模型“指向并复制”,研究人员发现了一种方法,可以使视觉证据与推理步骤保持一致,防止模型偏离事实。
研究人员也谨慎地指出,这并不是解决所有问题的万灵药。有时模型仍然会指向错误的区域,或者可能会指向得过于频繁,或者可能在处理不符合整齐框格的抽象概念时感到吃力。然而,核心发现是清晰的:主动的视觉引用确实有所帮助。它将 AI 从一个看一眼地图然后听天由命的学生,变成了一个不断检查地图的导航员,确保每一次转弯都是正确的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。